ميزات Happy Horse 1.1 وقدراته
Happy Horse 1.1 هو نموذج الفيديو من Alibaba، مُقدَّم عبر fal ومتاح على Morphic. يولّد الفيديو والصوت معًا في تمريرة واحدة، مع مزامنة شفاه أصلية عبر سبع لغات، ويدعم تحويل المرجع إلى فيديو بحتى تسعة عناصر، وتسع نسب أبعاد، ومخرجات 1080p.
| الميزة | ما تفعله | الأفضل لـ |
|---|---|---|
| الصوت والفيديو المشتركان | يولّد المقطع وصوته المتزامن في تمريرة واحدة، دون خطوة صوت منفصلة | مشاهد الحوار، مقاطع الموسيقى، الرؤوس المتحدثة |
| مزامنة الشفاه متعددة اللغات | ينطق ويزامن الشفاه عبر 7 لغات، بأشكال فم تطابق النطق الصوتي | الإعلانات المؤقلَمة، المقدّمون متعددو اللغات |
| تحويل المرجع إلى فيديو، حتى 9 | يحمل حتى تسعة عناصر مرجعية إلى مشهد جديد، كلٌّ مُستدعى بالفهرس | مشاهد الطاقم، السلاسل ثابتة الشخصيات |
| تحويل الصورة إلى فيديو | يحرّك إطارًا أول ثابتًا إلى مقطع متحرك 1080p مع صوت | لقطات المنتجات، الأعمال الفنية الرئيسية، تحريك الصور |
| تسع نسب أبعاد | يقدّم من 16:9 و9:16 إلى العريضة جدًا 21:9، بتسع نسب | التسليم السينمائي والعمودي والمربع |
الصوت والفيديو المشتركان في تمريرة واحدة
يولّد Happy Horse الصورة وصوتها معًا بدلًا من إضافة الصوت لاحقًا. الحوار المنطوق مع مزامنة الشفاه، والصوت المحيطي للغرفة، والمؤثرات الصوتية، والموسيقى، كلها تخرج من التوليد نفسه، فتتوافق الحركة والصوت من الإطار الأول. تصف الصوت في الأمر نفسه مع الفعل.
مزامنة الشفاه الأصلية متعددة اللغات
ينطق النموذج ويزامن الشفاه عبر الإنجليزية والماندرين والكانتونية واليابانية والكورية والألمانية والفرنسية. تتبع أشكال الفم النطق الصوتي للغة المنطوقة بدلًا من التقريب، ما يجعله مناسبًا لمشاهد الحوار والنسخ المؤقلَمة من اللقطة نفسها.
تحويل المرجع إلى فيديو بحتى 9 عناصر
مرِّر حتى تسع صور مرجعية وأشِر إلى كل منها بالفهرس في الأمر، من character1 إلى character9 مطابقًا الترتيب الذي تزوّدها به. مع حتى تسعة عناصر، يبقى طاقم كامل معروفًا عبر اللقطات. صِف كل عنصر، ثم المشهد والفعل.
تحويل الصورة إلى فيديو
قدّم إطارًا أول ثابتًا، مثل لقطة منتج أو إطار شخصية، وأضف أمرًا يصف الحركة والصوت، فيحرّك النموذج انطلاقًا من تلك الصورة مع الحفاظ على إضاءتها وتفاصيلها. كما يعمل بتحويل النص إلى فيديو حين لا تملك صورة انطلاق.
تسع نسب أبعاد
قدّم بتسع نسب: 16:9، 9:16، 1:1، 4:3، 3:4، 21:9، 9:21، 5:4، و4:5. يُنتج إطار الأمر نفسه لقطة سينمائية عريضة جدًا ولقطة اجتماعية عمودية دون سير عمل منفصل لكل صيغة.
المواصفات التقنية لـ Happy Horse 1.1
| المواصفة | Happy Horse 1.1 |
|---|---|
| المزوّد | Alibaba (مُقدَّم عبر fal) |
| الأوضاع | تحويل النص إلى فيديو، تحويل الصورة إلى فيديو، تحويل المرجع إلى فيديو |
| الصوت | أصلي، متزامن، مع مزامنة شفاه متعددة اللغات |
| اللغات | 7 (الإنجليزية، الماندرين، الكانتونية، اليابانية، الكورية، الألمانية، الفرنسية) |
| الدقة | 720p أو 1080p |
| المدة | 3 إلى 15 ثانية (الافتراضي 5) |
| نسب الأبعاد | 16:9، 9:16، 1:1، 4:3، 3:4، 21:9، 9:21، 5:4، 4:5 |
| الصور المرجعية | حتى 9 (من character1 إلى character9) |
| طول الأمر | حتى 2,500 حرف |
| الإصدار | يونيو 2026 |
حالات استخدام Happy Horse 1.1
مشاهد الحوار والرؤوس المتحدثة
تتحدّث الشخصيات بحركة شفاه متزامنة، وصوت محيطي للغرفة، وتوقيت، كلها مولّدة في تمريرة واحدة. اكتب الجملة في الأمر فيعود الصوت مع الحركة.
مشاهد الطاقم متعدد الشخصيات
احمل حتى تسعة عناصر من صور مرجعية إلى مشهد واحد، مستدعيًا كلًّا بالفهرس ليبقى الطاقم كله معروفًا من لقطة إلى أخرى.
مقاطع الموسيقى والأداء
لأن الفيديو والصوت يُولَّدان معًا، تحطّ الحركة على الإيقاع من التمريرة الأولى. ابنِ مقطع أداء بموسيقى تصويرية وحركة متزامنة في توليد واحد.
لقطات سينمائية عريضة جدًا
استخدم نسبة 21:9 لإطار سينمائي عريض، ثم قدّم المشهد نفسه بنسبة عمودية 9:16 من الأمر نفسه.
أقلمة الإعلانات متعددة اللغات
أبقِ المشهد والشخصيات نفسها وبدّل الحوار عبر اللغات مع مزامنة شفاه أصلية، فتُشحن معالجة واحدة في أسواق عدة.
كيفية تحقيق أفضل ما في Happy Horse 1.1
يكافئ Happy Horse موجزًا يسمّي الحركة والصوت معًا، ومجموعة نظيفة من الصور المرجعية حين يجب أن تبقى الشخصيات ثابتة. تحمل بضع ممارسات معظم الجودة:
- سمِّ الصوت دائمًا. الحوار أو المؤثرات الصوتية أو الصوت المحيطي أو الموسيقى بلغة بسيطة، ليولّد النموذج الصوت مع الحركة بدلًا من مقطع صامت.
- اكتب الحركة، لا صورة فوتوغرافية. صِف كيف يتحرّك الموضوع والكاميرا عبر المقطع، لا مجرد شكل الإطار في لحظة واحدة.
- فهرِس مراجعك. لتحويل المرجع إلى فيديو، أشِر إلى كل عنصر باسم character1 وcharacter2 وهكذا، مطابقًا ترتيب تزويد الصور المرجعية.
- أبقِ الجمل قصيرة لمزامنة شفاه نظيفة. للشخصيات المتحدثة، استخدم إطارًا مواجهًا للأمام والفم ظاهر، وأبقِ كل جملة منطوقة موجزة.
- إيقاع واحد لكل مقطع. احشُر فعلًا واحدًا في بضع ثوانٍ بدلًا من ازدحام عدة أفعال في توليد واحد.
- اختر النسبة مقدّمًا. اختر 21:9 للقطة سينمائية أو 9:16 للعمودية، لأن التأطير يغيّر طريقة إخراج الفعل.
دليل كتابة أوامر Happy Horse 1.1
الأمر القوي يُقرأ كموجز لقطة قصير، لا كتعليق على صورة. يقود النتيجة أمران: قائمة واضحة بما تحتويه اللقطة، وصياغة محددة بدل صياغة غامضة.
ما يدخل في الأمر
| العنصر | ما تُدرجه | مثال |
|---|---|---|
| الموضوع | من أو ما في الإطار، موصوفًا بدقة | مذيع أخبار ببدلة كحلية إلى مكتب زجاجي |
| الحركة | ما يتحرّك، وكيف | يستدير إلى كاميرا ثانية ويشير بيده |
| الكاميرا | نوع اللقطة مع حركة واحدة | لقطة متوسطة، دفع بطيء نحو الداخل |
| الصوت | حوار أو مؤثرات أو صوت محيطي أو موسيقى | يقول «مساء الخير»؛ صوت استوديو محيطي خفيف |
| الصيغة | المدة ونسبة الأبعاد | 10 ثوانٍ، 16:9 |
صياغة المرجع والحوار
لتحويل المرجع إلى فيديو، أشِر إلى كل عنصر باسم character1 وcharacter2 وهكذا، مطابقًا ترتيب تزويد الصور المرجعية. للحوار الموقوت، علّم الجمل المنطوقة مقابل الخط الزمني للمقطع لتحطّ مزامنة الشفاه حيث تريد.
يجلس character1 وcharacter2 إلى طاولة مقهى، ضوء نافذة دافئ. 0-4ث: يقول character1 بالفرنسية «Tu as vu ça?»؛ 4-8ث: يضحك character2 ويردّ «Incroyable». صوت مقهى محيطي ناعم، محمولة لطيفة.
الأوامر الضعيفة مقابل القوية
سمِّ الكاميرا، والحركة وتوقيتها، والصوت بدلًا من تركها للصدفة.
| التركيز | ضعيف | قوي |
|---|---|---|
| الكاميرا | امرأة في مدينة ليلًا | لقطة تتبّع محمولة تتبع امرأة عبر شوارع مبلّلة بالمطر، أضواء المتاجر تنعكس على الرصيف، عمق ميدان ضحل |
| الحركة والتوقيت | يُفتح الباب ويدخل أحدهم | ينفتح الباب ببطء، تخطو شخصية بعد لحظة، ثم تستقر الكاميرا على لقطة متوسطة |
| الصوت | طاهٍ يرتّب طبقًا | لقطة قريبة لطاهٍ يرتّب طبقًا، بخار يتصاعد. الصوت: أزيز المقلاة، صوت مطبخ محيطي ناعم، و«الطلب جاهز». |
الأخطاء الشائعة
- ترك الأمر صامتًا: اكتب دائمًا إشارة صوت واحدة على الأقل، لأن النموذج يولّد الصوت مع الفيديو.
- كاميرا غامضة: كلمة «سينمائي» لا تخبر النموذج بشيء؛ سمِّ اللقطة والحركة.
- مراجع غير مفهرسة: لتحويل المرجع إلى فيديو، علّم كل عنصر باسم character1 وcharacter2 بدلًا من «استخدم هذه المراجع».
- الكثير في مقطع واحد: أبقِ فعلًا واحدًا لكل مقطع، وأبقِ الجمل المنطوقة قصيرة لمزامنة شفاه نظيفة.

