ميزات Grok Imagine Video 1.5 وقدراته
| الميزة | ما تفعله | الأفضل لـ |
|---|---|---|
| صوت أصلي متزامن | الحوار والمؤثرات والصوت المحيطي والموسيقى تُولَّد مع الحركة، متزامنة | الرؤوس المتحدثة، إعلانات المنتجات، مقاطع الموسيقى |
| تحريك صورة ثابتة | يحوّل صورة ثابتة إلى حركة مع الحفاظ على ضوئها ولونها وقوامها | الصور، لقطات المنتجات، الأعمال الفنية |
| تمديد الفيديو | يكمل من الإطار الأخير إلى تسلسل أطول | تسلسلات القصص، الإيقاعات الأطول |
| التوليد الموجَّه بالمراجع | يحمل شخصية أو نمطًا عبر المقاطع عبر صور مرجعية | الشخصيات الثابتة، السلاسل مثبّتة النمط |
| اتّباع الأمر + التحكم في الكاميرا | نوع اللقطة وحركة الكاميرا وإشارات التوقيت تحطّ كما كُتبت | معاينات اللوحة القصصية، اللقطات الدقيقة |
صوت أصلي متزامن
يُولَّد الصوت مع الفيديو في تمريرة واحدة: حوار منطوق مع مزامنة شفاه، ومؤثرات صوتية، وخلفية محيطية، وموسيقى. تصف الصوت في الأمر نفسه مع الحركة، فلا توجد خطوة صوت منفصلة.
تحريك صورة ثابتة
تُستخدم الصورة التي تقدّمها إطارًا أول، ويحرّك النموذج انطلاقًا منها. يُحتفظ بالإضاءة واللون والتفصيل الأصلية بدلًا من إعادة توليدها، ما يناسب تحريك الصور أو لقطات المنتجات أو الأعمال الفنية المنجزة.

تمديد الفيديو
يمكن لمقطع موجود أن يكمل من إطاره الأخير ليصنع لقطة أطول، مع الحفاظ على الموضوع والإضاءة والحركة نفسها. كرّر الخطوة لبناء تسلسل متعدد الأجزاء من مقطع انطلاق واحد.

التوليد الموجَّه بالمراجع
توجّه الصور المرجعية النمط والشخصية دون تثبيت الإطار الأول. يحمل النموذج ذلك المظهر إلى لقطات جديدة، ما يبقي الشخصية أو النمط البصري ثابتًا عبر عمليات توليد منفصلة.

اتّباع قوي للأمر وتحكم في الكاميرا
يتبع النموذج التوجيه المفصّل، بما في ذلك نوع اللقطة، وحركة كاميرا محددة مثل الدفع أو التحريك الأفقي، وتوقيت وقوع الفعل. هذا يجعل إعادة إنتاج لقطة مخطّطة أكثر قابلية للتنبؤ.
المواصفات التقنية لـ Grok Imagine Video 1.5
| المواصفة | Grok Imagine Video 1.5 |
|---|---|
| المزوّد | xAI |
| الأوضاع | تحويل الصورة إلى فيديو، تحويل النص إلى فيديو، تحويل المرجع إلى فيديو، تحرير الفيديو، تمديد الفيديو |
| الصوت | أصلي، متزامن (حوار، مؤثرات، صوت محيطي، موسيقى) |
| الدقة | 480p أو 720p |
| المدة | 1 إلى 15 ثانية |
| معدل الإطارات | 24 fps |
| نسب الأبعاد | 16:9، 9:16، 4:3، 3:4، 3:2، 2:3، 1:1 |
كيفية تحقيق أفضل ما في Grok Imagine Video 1.5
يكافئ النموذج إطار انطلاق قويًا وموجزًا واضحًا يركّز على الحركة. تحمل بضع ممارسات معظم الجودة:
- ابدأ من صورة ثابتة. ولّد أو أرفق صورة 16:9 أولًا، ثم حرّكها. الإطار الأول الجيد هو أكبر رافعة منفردة على النتيجة.
- أبقِ أمر الحركة قصيرًا ومحددًا. سمِّ الفعل وحركة كاميرا واحدة؛ ودع الصورة تحمل التكوين والنمط.
- سمِّ الصوت دائمًا. الحوار أو المؤثرات الصوتية أو الصوت المحيطي أو الموسيقى، بلغة بسيطة، ليولّد النموذج الصوت مع الحركة بدلًا من مقطع صامت.
- فعل واحد لكل مقطع. احشُر إيقاعًا واحدًا في بضع ثوانٍ واستخدم تمديد الفيديو للتسلسلات الأطول.
- للشخصيات المتحدثة، استخدم صورة شخصية مواجهة للأمام والفم في الإطار، وأبقِ الجمل قصيرة لمزامنة شفاه نظيفة.
- استخدم صورًا مرجعية حين يجب أن يبقى مظهر أو شخصية ثابتًا عبر المقاطع.
دليل كتابة أوامر Grok Imagine Video 1.5
الأمر القوي يُقرأ كموجز لقطة قصير، لا كتعليق على صورة. يقود النتيجة أمران: قائمة واضحة بما تحتويه اللقطة، وصياغة محددة بدل صياغة غامضة.
ما يدخل في الأمر
| العنصر | ما تُدرجه | مثال |
|---|---|---|
| الموضوع | من أو ما في الإطار، موصوفًا بدقة | مقدّمة بكنزة فحمية |
| الحركة | ما يتحرّك، وكيف | تبتسم وتنظر إلى الكاميرا |
| الكاميرا | نوع اللقطة مع حركة واحدة | لقطة متوسطة، دفع بطيء نحو الداخل |
| الصوت | حوار أو مؤثرات أو صوت محيطي أو موسيقى | تقول «أهلًا»؛ صوت غرفة محيطي خفيف |
| المدة | طول المقطع ونسبة الأبعاد | 5 ثوانٍ، 16:9 |
الأوامر الضعيفة مقابل القوية
سمِّ الكاميرا، والحركة وتوقيتها، والصوت بدلًا من تركها للصدفة.
| التركيز | ضعيف | قوي |
|---|---|---|
| الكاميرا | امرأة في مدينة ليلًا | لقطة تتبّع محمولة تتبع امرأة عبر شوارع مبلّلة بالمطر، انعكاسات نيون، عمق ميدان ضحل |
| الحركة والتوقيت | يُفتح الباب ويدخل أحدهم | ينفتح الباب ببطء، تخطو شخصية بعد لحظة، ثم تستقر الكاميرا |
| الصوت | طاهٍ يرتّب طبقًا | لقطة قريبة لطاهٍ يرتّب طبقًا، بخار يتصاعد. الصوت: أزيز المقلاة، صوت مطبخ محيطي ناعم، و«الطلب جاهز». |
إعدادات ينبغي معرفتها
| الإعداد | ملاحظات |
|---|---|
| المدة | 1 إلى 15 ثانية؛ أبقِ فعلًا واحدًا لكل مقطع |
| الدقة | 480p أو 720p |
| نسبة الأبعاد | تتبع صورة إدخالك، أو اضبط 16:9 أو 9:16 أو 1:1 |
| الصور المرجعية | أضفها لإبقاء نمط أو شخصية ثابتة عبر المقاطع |
| التسلسلات الأطول | استخدم تمديد الفيديو للإكمال من الإطار الأخير |
الأخطاء الشائعة
- ترك الأمر صامتًا: اكتب دائمًا إشارة صوت واحدة على الأقل.
- كاميرا غامضة: كلمة «سينمائي» لا تخبر النموذج بشيء؛ سمِّ اللقطة والحركة.
- الكثير في مقطع واحد: فعل واحد لكل مقطع، ثم مدّد.
الأسئلة الشائعة
ابدأ من صورة ثابتة 16:9 قوية، وأبقِ أمر الحركة قصيرًا ومحددًا، وسمِّ حركة كاميرا واحدة، وأدرج دائمًا إشارة صوت. أبقِ فعلًا واحدًا لكل مقطع واستخدم تمديد الفيديو للتسلسلات الأطول.
نعم. يُولَّد الصوت أصليًا مع الفيديو ويبقى متزامنًا مع الحركة. قد يتضمّن توليد واحد حوارًا متزامن الشفاه ومؤثرات صوتية وصوتًا محيطيًا وموسيقى، دون تمريرة صوت منفصلة.
صورة مع أمر نصي لتحويل الصورة إلى فيديو، أو أمر نصي وحده لتحويل النص إلى فيديو. يمكنك أيضًا تمرير صور مرجعية لتوجيه النمط والشخصية، ومواصلة مقطع موجود أو تعديله عبر تمديد الفيديو والتحرير.
تمتد المقاطع من 1 إلى 15 ثانية بدقة 480p أو 720p، و24 fps. لتحويل الصورة إلى فيديو، تتبع نسبة الأبعاد صورة إدخالك، ويمكنك ضبط نسبة للتسليم الأفقي أو المربع أو العمودي.
Grok Imagine الأصلي هو نموذج xAI متعدد الوسائط الذي يمتد عبر تحويل النص إلى صورة، وتحرير الصور، وعدة مسارات فيديو. أما Grok Imagine Video 1.5 فهو الإصدار المخصّص للفيديو، مضبوط لتحويل الصورة إلى فيديو مع صوت أصلي متزامن، وحوار متزامن الشفاه، وتمديد الفيديو.
