ميزات Flux 3 وقدراته
Flux 3 هو النموذج التأسيسي متعدد الوسائط من Black Forest Labs. بدلًا من نموذج منفصل لكل مخرج، يتعلّم الصورة والفيديو والصوت معًا، فيعيد الأمر الواحد لقطة متحرّكة وناطقة تسلك سلوك العالم الواقعي.
أعلنت Black Forest Labs عن Flux 3 في 23 يوليو 2026، وأتاحت توليد الفيديو للجميع في 4 أغسطس 2026. تمتد المقاطع من 5 إلى 20 ثانية بدقة HD 720p أو Full HD 1080p، في أي من سبع نسب أبعاد من 21:9 حتى 9:16، مع صوت يُولَّد إلى جانب الإطارات افتراضيًا. كل ما يلي يتبع دليل كتابة الأوامر الذي نشرته Black Forest Labs.
| الميزة | ماذا تفعل | الأنسب لـ |
|---|---|---|
| فيديو بصوت أصلي | يولّد المقطع وصوته المتزامن في تمريرة واحدة | المشاهد بالصوت، والحوار، والمؤثرات |
| فيزياء واقعية | تخضع الحركة للكتلة والزخم، ويطابق الصوت الاصطدام | أفلام المنتجات، والأكشن، والشروح |
| اللقطات المفتاحية | يستوفي لقطة واحدة عبر حتى 10 صور مثبّتة | الانتقالات المضبوطة، واللوحات القصصية |
| استكمال الفيديو | يمدّد مقطعًا قائمًا من إطاراته الأخيرة | المشاهد الأطول، وإنقاذ لقطة جيدة |
| حوار متعدد اللغات | يتحدّث أكثر من 13 لغة أمام الكاميرا مع مزامنة الشفاه | الفيديو المُوطَّن، والمقدّمون، والإعلانات |
| توليد متعدد اللقطات | يرتّب عدة زوايا داخل توليد واحد | الأفلام القصيرة، والإعلانات، والكشف عن منتج |
| وضع المسودة | معاينة سريعة، ثم تصيير كامل يطابقها | استكشاف الاتجاهات قبل الالتزام |
فيديو بصوت أصلي
العنوان الأبرز أن الصورة والصوت يصلان معًا. يولّد Flux 3 كل مقطع بصوت أصلي متزامن في التمريرة نفسها، فيرتبط الاصطدام أو وقع الخطى أو الجملة المنطوقة بالحركة بدلًا من إضافته لاحقًا. سمِّ الصوت الذي تريده في الأمر، وحدِّد لغة حين يتضمّن المشهد حوارًا.
فيزياء واقعية
يتعلّم Flux 3 الحركة والكتلة والصوت نظامًا واحدًا، فيتبع الوزن والزخم والاصطدامات قواعد حقيقية، وتحافظ المواد على مظهرها مع حركة الكاميرا. صِف كيف تتطوّر الحركة عبر اللقطة، فتُقرأ الفيزياء كأنها مصوَّرة لا منزلقة.
اللقطات المفتاحية والاستكمال
طريقتان للتحكّم في الحركة. ثبِّت صورًا بوصفها لقطات مفتاحية ويستوفي Flux 3 لقطة واحدة متصلة عبرها: صورة واحدة تضبط الإطار الافتتاحي، واثنتان تثبّتان البداية والنهاية، وحتى عشر صور مثبّتة بأزمنة تحوّل المقطع إلى لوحة قصصية يجب أن يمرّ بها النموذج بالترتيب. أو زوّده بلقطات لديك بالفعل، فيستكمل استكمال الفيديو من الإطارات الأخيرة، حاملًا الزخم وسلوك الكاميرا ومهد الصوت عبر نقطة الوصل دون قطع.
حوار متعدد اللغات والخط المكتوب
اقتبس الجملة، وسمِّ اللغة، وصِف طريقة الإلقاء، وينطقها Flux 3 أمام الكاميرا بلكنة ومزامنة شفاه متطابقتين. تشمل اللغات المدعومة الإنجليزية ولهجاتها، والصينية، والإسبانية، والفرنسية، والألمانية، واليابانية، والبرتغالية، والروسية، والإيطالية، والإندونيسية، والتركية، والهندية، والبنجابية. تُعرَض الكتابة كجزء من المشهد وتصمد مع حركة الكاميرا، فتبقى العناوين واللافتات واضحة أثناء الحركة.
حالات استخدام Flux 3
مشاهد بصوت أصلي
يعود المقطع وصوته متزامنًا بالفعل، فتقع المؤثرات أو الجملة المنطوقة مع الحركة بدلًا من لقطة صامتة تُصلحها لاحقًا.
أفلام المنتجات والعلامة التجارية
تبقى الانعكاسات والوزن والمواد صادقة مع حركة الكاميرا، فيُقرأ الصبّ أو الدوران أو السقوط كأنه مصوَّر لا محاكى.
تسلسلات متعددة اللقطات
رتِّب عدة زوايا داخل توليد واحد، أو مدِّد مقطعًا بالاستكمال، محافظًا على شخصية واحدة عبر كل قطع.

فيديو مُوطَّن
يتيح الحوار متعدد اللغات والنص الدقيق على الشاشة إصدار المشهد نفسه بعدة لغات، دون تمريرة عناوين أو صوت منفصلة.

مسودة، ثم التزام
عايِن اتجاهًا بسرعة وبتكلفة منخفضة، احكم عليه، ثم صيِّر النسخة التي اعتمدتها بجودة كاملة بالموضوعات والتكوين والحركة نفسها.

شروح بفيزياء واقعية
تتبع الجاذبية والاصطدامات والحركة قواعد حقيقية، فتبقى لقطات الشرح دقيقة وهي تحافظ على نظافتها.
كيف تكتب أمرًا لـ Flux 3
وجِّه مشهدًا، ولا تصف كومة أشياء. توصي Black Forest Labs بتسمية ما يحدث، وكيف تتحرّك الموضوعات، وكيف تتصرّف الكاميرا، وكيف تُسمَع اللقطة، مستخدمًا أسماء وأفعالًا محسوسة تراها الكاميرا فعلًا. الصفات الغامضة تترك النتيجة للصدفة.
اختر صيغة الأمر
يقبل Flux 3 أربع صيغ، والطول ليس الهدف. ابدأ قصيرًا للاستكشاف، ثم أطِل الأمر فقط حيث تحتاج تحكّمًا أكبر.
| الصيغة | استخدمها حين | مثال |
|---|---|---|
| عبارة قصيرة | الاستكشاف السريع، موضوع واحد واضح، والمفاجآت السعيدة | صقر ينقضّ فوق كثبان الصحراء عند الغروب، تقريب بعيد |
| جملة بلغة طبيعية | الخيار اليومي المعتاد للقطة واحدة | لقطة تتبّع منخفضة لقارب داو تقليدي يعبر مياه الخليج الهادئة عند الفجر |
| حقول موسومة | ضبط عنصر واحد دون لمس الباقي | لقطة الكاميرا: واسعة، زاوية منخفضة. الموضوع: مدرِّب صقور يعبر الكثبان |
| صياغة زمنية | حين يجب أن يقع الفعل عند لحظة محددة | 0.0–1.5 ثانية لقطة واسعة ثابتة لواجهة دبي البحرية. 1.5–3.0 ثانية يبدأ دفع بطيء نحو الداخل |
شكل الجملة الطبيعية يستحق الحفظ: [الكاميرا] لقطة لـ[الموضوع] وهو [الفعل] في [البيئة]، ثم تفصيل بصري وحركي داعم. أبقِ لحظات الصياغة الزمنية قابلة للتحقيق، لحظتان أو ثلاث للمقطع من خمس ثوانٍ، وحدِّد قطعًا حادًا أينما تغيّرت الزاوية.
ابنِ CASTLE للعمل متعدد اللقطات
حين يجب أن يصمد المظهر والقصة عبر عدة لقطات، توثّق Black Forest Labs مخططًا من ستة أجزاء. تجمع الأجزاء الستة اختصار CASTLE، وهو اختصارنا لمخططها لا اسمًا رسميًا له، وهو أسرع طريقة لتذكّر ما ينقص أمرًا طويلًا.
| العنصر | ما يدخل فيه | |
|---|---|---|
| C | الملخّص الأساسي | سطر واحد يغطّي التسلسل كله: من، وأين، ومسار الأحداث |
| A | الصوت | لكل لقطة: المشهد الصوتي، مُقدَّمًا متزامنًا مع الإطارات |
| S | الموضوع | يبقى ثابتًا كلمة بكلمة عبر اللقطات، فتستقر الهوية |
| T | الجدول الزمني | لكل لقطة، بتوقيت: حركة الكاميرا وفعل الموضوع |
| L | المظهر | اللمسة العامة: مستوى الواقعية، ومرجعيات اللون، والحبيبات |
| E | البيئة | لكل لقطة: المكان، ونوعية الضوء، وعمق الميدان |
املأها بأي ترتيب تفكّر فيه، ثم اجمع الأمر بالتسلسل الذي توثّقه Black Forest Labs: الملخّص الأساسي، البيئة، الموضوع، الجدول الزمني، الصوت، المظهر. إبقاء وصف الموضوع مطابقًا حرفيًا بين اللقطات هو ما يمنع الشخصية من الانحراف عبر القطع. إنها أرخص حيلة استمرارية في الدليل.
سمِّ الصوت الذي تريده
يُولَّد الصوت مع الصورة، فالمشهد الذي يوحي بصوت يمنح النموذج مادة أوفر من مشهد مجرّد. وقع الخطى، والاصطدامات، والمطر، والمحركات، والحشود، كلها تُقرأ بوضوح. هناك أربع طبقات، ونادرًا ما تحتاجها كلها.
| الطبقة | ماذا تصف | مثال |
|---|---|---|
| الكلام | من يتحدّث، والكلمات الدقيقة بين علامتي تنصيص، وكيف | صانع القهوة يقول: «جرّبها الآن». بهدوء ومباشرة |
| الصوت المحيطي | صوت المكان نفسه | لغط خفيف في سوق تقليدي، وأصوات باعة من بعيد |
| المؤثرات | أصوات مرتبطة بأفعال مرئية | فنجان قهوة صغير يصطدم بصحنه |
| الموسيقى | الأسلوب، والإيقاع، وموضعها في المزيج | لحن بيانو متقشّف تحت المشهد، منخفض في المزيج |
عادتان تؤديان معظم العمل. سمِّ مصدر الصوت بدلًا من طلب الصمت، لأن «هدوء الغرفة» قد ينهار إلى فراغ صوتي بينما «لغط سوق من بعيد» يمنح النموذج ما يصيّره. وفي الجملة المنطوقة، حدِّد إن كان المتحدّث أمام الكاميرا أو أنه تعليق صوتي، وإلا فقد تُعامَل الجملة المقتبسة نصًّا يُكتب داخل الإطار.
وجِّه الصوت لا الانطباع
«محترف، ودافئ، وجذّاب» تنتج القراءة المصقولة نفسها لمذيع في كل مرة. المرجعيات الملموسة أفضل: العمر واللكنة حين يهمّان، والسجل الصوتي، وكيف سُجِّل، وطريقة الإلقاء، وقيد مثل «دون إلقاء مذيع». ثم اقرأ الجملة بصوت مسموع قبل التوليد. توجيه الصوت لا يُنقذ نصًّا جامدًا.
أخطاء شائعة
- وصف لقطة ثابتة. النموذج المخصّص للفيديو يحتاج حركة عبر الزمن، لا صورة موصوفة بالكلمات.
- نسيان الصوت. الصوت يُولَّد افتراضيًا، فسمِّ المؤثر أو الصوت المحيطي أو الجملة التي تريدها.
- تكديس مصطلحات الكاميرا. «لقطة تتبّع منخفضة» واضحة؛ أما «مدار محمول جوي منخفض مع دفع نحو الداخل» فليست كذلك.
- كتابة أوامر سلبية. لا تدعم نماذج Flux الأوامر السلبية، فاذكر ما تريده فعلًا.
- إثقال مقطع قصير. عدة متحدّثين، ونص طويل، وعدة إيقاعات في خمس ثوانٍ ستقتطع الكلمة الأخيرة. اختصر الجملة أو ارفع المدة.
للاطّلاع على قائمة القدرات والمواصفات الكاملة، راجع صفحة نموذج Flux 3.
