ما هو Kling 3.0؟ شرح الميزات ونصائح كتابة الأوامر وحالات الاستخدام

ما هو Kling 3.0؟ شرح الميزات ونصائح كتابة الأوامر وحالات الاستخدام

كل ما تحتاج معرفته عن Kling 3.0. كيف توجّهه، وما الذي تغيّر عن Kling 2.6، والقدرات، والمواصفات التقنية، وحالات استخدام واقعية.

ما هو Kling 3.0؟

Kling 3.0 هو نموذج توليد فيديو أصدرته Kuaishou في فبراير 2026. بُني بدمج نموذجين سابقين، Kling Video 2.6 وKling O1، في بنية موحّدة واحدة. تولّى Video 2.6 توليد تحويل النص إلى فيديو وتحويل الصورة إلى فيديو مع التحكم في الحركة. وركّز Kling O1 على الجودة البصرية والثبات. يجمع Kling 3.0 كليهما في نموذج واحد يولّد الفيديو والصوت وثبات العناصر في تمريرة واحدة.

النتيجة نموذج يعمل أقل كمولّد مقاطع وأكثر كمخرج مشاهد. تصف سردًا في أمرك، فيخطّط Kling 3.0 اللقطات، ويعيّن زوايا الكاميرا، ويولّد حوارًا متزامنًا مع مزامنة الشفاه، ويبقي الشخصيات ثابتة بصريًا عبر كل قطعة. تدعم المخرجات مددًا من 3 إلى 15 ثانية بدقات تصل إلى 4K أصلي.

على Morphic، يتاح Kling 3.0 كجزء من مجموعة توليد الفيديو. يمكنك استخدامه في مساحة العمل نفسها مع أدوات الصور والموسيقى والصوت في Morphic، ما يفيد حين يحتاج المشروع إلى أصول عبر صيغ متعددة.

كيفية توجيه Kling 3.0

طريقة كتابتك للأمر تغيّر كل شيء في المخرجات. Kling 3.0 نموذج فيديو، ما يعني أنه يستجيب للحركة والتوقيت وإخراج الكاميرا، لا للمظهر البصري فحسب. الأوامر التي تنتج أفضل النتائج تُقرأ كوصف مشهد لفيلم قصير، لا كتعليق على صورة فوتوغرافية.

إليك إطار عمل لكتابة الأوامر يحقّق نتائج قوية عبر أنواع مختلفة من محتوى الفيديو.

1. ابدأ بلغة الكاميرا

الكلمات الأولى في أمرك تحدّد الطابع البصري للتوليد كله. يفهم Kling 3.0 المصطلحات السينمائية ويستجيب لها مباشرةً. تسمية سلوك كاميرا محدد قبل وصف أي شيء آخر تثبّت النموذج على نهج بصري متسق.

أمر ضعيفأمر قوي
«امرأة تمشي في مدينة ليلًا، مظهر سينمائي»«لقطة تتبّع محمولة تتبع امرأة بمعطف داكن تمشي في شوارع مدينة مبلّلة بالمطر ليلًا، انعكاسات نيون على الرصيف، عمق ميدان ضحل»

الأمر الأول يترك سلوك الكاميرا بالكامل للنموذج. أما الثاني فيخبره بالضبط كيف يتحرّك: محمول، تتبّع، يتبع الموضوع. كما يؤسّس المشهد بتفاصيل بيئية محددة توجّه الإضاءة والأجواء.

مصطلحات الكاميرا التي يستجيب لها Kling 3.0 جيدًا: لقطة التتبّع، والتحريك المداري، ولقطة الماكرو القريبة، ومنظور الشخص (POV)، والتحريك الخاطف، والدفع البطيء نحو الداخل، واللقطة الواسعة الثابتة، والمحمولة بانجراف خفيف.

2. هيكل الأوامر متعددة اللقطات بلقطات معلّمة

حين تريد زوايا كاميرا متعددة في توليد واحد، علّم كل لقطة صراحةً. يدعم Kling 3.0 وضع تعدد اللقطات المخصّص حيث تحدّد عدد اللقطات ومدة كل واحدة وما يحدث في الإطار. كلما كانت تسميات لقطاتك أوضح، تبعها النموذج بدقة أعلى.

أمر ضعيفأمر قوي
«رجل يطلب طعامًا في مطعم، ثم يحضر النادل الوجبة، ثم يأكل»«اللقطة 1: لقطة متوسطة لرجل بقميص كحلي جالس إلى طاولة مطعم، يتصفّح القائمة، إضاءة داخلية دافئة. اللقطة 2: لقطة قريبة من فوق الكتف للقائمة في يديه، وإصبعه يشير إلى صنف. اللقطة 3: لقطة واسعة للنادل يقترب من الطاولة حاملًا طبقًا، والرجل ينظر إلى الأعلى. اللقطة 4: لقطة قريبة للطبق وهو يُوضع على الطاولة، والبخار يتصاعد من الطعام.»

الأمر الأول يصف سلسلة أحداث لكنه لا يمنح النموذج أي توجيه بصري. أما الثاني فيقسّم السرد إلى لقطات مميّزة، لكل واحدة تأطير محدد وموضع للموضوع وتفصيل بصري. هذا ما صُمِّم من أجله وضع تعدد اللقطات المخصّص.

3. علّم المتحدثين مباشرةً بحوارهم

في المشاهد ذات الحوار، يحتاج Kling 3.0 إلى معرفة أي شخصية تنطق أي جملة. دون تعليم صريح، قد يعيّن النموذج الأصوات للوجوه الخطأ أو يُحدث خلطًا بين المتحدثين، خصوصًا مع ثلاث شخصيات أو أكثر.

أمر ضعيفأمر قوي
«شخصان يجلسان إلى طاولة مقهى ويتحدثان عن خطط عطلتهما وما إذا كان عليهما الذهاب للمشي في الجبال أو البقاء في المدينة»«امرأة شابة بقميص أبيض ورجل بسترة رمادية يجلسان إلى طاولة مقهى في الهواء الطلق. ترفع المرأة كوب قهوتها وتقول «كنت أفكّر أن نسلك المسار الساحلي يوم السبت.» يتّكئ الرجل إلى الخلف ويردّ «هذا يناسبني، لكن علينا المغادرة مبكرًا قبل اشتداد الحرّ.»»

الأمر الأول يلخّص موضوع المحادثة دون منح النموذج أي حوار فعلي أو تحديد للمتحدث. أما الثاني فيقرن كل شخصية بوصف جسدي وجملتها المحددة، فيستطيع النموذج مطابقة حركات الشفاه والصوت بالوجه الصحيح.

4. استخدم الصور المرجعية لتثبيت الشخصيات

حين ترفع صورة مرجعية، يستخدمها Kling 3.0 مرتكزًا بصريًا طوال التوليد. هذا أكثر موثوقيةً من وصف مظهر الشخصية بالنص وحده، خصوصًا للحفاظ على الثبات عبر عدة لقطات أو عمليات توليد منفصلة.

للاستفادة القصوى من المراجع:

  • ارفع 2 إلى 4 صور مرجعية تُظهر الشخصية من زوايا مختلفة إن أمكن. هذا يمنح النموذج بيانات بصرية أكثر ليتشبّث بها.
  • إن رفعت مرجع فيديو، يستطيع النموذج استخراج مظهر الشخصية ونبرة صوتها الطبيعية معًا، مبقيًا كليهما ثابتًا طوال التوليد.
  • لفيديوهات المنتجات، ارفع صورة المنتج مرجعًا لإبقاء الهوية والنص والألوان ثابتة أثناء حركة الكاميرا.

5. صِف الحركة والفعل عبر الزمن، لا المشاهد الثابتة

أكثر الأخطاء شيوعًا عند توجيه نموذج فيديو هو كتابة أمر يصف صورة فوتوغرافية. يولّد Kling 3.0 حركةً، لذا يحتاج أمرك إلى وصف كيف تتغيّر الأشياء عبر مدة المقطع: كيف يتحرّك الموضوع، وكيف تستجيب الكاميرا، وكيف يتطوّر المشهد.

أمر ضعيفأمر قوي
«زجاجة عطر على سطح مخملي بإضاءة ناعمة وبتلات ورد»«تدور الكاميرا ببطء حول زجاجة عطر زجاجية على سطح مخملي داكن، ضوء ذهبي ناعم يلتقط أوجه الزجاجة وهي تدور إلى المشهد، بتلات ورد متناثرة تتحرّك برفق من حركة الهواء، الكاميرا تضيّق التأطير تدريجيًا من إطار واسع إلى لقطة قريبة للملصق»

الأمر الأول يصف صورة ثابتة. أما الثاني فيصف كيف تتحرّك الكاميرا، وكيف يتفاعل الضوء مع الجسم عبر الزمن، وكيف يتغيّر التأطير. هذا يمنح النموذج مسار حركة واضحًا يتبعه.

ما الجديد في Kling 3.0

Kling 3.0 ترقية كبيرة عن Kling Video 2.6. يوضّح الجدول أدناه ما الذي تغيّر، استنادًا إلى وثائق نموذج Kling 3.0 الرسمية.

القدرةKling Video 2.6Kling Video 3.0
تحويل النص إلى فيديونعمنعم
تحويل الصورة إلى فيديونعمنعم
من إطارَي البداية والنهاية إلى فيديونعمنعم
صوت أصلينعمنعم
توليد متعدد اللقطاتلانعم
إطار بداية + مرجع عنصرلانعم
الإسناد المرجعي المشترك لعدة شخصيات (3+)لانعم
دعم متعدد اللغات (الصينية، الإنجليزية، اليابانية، الكورية، الإسبانية)لانعم
اللهجات واللكناتلانعم
مدة مخرجات 15 ثانيةلانعم
مدة مرنة (3 إلى 15 ثانية)لانعم
دقة 4K أصليةلانعم

أبرز الإضافات هي التوليد متعدد اللقطات ونظام مرجع العناصر. يتيح تعدد اللقطات حتى ست قطعات كاميرا في توليد واحد، ما يلغي الحاجة إلى توليد مقاطع فردية وخياطتها معًا يدويًا. ويتيح لك نظام مرجع العناصر ربط مظهر الشخصية البصري ونبرة صوتها بعنصر قابل لإعادة الاستخدام، فيحمل الثبات عبر اللقطات وحتى عبر عمليات توليد فيديو منفصلة.

كما أن الدعم متعدد اللغات مع رسم اللهجات واللكنات جديد أيضًا. دعم Kling 2.6 الصوت الأصلي، لكن 3.0 يمدّ هذا إلى خمس لغات مع القدرة على محاكاة لكنات محددة (الأمريكية والبريطانية والهندية للإنجليزية؛ والكانتونية وشمال الصين وبكين والسيتشوانية والتايوانية للصينية) والتعامل مع التبديل اللغوي داخل مشهد واحد.

قدرات Kling 3.0

إخراج لوحة قصصية متعددة اللقطات

يوفّر Kling 3.0 وضعين للفيديو متعدد اللقطات. في الوضع التلقائي، تفعّل مفتاح تعدد اللقطات فيقرأ النموذج وصف مشهدك لتخطيط انتقالات الكاميرا وتأطير اللقطات وإيقاعها بنفسه. وفي الوضع المخصّص، تحدّد كل لقطة على حدة، مع تعيين المدة وزاوية الكاميرا والمحتوى السردي. يتبع النموذج لوحتك القصصية بدقة.

الوضع المخصّص مفيد بشكل خاص للمحتوى المنظّم مثل إعلانات المنتجات أو تسلسلات الحوار حيث يهمّ توقيت كل قطعة. ويعمل الوضع التلقائي جيدًا حين تريد أن يفسّر النموذج أمرًا سرديًا ويقرّر التغطية البصرية.

صوت أصلي بربط صوت خاص بكل شخصية

يُولَّد الفيديو والصوت في تمريرة واحدة. ينتج النموذج حوارًا متزامن الشفاه، ويمكنك التحكم في أي شخصية تنطق أي جملة بإقران الشخصيات بحوارها في الأمر. وإلى جانب مزامنة الشفاه الأساسية، يدعم Kling 3.0 إنشاء عناصر شخصيات بنبرات صوت مربوطة. وحالما تربط صوتًا بعنصر شخصية، يبقى ذلك الصوت متسقًا في كل ظهور للشخصية دون حاجة إلى إعادة تحديده.

يدعم النموذج الحوار بالإنجليزية والصينية واليابانية والكورية والإسبانية، مع دعم اللهجات واللكنات والتبديل اللغوي متعدد اللغات داخل مشهد واحد.

نظام مرجع العناصر

يمكنك إنشاء عناصر شخصيات قابلة لإعادة الاستخدام برفع 2 إلى 4 صور مرجعية أو مقطع فيديو مرجعي قصير. ولعناصر الشخصيات، يمكنك أيضًا تعيين نبرة صوت برفع مقطع صوتي أو الاختيار من الأصوات المتاحة. وحين تستخدم عنصرًا في أمر، يثبّت النموذج مظهر الشخصية وصوتها طوال الفيديو، محافظًا على الثبات حتى عبر حركات الكاميرا وتغيّرات المشاهد والتسلسلات متعددة اللقطات.

يدعم هذا النظام ثلاث شخصيات مميّزة أو أكثر في الإطار نفسه دون مزج الملامح، وهو أمر حاسم لمشاهد الحوار وأي فيديو بأشخاص متعددين.

الحفاظ على النص والشعار

يستطيع النموذج تحديد المحتوى النصي في الصور المرفوعة، مثل اللافتات أو ملصقات المنتجات أو الشعارات، والحفاظ على ثبات النص طوال الفيديو. كما يستطيع توليد محتوى نصي جديد داخل الفيديو نفسه. يبقى النص واضحًا حتى أثناء حركة الكاميرا المتصلة، ما يفيد المحتوى التجاري حيث يجب أن تبقى عناصر العلامة التجارية حادةً وقابلة للقراءة.

مدة ودقة مرنتان

يولّد Kling 3.0 فيديو من 3 إلى 15 ثانية في تمريرة واحدة، مع دعم دقات تصل إلى 4K أصلي. تمنح المدة الممتدة النموذج مساحةً لتطوير سردي أعقد، وانتقالات مشاهد، وتسلسلات فعل لا تتسع لها المقاطع الأقصر. تشمل خيارات الدقة أيضًا 1080p و720p.

المواصفات التقنية لـ Kling 3.0

المواصفةالتفاصيل
أوضاع التوليدتحويل النص إلى فيديو، تحويل الصورة إلى فيديو، من إطارَي البداية والنهاية إلى فيديو
أقصى مدة15 ثانية
أدنى مدة3 ثوانٍ
أقصى دقة4K أصلي
دقات أخرى1080p، 720p
نسب الأبعاد16:9، 9:16، 1:1
تعدد اللقطاتحتى 6 قطعات كاميرا لكل توليد
أوضاع تعدد اللقطاتتلقائي (النموذج يخطّط اللقطات) ومخصّص (المستخدم يحدّد كل لقطة)
الصوت الأصليحوار متزامن الشفاه، التحكم في نبرة الصوت
اللغات المدعومةالإنجليزية، الصينية، اليابانية، الكورية، الإسبانية
دعم اللهجات واللكناتنعم (لهجات صينية وإنجليزية، لكنات إقليمية)
التبديل اللغوينعم (لغات متعددة في مشهد واحد)
عناصر الشخصياتتُنشأ من 2 إلى 4 صور أو مرجع فيديو
ربط الصوتنبرة الصوت مربوطة بعناصر الشخصيات
الإسناد المرجعي المشترك لعدة شخصياتشخصيتان مميّزتان أو أكثر (3+) في إطار واحد
الحفاظ على النصيقرأ ويحافظ على النص من الصور المرفوعة
نسب النموذجموحّد من Kling Video 2.6 + Kling O1
تاريخ الإصدارفبراير 2026

حالات استخدام Kling 3.0

صنّاع الأفلام القصيرة والمبدعون السرديون

التوليد متعدد اللقطات هو ما يجعل Kling 3.0 مفيدًا بشكل خاص للمحتوى السردي القصير. يمكنك توليد مشهد كامل بحوار لقطة ولقطة معاكسة، ولقطات تأسيسية، ولقطات قريبة في تمريرة واحدة. للمبدعين العاملين على أفلام قصيرة أو مسلسلات مصغّرة أو محتوى اجتماعي مدفوع بالقصة، يزيل هذا العمل اليدوي لتوليد مقاطع فردية وتحريرها معًا. تمنح مدة 15 ثانية بحتى ست قطعات مساحةً كافية لبداية ووسط وذروة داخل توليد واحد.

فيديو المنتجات والتجارة الإلكترونية

تحتاج إعلانات المنتجات إلى تحريك الكاميرا حول جسم مع بقاء نص العلامة التجارية وشعاراتها حادًا. يتعامل الحفاظ على النص في Kling 3.0 مع هذا أصليًا، مبقيًا التسميات واضحة أثناء اللقطات المدارية وحركات التتبّع. وبالاقتران مع نظام مرجع العناصر، يمكنك تثبيت الهوية البصرية للمنتج وتوليد عدة تنويعات إعلانية بزوايا كاميرا أو إعدادات إضاءة أو بيئات خلفية مختلفة بينما يبقى المنتج نفسه ثابتًا. على Morphic، يمكنك توليد فيديو المنتج ثم إنشاء صور مصغّرة مطابقة أو أصول اجتماعية في مساحة العمل نفسها.

فرق محتوى وسائل التواصل الاجتماعي

الجمع بين نسب الأبعاد المرنة (16:9، 9:16، 1:1) والتكرار السريع يعني أنك تستطيع توليد محتوى فيديو خاص بكل منصة دون سير عمل إنتاج منفصل لكل صيغة. وضع تعدد اللقطات مع اللوحة القصصية التلقائية مفيد هنا، حيث تصف فكرة المحتوى ويتولّى النموذج تخطيط اللقطات. للفرق التي تحتاج إلى حجم عبر Instagram وTikTok وYouTube Shorts ومنشورات الموجز، يسرّع هذا دورة الإنشاء بشكل ملحوظ.

المحتوى متعدد اللغات والمؤقلَم

يفتح دعم اللهجات والتبديل اللغوي حالات استخدام لا تستطيع معظم نماذج الفيديو بالذكاء الاصطناعي التعامل معها. فيديو تدريبي يتحدّث فيه مقدّم بالكورية، أو إعلان سياحي تتنقل فيه الشخصيات بين الإنجليزية والإسبانية في منتصف المحادثة، أو مقطع اجتماعي بلكنات إقليمية أصيلة، كلها تُولَّد بحركات شفاه طبيعية وتعابير وجه متسقة. للعلامات التجارية التي تستهدف أسواقًا متعددة، يعني هذا إنتاج محتوى فيديو مؤقلَم من إطار العمل النصي نفسه دون إعادة تسجيل الصوت.

على Morphic، يمكنك اقتران Kling 3.0 بأدوات الصور والصوت في المنصة لبناء حزمة محتوى كاملة، من الفيديو إلى الصورة المصغّرة إلى موسيقى الخلفية، دون التبديل بين تطبيقات منفصلة.

الأسئلة الشائعة

هل Kling 3.0 متاح على Morphic؟

Kling 3.0 متاح على Morphic. سجّل في خطة Morphic، واختر وضع الفيديو من شريط الأوامر، ثم اختر Kling 3.0 من قائمة النماذج المنسدلة. يجاور أدوات توليد الصور والموسيقى والصوت، فيمكنك العمل عبر أنواع محتوى متعددة في مساحة عمل واحدة.

ما الفرق بين Kling 3.0 وKling 3.0 Omni؟

يتعامل النموذجان مع تحويل النص إلى فيديو وتحويل الصورة إلى فيديو، لكنهما يخدمان حالات استخدام مختلفة. Kling 3.0 هو نموذج التوليد الأساسي بلوحة قصصية متعددة اللقطات وصوت أصلي. ويمدّ Kling 3.0 Omni ذلك بضوابط أعمق لثبات العناصر، ومراجع شخصيات معتمدة على الفيديو، وربط نبرة الصوت. إن كنت تحتاج فيديو واحدًا متقنًا من أمر، فـ Kling 3.0 هو الخيار الصحيح. وإن كنت تبني سلسلة تظهر فيها الشخصيات نفسها عبر عمليات توليد متعددة، فيمنحك Omni أدوات الثبات للحفاظ على ذلك.

ما اللغات التي يدعمها Kling 3.0 للصوت؟

يولّد النموذج حوارًا متزامن الشفاه بخمس لغات: الإنجليزية والصينية واليابانية والكورية والإسبانية. ويتجاوز دعم اللغة الأساسي برسم لهجات ولكنات محددة، منها اللكنات الأمريكية والبريطانية والهندية للإنجليزية، ولهجات الكانتونية وشمال الصين وبكين والسيتشوانية والتايوانية للصينية. يمكن للشخصيات أيضًا التنقل بين اللغات في منتصف المحادثة داخل المقطع نفسه.

كيف يعمل التوليد متعدد اللقطات في Kling 3.0؟

يولّد تعدد اللقطات حتى ست قطعات كاميرا مميّزة داخل فيديو واحد. أمامك خياران: الوضع التلقائي، حيث يخطّط النموذج انتقالات اللقطات بناءً على أمرك، والوضع المخصّص، حيث تحدّد بنفسك تأطير كل لقطة ومدتها وزاوية كاميراتها. في الوضع المخصّص، يتبع النموذج لوحتك القصصية بدقة. وفي الوضع التلقائي، يفسّر سردك ويقرّر أفضل تغطية للقطات. يحافظ الوضعان على ثبات الشخصية عبر كل القطعات.

ما الدقة والمدة اللتان يدعمهما Kling 3.0؟

أقصى دقة هي 4K أصلي، أي أن الفيديو يُولَّد بتلك الدقة بدلًا من تكبيره. يتوفّر أيضًا 1080p و720p لتوليد أسرع أو أحجام ملفات أصغر. تتراوح المدة بين 3 و15 ثانية لكل توليد. نسب الأبعاد المدعومة هي 16:9 و9:16 و1:1، تغطّي الصيغ العريضة والعمودية والمربعة.