Wan 3.0
بواسطة Alibaba
نموذج الفيديو الأحدث من Alibaba، في بيتا عامة.
ثلاثون ثانية من برومبت أو مستند أو صفحة ويب.

الميزات الأساسية
مواصفات مؤكَّدة من إطلاق Wan 3.0 في البيتا العامة لدى Alibaba، أغسطس 2026.
المواصفات التقنية
حتى 30 ثانية
ثلاثون ثانية أصلية في مرور واحد، بتحكم ذكي في المدة.
480p إلى 1080p
ثلاثة مستويات: 480p و720p و1080p. ولا يوجد إخراج 4K.
بيتا عامة
على Alibaba Cloud Model Studio وQwen Cloud باسم wan3.0-video.
API فقط
لا أوزان مفتوحة. وخط Wan المفتوح يقف عند Wan 2.2.
حالات الاستخدام
من التقرير إلى الفيديو
سلّم Wan 3.0 عرضًا أو جدولًا أو ملف pdf. يقرأ ما بداخله ويبني منه تسلسلًا مرئيًا. تقرير الربع يخرج مقطعًا، لا شرائح.
إعلان كامل في لقطة واحدة
ثلاثون ثانية تغطي الإعلان كله في توليدة واحدة. لا قطعات تُخاط ولا ألوان تُطابق بعدها. وإعلان رمضان لا يملك ذلك الوقت.
سلسلة مقيّدة بالمراجع
يثبّت Omni-Reference الشخصية والمنتج والموقع عبر كل لقطة. فتُقرأ حملة متجر خليجي كاملة كقطعة واحدة.
أمثلة على الأوامر
نظرة عامة
وكالة في دبي وفريق تسويق في الرياض ينتجان فيديو أكثر من أي وقت. والمادة الخام موجودة عندهما أصلًا. تقارير أداء، وأوراق منتجات، وصفحات متاجر. لكن الطريق من الملف إلى المقطع المنشور يمرّ بكاتب ومصمم ومونتير. وهنا تحديدًا يقع ما يميّز Wan 3.0.
وهو أحدث نموذج في خط Wan للفيديو لدى Alibaba Tongyi Lab. أُطلق في بيتا عامة يوم 6 أغسطس 2026. تصفه Alibaba بقفزة «من توليد إطار إلى رواية قصة كاملة». وعمليًا يعني ذلك ثلاثة أشياء. مقاطع أصلية من 30 ثانية في مرور واحد. وصوت يُولَّد إلى جانب الصورة. ومدخل يتجاوز البرومبت إلى المستندات والعروض وصفحات الويب. وهو يعمل على Alibaba Cloud Model Studio وQwen Cloud باسم wan3.0-video. والتسعير لكل ثانية، عبر ثلاثة مستويات دقة.
قبل أي شيء: ما هو متاح فعلًا
جداول المواصفات المتداولة عن Wan 3.0 تحتاج تدقيقًا. الدقة تقف عند ثلاثة مستويات: 480p و720p و1080p. ولا يوجد مستوى 4K. وادعاءات «Wan 3.0 يدعم 4K» في نتائج البحث ليست من Alibaba. فصفحة النموذج لديها تسعّر ثلاثة مستويات بالضبط، ولا تذكر 4K إطلاقًا.
والباب مغلق كذلك أمام الأوزان. Wan 3.0 يعمل عبر الواجهة البرمجية وحدها. ولم تظهر له أوزان على Hugging Face، ولا على GitHub، ولا على ModelScope. وأوزان Alibaba المنشورة تقف عند Wan 2.2 برخصة Apache 2.0. أما أجيال 2.5 و2.6 و2.7 فكانت كلها تجارية عبر الواجهة. فإن كان فريقك ملزمًا باستضافة ذاتية، فالجواب هو Wan 2.2 وحده. وتدور كذلك جداول تذكر «60 مليار معامل» أو «أوزانًا مفتوحة برخصة Apache 2.0». عاملها كلها على أنها مفبركة، حتى تنشر Alibaba بطاقة النموذج.
المستند مدخل، لا مرفق
القدرة الفارقة اسمها Omni-Reference. مدخلها ليس نصًا وصورة وصوتًا وفيديو فحسب. فهي تقرأ كذلك الملفات المنظّمة. ومنها doc وxls وppt وpdf وtxt وkey وpages وnumbers وmd. ويقبل النموذج معها أي رابط صفحة ويب. ثم يبني تسلسلًا مرئيًا مما يجده بداخلها. وتصف Alibaba ذلك بتحويل «البيانات الساكنة الكثيفة بالنص إلى محتوى فيديو بدرجة الواقع».
والفرق العملي بسيط. سلّمه عرض الربع أو ورقة مواصفات منتج. يعود بمقطع منتهٍ، لا بلوحة قصة. وهذا المدخل تحديدًا لا تجده اليوم في أي نموذج فيديو رئيسي آخر.
ثلاثون ثانية تغيّر وحدة العمل
القفزة عن Wan 2.7 ليست في الرقم وحده. ثلاثون ثانية في مرور واحد تعادل نحو ضعف ما كان الخط يبلغه. لكن الأهم أن وحدة العمل نفسها تغيّرت. فالإعلان الكامل يدخل في توليدة واحدة، وكذلك المشهد القصير والكشف البطيء. وكان البديل قبلها مقاطع تُجمَّع، ثم يُطارَد فيها تطابق الضوء والإيقاع والاتصال. والتحكم الذكي في المدة يقيس الطول على الموجز. فلا تُحشى اللحظة القصيرة بثوانٍ فارغة.
واللقطة الطويلة تطلب برومبتًا من نوع آخر. المشهد القصير يُوصف بما فيه. أما الثلاثون ثانية فتُوصف بما يجري فيها. فالمشهد يحتاج أن يبدأ، ثم يتحوّل، ثم ينتهي. اكتب إذًا كيف يتطوّر الإطار، لا ما يحتويه فقط. والطول بلا تحوّل يبقى مقطعًا بطيئًا. وهذه أشيع طريقة لإهدار التوليد الطويل.
المراجع والتحرير: تحكّم بدل إعادة المحاولة
يقبل Omni-Reference حتى 20 أصلًا مرجعيًا. يثبّت بها شخصية أو منتجًا أو موقعًا عبر المقطع ومن لقطة إلى أخرى. وهذا ما يجعل السلسلة تُقرأ كقطعة عمل واحدة. ووسم كل مرجع داخل البرومبت لا يقلّ أهمية عن رفعه.
وصار التحرير داخل النموذج نفسه، لا في أداة تالية. يدعم Wan 3.0 التحرير بالتعليمات وبالمراجع. تحدّد فترة زمنية وتعيد توليدها وحدها، ويبقى ما عداها كما هو. وتضبط في المرور نفسه الصورة والحركة وحتى جمل الشخصية. ووصفت التغطية الصينية النقلة بأنها انتقال «من القرعة إلى الإنتاج». أي مرور يمكن التحكم به، بدل إعادات لا تنتهي.
الصورة والصوت والنص داخل الإطار
تسمّي Alibaba هدفها البصري «تصييرًا بدرجة الواقع»، وتركّز فيه على البشر. الوجه والبشرة يخرجان بتفاصيلهما. والانفعال يبقى طبيعيًا متحفّظًا. والتعابير الدقيقة ترتبط بالإيماءة. ويصل تخصيص الملامح إلى بنية العظام وتفاصيل العين.
أما الصوت فيُولَّد في المرور نفسه مع الصورة. لذلك يُكتب الإيقاع داخل البرومبت. سمِّ الفراش الصوتي، وحدّد موضع النبضة، لتنزل الصورة والصوت معًا.
وتحسّن النص داخل الإطار كذلك. فهناك تصيير نص طويل عبر 12 لغة، ورسوم وصيغ ومعلومات بيانية أنظف. غير أن المراجعات تشير إلى مساحة نمو باقية في الصوت والنص. ولم تنشر Alibaba قائمة اللغات الاثنتي عشرة. فإن كان العنوان العربي جزءًا من اللقطة، افحصه إطارًا بإطار قبل التسليم.
Wan 3.0 وMorphic
Wan 3.0 ليس ضمن كتالوج Morphic. لكن Morphic تشغّل اليوم تشكيلة فيديو واسعة، منها Seedance وKling وVeo. فتستطيع أن تولّد الآن، وتختار النموذج الذي يناسب اللقطة. وعادات البرومبت أعلاه تنتقل معك إلى أي منها. اكتب اللقطة الطويلة بوصفها تحوّلًا. وسِم كل مرجع باسمه. وابنِ الإيقاع داخل الموجز. فالصياغة على هذا الأساس لا تكلّفك شيئًا.
أسعار بسيطة
ابدأ مجاناً اليوم، مع إمكانية الترقية أو الإلغاء في أي وقت.
Basic
1100 شهرياً أرصدة
1 مستخدم فقط
جميع النماذج
Workflows
Standard
3625 شهرياً أرصدة
1 مستخدم فقط
جميع النماذج
Workflows
Pro
6350 مشترك شهرياً أرصدة
1 مستخدم
جميع النماذج
Workflows
Pro Max
24650 مشترك شهرياً أرصدة
1 مستخدم
جميع النماذج
Workflows
Enterprise
لحدود أعلى
مخصص
شروط الأسعار والفوترة

Free
للتجربة والاستكشاف
$0
مجاني إلى الأبد
الأسئلة الشائعة
ChatGPT Images 2.5
OpenAI
نموذج الصور من OpenAI، صدر في سبتمبر 2026. تفاصيل أدق، وتحرير محدّد، وسرعة أعلى.
Lyria 3.5
Google DeepMind
أغانٍ كاملة ببنية وغناء وكلمات. اكتب طلبك بالعربية، تُغنَّ بالعربية.
MiniMax H3 Max Turbo
fal.ai
المستوى السريع من H3 المطور لدى fal. ضعف السرعة، والمظهر نفسه تقريبًا.
Inworld TTS 2
Inworld
خمسة وتسعون صوتًا، وأكثر من 100 لغة. يبدأ الصوت في أقل من ثانية.