Seed Audio 1.0
بواسطة ByteDance
نموذج TTS الشامل من ByteDance.
صوت وموسيقى ومؤثرات في توليد واحد.

الميزات الأساسية
استمع إلى النطاق الكامل
تعليق وثائقي دافئ ومتزن.
قراءة جملة خافتة ومتوترة، قريبة وحميمة.
سرير صوتي طبقي لسوق مفتوح.
عاصفة متدحرجة تتصاعد إلى قصف رعد بعيد.
مقطع قصير صاعد للوتريات والنحاسيات.
إيقاع مسترخٍ بمفاتيح ناعمة وطقطقة فينيل.
المواصفات التقنية
ByteDance
طوّره فريق أبحاث Seed التابع لـ ByteDance.
20
الإنجليزية والصينية واليابانية والكورية والإسبانية والفرنسية والألمانية وغيرها.
حتى دقيقتين
دقيقتان من الصوت المولّد كحد أقصى في كل مرور.
3000 حرف
مساحة تكفي لموجز مشهد كامل، بما فيه الحوار.
حتى 3
حتى ثلاثة مقاطع مرجعية، مدة كل منها 30 ثانية.
بدون بث
يعالج المسار كاملًا، لا بثًا لحظيًا.
حالات الاستخدام
الكتب الصوتية
سرد وأصوات وتصميم صوتي لكتاب كامل. تقدّر ByteDance الكلفة بنحو عُشر تسجيل الاستوديو.
دبلجة الفيديو
صِف الصوت أو ارفع صورة الشخصية، ثم استخدم الأختام الزمنية لوضع كل جملة حيث تحتاجها الصورة.
صوت الألعاب
جمل الشخصيات والمشاهد المؤدّاة ومؤثرات البيئة للحظات غامرة، مولّدة من النص مباشرة.
صوت فيديو في مرور واحد
امنح المقطع سرده وتصميمه الصوتي وموسيقاه في توليد واحد، دون خطوة مزج منفصلة بعده.
الإعلانات والترويج
جملة منطوقة ومؤثرات وموسيقى كمسار واحد جاهز للاستخدام، مصمم للمحتوى القصير.
الحوار والدراما الصوتية
عدة شخصيات، لكل منها صوتها وأداؤها، في مشهد واحد بأجواء وإيقاع متناسقين.
أمثلة على الأوامر
نظرة عامة
Seed Audio 1.0 هو نموذج الصوت الشامل من ByteDance، مبني كخطوة تالية لتحويل النص إلى كلام لا كقطيعة معه. تستخدم سلاسل العمل الصوتية التقليدية أدوات منفصلة للصوت والموسيقى والمؤثرات، يولَّد كل منها على حدة ثم تُمزج. أما Seed Audio 1.0 فينتج الثلاثة معًا من أمر نصي واحد، ويكون الناتج مسارًا صوتيًا كاملًا جاهزًا للاستخدام.
من النص إلى الكلام نحو المرجع إلى الصوت
تأخذ أنظمة TTS المعتادة صوتًا وكتلة نص. أما Seed Audio 1.0 فيأخذ مشهدًا: الطقس والمكان، والموسيقى تحته، والمؤثرات حول الحدث، وكيف تبدو كل شخصية وكيف يُسمع صوتها، والجمل التي تقولها. كل ما يمكنك وصفه يصير جزءًا من التوليد نفسه، ولهذا يبلغ الأمر 3000 حرف دون أن يكون حشوًا.
يفهم النموذج سياق المشهد. أمر لحوار في مقهى ينال ضجيجًا خلفيًا والحيّز الصوتي الصحيح، لا طنين غرفة عامًا. ومشهد الحركة ينال مؤثرات حادة وموسيقى متحركة، لا موسيقى خلفية ملصقة فوق الصمت. تخرج الطبقات الثلاث متناسبة وممزوجة للمشهد، لا مجمّعة من تصديرات منفصلة.
أربعة أوضاع
أبسطها تحويل النص إلى كلام: تختار صوتًا وتُدخل نصًا فيقرؤه النموذج. ويضيف استنساخ الصوت خطوة واحدة: ترفع مقطعًا صوتيًا واحدًا فيصبح الصوت المستنسخ متاحًا للغرض نفسه. أما الوضعان الآخران فهما ما يميّز هذا النموذج عن أنظمة TTS المعتادة.
في من النص إلى الصوت (T2A) يأتي كل صوت من وصفك. حدّد عمر الشخصية ولكنتها وانفعالها ونبرتها وسرعتها، ويتولى النموذج إسنادها.
في من النص مع الصوت إلى الصوت (TA2A) ترفع حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية كحد أقصى، وتربط كل مقطع بشخصية داخل الأمر. عندها يتبع الصوت المولّد التسجيل بدل الوصف. ويمكن رفع المقاطع المرجعية لمهمة واحدة أو حفظها في مكتبة أصول وإعادة استخدامها عبر سلسلة كاملة.
عشرون لغة
يولّد Seed Audio 1.0 بالإنجليزية والصينية واليابانية والكورية والإسبانية المكسيكية والإسبانية القشتالية والإندونيسية والألمانية والبرتغالية البرازيلية والفرنسية والتايلاندية والفيتنامية والملايوية والفلبينية والإيطالية والروسية والهولندية والبولندية والتركية والسويدية. العربية ليست ضمن اللغات المدعومة حتى الآن. ويجب أن تتطابق لغة الأمر مع لغة النص: اكتب الموجز باللغة التي تتحدث بها الشخصيات.
توقيت تضبطه بدقة الثانية
يقبل Seed Audio 1.0 ختمًا زمنيًا على أي جملة، يُكتب داخل السطر بصيغة [5.5s:8.0s]، ويضبط الأداء ضمن تلك النافذة تحديدًا. في الدبلجة، هذا هو الفرق بين صوت يقارب المطلوب وصوت يقع على القطع تمامًا. والتوليد بدون بث: يعالج النموذج المسار النهائي في مرور واحد، حتى دقيقتين.
أسعار بسيطة
ابدأ مجاناً اليوم، مع إمكانية الترقية أو الإلغاء في أي وقت.
Basic
1100 شهرياً أرصدة
1 مستخدم فقط
جميع النماذج
Workflows
Standard
3625 شهرياً أرصدة
1 مستخدم فقط
جميع النماذج
Workflows
Pro
6350 مشترك شهرياً أرصدة
1 مستخدم
جميع النماذج
Workflows
Pro Max
24650 مشترك شهرياً أرصدة
1 مستخدم
جميع النماذج
Workflows
Enterprise
لحدود أعلى
مخصص
شروط الأسعار والفوترة

Free
للتجربة والاستكشاف
$0
مجاني إلى الأبد
الأسئلة الشائعة
ChatGPT Images 2.5
OpenAI
نموذج الصور من OpenAI، صدر في سبتمبر 2026. تفاصيل أدق، وتحرير محدّد، وسرعة أعلى.
Lyria 3.5
Google DeepMind
أغانٍ كاملة ببنية وغناء وكلمات. اكتب طلبك بالعربية، تُغنَّ بالعربية.
MiniMax H3 Max Turbo
fal.ai
المستوى السريع من H3 المطور لدى fal. ضعف السرعة، والمظهر نفسه تقريبًا.
Inworld TTS 2
Inworld
خمسة وتسعون صوتًا، وأكثر من 100 لغة. يبدأ الصوت في أقل من ثانية.