توليد الصوت

Seed Audio 1.0

بواسطة ByteDance

نموذج TTS الشامل من ByteDance.
صوت وموسيقى ومؤثرات في توليد واحد.

Seed Audio 1.0

الميزات الأساسية

استمع إلى النطاق الكامل

سرد وثائقيكلام

تعليق وثائقي دافئ ومتزن.

0:00
0:12
تعليق إثارةكلام

قراءة جملة خافتة ومتوترة، قريبة وحميمة.

0:00
0:12
أجواء سوق التوابلمؤثرات صوتية

سرير صوتي طبقي لسوق مفتوح.

0:00
0:12
عاصفة رعديةمؤثرات صوتية

عاصفة متدحرجة تتصاعد إلى قصف رعد بعيد.

0:00
0:12
مقطع أوركستراليموسيقى

مقطع قصير صاعد للوتريات والنحاسيات.

0:00
0:12
إيقاع Lo-fiموسيقى

إيقاع مسترخٍ بمفاتيح ناعمة وطقطقة فينيل.

0:00
0:12

المواصفات التقنية

ByteDance

طوّره فريق أبحاث Seed التابع لـ ByteDance.

20

الإنجليزية والصينية واليابانية والكورية والإسبانية والفرنسية والألمانية وغيرها.

حتى دقيقتين

دقيقتان من الصوت المولّد كحد أقصى في كل مرور.

3000 حرف

مساحة تكفي لموجز مشهد كامل، بما فيه الحوار.

حتى 3

حتى ثلاثة مقاطع مرجعية، مدة كل منها 30 ثانية.

بدون بث

يعالج المسار كاملًا، لا بثًا لحظيًا.

حالات الاستخدام

الكتب الصوتية

سرد وأصوات وتصميم صوتي لكتاب كامل. تقدّر ByteDance الكلفة بنحو عُشر تسجيل الاستوديو.

دبلجة الفيديو

صِف الصوت أو ارفع صورة الشخصية، ثم استخدم الأختام الزمنية لوضع كل جملة حيث تحتاجها الصورة.

صوت الألعاب

جمل الشخصيات والمشاهد المؤدّاة ومؤثرات البيئة للحظات غامرة، مولّدة من النص مباشرة.

صوت فيديو في مرور واحد

امنح المقطع سرده وتصميمه الصوتي وموسيقاه في توليد واحد، دون خطوة مزج منفصلة بعده.

الإعلانات والترويج

جملة منطوقة ومؤثرات وموسيقى كمسار واحد جاهز للاستخدام، مصمم للمحتوى القصير.

الحوار والدراما الصوتية

عدة شخصيات، لكل منها صوتها وأداؤها، في مشهد واحد بأجواء وإيقاع متناسقين.

أمثلة على الأوامر

شرح مسرود

راوٍ هادئ، أجواء مطبخ خفيفة: «اخلط الطحين مع الزبدة.»

Edit prompt

تحكم زمني

ريان (دافئ، لاهث): «[5.5s:8.0s] مايا! هل سترحلين الليلة فعلًا؟»

Edit prompt

مشهد كتاب صوتي

مطر على النافذة. الراوية، خفيضة ومتمهلة: «قرأتها مرتين.»

Edit prompt

تعليق رياضي

ملعب ممتلئ، جمهور هادر. المعلق، منتشيًا: «هدف!»

Edit prompt

دراما صوتية

المحقق، متوترًا: «لا تتحرك.» تتوقف الخطى، ويصرّ باب.

Edit prompt

لحظة في لعبة

صوت عميق بطولي: «انكسر الختم القديم.» حجر يحتك.

Edit prompt

نظرة عامة

‏Seed Audio 1.0 هو نموذج الصوت الشامل من ByteDance، مبني كخطوة تالية لتحويل النص إلى كلام لا كقطيعة معه. تستخدم سلاسل العمل الصوتية التقليدية أدوات منفصلة للصوت والموسيقى والمؤثرات، يولَّد كل منها على حدة ثم تُمزج. أما Seed Audio 1.0 فينتج الثلاثة معًا من أمر نصي واحد، ويكون الناتج مسارًا صوتيًا كاملًا جاهزًا للاستخدام.

من النص إلى الكلام نحو المرجع إلى الصوت

تأخذ أنظمة TTS المعتادة صوتًا وكتلة نص. أما Seed Audio 1.0 فيأخذ مشهدًا: الطقس والمكان، والموسيقى تحته، والمؤثرات حول الحدث، وكيف تبدو كل شخصية وكيف يُسمع صوتها، والجمل التي تقولها. كل ما يمكنك وصفه يصير جزءًا من التوليد نفسه، ولهذا يبلغ الأمر 3000 حرف دون أن يكون حشوًا.

يفهم النموذج سياق المشهد. أمر لحوار في مقهى ينال ضجيجًا خلفيًا والحيّز الصوتي الصحيح، لا طنين غرفة عامًا. ومشهد الحركة ينال مؤثرات حادة وموسيقى متحركة، لا موسيقى خلفية ملصقة فوق الصمت. تخرج الطبقات الثلاث متناسبة وممزوجة للمشهد، لا مجمّعة من تصديرات منفصلة.

أربعة أوضاع

أبسطها تحويل النص إلى كلام: تختار صوتًا وتُدخل نصًا فيقرؤه النموذج. ويضيف استنساخ الصوت خطوة واحدة: ترفع مقطعًا صوتيًا واحدًا فيصبح الصوت المستنسخ متاحًا للغرض نفسه. أما الوضعان الآخران فهما ما يميّز هذا النموذج عن أنظمة TTS المعتادة.

في من النص إلى الصوت (T2A) يأتي كل صوت من وصفك. حدّد عمر الشخصية ولكنتها وانفعالها ونبرتها وسرعتها، ويتولى النموذج إسنادها.

في من النص مع الصوت إلى الصوت (TA2A) ترفع حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية كحد أقصى، وتربط كل مقطع بشخصية داخل الأمر. عندها يتبع الصوت المولّد التسجيل بدل الوصف. ويمكن رفع المقاطع المرجعية لمهمة واحدة أو حفظها في مكتبة أصول وإعادة استخدامها عبر سلسلة كاملة.

عشرون لغة

يولّد Seed Audio 1.0 بالإنجليزية والصينية واليابانية والكورية والإسبانية المكسيكية والإسبانية القشتالية والإندونيسية والألمانية والبرتغالية البرازيلية والفرنسية والتايلاندية والفيتنامية والملايوية والفلبينية والإيطالية والروسية والهولندية والبولندية والتركية والسويدية. العربية ليست ضمن اللغات المدعومة حتى الآن. ويجب أن تتطابق لغة الأمر مع لغة النص: اكتب الموجز باللغة التي تتحدث بها الشخصيات.

توقيت تضبطه بدقة الثانية

يقبل Seed Audio 1.0 ختمًا زمنيًا على أي جملة، يُكتب داخل السطر بصيغة [5.5s:8.0s]، ويضبط الأداء ضمن تلك النافذة تحديدًا. في الدبلجة، هذا هو الفرق بين صوت يقارب المطلوب وصوت يقع على القطع تمامًا. والتوليد بدون بث: يعالج النموذج المسار النهائي في مرور واحد، حتى دقيقتين.

أسعار بسيطة

ابدأ مجاناً اليوم، مع إمكانية الترقية أو الإلغاء في أي وقت.

Basic

$9/ شهر
تُفوتر باعتبارها $0 سنوياً

1100 شهرياً أرصدة

1 مستخدم فقط

جميع النماذج

Workflows

Standard

$24/ شهر
تُفوتر باعتبارها $0 سنوياً

3625 شهرياً أرصدة

1 مستخدم فقط

جميع النماذج

Workflows

Pro

$45/ شهر
تُفوتر باعتبارها $0 سنوياً

6350 مشترك شهرياً أرصدة

1 مستخدم

+ حتى 4 المزيد بتكلفة إضافية

جميع النماذج

Workflows

Pro Max

$170/ شهر
تُفوتر باعتبارها $0 سنوياً

24650 مشترك شهرياً أرصدة

1 مستخدم

+ حتى 9 المزيد بتكلفة إضافية

جميع النماذج

Workflows

Enterprise

لحدود أعلى

مخصص

شروط الأسعار والفوترة

أرصدة كبيرة الحجم
حدود مقاعد مخصصة
جميع النماذج
Workflows
Pricing Gradient

Free

للتجربة والاستكشاف

$0

مجاني إلى الأبد

حتى 20 رصيد
مستخدم واحد فقط
نماذج محدودة
Workflows

الأسئلة الشائعة

ما هو Seed Audio 1.0؟
‏Seed Audio 1.0 هو نموذج تحويل النص إلى كلام الشامل من ByteDance. من أمر نصي واحد ينتج الصوت والموسيقى الآلية والمؤثرات الصوتية معًا كمسار نهائي ممزوج. يعمل بوضعين رئيسيين: من النص إلى الصوت (T2A) حيث يأتي كل شيء من وصفك، ومن النص مع الصوت إلى الصوت (TA2A) حيث تضيف مقاطع مرجعية لإسناد أصوات بعينها.
ما اللغات التي يدعمها Seed Audio 1.0؟
يدعم Seed Audio 1.0 عشرين لغة: الإنجليزية والصينية واليابانية والكورية والإسبانية المكسيكية والإسبانية القشتالية والإندونيسية والألمانية والبرتغالية البرازيلية والفرنسية والتايلاندية والفيتنامية والملايوية والفلبينية والإيطالية والروسية والهولندية والبولندية والتركية والسويدية. العربية غير مدرجة ضمن هذه القائمة حتى الآن. وللحصول على أفضل نتيجة، اكتب الأمر بلغة الحوار نفسه.
كيف يعمل الصوت المرجعي في Seed Audio 1.0؟
في وضع TA2A تقدّم حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية كحد أقصى، ثم تربطها داخل الأمر بحيث تقابل كل شخصية تسجيلًا بعينه. يأخذ النموذج طابع الصوت وانفعاله من المرجع ويحافظ عليهما طوال التوليد. ويمكنك كذلك تعريف الصوت بوصف نصي أو بصورة شخصية بدل التسجيل.
هل يستنسخ Seed Audio 1.0 الأصوات؟
نعم. إلى جانب T2A و TA2A هناك وضع لاستنساخ الصوت: ترفع مقطعًا صوتيًا واحدًا، فيصبح الصوت المستنسخ متاحًا لتحويل النص إلى كلام العادي. توثّقه ByteDance بوصفه استنساخًا من مقطع واحد. أما إذا كان الصوت سيظهر داخل مشهد كامل مع موسيقى ومؤثرات وشخصيات أخرى، فاستخدم TA2A بمقاطعه المرجعية الثلاثة.
هل يتحكم Seed Audio 1.0 في توقيت كل جملة؟
نعم. يدعم Seed Audio 1.0 تحكمًا زمنيًا دقيقًا: ضع ختمًا زمنيًا مثل [5.5s:8.0s] في بداية الجملة، فيضبط النموذج أداءها ضمن تلك النافذة تحديدًا. وهذا ما يجعله صالحًا للدبلجة، حيث يجب أن يطابق الحوار الصورة.
هل يولّد Seed Audio 1.0 عدة متحدثين دفعة واحدة؟
نعم. اكتب مشهدًا بعدة شخصيات وصِف كل صوت داخل النص. يمنح Seed Audio 1.0 كل متحدث صوتًا وانفعالًا وإيقاعًا مميزًا في توليد واحد، مع الأجواء والمؤثرات المحيطة بهم.
ما أقصى مدة لتوليد واحد من Seed Audio 1.0؟
يولّد Seed Audio 1.0 حتى دقيقتين من الصوت في مرور واحد، انطلاقًا من أمر لا يتجاوز 3000 حرف. أما الأعمال الأطول فتُبنى مشهدًا بعد مشهد.
بمَ يختلف Seed Audio 1.0 عن تحويل النص إلى كلام المعتاد؟
تحويل النص إلى كلام المعتاد يختار صوتًا ويقرأ النص. أما Seed Audio 1.0 فينتقل من النص إلى الكلام نحو المرجع إلى الصوت: أمر واحد يصف البيئة والموسيقى والمؤثرات وصوت كل شخصية، ويعيد النموذج المشهد كله ممزوجًا. الفارق في النطاق: عمل صوتي مكتمل بدل الصوت وحده.