توليد الصوت

Seed Audio 1.0

بواسطة ByteDance

نموذج TTS الشامل من ByteDance.
صوت وموسيقى ومؤثرات في توليد واحد.

Seed Audio 1.0

الميزات الأساسية

استمع إلى النطاق الكامل

سرد وثائقيكلام

تعليق وثائقي دافئ ومتزن.

0:00
0:12
تعليق إثارةكلام

قراءة جملة خافتة ومتوترة، قريبة وحميمة.

0:00
0:12
أجواء سوق التوابلمؤثرات صوتية

سرير صوتي طبقي لسوق مفتوح.

0:00
0:12
عاصفة رعديةمؤثرات صوتية

عاصفة متدحرجة تتصاعد إلى قصف رعد بعيد.

0:00
0:12
مقطع أوركستراليموسيقى

مقطع قصير صاعد للوتريات والنحاسيات.

0:00
0:12
إيقاع Lo-fiموسيقى

إيقاع مسترخٍ بمفاتيح ناعمة وطقطقة فينيل.

0:00
0:12

المواصفات التقنية

ByteDance

طوّره فريق أبحاث Seed التابع لـ ByteDance.

20

الإنجليزية والصينية واليابانية والكورية والإسبانية والفرنسية والألمانية وغيرها.

حتى دقيقتين

دقيقتان من الصوت المولّد كحد أقصى في كل مرور.

3000 حرف

مساحة تكفي لموجز مشهد كامل، بما فيه الحوار.

حتى 3

حتى ثلاثة مقاطع مرجعية، مدة كل منها 30 ثانية.

بدون بث

يعالج المسار كاملًا، لا بثًا لحظيًا.

حالات الاستخدام

الكتب الصوتية

سرد وأصوات وتصميم صوتي لكتاب كامل. تقدّر ByteDance الكلفة بنحو عُشر تسجيل الاستوديو.

دبلجة الفيديو

صِف الصوت أو ارفع صورة الشخصية، ثم استخدم الأختام الزمنية لوضع كل جملة حيث تحتاجها الصورة.

صوت الألعاب

جمل الشخصيات والمشاهد المؤدّاة ومؤثرات البيئة للحظات غامرة، مولّدة من النص مباشرة.

صوت فيديو في مرور واحد

امنح المقطع سرده وتصميمه الصوتي وموسيقاه في توليد واحد، دون خطوة مزج منفصلة بعده.

الإعلانات والترويج

جملة منطوقة ومؤثرات وموسيقى كمسار واحد جاهز للاستخدام، مصمم للمحتوى القصير.

الحوار والدراما الصوتية

عدة شخصيات، لكل منها صوتها وأداؤها، في مشهد واحد بأجواء وإيقاع متناسقين.

أمثلة على الأوامر

شرح مسرود

راوٍ هادئ، أجواء مطبخ خفيفة: «اخلط الطحين مع الزبدة.»

Edit prompt

تحكم زمني

ريان (دافئ، لاهث): «[5.5s:8.0s] مايا! هل سترحلين الليلة فعلًا؟»

Edit prompt

مشهد كتاب صوتي

مطر على النافذة. الراوية، خفيضة ومتمهلة: «قرأتها مرتين.»

Edit prompt

تعليق رياضي

ملعب ممتلئ، جمهور هادر. المعلق، منتشيًا: «هدف!»

Edit prompt

دراما صوتية

المحقق، متوترًا: «لا تتحرك.» تتوقف الخطى، ويصرّ باب.

Edit prompt

لحظة في لعبة

صوت عميق بطولي: «انكسر الختم القديم.» حجر يحتك.

Edit prompt

أسعار بسيطة

ابدأ مجاناً اليوم، مع إمكانية الترقية أو الإلغاء في أي وقت.

Basic

$9/ شهر
تُفوتر باعتبارها $0 سنوياً

900 شهرياً أرصدة

1 مستخدم فقط

جميع النماذج

Workflows

Standard

$24/ شهر
تُفوتر باعتبارها $0 سنوياً

3200 شهرياً أرصدة

1 مستخدم فقط

جميع النماذج

Workflows

Pro

$45/ شهر
تُفوتر باعتبارها $0 سنوياً

6200 مشترك شهرياً أرصدة

1 مستخدم

+ حتى 4 المزيد بتكلفة إضافية

جميع النماذج

Workflows

Pro Max

$170/ شهر
تُفوتر باعتبارها $0 سنوياً

24000 مشترك شهرياً أرصدة

1 مستخدم

+ حتى 9 المزيد بتكلفة إضافية

جميع النماذج

Workflows

Enterprise

لحدود أعلى

مخصص

شروط الأسعار والفوترة

أرصدة كبيرة الحجم
حدود مقاعد مخصصة
جميع النماذج
Workflows
Pricing Gradient

Free

للتجربة والاستكشاف

$0

مجاني إلى الأبد

حتى 20 رصيد
مستخدم واحد فقط
نماذج محدودة
Workflows

الأسئلة الشائعة

ما هو Seed Audio 1.0؟
‏Seed Audio 1.0 هو نموذج تحويل النص إلى كلام الشامل من ByteDance. من أمر نصي واحد ينتج الصوت والموسيقى الآلية والمؤثرات الصوتية معًا كمسار نهائي ممزوج. يعمل بوضعين رئيسيين: من النص إلى الصوت (T2A) حيث يأتي كل شيء من وصفك، ومن النص مع الصوت إلى الصوت (TA2A) حيث تضيف مقاطع مرجعية لإسناد أصوات بعينها.
ما اللغات التي يدعمها Seed Audio 1.0؟
يدعم Seed Audio 1.0 عشرين لغة: الإنجليزية والصينية واليابانية والكورية والإسبانية المكسيكية والإسبانية القشتالية والإندونيسية والألمانية والبرتغالية البرازيلية والفرنسية والتايلاندية والفيتنامية والملايوية والفلبينية والإيطالية والروسية والهولندية والبولندية والتركية والسويدية. العربية غير مدرجة ضمن هذه القائمة حتى الآن. وللحصول على أفضل نتيجة، اكتب الأمر بلغة الحوار نفسه.
كيف يعمل الصوت المرجعي في Seed Audio 1.0؟
في وضع TA2A تقدّم حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية كحد أقصى، ثم تربطها داخل الأمر بحيث تقابل كل شخصية تسجيلًا بعينه. يأخذ النموذج طابع الصوت وانفعاله من المرجع ويحافظ عليهما طوال التوليد. ويمكنك كذلك تعريف الصوت بوصف نصي أو بصورة شخصية بدل التسجيل.
هل يستنسخ Seed Audio 1.0 الأصوات؟
نعم. إلى جانب T2A و TA2A هناك وضع لاستنساخ الصوت: ترفع مقطعًا صوتيًا واحدًا، فيصبح الصوت المستنسخ متاحًا لتحويل النص إلى كلام العادي. توثّقه ByteDance بوصفه استنساخًا من مقطع واحد. أما إذا كان الصوت سيظهر داخل مشهد كامل مع موسيقى ومؤثرات وشخصيات أخرى، فاستخدم TA2A بمقاطعه المرجعية الثلاثة.
هل يتحكم Seed Audio 1.0 في توقيت كل جملة؟
نعم. يدعم Seed Audio 1.0 تحكمًا زمنيًا دقيقًا: ضع ختمًا زمنيًا مثل [5.5s:8.0s] في بداية الجملة، فيضبط النموذج أداءها ضمن تلك النافذة تحديدًا. وهذا ما يجعله صالحًا للدبلجة، حيث يجب أن يطابق الحوار الصورة.
هل يولّد Seed Audio 1.0 عدة متحدثين دفعة واحدة؟
نعم. اكتب مشهدًا بعدة شخصيات وصِف كل صوت داخل النص. يمنح Seed Audio 1.0 كل متحدث صوتًا وانفعالًا وإيقاعًا مميزًا في توليد واحد، مع الأجواء والمؤثرات المحيطة بهم.
ما أقصى مدة لتوليد واحد من Seed Audio 1.0؟
يولّد Seed Audio 1.0 حتى دقيقتين من الصوت في مرور واحد، انطلاقًا من أمر لا يتجاوز 3000 حرف. أما الأعمال الأطول فتُبنى مشهدًا بعد مشهد.
بمَ يختلف Seed Audio 1.0 عن تحويل النص إلى كلام المعتاد؟
تحويل النص إلى كلام المعتاد يختار صوتًا ويقرأ النص. أما Seed Audio 1.0 فينتقل من النص إلى الكلام نحو المرجع إلى الصوت: أمر واحد يصف البيئة والموسيقى والمؤثرات وصوت كل شخصية، ويعيد النموذج المشهد كله ممزوجًا. الفارق في النطاق: عمل صوتي مكتمل بدل الصوت وحده.