Seed Audio 1.0: الدليل الكامل

Seed Audio 1.0: الدليل الكامل

تعلّم كيفية استخدام Seed Audio 1.0: ولّد الصوت والموسيقى والمؤثرات الصوتية في مرور واحد، واكتب أوامر T2A و TA2A، وأسنِد الأصوات من مقاطع مرجعية، وتحكّم في التوقيت بدقة الثانية.

استمع إلى Seed Audio 1.0

سرد وثائقي

كلام، دافئ ومتزن

تعليق صوتي إثارة

كلام، خافت ومتوتر

أجواء سوق توابل

مؤثرات صوتية، طبقة في الهواء الطلق

عاصفة رعدية

مؤثرات صوتية، عاصفة تنتهي بقصفة

مقطوعة أوركسترالية

موسيقى، وتريات ونحاسيات صاعدة

إيقاع لو-فاي

موسيقى، مفاتيح ناعمة وفينيل

استخدامات Seed Audio 1.0

صوت فيديو في مرور واحد

امنح المقطع سرده وتصميمه الصوتي وموسيقاه في توليد واحد. صِف المشهد ومن يتكلم وما يحدث والمزاج العام، ويتولى النموذج مسار الصوت كاملًا.

لقطة سينمائية ثابتة: شخص وحيد بمظلة في شارع لامع من المطر عند الغسق

الشروحات والدروس المسرودة

صوت متماسك مع طنين غرفة وفراش موسيقي خفيف في مخرج واحد. يحمل السرد المحتوى، ويملأ النموذج الحيّز الصوتي فيبدو الناتج موضوعًا في مكانه ومكتملًا.

لقطة من فوق الكتف ليدين تضبطان عجلة دراجة على طاولة عمل تحت ضوء نافذة ناعم

إعلانات وترويجات قصيرة

جملة منطوقة ومؤثرات وموسيقى كمسار واحد جاهز. اكتب التوقيت داخل الأمر، فيضع النموذج النبرة على الكلمة الصحيحة ويخفض الموسيقى في اللحظة المناسبة.

حذاء رياضي مفرد ملتقط في الهواء فوق مضمار مضاء بالشمس في ساعة ذهبية

حوار مكتوب ودراما صوتية

مشاهد متعددة الشخصيات بأصوات مميزة وأداء انفعالي دقيق وأجواء متناسقة، كلها في أمر واحد. اكتب النص وصِف كل صوت، ويتولى النموذج الإسناد والإخراج.

شخصان في منتصف حديث عبر طاولة مقهى صغيرة بجانب نافذة مبللة بخطوط المطر

الكتب الصوتية والسرد الطويل

سرد وأصوات شخصيات وتصميم صوتي دون جلسة استوديو، بكلفة تقدّرها ByteDance بنحو عُشر التسجيل البشري. أسنِد الراوي من مقطع أو من وصف، ثم امضِ مشهدًا بعد مشهد.

ركن تسجيل منزلي مريح بميكروفون استوديو مضاء بضوء رئيسي دافئ

دبلجة مضبوطة على الإطار

ضع ختمًا زمنيًا على كل جملة، فيضبط النموذج الأداء ضمن تلك النافذة تحديدًا، ليقع الحوار على القطع لا بجواره. يعمل في اللغات العشرين المدعومة كلها.

مساحة عمل لتحرير الصوت بموجة متوهجة على مخطط زمني على شاشة داكنة

كيف تكتب أمر Seed Audio 1.0

الأمر القوي يُقرأ كموجز مشهد قصير، لا كسطر لتحويل النص إلى كلام، وبذلك يستطيع النموذج أن يجمع الصوت والموسيقى والمؤثرات في مشهد واحد. راجع SCENE قبل الإرسال.

SCENEما يجب تضمينهمثال
المشهدالطقس والمكان والسياق والصوتياتممر بعد انتهاء الدوام، خطى بعيدة، صدى
الشخصياتما تفعله كل شخصية أو ترتديهحقيبة على الكتف، تلويح من الباب
المؤثراتمزاج الموسيقى ونوعها، والمؤثرات الصوتيةطبول حرب عميقة، نحاسيات خفيضة، «طَقّ» خزانة
ملاحظات الصوتالجنس والعمر واللكنة والانفعال والنبرة والسرعةمراهق، لكنة أمريكية، صوت مشرق وواثق
الجملما تقوله كل شخصية، بين علامتَي اقتباس«إيما، هل أنتِ متفرغة السبت؟»

ثلاث عادات تفصل الأوامر القوية عن العامة.

اكتب بإسهاب. الحد 3000 حرف، والأمثلة الرسمية تستهلك معظمه. الوصف هنا ليس حشوًا: البيئة والموسيقى وأداء كل شخصية كلها أشياء يعالجها النموذج، فكل جملة تحذفها قرار تعيده إليه.

اكتب الأصوات نفسها. المحاكاة الصوتية تنفع. سحّاب حقيبة «زززيب»، جرس مدرسة «درننن» يبتعد، «ووم، ووم» نصل يشق الهواء. تهجئة الصوت أوثق من تسميته.

طابِق اللغات. اكتب الأمر بلغة الجمل التي تريد نطقها. نص عربي بموجز إنجليزي هو السبب الأشيع للكنة غير متسقة، وتذكّر أن العربية ليست ضمن لغات التوليد المدعومة بعد.

جرس مدرسة «درننن» يخفت من القريب إلى البعيد، أجواء ممر بعد انتهاء الدوام مع خطى بعيدة، وثرثرة طلاب، و«طَقّ» خزانة بين الحين والآخر، وصدى ممر. جيك (مراهق، لكنة أمريكية، صوت شاب مشرق، مرح وواثق) يقول مازحًا: «إيما، هل أنتِ متفرغة السبت؟ على حسابي، إلى المدينة الترفيهية الجديدة!» سحّاب حقيبة يصدر «زززيب». إيما (مراهقة، لكنة أمريكية، صوت عذب ناعم خفيف، خجولة) تخفض صوتها مرتبكة: «آه… لم أُنهِ واجبي بعد.» يلحّ جيك ممططًا كلماته: «تنهينه الأحد، إنه نصف يوم فقط!» تتمتم إيما وقد لانت: «لكنه… مطلوب الاثنين.» يقول جيك بلطف: «سأحله معكِ ثم نخرج، اتفقنا؟» لا تتمالك إيما ضحكتها وتوافق بخجل: «حسنًا، نصف يوم فقط، اتفقنا؟» جيك، بحماس: «اتفقنا!» ينتهي بخطواتهما وهي تبتعد.

التحكم في التوقيت بدقة الثانية

يدعم Seed Audio 1.0 تحكمًا زمنيًا دقيقًا. ضع ختمًا زمنيًا في مقدمة الجملة بصيغة [البداية:النهاية]، فيضبط النموذج أداء تلك الجملة داخل النافذة تحديدًا. يسرّع ويبطئ ويوزّع الوقفات حتى تستقر الجملة.

ريان (شاب، صوت دافئ) ينادي بقلق ولاهثًا قليلًا: «[5.5s:8.0s] مايا! انتظري، هل سترحلين الليلة فعلًا؟» مايا (شابة، صوت ناعم) تجيب بهدوء وهي تجبر نفسها على التماسك: «[8.5s:11.5s] عليّ الذهاب. أمضيت سنوات ألاحق هذا، لا أستطيع التراجع الآن.»

هذا ما يجعل النموذج صالحًا للدبلجة. خذ نقطتَي الدخول والخروج لكل جملة من مخططك الزمني، واكتبهما في الأمر، فيستقر المسار الناتج على الصورة دون مطّ أو قصّ. وإن تركت الأختام الزمنية، منح النموذج المشهد إيقاعًا طبيعيًا.

إسناد الأصوات من مقاطع مرجعية (TA2A)

هناك طريقتان لإدخال صوت إلى مشهد. في T2A تصفه أنت ويتولى النموذج إسناده. وفي TA2A ترفع صوتًا مرجعيًا فيتبع الصوت المولّد التسجيل.

وهناك أيضًا وضع أبسط هو استنساخ الصوت، خارج العمل على المشاهد: ارفع مقطعًا واحدًا فيصبح الصوت المستنسخ متاحًا لتحويل النص إلى كلام العادي. استخدمه حين تريد صوتًا يقرأ نصًا فحسب. وانتقل إلى TA2A متى وجب أن يقف ذلك الصوت داخل مشهد إلى جانب الموسيقى والمؤثرات وبقية الشخصيات.

يقبل TA2A حتى ثلاثة مقاطع مرجعية مدة كل منها 30 ثانية كحد أقصى. اربط كل مقطع بشخصية داخل النص، ليعرف النموذج أي صوت يخص أي متحدث، ثم اكتب المشهد تمامًا كما تكتبه في T2A.

[أصوات شارع محيطة: سيارات تمرّ، ثرثرة بعيدة، نسمة خفيفة.] ماركوس (صوت رجولي، رخيم وواثق، بنبرة مذيع دافئة مرحة، نطق واضح، والممثل هو <<TGT_SPK1>>)، مبتهجًا ومرحبًا، يقول: «أهلًا! سؤال سريع، ما أكثر موقف محرج مرّ بك؟» تايلر (صوت رجولي أصغر سنًا، متوتر قليلًا، معبّر مع ضحكة خفيفة، والممثل هو <<TGT_SPK2>>)، يطلق أنينًا طويلًا وضحكة موجوعة، يقول: «آه، أنت لا تريد أن تعرف حقًا. حسنًا، لكن هذا يبقى بيننا.» ماركوس (والممثل هو <<TGT_SPK1>>)، مائلًا إلى الأمام باهتمام، يقول: «الآن يجب أن أسمعها. هيا.» [ينفجر الاثنان ضاحكَين؛ ترتفع أجواء الشارع ثم تخفت.]

ثلاثة أمور يجب ضبطها في أمر TA2A: أي محتوى تريد توليده، وأي صوت مرجعي تستخدم، وما الغرض من كل صوت مرجعي. تُختار المقاطع عبر @Audio1 و@Audio2 و@Audio3، إما مرفوعة للمهمة الحالية أو مختارة من مكتبة أصولك ومعاد استخدامها عبر سلسلة كاملة.

الإشارات بين قوسين معقوفين مثل [أصوات شارع محيطة: سيارات تمرّ، ثرثرة بعيدة] طريقة نظيفة لفتح المشهد وإغلاقه دون ربط الصوت بمتحدث بعينه.

جهّز مقاطعك المرجعية وفق قائمة CLEAR:

  • تسجيل نظيف، بأقل ضجيج خلفي
  • مدة أقل من 30 ثانية لكل مقطع
  • انفعال متوافق مع الأداء الذي تريده
  • لكنة ثابتة داخل كل مقطع
  • طنين غرفة مستقر بين المقاطع

وإن لم يكن لديك مقطع، فصِف الصوت نصًا، بذكر العمر واللكنة والسرعة بدل «لطيف» أو «احترافي». وتنفع صورة الشخصية أيضًا: يستنتج النموذج صوتًا متوافقًا مع العمر والطابع الظاهرين، وهو مفيد للمتحدثين الخياليين أو المتحركين.

كيفية استخدام Seed Audio 1.0

الوصول إلى مسار مكتمل يستغرق أربع خطوات.

  1. اكتب موجز المشهد. صِف المكان والشخصيات والموسيقى والمؤثرات وكل صوت والجمل، وفق قائمة SCENE أعلاه. حتى 3000 حرف.
  2. حدّد الأصوات. صِفها داخل الأمر في وضع T2A، أو ارفع حتى ثلاثة مقاطع مرجعية واربطها في وضع TA2A. وتصلح صورة الشخصية كذلك.
  3. أضف التوقيت عند الحاجة. ضع أختامًا زمنية [البداية:النهاية] على الجمل التي يجب أن تقع في نافذة محددة.
  4. ولّد. مرور واحد يعيد الصوت والموسيقى والمؤثرات معًا، ممزوجة سلفًا، حتى دقيقتين.

ولأي عمل يتجاوز الدقيقتين، كفصل من كتاب صوتي أو حلقة كاملة، امضِ مشهدًا بعد مشهد واحتفظ بالمرجع الصوتي نفسه عبر عمليات التوليد ليبقى الإسناد ثابتًا.

الأسئلة الشائعة

ما الفرق بين T2A و TA2A في Seed Audio 1.0؟

‏T2A، أي من النص إلى الصوت، يبني كل شيء من وصفك: البيئة والموسيقى والمؤثرات الصوتية وصوت كل شخصية. أما TA2A، أي من النص مع الصوت إلى الصوت، فيضيف حتى ثلاثة تسجيلات مرجعية تربطها بشخصيات بعينها، فتتبع تلك الأصوات التسجيلات بدل وصف مكتوب. وما عدا ذلك يبقى الأمر كما هو.

هل يستنسخ Seed Audio 1.0 الأصوات؟

نعم. إلى جانب T2A و TA2A هناك وضع لاستنساخ الصوت: ترفع مقطعًا صوتيًا فيصبح الصوت المستنسخ متاحًا لتحويل النص إلى كلام العادي. توثّقه ByteDance بوصفه استنساخًا من مقطع واحد. وإذا كان الصوت سيظهر في مشهد كامل مع موسيقى ومؤثرات ومتحدثين آخرين، فاستخدم TA2A الذي يقبل حتى ثلاثة مقاطع مرجعية ويربط كل مقطع بشخصية.

كيف يعمل التحكم الزمني في Seed Audio 1.0؟

ضع ختمًا زمنيًا بصيغة [5.5s:8.0s] في بداية الجملة، فيضبط النموذج أداءها ضمن تلك النافذة تحديدًا، معدّلًا الإيقاع والوقفات حتى تستقر. هذه هي الميزة التي تجعل النموذج عمليًا في الدبلجة، حيث يجب أن يطابق الصوت الصورة. أما الجمل بلا ختم زمني فتُؤدَّى بإيقاع طبيعي.

ما اللغات التي يدعمها Seed Audio 1.0؟

عشرون لغة: الإنجليزية والصينية واليابانية والكورية والإسبانية المكسيكية والإسبانية القشتالية والإندونيسية والألمانية والبرتغالية البرازيلية والفرنسية والتايلاندية والفيتنامية والملايوية والفلبينية والإيطالية والروسية والهولندية والبولندية والتركية والسويدية. العربية غير مدرجة ضمنها حتى الآن. واكتب الأمر بلغة النص نفسها للحصول على أكثر النتائج اتساقًا.

هل يولّد Seed Audio 1.0 عدة متحدثين دفعة واحدة؟

نعم. صِف صوت كل شخصية وأنت تكتب المشهد، فيمنح النموذج كل متحدث صوتًا وانفعالًا وإيقاعًا مميزًا في توليد واحد، مع الأجواء والمؤثرات المحيطة بهم. وفي وضع TA2A يمكنك ربط ثلاث من تلك الشخصيات بتسجيلات مرجعية.

ما أقصى مدة لتوليد واحد من Seed Audio 1.0؟

حتى دقيقتين من الصوت في كل مرور، انطلاقًا من أمر لا يتجاوز 3000 حرف. والتوليد بدون بث: يعالج النموذج المسار الممزوج كاملًا بدل إعادة الصوت لحظيًا. أما الأعمال الأطول فتُبنى مشهدًا بعد مشهد.

هل يصلح Seed Audio 1.0 لسرد كتاب صوتي؟

هو من أنسب الاستخدامات لهذا النموذج. أمر واحد يغطي صوت الراوي وأصوات الشخصيات والتصميم الصوتي حولها، فيصل المشهد مكتملًا بدل مسارات منفصلة تنتظر المزج. احتفظ بالمرجع الصوتي نفسه عبر الفصول، فيبقى الراوي ثابتًا في الكتاب كله.

هل يختلف Seed Audio 1.0 عن تحويل النص إلى كلام المعتاد؟

اختلافًا واضحًا. تحويل النص إلى كلام المعتاد يختار صوتًا ويقرأ النص. أما Seed Audio 1.0 فينتقل من النص إلى الكلام نحو المرجع إلى الصوت: أمر واحد يصف البيئة والموسيقى والمؤثرات وصوت كل شخصية، ويعيد النموذج المشهد كله ممزوجًا. الفارق في النطاق هو عمل صوتي كامل مقابل الصوت وحده.