Seed Audio 1.0: eksiksiz rehber

Seed Audio 1.0: eksiksiz rehber

Seed Audio 1.0'ı nasıl kullanacağınızı öğrenin: tek seferde ses, müzik ve ses efekti üretin, T2A ve TA2A istemleri yazın, referans sesten rol dağıtın ve zamanlamayı saniyesine kadar kontrol edin.

Seed Audio 1.0'ı dinleyin

Belgesel anlatımı

Konuşma, sıcak ve ölçülü

Gerilim filmi seslendirmesi

Konuşma, fısıltılı ve gergin

Baharat pazarı atmosferi

Ses efekti, açık hava zemini

Gök gürültülü fırtına

Ses efekti, fırtınadan şimşeğe

Orkestra müziği

Müzik, yükselen yaylılar ve nefesliler

Lo-fi ritim

Müzik, yumuşak tuşlar ve plak sesi

Seed Audio 1.0 kullanım alanları

Tek geçişte video sesi

Bir klibe anlatımını, ses tasarımını ve müziğini tek üretimde verin. Sahneyi, kimin konuştuğunu, ne olduğunu ve havayı anlatın; model ses parçasının tamamını üstlensin.

Sinematik bir film karesi: alacakaranlıkta yağmurlu bir sokakta şemsiyeli tek bir figür

Anlatımlı açıklamalar ve eğitimler

Oda tonu ve hafif bir müzik zemini olan derli toplu bir ses, tek bir çıktıda. Anlatım içeriği taşır, model de akustik alanı doldurur; sonuç bir yere ait ve bitmiş duyulur.

Bir çalışma tezgahında yumuşak pencere ışığında bisiklet tekerleği ayarlanırken omuz üzerinden çekim

Kısa reklam ve tanıtımlar

Replik, ses efektleri ve müzik; kullanıma hazır tek bir parça. Zamanlamayı isteme yazın; model vurguyu doğru kelimeye koysun ve müziği tam yerinde kıssın.

Altın saatte güneşli bir pist şeridinde havada asılı kalmış tek bir koşu ayakkabısı

Senaryolu diyalog ve radyo tiyatrosu

Ayrı sesler, isabetli duygu aktarımı ve uyumlu ortamla çok karakterli sahneler, hepsi tek bir istemde. Senaryoyu yazın, her sesi tarif edin; model kadroyu kursun ve yönetsin.

Yağmurun ıslattığı bir pencere kenarındaki küçük bir kafe masasında sohbet eden iki kişi

Sesli kitap ve uzun anlatım

Stüdyo seansı olmadan anlatım, karakter sesleri ve ses tasarımı; ByteDance maliyeti insan kaydının onda biri civarında gösteriyor. Anlatıcıyı bir klipten ya da tariften kurun, sonra sahne sahne ilerleyin.

Sıcak bir ışıkla aydınlatılmış stüdyo mikrofonlu rahat bir ev kayıt köşesi

Kareye oturan dublaj

Her repliğe bir zaman kodu koyun; model okuyuşu tam o aralığa oturtsun, diyalog kurgunun yanına değil üstüne düşsün. Desteklenen yirmi dilin hepsinde çalışır.

Koyu renkli bir ekranda parlayan bir dalga formu zaman çizelgesiyle ses düzenleme çalışma alanı

Seed Audio 1.0 istemi nasıl yazılır

Güçlü bir istem, bir metin okuma satırı gibi değil, kısa bir sahne brifingi gibi okunur; model ses, müzik ve efektleri tek bir sahneye ancak böyle sığdırır. Göndermeden önce SCENE'i gözden geçirin.

SCENEİçermeliÖrnek
SahneHava, mekân, bağlam, akustikDers çıkışı koridoru, uzaktan ayak sesleri, yankı
KadroHer karakter ne yapıyor, ne giyiyorSırt çantası omzunda, kapıdan el sallıyor
EfektlerMüziğin havası ve türü, ses efektleriDerin savaş davulları, pes bakırlar, dolap “tak”ı
Ses notlarıCinsiyet, yaş, aksan, duygu, ton, hızGenç erkek, Amerikan aksanı, parlak ve fiyakalı ses
RepliklerHer karakter ne diyor, tırnak içinde“Emma, cumartesi boş musun?”

Güçlü istemleri sıradan olanlardan üç alışkanlık ayırır.

Uzun yazın. Sınır 3.000 karakter ve resmî örnekler bunun büyük kısmını kullanıyor. Buradaki tarif dolgu değil: ortam, müzik ve her karakterin oyunculuğu modelin işlediği şeyler; dolayısıyla kestiğiniz her cümle, karara modeli ortak etmek demek.

Sesleri yazıya dökün. Yansıma sözcükler işe yarıyor. Sırt çantası fermuarının “ccırt”ı, uzaklaşan okul zilinin “ziiing”i, havayı yaran bir kılıcın “vum, vum”u. Sesi hecelemek, adını koymaktan daha güvenilir.

Dilleri eşleyin. İstemi, seslendirilecek repliklerle aynı dilde yazın. Türkçe bir senaryonun İngilizce brifingle verilmesi, aksanın tuhaf çıkmasının en sık nedeni.

Okul zili “ziiing” diye yakından uzağa sönerek çalıyor, ders çıkışı koridorunda uzaktan ayak sesleri, öğrenci uğultusu, ara ara dolap “tak”ı ve koridor yankısı. Jake (genç erkek, Amerikan aksanı, parlak ve genç bir ses, güneşli ve fiyakalı) oyunbaz ve takılan bir tonla diyor ki: “Emma, cumartesi boş musun? Benden olsun, şu yeni lunaparka!” Sırt çantası fermuarı “ccırt” diye ötüyor. Emma (genç kız, Amerikan aksanı, tatlı, yumuşak ve hafif bir ses, utangaç) sesini alçaltıyor, bozularak: “Ee… ödevim daha bitmedi.” Jake kelimeleri uzatarak ikna etmeye çalışıyor: “Pazar yaparsın, topu topu yarım gün!” Emma yumuşayarak mırıldanıyor: “Ama… pazartesiye teslim.” Jake yumuşak bir sesle: “Seninle birlikte yaparım, sonra çıkarız, anlaştık mı?” Emma gülmesini tutamıyor, utanarak razı oluyor: “Tamam, sadece yarım gün, oldu mu?” Jake, heyecanla: “Anlaştık!” İkisinin uzaklaşan ayak sesleriyle biter.

Zamanlamayı saniyesine kadar kontrol etmek

Seed Audio 1.0 hassas zaman kontrolünü destekler. Bir repliğin başına [başlangıç:bitiş] biçiminde bir zaman kodu koyun; model o repliğin okuyuşunu tam olarak o aralığa sığdırsın. Repliğin oturması için hızlanır, yavaşlar ve duraklamaları yerleştirir.

Ryan (genç erkek, sıcak bir ses) endişeyle, hafif nefes nefese sesleniyor: “[5.5s:8.0s] Maya! Dur, gerçekten bu gece mi gidiyorsun?” Maya (genç kadın, yumuşak bir ses) sakin kalmaya zorlayarak alçak sesle yanıtlıyor: “[8.5s:11.5s] Gitmem gerek. Yıllardır bunun peşindeyim, şimdi vazgeçemem.”

Modeli dublajda kullanılabilir kılan şey budur. Her repliğin giriş ve çıkış noktalarını zaman çizelgenizden alın, isteme yazın; dönen parça esnetmeden ya da kırpmadan görüntünün üstüne otursun. Zaman kodu koymazsanız model sahneye doğal bir tempo verir.

Referans sesten rol dağıtmak (TA2A)

Bir sesi sahneye sokmanın iki yolu var. T2A'da onu siz tarif edersiniz, model kadroya alır. TA2A'da referans ses yüklersiniz ve üretilen ses kaydı izler.

Bunların dışında, sahne çalışmasından bağımsız daha yalın bir ses klonlama modu da var: tek bir klip yükleyin, klonlanan ses düz metin okuma için kullanılabilir olsun. Yalnızca bir sesin metni okumasını istiyorsanız bunu seçin. O ses; müzik, efektler ve başka karakterlerle birlikte bir sahnede duracaksa TA2A'ya geçin.

TA2A her biri en fazla 30 saniyelik üç referans klibe kadar kabul eder. Her klibi metnin içinde bir karaktere bağlayın ki model hangi sesin hangi konuşmacıya ait olduğunu bilsin; sonra sahneyi tam olarak T2A'daki gibi yazın.

[Sokak ortam sesleri: geçen arabalar, uzaktan konuşmalar, hafif bir esinti.] Marcus (erkek ses, pürüzsüz ve kendinden emin, sıcak ve şakacı bir sunucu tonu, net telaffuz, oyuncu <<TGT_SPK1>>), neşeli ve davetkâr, diyor ki: “Merhaba! Kısa bir soru, başınıza gelen en utanç verici şey neydi?” Tyler (daha genç bir erkek ses, biraz gergin, hafif bir kahkahayla canlı, oyuncu <<TGT_SPK2>>), uzun bir inleme ve acı bir kahkaha koyveriyor ve diyor ki: “Ah, bunu duymak İSTEMEZSİNİZ. Peki tamam, ama aramızda kalsın.” Marcus (oyuncu <<TGT_SPK1>>), merakla öne eğilerek diyor ki: “Şimdi duymam ŞART. Anlatın.” [İkisi birden kahkahayı patlatır; sokak ortamı yükselir ve söner.]

Bir TA2A isteminde doğru kurulması gereken üç şey var: hangi içeriğin üretileceği, hangi referans sesin kullanılacağı ve her referans sesin ne işe yaradığı. Klipler @Audio1, @Audio2 ve @Audio3 ile seçilir; ya o iş için yüklenir ya da varlık kitaplığınızdan alınıp bir dizinin tamamında yeniden kullanılır.

[Sokak ortam sesleri: geçen arabalar, uzaktan konuşmalar] gibi köşeli parantezli notlar, sesi bir konuşmacıya bağlamadan sahneyi açıp kapatmanın temiz bir yolu.

Referans kliplerinizi CLEAR listesine göre hazırlayın:

  • Temiz kayıt, arka plan gürültüsü az
  • Klip başına 30 saniyenin altında süre
  • İstediğiniz oyunculukla uyumlu duygu
  • Her klip içinde tutarlı aksan
  • Klipler arasında sabit oda tonu

Hiç klip yoksa sesi metinle tarif edin; “hoş” ya da “profesyonel” yerine yaş, aksan ve konuşma hızı verin. Karakter görseli de işe yarar: model görünen yaştan ve karakterden uygun bir ses türetir; kurgusal ya da animasyon konuşmacılar için kullanışlıdır.

Seed Audio 1.0 nasıl kullanılır

Bitmiş bir parçaya ulaşmak dört adım sürer.

  1. Sahne brifingini yazın. Mekânı, kadroyu, müzik ve efektleri, her sesi ve replikleri yukarıdaki SCENE listesine göre anlatın. En fazla 3.000 karakter.
  2. Sesleri belirleyin. T2A için istemde tarif edin ya da TA2A için üç adede kadar referans klip yükleyip bağlayın. Karakter görseli de olur.
  3. Gerekiyorsa zamanlamayı ekleyin. Belirli bir aralığa oturması gereken repliklere [başlangıç:bitiş] zaman kodları koyun.
  4. Üretin. Tek geçiş; ses, müzik ve efektleri birlikte, miksi yapılmış halde, iki dakikaya kadar döndürür.

İki dakikayı aşan her şey için, bir sesli kitap bölümü ya da tam bir epizot, sahne sahne ilerleyin ve kadronun tutarlı kalması için üretimler boyunca aynı ses referansını koruyun.

SSS

Seed Audio 1.0'da T2A ile TA2A arasındaki fark nedir?

T2A, yani metinden sese, her şeyi sizin tarifinizden kurar: ortamı, müziği, ses efektlerini ve her karakterin sesini. TA2A, yani metin artı sesten sese, buna üç adede kadar referans kayıt ekler; bunları belirli karakterlere bağlarsınız ve o sesler yazılı bir tarifi değil kayıtları izler. İstemin geri kalanı aynıdır.

Seed Audio 1.0 bir sesi klonlayabilir mi?

Evet. T2A ve TA2A'nın ötesinde bir ses klonlama modu var: bir ses klibi yüklersiniz ve klonlanan ses düz metin okuma için kullanılabilir hale gelir. ByteDance bunu tek klipten klonlama olarak belgeliyor. Ses; müzik, efektler ve başka konuşmacılarla birlikte eksiksiz bir sahnede yer alacaksa, üç referans klip alıp her birini bir karaktere bağlayan TA2A'yı kullanın.

Seed Audio 1.0'da zaman kontrolü nasıl çalışır?

Bir repliğin başına [5.5s:8.0s] biçiminde bir zaman kodu koyun; model o repliğin okuyuşunu tam olarak o aralığa oturtur, oturması için tempoyu ve duraklamaları ayarlar. Sesin görüntüyle uyuşması gereken dublajda modeli pratik kılan özellik budur. Zaman kodu olmayan replikler doğal tempoyla okunur.

Seed Audio 1.0 hangi dilleri destekliyor?

Yirmi dil: İngilizce, Çince, Japonca, Korece, Meksika İspanyolcası, Kastilya İspanyolcası, Endonezce, Almanca, Brezilya Portekizcesi, Fransızca, Tayca, Vietnamca, Malayca, Filipince, İtalyanca, Rusça, Felemenkçe, Lehçe, Türkçe ve İsveççe. En tutarlı sonuç için istemi senaryoyla aynı dilde yazın.

Seed Audio 1.0 aynı anda birden çok konuşmacı üretebilir mi?

Evet. Sahneyi yazarken her karakterin sesini de tarif edin; model her konuşmacıya tek üretimde ayrı bir ses, duygu ve tempo verir, çevresindeki ortam ve efektlerle birlikte. TA2A modunda bu karakterlerden üçe kadarını referans kayıtlara bağlayabilirsiniz.

Bir Seed Audio 1.0 üretimi ne kadar uzun olabilir?

Geçiş başına iki dakikaya kadar ses; istem en fazla 3.000 karakter. Üretim akışsızdır: model sesi gerçek zamanlı döndürmek yerine miksi yapılmış parçanın tamamını işler. Daha uzun yapımlar sahne sahne kurulur.

Seed Audio 1.0 sesli kitap seslendirebilir mi?

Modelin en oturduğu kullanımlardan biri. Tek bir istem anlatıcının sesini, karakter seslerini ve çevrelerindeki ses tasarımını kapsar; böylece sahne, mikslenmeyi bekleyen ayrı parçalar halinde değil, bitmiş olarak gelir. Bölümler boyunca aynı ses referansını koruyun; anlatıcı kitabın tamamında tutarlı kalsın.

Seed Audio 1.0 sıradan metin okumadan farklı mı?

Belirgin biçimde. Sıradan metin okuma bir ses seçip metni okur. Seed Audio 1.0 metin okumadan referanstan sese geçer: tek bir istem ortamı, müziği, efektleri ve her karakterin sesini anlatır, model de sahnenin tamamını miksi yapılmış halde döndürür. Kapsam farkı, yalnızca sese karşılık eksiksiz bir ses yapımıdır.