Seed Audio 1.0'ı dinleyin
Belgesel anlatımı
Konuşma, sıcak ve ölçülü
Gerilim filmi seslendirmesi
Konuşma, fısıltılı ve gergin
Baharat pazarı atmosferi
Ses efekti, açık hava zemini
Gök gürültülü fırtına
Ses efekti, fırtınadan şimşeğe
Orkestra müziği
Müzik, yükselen yaylılar ve nefesliler
Lo-fi ritim
Müzik, yumuşak tuşlar ve plak sesi
Seed Audio 1.0 kullanım alanları
Tek geçişte video sesi
Bir klibe anlatımını, ses tasarımını ve müziğini tek üretimde verin. Sahneyi, kimin konuştuğunu, ne olduğunu ve havayı anlatın; model ses parçasının tamamını üstlensin.

Anlatımlı açıklamalar ve eğitimler
Oda tonu ve hafif bir müzik zemini olan derli toplu bir ses, tek bir çıktıda. Anlatım içeriği taşır, model de akustik alanı doldurur; sonuç bir yere ait ve bitmiş duyulur.

Kısa reklam ve tanıtımlar
Replik, ses efektleri ve müzik; kullanıma hazır tek bir parça. Zamanlamayı isteme yazın; model vurguyu doğru kelimeye koysun ve müziği tam yerinde kıssın.

Senaryolu diyalog ve radyo tiyatrosu
Ayrı sesler, isabetli duygu aktarımı ve uyumlu ortamla çok karakterli sahneler, hepsi tek bir istemde. Senaryoyu yazın, her sesi tarif edin; model kadroyu kursun ve yönetsin.

Sesli kitap ve uzun anlatım
Stüdyo seansı olmadan anlatım, karakter sesleri ve ses tasarımı; ByteDance maliyeti insan kaydının onda biri civarında gösteriyor. Anlatıcıyı bir klipten ya da tariften kurun, sonra sahne sahne ilerleyin.

Kareye oturan dublaj
Her repliğe bir zaman kodu koyun; model okuyuşu tam o aralığa oturtsun, diyalog kurgunun yanına değil üstüne düşsün. Desteklenen yirmi dilin hepsinde çalışır.

Seed Audio 1.0 istemi nasıl yazılır
Güçlü bir istem, bir metin okuma satırı gibi değil, kısa bir sahne brifingi gibi okunur; model ses, müzik ve efektleri tek bir sahneye ancak böyle sığdırır. Göndermeden önce SCENE'i gözden geçirin.
| SCENE | İçermeli | Örnek |
|---|---|---|
| Sahne | Hava, mekân, bağlam, akustik | Ders çıkışı koridoru, uzaktan ayak sesleri, yankı |
| Kadro | Her karakter ne yapıyor, ne giyiyor | Sırt çantası omzunda, kapıdan el sallıyor |
| Efektler | Müziğin havası ve türü, ses efektleri | Derin savaş davulları, pes bakırlar, dolap “tak”ı |
| Ses notları | Cinsiyet, yaş, aksan, duygu, ton, hız | Genç erkek, Amerikan aksanı, parlak ve fiyakalı ses |
| Replikler | Her karakter ne diyor, tırnak içinde | “Emma, cumartesi boş musun?” |
Güçlü istemleri sıradan olanlardan üç alışkanlık ayırır.
Uzun yazın. Sınır 3.000 karakter ve resmî örnekler bunun büyük kısmını kullanıyor. Buradaki tarif dolgu değil: ortam, müzik ve her karakterin oyunculuğu modelin işlediği şeyler; dolayısıyla kestiğiniz her cümle, karara modeli ortak etmek demek.
Sesleri yazıya dökün. Yansıma sözcükler işe yarıyor. Sırt çantası fermuarının “ccırt”ı, uzaklaşan okul zilinin “ziiing”i, havayı yaran bir kılıcın “vum, vum”u. Sesi hecelemek, adını koymaktan daha güvenilir.
Dilleri eşleyin. İstemi, seslendirilecek repliklerle aynı dilde yazın. Türkçe bir senaryonun İngilizce brifingle verilmesi, aksanın tuhaf çıkmasının en sık nedeni.
Okul zili “ziiing” diye yakından uzağa sönerek çalıyor, ders çıkışı koridorunda uzaktan ayak sesleri, öğrenci uğultusu, ara ara dolap “tak”ı ve koridor yankısı. Jake (genç erkek, Amerikan aksanı, parlak ve genç bir ses, güneşli ve fiyakalı) oyunbaz ve takılan bir tonla diyor ki: “Emma, cumartesi boş musun? Benden olsun, şu yeni lunaparka!” Sırt çantası fermuarı “ccırt” diye ötüyor. Emma (genç kız, Amerikan aksanı, tatlı, yumuşak ve hafif bir ses, utangaç) sesini alçaltıyor, bozularak: “Ee… ödevim daha bitmedi.” Jake kelimeleri uzatarak ikna etmeye çalışıyor: “Pazar yaparsın, topu topu yarım gün!” Emma yumuşayarak mırıldanıyor: “Ama… pazartesiye teslim.” Jake yumuşak bir sesle: “Seninle birlikte yaparım, sonra çıkarız, anlaştık mı?” Emma gülmesini tutamıyor, utanarak razı oluyor: “Tamam, sadece yarım gün, oldu mu?” Jake, heyecanla: “Anlaştık!” İkisinin uzaklaşan ayak sesleriyle biter.
Zamanlamayı saniyesine kadar kontrol etmek
Seed Audio 1.0 hassas zaman kontrolünü destekler. Bir repliğin başına [başlangıç:bitiş] biçiminde bir zaman kodu koyun; model o repliğin okuyuşunu tam olarak o aralığa sığdırsın. Repliğin oturması için hızlanır, yavaşlar ve duraklamaları yerleştirir.
Ryan (genç erkek, sıcak bir ses) endişeyle, hafif nefes nefese sesleniyor: “[5.5s:8.0s] Maya! Dur, gerçekten bu gece mi gidiyorsun?” Maya (genç kadın, yumuşak bir ses) sakin kalmaya zorlayarak alçak sesle yanıtlıyor: “[8.5s:11.5s] Gitmem gerek. Yıllardır bunun peşindeyim, şimdi vazgeçemem.”
Modeli dublajda kullanılabilir kılan şey budur. Her repliğin giriş ve çıkış noktalarını zaman çizelgenizden alın, isteme yazın; dönen parça esnetmeden ya da kırpmadan görüntünün üstüne otursun. Zaman kodu koymazsanız model sahneye doğal bir tempo verir.
Referans sesten rol dağıtmak (TA2A)
Bir sesi sahneye sokmanın iki yolu var. T2A'da onu siz tarif edersiniz, model kadroya alır. TA2A'da referans ses yüklersiniz ve üretilen ses kaydı izler.
Bunların dışında, sahne çalışmasından bağımsız daha yalın bir ses klonlama modu da var: tek bir klip yükleyin, klonlanan ses düz metin okuma için kullanılabilir olsun. Yalnızca bir sesin metni okumasını istiyorsanız bunu seçin. O ses; müzik, efektler ve başka karakterlerle birlikte bir sahnede duracaksa TA2A'ya geçin.
TA2A her biri en fazla 30 saniyelik üç referans klibe kadar kabul eder. Her klibi metnin içinde bir karaktere bağlayın ki model hangi sesin hangi konuşmacıya ait olduğunu bilsin; sonra sahneyi tam olarak T2A'daki gibi yazın.
[Sokak ortam sesleri: geçen arabalar, uzaktan konuşmalar, hafif bir esinti.] Marcus (erkek ses, pürüzsüz ve kendinden emin, sıcak ve şakacı bir sunucu tonu, net telaffuz, oyuncu <<TGT_SPK1>>), neşeli ve davetkâr, diyor ki: “Merhaba! Kısa bir soru, başınıza gelen en utanç verici şey neydi?” Tyler (daha genç bir erkek ses, biraz gergin, hafif bir kahkahayla canlı, oyuncu <<TGT_SPK2>>), uzun bir inleme ve acı bir kahkaha koyveriyor ve diyor ki: “Ah, bunu duymak İSTEMEZSİNİZ. Peki tamam, ama aramızda kalsın.” Marcus (oyuncu <<TGT_SPK1>>), merakla öne eğilerek diyor ki: “Şimdi duymam ŞART. Anlatın.” [İkisi birden kahkahayı patlatır; sokak ortamı yükselir ve söner.]
Bir TA2A isteminde doğru kurulması gereken üç şey var: hangi içeriğin üretileceği, hangi referans sesin kullanılacağı ve her referans sesin ne işe yaradığı. Klipler @Audio1, @Audio2 ve @Audio3 ile seçilir; ya o iş için yüklenir ya da varlık kitaplığınızdan alınıp bir dizinin tamamında yeniden kullanılır.
[Sokak ortam sesleri: geçen arabalar, uzaktan konuşmalar] gibi köşeli parantezli notlar, sesi bir konuşmacıya bağlamadan sahneyi açıp kapatmanın temiz bir yolu.
Referans kliplerinizi CLEAR listesine göre hazırlayın:
- Temiz kayıt, arka plan gürültüsü az
- Klip başına 30 saniyenin altında süre
- İstediğiniz oyunculukla uyumlu duygu
- Her klip içinde tutarlı aksan
- Klipler arasında sabit oda tonu
Hiç klip yoksa sesi metinle tarif edin; “hoş” ya da “profesyonel” yerine yaş, aksan ve konuşma hızı verin. Karakter görseli de işe yarar: model görünen yaştan ve karakterden uygun bir ses türetir; kurgusal ya da animasyon konuşmacılar için kullanışlıdır.
Seed Audio 1.0 nasıl kullanılır
Bitmiş bir parçaya ulaşmak dört adım sürer.
- Sahne brifingini yazın. Mekânı, kadroyu, müzik ve efektleri, her sesi ve replikleri yukarıdaki SCENE listesine göre anlatın. En fazla 3.000 karakter.
- Sesleri belirleyin. T2A için istemde tarif edin ya da TA2A için üç adede kadar referans klip yükleyip bağlayın. Karakter görseli de olur.
- Gerekiyorsa zamanlamayı ekleyin. Belirli bir aralığa oturması gereken repliklere
[başlangıç:bitiş]zaman kodları koyun. - Üretin. Tek geçiş; ses, müzik ve efektleri birlikte, miksi yapılmış halde, iki dakikaya kadar döndürür.
İki dakikayı aşan her şey için, bir sesli kitap bölümü ya da tam bir epizot, sahne sahne ilerleyin ve kadronun tutarlı kalması için üretimler boyunca aynı ses referansını koruyun.
SSS
T2A, yani metinden sese, her şeyi sizin tarifinizden kurar: ortamı, müziği, ses efektlerini ve her karakterin sesini. TA2A, yani metin artı sesten sese, buna üç adede kadar referans kayıt ekler; bunları belirli karakterlere bağlarsınız ve o sesler yazılı bir tarifi değil kayıtları izler. İstemin geri kalanı aynıdır.
Evet. T2A ve TA2A'nın ötesinde bir ses klonlama modu var: bir ses klibi yüklersiniz ve klonlanan ses düz metin okuma için kullanılabilir hale gelir. ByteDance bunu tek klipten klonlama olarak belgeliyor. Ses; müzik, efektler ve başka konuşmacılarla birlikte eksiksiz bir sahnede yer alacaksa, üç referans klip alıp her birini bir karaktere bağlayan TA2A'yı kullanın.
Bir repliğin başına [5.5s:8.0s] biçiminde bir zaman kodu koyun; model o repliğin okuyuşunu tam olarak o aralığa oturtur, oturması için tempoyu ve duraklamaları ayarlar. Sesin görüntüyle uyuşması gereken dublajda modeli pratik kılan özellik budur. Zaman kodu olmayan replikler doğal tempoyla okunur.
Yirmi dil: İngilizce, Çince, Japonca, Korece, Meksika İspanyolcası, Kastilya İspanyolcası, Endonezce, Almanca, Brezilya Portekizcesi, Fransızca, Tayca, Vietnamca, Malayca, Filipince, İtalyanca, Rusça, Felemenkçe, Lehçe, Türkçe ve İsveççe. En tutarlı sonuç için istemi senaryoyla aynı dilde yazın.
Evet. Sahneyi yazarken her karakterin sesini de tarif edin; model her konuşmacıya tek üretimde ayrı bir ses, duygu ve tempo verir, çevresindeki ortam ve efektlerle birlikte. TA2A modunda bu karakterlerden üçe kadarını referans kayıtlara bağlayabilirsiniz.
Geçiş başına iki dakikaya kadar ses; istem en fazla 3.000 karakter. Üretim akışsızdır: model sesi gerçek zamanlı döndürmek yerine miksi yapılmış parçanın tamamını işler. Daha uzun yapımlar sahne sahne kurulur.
Modelin en oturduğu kullanımlardan biri. Tek bir istem anlatıcının sesini, karakter seslerini ve çevrelerindeki ses tasarımını kapsar; böylece sahne, mikslenmeyi bekleyen ayrı parçalar halinde değil, bitmiş olarak gelir. Bölümler boyunca aynı ses referansını koruyun; anlatıcı kitabın tamamında tutarlı kalsın.
Belirgin biçimde. Sıradan metin okuma bir ses seçip metni okur. Seed Audio 1.0 metin okumadan referanstan sese geçer: tek bir istem ortamı, müziği, efektleri ve her karakterin sesini anlatır, model de sahnenin tamamını miksi yapılmış halde döndürür. Kapsam farkı, yalnızca sese karşılık eksiksiz bir ses yapımıdır.
