Ses üretimi

Seed Audio 1.0

ByteDance tarafından

ByteDance'in hepsi bir arada TTS modeli.
Ses, müzik ve efektler tek üretimde.

Seed Audio 1.0

Öne çıkan özellikler

Kapsamı dinleyin

Belgesel anlatımıSpeech

Sıcak ve ölçülü bir belgesel seslendirmesi.

0:00
0:12
Gerilim seslendirmesiSpeech

Fısıltılı, gergin, yakın ve samimi bir satır okuması.

0:00
0:12
Baharat pazarı ortamıSound effects

Katmanlı bir açık hava pazarı ses altyapısı.

0:00
0:12
FırtınaSound effects

Uzaktaki bir gök gürültüsüne doğru büyüyen bir fırtına.

0:00
0:12
Orkestra vuruşuMusic

Yaylılar ve bakır nefesliler için kısa, yükselen bir vuruş.

0:00
0:12
Lo-fi ritimMusic

Yumuşak tuşlar ve plak cızırtısıyla rahat bir ritim.

0:00
0:12

Teknik özellikler

ByteDance

ByteDance'in Seed araştırma ekibi tarafından geliştirildi.

20

İngilizce, Çince, Japonca, Korece, İspanyolca, Fransızca, Almanca ve dahası.

2 dakikaya dek

Geçiş başına en fazla iki dakika üretilmiş ses.

3.000 karakter

Diyalog dahil eksiksiz bir sahne brifingine yetecek alan.

3 adede dek

Her biri en fazla 30 saniyelik üç referans klibe kadar.

Akışsız

Gerçek zamanlı akış değil, parçanın tamamını işler.

Kullanım örnekleri

Sesli kitaplar

Bütün bir kitap için anlatım, sesler ve ses tasarımı. ByteDance maliyeti stüdyonun onda biri civarında gösteriyor.

Video dublajı

Sesi tarif edin ya da karakter görseli yükleyin, sonra zaman koduyla her repliği görüntünün istediği yere oturtun.

Oyun sesi

Karakter replikleri, oynanmış sahneler ve çevre efektleri; sürükleyici anlar doğrudan senaryodan üretilir.

Tek geçişte video sesi

Bir klibe anlatımını, ses tasarımını ve müziğini tek üretimde verin; sonrasında ayrı bir miks adımı olmadan.

Reklam ve tanıtım

Bir replik, ses efektleri ve müzik; kısa formatlar için hazırlanmış, kullanıma hazır tek bir parça.

Diyalog ve radyo tiyatrosu

Her biri kendi sesi ve oyunculuğuyla birden çok karakter; ortamı ve temposu uyumlu tek bir sahnede.

Prompt örnekleri

Anlatımlı açıklama

Sakin anlatıcı, yumuşak mutfak ortamı: “Unu ve tereyağını karıştırın.”

Edit prompt

Zaman kontrolü

Ryan (sıcak, nefes nefese): “[5.5s:8.0s] Maya! Gerçekten bu gece mi gidiyorsun?”

Edit prompt

Sesli kitap sahnesi

Camda yağmur. Anlatıcı, pes ve aceleci değil: “İki kez okudu.”

Edit prompt

Spor spikerliği

Dolu stat, kükreyen taraftar. Spiker, coşkuyla: “VE GOOOL!”

Edit prompt

Radyo tiyatrosu

Dedektif, gergin: “Kımıldama.” Ayak sesleri durur, bir kapı gıcırdar.

Edit prompt

Oyun anı

Derin, kahramanca ses: “Kadim mühür kırıldı.” Taş sürtünür.

Edit prompt

Genel bakış

Seed Audio 1.0, ByteDance'in hepsi bir arada ses modeli; metin okumadan bir kopuş olarak değil, onun bir sonraki adımı olarak kurulmuş. Geleneksel ses iş akışları ses, müzik ve efektler için ayrı araçlar kullanır; her biri tek başına üretilir, sonra mikslenir. Seed Audio 1.0 üçünü de tek bir metin isteminden birlikte üretir ve çıktı, doğrudan kullanılabilir eksiksiz bir ses parçasıdır.

Metin okumadan referanstan sese

Alışılmış TTS bir ses ve bir metin bloğu alır. Seed Audio 1.0 bir sahne alır: havayı ve mekânı, altta akan müziği, olayın çevresindeki efektleri, her karakterin neye benzediğini ve nasıl duyulduğunu, bir de söyledikleri replikleri. Tarif edebildiğiniz her şey aynı üretimin parçası olur; bir istemin dolgu olmadan 3.000 karaktere çıkabilmesinin nedeni de budur.

Model sahne bağlamını anlar. Kafede geçen bir konuşma istemi, jenerik bir oda tonu değil, arka planda uğultu ve doğru akustik alanı alır. Bir aksiyon sahnesi, sessizliğin üzerine yapıştırılmış fon müziği değil, keskin efektler ve devingen bir müzik alır. Üç katman ayrı ayrı dışa aktarılıp birleştirilmiş gibi değil, sahneye göre oranlanıp mikslenmiş olarak çıkar.

Dört mod

En yalını metin okuma: bir ses seçin, metni girin, model okusun. Ses klonlama bir adım ekler: tek bir ses klibi yüklersiniz ve klonlanan ses aynı metin okuma için kullanılabilir olur. Diğer iki mod ise bu modeli sıradan TTS'ten ayıran yer.

Metinden sese (T2A) modunda her ses sizin tarifinizden doğar. Bir karakterin yaşını, aksanını, duygusunu, tonunu ve konuşma hızını söyleyin; model onu kadroya alsın.

Metin artı sesten sese (TA2A) modunda her biri en fazla 30 saniyelik üç referans klibe kadar dosya yükler ve her birini istem içinde bir karaktere bağlarsınız. Üretilen ses o zaman bir tarifi değil, kaydı izler. Referans klipler tek bir iş için yüklenebilir ya da bir varlık kitaplığında tutulup bir dizinin tamamında yeniden kullanılabilir.

Yirmi dil

Seed Audio 1.0 İngilizce, Çince, Japonca, Korece, Meksika İspanyolcası, Kastilya İspanyolcası, Endonezce, Almanca, Brezilya Portekizcesi, Fransızca, Tayca, Vietnamca, Malayca, Filipince, İtalyanca, Rusça, Felemenkçe, Lehçe, Türkçe ve İsveççe üretim yapar. İstem dili ile senaryo dili aynı olmalı: brifingi, karakterlerin konuştuğu dilde yazın.

Saniyesine kadar belirleyebildiğiniz zamanlama

Seed Audio 1.0 herhangi bir replikte, satır içinde [5.5s:8.0s] biçiminde yazılan bir zaman kodunu kabul eder ve okuyuşu tam olarak o aralığa oturtur. Dublajda bu, aşağı yukarı uyan sesle kurguya tam oturan ses arasındaki farktır. Üretim akışsızdır: model bitmiş parçayı iki dakikaya kadar tek geçişte işler.

Basit fiyatlandırma

Bugün ücretsiz başlayın, istediğiniz zaman yükseltme veya iptal etme seçeneğiyle.

Basic

$9/ ay
şu şekilde faturalandırılır $0 yıl başına

1100 aylık kredi

1 yalnızca kullanıcı

Tüm modeller

Workflows

Standard

$24/ ay
şu şekilde faturalandırılır $0 yıl başına

3625 aylık kredi

1 yalnızca kullanıcı

Tüm modeller

Workflows

Pro

$45/ ay
şu şekilde faturalandırılır $0 yıl başına

6350 paylaşılan aylık kredi

1 kullanıcı

+ en fazla 4 ek ücret karşılığında daha fazlası

Tüm modeller

Workflows

Pro Max

$170/ ay
şu şekilde faturalandırılır $0 yıl başına

24650 paylaşılan aylık kredi

1 kullanıcı

+ en fazla 9 ek ücret karşılığında daha fazlası

Tüm modeller

Workflows

Enterprise

Daha yüksek limitler için

Özel

fiyatlandırma ve faturalandırma koşulları

Yüksek hacimli krediler
Özel koltuk limitleri
Tüm modeller
Workflows
Pricing Gradient

Free

Denemek için

$0

kalıcı olarak ücretsiz

En fazla 20 kredi
Yalnızca 1 kullanıcı
Sınırlı modeller
Workflows

SSS

Seed Audio 1.0 nedir?
Seed Audio 1.0, ByteDance'in hepsi bir arada metin okuma modelidir. Tek bir metin isteminden ses, enstrümantal müzik ve ses efektlerini birlikte, miksi tamamlanmış tek bir parça olarak üretir. İki ana modda çalışır: metinden sese (T2A), her şeyin sizin tarifinizden geldiği mod, ve metin artı sesten sese (TA2A), belirli sesleri kadroya almak için referans klipler eklediğiniz mod.
Seed Audio 1.0 hangi dilleri destekliyor?
Seed Audio 1.0 20 dili destekler: İngilizce, Çince, Japonca, Korece, Meksika İspanyolcası, Kastilya İspanyolcası, Endonezce, Almanca, Brezilya Portekizcesi, Fransızca, Tayca, Vietnamca, Malayca, Filipince, İtalyanca, Rusça, Felemenkçe, Lehçe, Türkçe ve İsveççe. En iyi sonuç için istemi, seslendirilecek repliklerle aynı dilde yazın.
Seed Audio 1.0'da referans ses nasıl çalışır?
TA2A modunda her biri en fazla 30 saniyelik üç referans klibe kadar dosya verir, sonra bunları istem içinde etiketleyerek her karakteri bir kayda bağlarsınız. Model referansın ses karakterini ve duygusunu alıp üretim boyunca korur. Bir sesi kayıt yerine metinle ya da karakter görseliyle de tanımlayabilirsiniz.
Seed Audio 1.0 bir sesi klonlayabilir mi?
Evet. T2A ve TA2A'nın yanında bir ses klonlama modu var: tek bir ses klibi yüklersiniz ve klonlanan ses düz metin okuma için kullanılabilir hale gelir. ByteDance bunu tek klipten klonlama olarak belgeliyor. Ses; müzik, efektler ve başka karakterlerle birlikte eksiksiz bir sahnenin içinde duracaksa, bunun yerine üç referans klip alan TA2A'yı kullanın.
Seed Audio 1.0 her repliğin zamanlamasını kontrol edebilir mi?
Evet. Seed Audio 1.0 hassas zaman kontrolünü destekler: bir repliğin başına [5.5s:8.0s] gibi bir zaman kodu koyun, model o repliği tam olarak o aralığa oturtsun. Diyaloğun görüntüyle uyuşması gereken dublajda modeli kullanılabilir kılan şey budur.
Seed Audio 1.0 aynı anda birden çok konuşmacı üretebilir mi?
Evet. Birkaç karakterli bir sahne yazın ve her sesi metnin içinde tarif edin. Seed Audio 1.0 her konuşmacıya tek üretimde ayrı bir ses, duygu ve tempo verir; çevresindeki ortam ve efektlerle birlikte.
Bir Seed Audio 1.0 üretimi ne kadar uzun olabilir?
Seed Audio 1.0 tek geçişte iki dakikaya kadar ses üretir; istem en fazla 3.000 karakter olabilir. Daha uzun yapımlar sahne sahne kurulur.
Seed Audio 1.0'ın sıradan metin okumadan farkı nedir?
Sıradan metin okuma bir ses seçip metni okur. Seed Audio 1.0 metin okumadan referanstan sese geçer: tek bir istem ortamı, müziği, efektleri ve her karakterin sesini anlatır, model de sahnenin tamamını miksi yapılmış halde döndürür. Fark kapsamdadır: yalnızca ses değil, bitmiş bir ses yapımı.