Pembuatan audio

Seed Audio 1.0

oleh ByteDance

Model TTS all‑in‑one dari ByteDance.
Suara, musik, dan efek suara dalam satu proses.

Seed Audio 1.0

Fitur utama

Dengarkan rentangnya

Narasi dokumenterSpeech

Voice-over dokumenter yang hangat dan tenang.

0:00
0:12
Voice-over thrillerSpeech

Pengucapan baris yang berbisik, tegang, dekat, dan intim.

0:00
0:12
Ambience pasar rempahSound effects

Lapisan suara pasar terbuka yang kaya.

0:00
0:12
Badai petirSound effects

Badai yang membesar hingga gemuruh petir di kejauhan.

0:00
0:12
Cue orkestraMusic

Cue singkat yang naik untuk string dan brass.

0:00
0:12
Beat lo-fiMusic

Beat santai dengan piano lembut dan derak vinyl.

0:00
0:12

Spesifikasi teknis

ByteDance

Dikembangkan oleh tim riset Seed dari ByteDance.

20

Inggris, Mandarin, Jepang, Korea, Spanyol, Prancis, Jerman, dan lainnya.

Hingga 2 mnt

Maksimal dua menit audio yang dihasilkan per proses.

3.000 kar.

Cukup untuk brief adegan lengkap, termasuk dialognya.

Hingga 3

Hingga tiga klip referensi, masing-masing maksimal 30 detik.

Non-streaming

Merender track lengkap, bukan aliran real-time.

Contoh penggunaan

Buku audio

Narasi, suara karakter, dan desain suara untuk satu buku penuh. ByteDance menaksir biayanya sekitar sepersepuluh studio.

Sulih suara video

Jelaskan suaranya atau unggah gambar karakter, lalu pakai timecode agar tiap baris jatuh persis di tempat yang dibutuhkan.

Audio game

Dialog karakter, adegan berakting, dan efek lingkungan untuk momen yang imersif, dihasilkan langsung dari naskah.

Audio video sekali proses

Beri sebuah klip narasi, desain suara, dan musiknya dalam satu proses, tanpa langkah mixing terpisah setelahnya.

Iklan dan promo

Satu baris dialog, efek suara, dan musik sebagai satu track siap pakai, dibuat untuk konten berdurasi pendek.

Dialog dan drama audio

Beberapa karakter, masing-masing dengan suara dan pembawaannya, dalam satu adegan dengan ambience dan tempo yang pas.

Contoh prompt

Penjelasan bernarasi

Narator tenang, ambience dapur lembut: “Campurkan tepung dan mentega.”

Edit prompt

Kontrol waktu

Ryan (hangat, terengah): “[5.5s:8.0s] Maya! Kamu benar-benar pergi malam ini?”

Edit prompt

Adegan buku audio

Hujan di jendela. Narator, rendah dan tenang: “Dia membacanya dua kali.”

Edit prompt

Komentar olahraga

Stadion penuh, penonton menggemuruh. Komentator, girang: “GOOOL!”

Edit prompt

Drama audio

Detektif, tegang: “Jangan bergerak.” Langkah berhenti, pintu berderit.

Edit prompt

Momen game

Suara berat dan heroik: “Segel kuno telah pecah.” Batu bergesek.

Edit prompt

Gambaran umum

Seed Audio 1.0 adalah model audio all-in-one dari ByteDance, dibangun sebagai langkah berikutnya bagi text-to-speech, bukan sebagai pemutusan darinya. Alur kerja audio tradisional memakai perkakas terpisah untuk suara, musik, dan efek suara, masing-masing dibuat sendiri lalu dimix. Seed Audio 1.0 menghasilkan ketiganya sekaligus dari satu prompt teks, dan keluarannya adalah track audio utuh yang siap dipakai.

Dari text-to-speech ke audio berbasis referensi

TTS biasa mengambil satu suara dan satu blok teks. Seed Audio 1.0 mengambil satu adegan: cuaca dan ruangannya, musik di bawahnya, efek di sekitar aksinya, seperti apa rupa dan bunyi tiap karakter, serta dialog yang mereka ucapkan. Semua yang bisa Anda jelaskan menjadi bagian dari proses yang sama, dan itulah sebabnya sebuah prompt bisa mencapai 3.000 karakter tanpa menjadi pengisi kosong.

Model ini memahami konteks adegan. Prompt percakapan di kafe mendapat riuh obrolan dan ruang akustik yang tepat, bukan derau ruangan generik. Adegan aksi mendapat efek yang tajam dan musik yang dinamis, bukan musik latar yang ditempel di atas keheningan. Ketiga lapisan keluar dengan proporsi dan mix yang pas untuk adegannya, bukan dirakit dari ekspor terpisah.

Empat mode

Yang paling sederhana adalah text-to-speech: pilih suara, masukkan teks, model membacakannya. Kloning suara menambah satu langkah, unggah satu klip audio dan suara hasil kloning itu tersedia untuk text-to-speech yang sama. Dua mode berikutnya adalah yang membedakan model ini dari TTS biasa.

Pada teks ke audio (T2A), tiap suara berasal dari deskripsi Anda. Sebutkan usia, aksen, emosi, nada, dan kecepatan sebuah karakter, dan model akan memerankannya.

Pada teks plus audio ke audio (TA2A), Anda mengunggah hingga tiga klip referensi berdurasi maksimal 30 detik dan mengaitkan tiap klip ke satu karakter di dalam prompt. Suara yang dihasilkan lalu mengikuti rekaman itu, bukan sebuah deskripsi. Klip referensi bisa diunggah untuk satu pekerjaan saja atau disimpan di pustaka aset dan dipakai ulang di sepanjang satu seri.

Dua puluh bahasa

Seed Audio 1.0 menghasilkan audio dalam bahasa Inggris, Mandarin, Jepang, Korea, Spanyol Meksiko, Spanyol Kastilia, Indonesia, Jerman, Portugis Brasil, Prancis, Thai, Vietnam, Melayu, Filipino, Italia, Rusia, Belanda, Polandia, Turki, dan Swedia. Bahasa prompt dan bahasa naskah sebaiknya sama: tulis brief-nya dalam bahasa yang dipakai para karakter.

Waktu yang bisa ditentukan sampai per detik

Seed Audio 1.0 menerima timecode pada baris mana pun, ditulis langsung sebagai [5.5s:8.0s], dan menyesuaikan pembawaannya ke jendela waktu itu. Untuk sulih suara, inilah beda antara audio yang kira-kira pas dan audio yang jatuh tepat di potongan. Prosesnya non-streaming: model merender track jadi dalam satu proses, hingga dua menit.

Harga sederhana

Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.

Basic

$9/ bulan
ditagih sebagai $0 per tahun

1100 bulanan kredit

1 pengguna saja

Semua model

Workflows

Standard

$24/ bulan
ditagih sebagai $0 per tahun

3625 bulanan kredit

1 pengguna saja

Semua model

Workflows

Pro

$45/ bulan
ditagih sebagai $0 per tahun

6350 bersama bulanan kredit

1 pengguna

+ hingga 4 lainnya dengan biaya tambahan

Semua model

Workflows

Pro Max

$170/ bulan
ditagih sebagai $0 per tahun

24650 bersama bulanan kredit

1 pengguna

+ hingga 9 lainnya dengan biaya tambahan

Semua model

Workflows

Enterprise

Untuk batas yang lebih tinggi

Khusus

ketentuan harga dan penagihan

Kredit volume tinggi
Batas kursi khusus
Semua model
Workflows
Pricing Gradient

Free

Untuk bereksperimen

$0

gratis selamanya

Hingga 20 kredit
Hanya 1 pengguna
Model terbatas
Workflows

FAQ

Apa itu Seed Audio 1.0?
Seed Audio 1.0 adalah model text-to-speech all-in-one dari ByteDance. Dari satu prompt teks, model ini menghasilkan suara, musik instrumental, dan efek suara sekaligus sebagai satu track jadi yang sudah dimix. Model ini bekerja dalam dua mode utama: teks ke audio (T2A), di mana semuanya berasal dari deskripsi Anda, dan teks plus audio ke audio (TA2A), di mana Anda menambahkan klip referensi untuk memilih suara tertentu.
Bahasa apa saja yang didukung Seed Audio 1.0?
Seed Audio 1.0 mendukung 20 bahasa: Inggris, Mandarin, Jepang, Korea, Spanyol Meksiko, Spanyol Kastilia, Indonesia, Jerman, Portugis Brasil, Prancis, Thai, Vietnam, Melayu, Filipino, Italia, Rusia, Belanda, Polandia, Turki, dan Swedia. Untuk hasil terbaik, tulis prompt dalam bahasa yang sama dengan dialog yang ingin diucapkan.
Bagaimana audio referensi bekerja di Seed Audio 1.0?
Di mode TA2A Anda menyediakan hingga tiga klip referensi berdurasi maksimal 30 detik, lalu mengaitkannya di dalam prompt sehingga tiap karakter terhubung ke satu rekaman. Model mengambil karakter vokal dan emosi dari referensi itu dan mempertahankannya sepanjang proses. Anda juga bisa menentukan suara lewat deskripsi teks atau gambar karakter.
Bisakah Seed Audio 1.0 mengkloning suara?
Bisa. Selain T2A dan TA2A ada mode kloning suara: unggah satu klip audio, dan suara hasil kloning itu tersedia untuk text-to-speech biasa. ByteDance mendokumentasikannya sebagai kloning dari satu klip. Kalau suaranya harus berada di dalam satu adegan utuh bersama musik, efek, dan karakter lain, pakai TA2A dengan tiga klip referensinya.
Bisakah Seed Audio 1.0 mengatur durasi tiap baris?
Bisa. Seed Audio 1.0 mendukung kontrol waktu presisi: beri timecode seperti [5.5s:8.0s] di awal sebuah baris dan model akan menyesuaikan baris itu ke jendela waktu tersebut. Inilah yang membuatnya layak dipakai untuk sulih suara, di mana dialog harus cocok dengan gambar.
Bisakah Seed Audio 1.0 menghasilkan beberapa pembicara sekaligus?
Bisa. Tulis adegan dengan beberapa karakter dan jelaskan tiap suara di dalam teksnya. Seed Audio 1.0 memberi tiap pembicara suara, emosi, dan tempo yang berbeda dalam satu proses, lengkap dengan ambience dan efek di sekitarnya.
Berapa panjang maksimal satu generasi Seed Audio 1.0?
Seed Audio 1.0 menghasilkan hingga dua menit audio dalam satu proses, dari prompt sepanjang maksimal 3.000 karakter. Produksi yang lebih panjang dibangun adegan demi adegan.
Apa bedanya Seed Audio 1.0 dengan text-to-speech biasa?
Text-to-speech biasa memilih satu suara lalu membacakan teks. Seed Audio 1.0 beranjak dari text-to-speech ke audio berbasis referensi: satu prompt menjelaskan lingkungan, musik, efek suara, dan suara tiap karakter, lalu model mengembalikan seluruh adegan yang sudah dimix. Bedanya ada pada cakupan: produksi audio yang jadi, bukan hanya suaranya.