Seed Audio 1.0
oleh ByteDance
Model TTS all‑in‑one dari ByteDance.
Suara, musik, dan efek suara dalam satu proses.

Fitur utama
Dengarkan rentangnya
Voice-over dokumenter yang hangat dan tenang.
Pengucapan baris yang berbisik, tegang, dekat, dan intim.
Lapisan suara pasar terbuka yang kaya.
Badai yang membesar hingga gemuruh petir di kejauhan.
Cue singkat yang naik untuk string dan brass.
Beat santai dengan piano lembut dan derak vinyl.
Spesifikasi teknis
ByteDance
Dikembangkan oleh tim riset Seed dari ByteDance.
20
Inggris, Mandarin, Jepang, Korea, Spanyol, Prancis, Jerman, dan lainnya.
Hingga 2 mnt
Maksimal dua menit audio yang dihasilkan per proses.
3.000 kar.
Cukup untuk brief adegan lengkap, termasuk dialognya.
Hingga 3
Hingga tiga klip referensi, masing-masing maksimal 30 detik.
Non-streaming
Merender track lengkap, bukan aliran real-time.
Contoh penggunaan
Buku audio
Narasi, suara karakter, dan desain suara untuk satu buku penuh. ByteDance menaksir biayanya sekitar sepersepuluh studio.
Sulih suara video
Jelaskan suaranya atau unggah gambar karakter, lalu pakai timecode agar tiap baris jatuh persis di tempat yang dibutuhkan.
Audio game
Dialog karakter, adegan berakting, dan efek lingkungan untuk momen yang imersif, dihasilkan langsung dari naskah.
Audio video sekali proses
Beri sebuah klip narasi, desain suara, dan musiknya dalam satu proses, tanpa langkah mixing terpisah setelahnya.
Iklan dan promo
Satu baris dialog, efek suara, dan musik sebagai satu track siap pakai, dibuat untuk konten berdurasi pendek.
Dialog dan drama audio
Beberapa karakter, masing-masing dengan suara dan pembawaannya, dalam satu adegan dengan ambience dan tempo yang pas.
Contoh prompt
Penjelasan bernarasi
Narator tenang, ambience dapur lembut: “Campurkan tepung dan mentega.”
Edit promptKontrol waktu
Ryan (hangat, terengah): “[5.5s:8.0s] Maya! Kamu benar-benar pergi malam ini?”
Edit promptAdegan buku audio
Hujan di jendela. Narator, rendah dan tenang: “Dia membacanya dua kali.”
Edit promptGambaran umum
Seed Audio 1.0 adalah model audio all-in-one dari ByteDance, dibangun sebagai langkah berikutnya bagi text-to-speech, bukan sebagai pemutusan darinya. Alur kerja audio tradisional memakai perkakas terpisah untuk suara, musik, dan efek suara, masing-masing dibuat sendiri lalu dimix. Seed Audio 1.0 menghasilkan ketiganya sekaligus dari satu prompt teks, dan keluarannya adalah track audio utuh yang siap dipakai.
Dari text-to-speech ke audio berbasis referensi
TTS biasa mengambil satu suara dan satu blok teks. Seed Audio 1.0 mengambil satu adegan: cuaca dan ruangannya, musik di bawahnya, efek di sekitar aksinya, seperti apa rupa dan bunyi tiap karakter, serta dialog yang mereka ucapkan. Semua yang bisa Anda jelaskan menjadi bagian dari proses yang sama, dan itulah sebabnya sebuah prompt bisa mencapai 3.000 karakter tanpa menjadi pengisi kosong.
Model ini memahami konteks adegan. Prompt percakapan di kafe mendapat riuh obrolan dan ruang akustik yang tepat, bukan derau ruangan generik. Adegan aksi mendapat efek yang tajam dan musik yang dinamis, bukan musik latar yang ditempel di atas keheningan. Ketiga lapisan keluar dengan proporsi dan mix yang pas untuk adegannya, bukan dirakit dari ekspor terpisah.
Empat mode
Yang paling sederhana adalah text-to-speech: pilih suara, masukkan teks, model membacakannya. Kloning suara menambah satu langkah, unggah satu klip audio dan suara hasil kloning itu tersedia untuk text-to-speech yang sama. Dua mode berikutnya adalah yang membedakan model ini dari TTS biasa.
Pada teks ke audio (T2A), tiap suara berasal dari deskripsi Anda. Sebutkan usia, aksen, emosi, nada, dan kecepatan sebuah karakter, dan model akan memerankannya.
Pada teks plus audio ke audio (TA2A), Anda mengunggah hingga tiga klip referensi berdurasi maksimal 30 detik dan mengaitkan tiap klip ke satu karakter di dalam prompt. Suara yang dihasilkan lalu mengikuti rekaman itu, bukan sebuah deskripsi. Klip referensi bisa diunggah untuk satu pekerjaan saja atau disimpan di pustaka aset dan dipakai ulang di sepanjang satu seri.
Dua puluh bahasa
Seed Audio 1.0 menghasilkan audio dalam bahasa Inggris, Mandarin, Jepang, Korea, Spanyol Meksiko, Spanyol Kastilia, Indonesia, Jerman, Portugis Brasil, Prancis, Thai, Vietnam, Melayu, Filipino, Italia, Rusia, Belanda, Polandia, Turki, dan Swedia. Bahasa prompt dan bahasa naskah sebaiknya sama: tulis brief-nya dalam bahasa yang dipakai para karakter.
Waktu yang bisa ditentukan sampai per detik
Seed Audio 1.0 menerima timecode pada baris mana pun, ditulis langsung sebagai [5.5s:8.0s], dan menyesuaikan pembawaannya ke jendela waktu itu. Untuk sulih suara, inilah beda antara audio yang kira-kira pas dan audio yang jatuh tepat di potongan. Prosesnya non-streaming: model merender track jadi dalam satu proses, hingga dua menit.
Harga sederhana
Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.
Basic
1100 bulanan kredit
1 pengguna saja
Semua model
Workflows
Standard
3625 bulanan kredit
1 pengguna saja
Semua model
Workflows
Pro
6350 bersama bulanan kredit
1 pengguna
Semua model
Workflows
Pro Max
24650 bersama bulanan kredit
1 pengguna
Semua model
Workflows
Enterprise
Untuk batas yang lebih tinggi
Khusus
ketentuan harga dan penagihan

Free
Untuk bereksperimen
$0
gratis selamanya
FAQ
ChatGPT Images 2.5
OpenAI
Model gambar OpenAI, rilis September 2026. Detail lebih tajam, edit presisi, proses lebih cepat.
Lyria 3.5
Google DeepMind
Model musik terbaik dari Google. Lagu utuh: struktur, vokal, dan lirik.
MiniMax H3 Max Turbo
fal.ai
Tingkat cepat dari H3 racikan fal. Dua kali lebih gesit, tampilan mirip.
Inworld TTS 2
Inworld
95 suara, lebih dari 100 bahasa. Audio mulai di bawah satu detik.