Pembuatan audio

Seed Audio 1.0

oleh ByteDance

Model TTS all‑in‑one dari ByteDance.
Suara, musik, dan efek suara dalam satu proses.

Seed Audio 1.0

Fitur utama

Dengarkan rentangnya

Narasi dokumenterSpeech

Voice-over dokumenter yang hangat dan tenang.

0:00
0:12
Voice-over thrillerSpeech

Pengucapan baris yang berbisik, tegang, dekat, dan intim.

0:00
0:12
Ambience pasar rempahSound effects

Lapisan suara pasar terbuka yang kaya.

0:00
0:12
Badai petirSound effects

Badai yang membesar hingga gemuruh petir di kejauhan.

0:00
0:12
Cue orkestraMusic

Cue singkat yang naik untuk string dan brass.

0:00
0:12
Beat lo-fiMusic

Beat santai dengan piano lembut dan derak vinyl.

0:00
0:12

Spesifikasi teknis

ByteDance

Dikembangkan oleh tim riset Seed dari ByteDance.

20

Inggris, Mandarin, Jepang, Korea, Spanyol, Prancis, Jerman, dan lainnya.

Hingga 2 mnt

Maksimal dua menit audio yang dihasilkan per proses.

3.000 kar.

Cukup untuk brief adegan lengkap, termasuk dialognya.

Hingga 3

Hingga tiga klip referensi, masing-masing maksimal 30 detik.

Non-streaming

Merender track lengkap, bukan aliran real-time.

Contoh penggunaan

Buku audio

Narasi, suara karakter, dan desain suara untuk satu buku penuh. ByteDance menaksir biayanya sekitar sepersepuluh studio.

Sulih suara video

Jelaskan suaranya atau unggah gambar karakter, lalu pakai timecode agar tiap baris jatuh persis di tempat yang dibutuhkan.

Audio game

Dialog karakter, adegan berakting, dan efek lingkungan untuk momen yang imersif, dihasilkan langsung dari naskah.

Audio video sekali proses

Beri sebuah klip narasi, desain suara, dan musiknya dalam satu proses, tanpa langkah mixing terpisah setelahnya.

Iklan dan promo

Satu baris dialog, efek suara, dan musik sebagai satu track siap pakai, dibuat untuk konten berdurasi pendek.

Dialog dan drama audio

Beberapa karakter, masing-masing dengan suara dan pembawaannya, dalam satu adegan dengan ambience dan tempo yang pas.

Contoh prompt

Penjelasan bernarasi

Narator tenang, ambience dapur lembut: “Campurkan tepung dan mentega.”

Edit prompt

Kontrol waktu

Ryan (hangat, terengah): “[5.5s:8.0s] Maya! Kamu benar-benar pergi malam ini?”

Edit prompt

Adegan buku audio

Hujan di jendela. Narator, rendah dan tenang: “Dia membacanya dua kali.”

Edit prompt

Komentar olahraga

Stadion penuh, penonton menggemuruh. Komentator, girang: “GOOOL!”

Edit prompt

Drama audio

Detektif, tegang: “Jangan bergerak.” Langkah berhenti, pintu berderit.

Edit prompt

Momen game

Suara berat dan heroik: “Segel kuno telah pecah.” Batu bergesek.

Edit prompt

Harga sederhana

Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.

Basic

$9/ bulan
ditagih sebagai $0 per tahun

900 bulanan kredit

1 pengguna saja

Semua model

Workflows

Standard

$24/ bulan
ditagih sebagai $0 per tahun

3200 bulanan kredit

1 pengguna saja

Semua model

Workflows

Pro

$45/ bulan
ditagih sebagai $0 per tahun

6200 bersama bulanan kredit

1 pengguna

+ hingga 4 lainnya dengan biaya tambahan

Semua model

Workflows

Pro Max

$170/ bulan
ditagih sebagai $0 per tahun

24000 bersama bulanan kredit

1 pengguna

+ hingga 9 lainnya dengan biaya tambahan

Semua model

Workflows

Enterprise

Untuk batas yang lebih tinggi

Khusus

ketentuan harga dan penagihan

Kredit volume tinggi
Batas kursi khusus
Semua model
Workflows
Pricing Gradient

Free

Untuk bereksperimen

$0

gratis selamanya

Hingga 20 kredit
Hanya 1 pengguna
Model terbatas
Workflows

FAQ

Apa itu Seed Audio 1.0?
Seed Audio 1.0 adalah model text-to-speech all-in-one dari ByteDance. Dari satu prompt teks, model ini menghasilkan suara, musik instrumental, dan efek suara sekaligus sebagai satu track jadi yang sudah dimix. Model ini bekerja dalam dua mode utama: teks ke audio (T2A), di mana semuanya berasal dari deskripsi Anda, dan teks plus audio ke audio (TA2A), di mana Anda menambahkan klip referensi untuk memilih suara tertentu.
Bahasa apa saja yang didukung Seed Audio 1.0?
Seed Audio 1.0 mendukung 20 bahasa: Inggris, Mandarin, Jepang, Korea, Spanyol Meksiko, Spanyol Kastilia, Indonesia, Jerman, Portugis Brasil, Prancis, Thai, Vietnam, Melayu, Filipino, Italia, Rusia, Belanda, Polandia, Turki, dan Swedia. Untuk hasil terbaik, tulis prompt dalam bahasa yang sama dengan dialog yang ingin diucapkan.
Bagaimana audio referensi bekerja di Seed Audio 1.0?
Di mode TA2A Anda menyediakan hingga tiga klip referensi berdurasi maksimal 30 detik, lalu mengaitkannya di dalam prompt sehingga tiap karakter terhubung ke satu rekaman. Model mengambil karakter vokal dan emosi dari referensi itu dan mempertahankannya sepanjang proses. Anda juga bisa menentukan suara lewat deskripsi teks atau gambar karakter.
Bisakah Seed Audio 1.0 mengkloning suara?
Bisa. Selain T2A dan TA2A ada mode kloning suara: unggah satu klip audio, dan suara hasil kloning itu tersedia untuk text-to-speech biasa. ByteDance mendokumentasikannya sebagai kloning dari satu klip. Kalau suaranya harus berada di dalam satu adegan utuh bersama musik, efek, dan karakter lain, pakai TA2A dengan tiga klip referensinya.
Bisakah Seed Audio 1.0 mengatur durasi tiap baris?
Bisa. Seed Audio 1.0 mendukung kontrol waktu presisi: beri timecode seperti [5.5s:8.0s] di awal sebuah baris dan model akan menyesuaikan baris itu ke jendela waktu tersebut. Inilah yang membuatnya layak dipakai untuk sulih suara, di mana dialog harus cocok dengan gambar.
Bisakah Seed Audio 1.0 menghasilkan beberapa pembicara sekaligus?
Bisa. Tulis adegan dengan beberapa karakter dan jelaskan tiap suara di dalam teksnya. Seed Audio 1.0 memberi tiap pembicara suara, emosi, dan tempo yang berbeda dalam satu proses, lengkap dengan ambience dan efek di sekitarnya.
Berapa panjang maksimal satu generasi Seed Audio 1.0?
Seed Audio 1.0 menghasilkan hingga dua menit audio dalam satu proses, dari prompt sepanjang maksimal 3.000 karakter. Produksi yang lebih panjang dibangun adegan demi adegan.
Apa bedanya Seed Audio 1.0 dengan text-to-speech biasa?
Text-to-speech biasa memilih satu suara lalu membacakan teks. Seed Audio 1.0 beranjak dari text-to-speech ke audio berbasis referensi: satu prompt menjelaskan lingkungan, musik, efek suara, dan suara tiap karakter, lalu model mengembalikan seluruh adegan yang sudah dimix. Bedanya ada pada cakupan: produksi audio yang jadi, bukan hanya suaranya.