Pembuatan audio
Tersedia sekarang

Inworld TTS 2

oleh Inworld

95 suara, lebih dari 100 bahasa.
Audio mulai di bawah satu detik.

Inworld TTS 2

Fitur utama

Spesifikasi teknis

95

Suara siap pakai di empat belas bahasa native

100+

Crosslingual, satu identitas suara di semuanya

2.000 karakter

Panjang naskah maksimum per generasi

Di bawah 200 ms

Median waktu sampai audio pertama terdengar

MP3, 48 kHz

Audio full-rate, siap ditaruh di timeline

2

Inworld TTS 2 dan Inworld TTS 2 Flash

Contoh penggunaan

Dua titik cahaya terhubung oleh benang cahaya yang tegang, satu menjawab yang lain

Karakter interaktif

Suara yang mulai cukup cepat untuk menopang percakapan. Di sini latensi adalah fiturnya, bukan catatan kaki.

Pita cahaya panjang yang stabil dengan butiran merata di sepanjang badannya

Narasi dan voice-over

Pilih satu narator di awal. Suara yang sama lalu dipakai di setiap potongan, pengambilan tambahan, dan revisi.

Pita cahaya yang terbelah menjadi pita-pita sejajar dan tetap seirama

Voice-over versi lokal

Jalankan naskah yang sama ke banyak bahasa dengan satu suara. Suara brand Anda tetap utuh setelah dialihbahasakan.

Spiral cahaya kuning keemasan yang melambat dan menjauh dengan putaran merata

Audiobook dan konten panjang

Garap buku satu bagian demi satu bagian. Naratornya tetap stabil dari bab ke bab.

Banyak titik cahaya kecil tersebar dalam kedalaman, terhubung oleh benang samar

Dialog game dan NPC

Isi satu kampung penuh karakter. Dengan 95 suara, tidak ada yang perlu dipakai dua kali.

Deretan anak tangga bercahaya yang naik rapi dan menjauh ke kedalaman

Video penjelas dan tutorial

Kalau produknya berubah, cukup buat ulang satu kalimat. Tidak perlu menjadwalkan sesi rekaman lagi.

Contoh prompt

Cahaya keemasan pucat yang merekah lembut di tepi frame

Sambutan hangat

Airnya sudah mendidih. Duduk dulu, ceritakan semuanya.

Edit prompt
Lipatan cahaya seputih tulang yang berkilau di sepanjang lekuknya

Pembuka bab

Bab satu. Pagi itu air laut surut, lalu tidak pernah benar-benar kembali.

Edit prompt
Satu helai cahaya gading hangat yang melengkung sekali

Langkah resep

Campur tepung dan mentega sampai adonannya baru saja menyatu.

Edit prompt
Dua garis tipis cahaya putih dingin yang bertemu di satu titik

Kabar mendadak

Anda tidak akan percaya siapa yang barusan menelepon.

Edit prompt
Jalinan halus cahaya abu keperakan yang dilihat dari sangat dekat

Pembuka kelas

Selamat datang kembali. Kita lanjutkan dari materi kemarin.

Edit prompt
Cahaya kuning keemasan yang perlahan menyempit ke satu titik

Info tur

Turnya mulai jam sembilan, tepat di luar gerbang utara.

Edit prompt

Sekilas Inworld TTS 2

Inworld TTS 2 adalah model text to speech Realtime TTS-2 buatan Inworld. Modelnya rilis 31 Agustus 2026, dan hari itu juga tersedia di Morphic. Naskah Anda dibacakan oleh salah satu dari 95 suara siap pakai. Suara itu tetap sama di lebih dari 100 bahasa. Audionya keluar cukup cepat untuk masuk ke percakapan yang sedang berjalan.

Yang membuat Inworld TTS 2 berbeda

Ada dua hal yang memisahkannya dari model suara lain. Pertama, latensi. Median waktu ke audio pertama berada di bawah 200 milidetik. Text to speech jadi tidak lagi masuk kategori render lalu tunggu. Sebuah karakter bisa menjawab saat pemainnya masih mendengarkan.

Kedua, suara tidak terikat pada satu bahasa. Suara mana pun di katalog bisa membaca bahasa apa pun yang didukung. Identitasnya bertahan meski bahasanya berganti di tengah satu generasi. Naskah dua bahasa pun terdengar seperti satu orang, bukan dua rekaman yang disambung. Itulah yang membuat satu suara brand tetap utuh setelah kontennya dialihbahasakan.

Inworld TTS 2 di Morphic

Di Morphic, Inworld TTS 2 duduk di pemilih model audio untuk Speech. Tetangganya ElevenLabs dan Gemini 3.1 Flash TTS. Ubah prompt bar ke Audio, pilih Speech, lalu pilih Inworld TTS 2. Tentukan suaranya, tempel naskah Anda, dan generate. Satu generasi menampung sampai 2.000 karakter, lalu kembali sebagai MP3 48 kHz, langsung ke Canvas.

Tersedia dua tingkat. Inworld TTS 2 adalah pilihan bawaan. Inworld TTS 2 Flash memakai katalog 95 suara yang sama, dengan setelan lebih cepat dan lebih hemat. Pilihan itu cocok untuk pekerjaan bervolume besar dan draf. Berpindah di antara keduanya tidak membuat Anda memilih ulang suara.

Buat kreator konten faceless, satu narator yang konsisten adalah setengah dari identitas kanal. Pelaku UMKM bisa membacakan ulang naskah promo tiap kali harga atau stok berubah. Tidak perlu menjadwalkan sesi rekaman baru. Karena audionya selesai dalam hitungan detik, jadwal unggah harian di TikTok atau Reels tetap jalan.

Harga sederhana

Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.

Basic

$9/ bulan
ditagih sebagai $0 per tahun

1100 bulanan kredit

1 pengguna saja

Semua model

Workflows

Standard

$24/ bulan
ditagih sebagai $0 per tahun

3625 bulanan kredit

1 pengguna saja

Semua model

Workflows

Pro

$45/ bulan
ditagih sebagai $0 per tahun

6350 bersama bulanan kredit

1 pengguna

+ hingga 4 lainnya dengan biaya tambahan

Semua model

Workflows

Pro Max

$170/ bulan
ditagih sebagai $0 per tahun

24650 bersama bulanan kredit

1 pengguna

+ hingga 9 lainnya dengan biaya tambahan

Semua model

Workflows

Enterprise

Untuk batas yang lebih tinggi

Khusus

ketentuan harga dan penagihan

Kredit volume tinggi
Batas kursi khusus
Semua model
Workflows
Pricing Gradient

Free

Untuk bereksperimen

$0

gratis selamanya

Hingga 20 kredit
Hanya 1 pengguna
Model terbatas
Workflows

FAQ

Apa itu Inworld TTS 2?
Inworld TTS 2 adalah model text to speech Realtime TTS-2 buatan Inworld, dirilis 31 Agustus 2026. Naskah Anda dibacakan oleh salah satu dari 95 suara siap pakai. Identitas suara itu bertahan di lebih dari 100 bahasa, dan audionya kembali dengan kecepatan real-time.
Apakah Inworld TTS 2 bisa membaca naskah bahasa Indonesia?
Satu suara bisa membaca bahasa apa pun yang didukung, dan bahasa yang didukung lebih dari 100. Identitas suaranya tetap sama saat bahasa berganti, bahkan di tengah satu generasi. Inworld tidak merinci empat belas bahasa native di katalognya, jadi anggap ini kemampuan crosslingual, bukan suara native. Cara tercepat memastikannya: tempel naskah Anda, pilih satu suara, lalu dengarkan hasilnya.
Berapa banyak suara dan bahasa yang tersedia?
Ada 95 suara siap pakai di empat belas bahasa native, dengan pembacaan crosslingual di lebih dari 100 bahasa. Suara mana pun bisa membaca bahasa apa pun yang didukung. Jadi bahasa native sebuah suara menunjukkan cara suara itu direkam, bukan batas pemakaiannya.
Kenapa Inworld TTS 2 bisa secepat itu?
Median waktu ke audio pertama ada di bawah 200 milidetik. Angka itu memindahkan text to speech keluar dari kategori render lalu tunggu. Karena itu modelnya bisa dipakai untuk karakter interaktif dan agen langsung, bukan cuma voice-over yang dibuat sekali lalu ditempel.
Apa bedanya Inworld TTS 2 dan Inworld TTS 2 Flash?
Keduanya memakai katalog 95 suara yang sama. Inworld TTS 2 memberi pembacaan paling penuh. Inworld TTS 2 Flash adalah tingkat yang lebih cepat dan lebih murah, cocok untuk pekerjaan bervolume besar atau draf. Berpindah di antara keduanya tidak membuat Anda memilih ulang suara.
Berapa panjang naskah yang bisa dibaca sekali jalan?
Sampai 2.000 karakter per generasi. Untuk naskah yang lebih panjang, pecah dulu menjadi beberapa bagian, lalu buat satu per satu. Suara yang Anda pilih tetap sama di semua bagian, jadi karya panjang tetap terdengar konsisten.
Apa bedanya dengan ElevenLabs di Morphic?
Keduanya menghasilkan suara sekelas manusia di Morphic. ElevenLabs adalah paket audio lengkap: suara, musik, dan efek suara, plus penyetelan suara yang detail. Inworld TTS 2 fokus pada suara saja, dengan keunggulan di latensi dan pada satu suara yang bertahan lintas bahasa. Banyak kreator memakai keduanya, satu untuk suara, satu lagi untuk musik dan efek.
Bagaimana cara memakai Inworld TTS 2 di Morphic?
Buka Morphic, ubah prompt bar ke Audio, lalu pilih Speech. Pilih Inworld TTS 2 sebagai modelnya, tentukan suara, tempel naskah Anda, dan generate. Audionya mendarat di Canvas, berdampingan dengan klip video Anda.