Inworld TTS 2
oleh Inworld
95 suara, lebih dari 100 bahasa.
Audio mulai di bawah satu detik.

Fitur utama
Spesifikasi teknis
95
Suara siap pakai di empat belas bahasa native
100+
Crosslingual, satu identitas suara di semuanya
2.000 karakter
Panjang naskah maksimum per generasi
Di bawah 200 ms
Median waktu sampai audio pertama terdengar
MP3, 48 kHz
Audio full-rate, siap ditaruh di timeline
2
Inworld TTS 2 dan Inworld TTS 2 Flash
Contoh penggunaan

Karakter interaktif
Suara yang mulai cukup cepat untuk menopang percakapan. Di sini latensi adalah fiturnya, bukan catatan kaki.

Narasi dan voice-over
Pilih satu narator di awal. Suara yang sama lalu dipakai di setiap potongan, pengambilan tambahan, dan revisi.

Voice-over versi lokal
Jalankan naskah yang sama ke banyak bahasa dengan satu suara. Suara brand Anda tetap utuh setelah dialihbahasakan.

Audiobook dan konten panjang
Garap buku satu bagian demi satu bagian. Naratornya tetap stabil dari bab ke bab.

Dialog game dan NPC
Isi satu kampung penuh karakter. Dengan 95 suara, tidak ada yang perlu dipakai dua kali.

Video penjelas dan tutorial
Kalau produknya berubah, cukup buat ulang satu kalimat. Tidak perlu menjadwalkan sesi rekaman lagi.
Contoh prompt






Sekilas Inworld TTS 2
Inworld TTS 2 adalah model text to speech Realtime TTS-2 buatan Inworld. Modelnya rilis 31 Agustus 2026, dan hari itu juga tersedia di Morphic. Naskah Anda dibacakan oleh salah satu dari 95 suara siap pakai. Suara itu tetap sama di lebih dari 100 bahasa. Audionya keluar cukup cepat untuk masuk ke percakapan yang sedang berjalan.
Yang membuat Inworld TTS 2 berbeda
Ada dua hal yang memisahkannya dari model suara lain. Pertama, latensi. Median waktu ke audio pertama berada di bawah 200 milidetik. Text to speech jadi tidak lagi masuk kategori render lalu tunggu. Sebuah karakter bisa menjawab saat pemainnya masih mendengarkan.
Kedua, suara tidak terikat pada satu bahasa. Suara mana pun di katalog bisa membaca bahasa apa pun yang didukung. Identitasnya bertahan meski bahasanya berganti di tengah satu generasi. Naskah dua bahasa pun terdengar seperti satu orang, bukan dua rekaman yang disambung. Itulah yang membuat satu suara brand tetap utuh setelah kontennya dialihbahasakan.
Inworld TTS 2 di Morphic
Di Morphic, Inworld TTS 2 duduk di pemilih model audio untuk Speech. Tetangganya ElevenLabs dan Gemini 3.1 Flash TTS. Ubah prompt bar ke Audio, pilih Speech, lalu pilih Inworld TTS 2. Tentukan suaranya, tempel naskah Anda, dan generate. Satu generasi menampung sampai 2.000 karakter, lalu kembali sebagai MP3 48 kHz, langsung ke Canvas.
Tersedia dua tingkat. Inworld TTS 2 adalah pilihan bawaan. Inworld TTS 2 Flash memakai katalog 95 suara yang sama, dengan setelan lebih cepat dan lebih hemat. Pilihan itu cocok untuk pekerjaan bervolume besar dan draf. Berpindah di antara keduanya tidak membuat Anda memilih ulang suara.
Buat kreator konten faceless, satu narator yang konsisten adalah setengah dari identitas kanal. Pelaku UMKM bisa membacakan ulang naskah promo tiap kali harga atau stok berubah. Tidak perlu menjadwalkan sesi rekaman baru. Karena audionya selesai dalam hitungan detik, jadwal unggah harian di TikTok atau Reels tetap jalan.
Harga sederhana
Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.
Basic
1100 bulanan kredit
1 pengguna saja
Semua model
Workflows
Standard
3625 bulanan kredit
1 pengguna saja
Semua model
Workflows
Pro
6350 bersama bulanan kredit
1 pengguna
Semua model
Workflows
Pro Max
24650 bersama bulanan kredit
1 pengguna
Semua model
Workflows
Enterprise
Untuk batas yang lebih tinggi
Khusus
ketentuan harga dan penagihan

Free
Untuk bereksperimen
$0
gratis selamanya
FAQ
ChatGPT Images 2.5
OpenAI
Model gambar OpenAI, rilis September 2026. Detail lebih tajam, edit presisi, proses lebih cepat.
Lyria 3.5
Google DeepMind
Model musik terbaik dari Google. Lagu utuh: struktur, vokal, dan lirik.
MiniMax H3 Max Turbo
fal.ai
Tingkat cepat dari H3 racikan fal. Dua kali lebih gesit, tampilan mirip.
Gemini Omni Flash 1.1
Google DeepMind
Model video Google: edit cukup Anda ketik. Kini output 4K dan adegan sampai 40 detik.