Inworld TTS 2
par Inworld
95 voix, plus de 100 langues.
La voix part en moins d’une seconde.

Fonctionnalités clés
Spécifications techniques
95
Voix prêtes à l’emploi, sur quatorze langues natives
100+
Lecture crosslingue, avec une seule identité vocale
2 000 signes
Longueur maximale du script par génération
Moins de 200 ms
Temps médian avant le premier son
MP3, 48 kHz
Audio pleine définition, prêt à poser dans un montage
2
Inworld TTS 2 et Inworld TTS 2 Flash
Cas d'utilisation

Personnages interactifs
La réplique part avant que le joueur ne décroche. Ici, la latence n’est pas une note technique, c’est tout l’intérêt du modèle.

Narration et voix off
Vous choisissez un narrateur une seule fois. La même voix tient ensuite sur chaque plan, chaque raccord et chaque reprise.

Doublage et versions localisées
Le même script part dans plusieurs langues sans changer de voix. Une marque garde donc son timbre après traduction.

Livres audio et formats longs
Un ouvrage s’enregistre passage après passage. Le narrateur ne bouge pas d’un chapitre à l’autre.

Dialogues de jeu et PNJ
Distribuez toute une troupe. Quatre-vingt-quinze voix suffisent à peupler un village sans jamais en réutiliser une.

Tutoriels et vidéos explicatives
Le produit change, vous régénérez la seule ligne concernée. Plus besoin de reprendre rendez-vous en cabine.
Exemples de prompts


Ouverture de chapitre
Chapitre premier. Ce matin-là, la marée s’est retirée et n’est jamais vraiment revenue.
Edit prompt



Vue d’ensemble
Inworld TTS 2 est le modèle de synthèse vocale Realtime TTS-2 d’Inworld. Il est sorti le 31 août 2026, et il est arrivé sur Morphic le jour même. Il lit un script dans l’une des quatre-vingt-quinze voix du catalogue. Cette voix tient ensuite sur plus de 100 langues. Et l’audio revient assez vite pour tenir dans une conversation en cours.
Ce qui distingue Inworld TTS 2
Deux choses le séparent du reste du rayon parole. La première est la latence. Le premier son arrive en moins de 200 millisecondes en médiane. On quitte donc le rendu que l’on lance puis que l’on attend. On entre dans l’interactif, là où un personnage doit répondre pendant que le joueur écoute encore.
La seconde tient à la voix elle-même, qui n’est attachée à aucune langue. N’importe quelle voix du catalogue lit n’importe quelle langue prise en charge, et l’identité tient même si la langue bascule au milieu d’une génération. Un script bilingue revient donc avec un seul locuteur, et non deux prises recollées.
C’est exactement ce que cherche un studio de doublage ou une équipe qui décline une campagne en six versions. La voix de marque cesse de se perdre à la traduction. Vous castez un comédien de synthèse une fois, et vous le retrouvez identique dans chaque version linguistique.
Inworld TTS 2 sur Morphic
Sur Morphic, Inworld TTS 2 figure dans le sélecteur de modèles audio, à la rubrique Speech, aux côtés d’ElevenLabs et de Gemini 3.1 Flash TTS. Basculez la barre de prompt sur Audio, choisissez Speech, sélectionnez Inworld TTS 2, puis une voix, collez votre script et générez. Chaque génération accepte jusqu’à 2 000 signes et revient en MP3 48 kHz, directement sur votre Canvas.
Deux paliers coexistent. Inworld TTS 2 est celui par défaut. Inworld TTS 2 Flash puise dans le même catalogue de quatre-vingt-quinze voix, en plus rapide et moins cher. Ce palier va bien aux gros volumes et aux versions de travail. Passer de l’un à l’autre ne vous oblige jamais à recaster la voix.
Tarifs simples
Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.
Basic
1100 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Standard
3625 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Pro
6350 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Pro Max
24650 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Enterprise
Pour des limites plus élevées
Personnalisé
conditions de tarification et de facturation

Free
Pour expérimenter
$0
gratuit pour toujours
Questions fréquentes
ChatGPT Images 2.5
OpenAI
Le modèle d'image d'OpenAI, sorti en septembre 2026. Plus de détail, des retouches ciblées, plus de vitesse.
Lyria 3.5
Google DeepMind
Le meilleur modèle musical de Google. Des chansons entières, voix et paroles.
MiniMax H3 Max Turbo
fal.ai
Le palier rapide du H3 signé fal. Deux fois plus vite, rendu quasi égal.
Gemini Omni Flash 1.1
Google DeepMind
Le modèle vidéo de Google où la retouche s’écrit. Désormais en 4K et jusqu’à 40 secondes.