Génération audio
Disponible maintenant

Inworld TTS 2

par Inworld

95 voix, plus de 100 langues.
La voix part en moins d’une seconde.

Inworld TTS 2

Fonctionnalités clés

Spécifications techniques

95

Voix prêtes à l’emploi, sur quatorze langues natives

100+

Lecture crosslingue, avec une seule identité vocale

2 000 signes

Longueur maximale du script par génération

Moins de 200 ms

Temps médian avant le premier son

MP3, 48 kHz

Audio pleine définition, prêt à poser dans un montage

2

Inworld TTS 2 et Inworld TTS 2 Flash

Cas d'utilisation

Deux points lumineux reliés par un fil de lumière tendu, l’un répondant à l’autre

Personnages interactifs

La réplique part avant que le joueur ne décroche. Ici, la latence n’est pas une note technique, c’est tout l’intérêt du modèle.

Une longue bande de lumière régulière, au grain constant sur toute sa longueur

Narration et voix off

Vous choisissez un narrateur une seule fois. La même voix tient ensuite sur chaque plan, chaque raccord et chaque reprise.

Un ruban de lumière qui se divise en rubans parallèles restant au même pas

Doublage et versions localisées

Le même script part dans plusieurs langues sans changer de voix. Une marque garde donc son timbre après traduction.

Une longue spirale de lumière ambrée qui s’enfonce en profondeur, aux tours réguliers

Livres audio et formats longs

Un ouvrage s’enregistre passage après passage. Le narrateur ne bouge pas d’un chapitre à l’autre.

De nombreux petits points lumineux dispersés en profondeur, reliés par de fins filaments

Dialogues de jeu et PNJ

Distribuez toute une troupe. Quatre-vingt-quinze voix suffisent à peupler un village sans jamais en réutiliser une.

Une série nette de marches lumineuses qui montent et s’éloignent en profondeur

Tutoriels et vidéos explicatives

Le produit change, vous régénérez la seule ligne concernée. Plus besoin de reprendre rendez-vous en cabine.

Exemples de prompts

Une douce éclosion de lumière dorée pâle qui s’ouvre au bord du cadre

Accueil chaleureux

L’eau chauffe. Installez-vous, racontez-moi tout.

Edit prompt
Un pli léger de lumière blanc ivoire qui accroche le long de son arête

Ouverture de chapitre

Chapitre premier. Ce matin-là, la marée s’est retirée et n’est jamais vraiment revenue.

Edit prompt
Un seul fil de lumière ivoire chaude qui s’enroule une fois sur lui-même

Étape de recette

Mélangez la farine et le beurre, juste assez pour que la pâte se tienne.

Edit prompt
Deux lignes fines de lumière blanche et froide qui convergent vers un point

Scoop

Vous ne devinerez jamais qui vient d’appeler.

Edit prompt
Un fin maillage de lumière gris argent, vu de très près

Reprise de cours

Bon retour parmi nous. On reprend là où nous nous étions arrêtés.

Edit prompt
Un lent effilement de lumière ambrée douce qui se resserre en pointe

Annonce de visite

La visite commence à neuf heures, juste devant la porte nord.

Edit prompt

Vue d’ensemble

Inworld TTS 2 est le modèle de synthèse vocale Realtime TTS-2 d’Inworld. Il est sorti le 31 août 2026, et il est arrivé sur Morphic le jour même. Il lit un script dans l’une des quatre-vingt-quinze voix du catalogue. Cette voix tient ensuite sur plus de 100 langues. Et l’audio revient assez vite pour tenir dans une conversation en cours.

Ce qui distingue Inworld TTS 2

Deux choses le séparent du reste du rayon parole. La première est la latence. Le premier son arrive en moins de 200 millisecondes en médiane. On quitte donc le rendu que l’on lance puis que l’on attend. On entre dans l’interactif, là où un personnage doit répondre pendant que le joueur écoute encore.

La seconde tient à la voix elle-même, qui n’est attachée à aucune langue. N’importe quelle voix du catalogue lit n’importe quelle langue prise en charge, et l’identité tient même si la langue bascule au milieu d’une génération. Un script bilingue revient donc avec un seul locuteur, et non deux prises recollées.

C’est exactement ce que cherche un studio de doublage ou une équipe qui décline une campagne en six versions. La voix de marque cesse de se perdre à la traduction. Vous castez un comédien de synthèse une fois, et vous le retrouvez identique dans chaque version linguistique.

Inworld TTS 2 sur Morphic

Sur Morphic, Inworld TTS 2 figure dans le sélecteur de modèles audio, à la rubrique Speech, aux côtés d’ElevenLabs et de Gemini 3.1 Flash TTS. Basculez la barre de prompt sur Audio, choisissez Speech, sélectionnez Inworld TTS 2, puis une voix, collez votre script et générez. Chaque génération accepte jusqu’à 2 000 signes et revient en MP3 48 kHz, directement sur votre Canvas.

Deux paliers coexistent. Inworld TTS 2 est celui par défaut. Inworld TTS 2 Flash puise dans le même catalogue de quatre-vingt-quinze voix, en plus rapide et moins cher. Ce palier va bien aux gros volumes et aux versions de travail. Passer de l’un à l’autre ne vous oblige jamais à recaster la voix.

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$9/ mois
facturé comme $0 par an

1100 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3625 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6350 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Pro Max

$170/ mois
facturé comme $0 par an

24650 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Qu’est-ce qu’Inworld TTS 2 ?
Inworld TTS 2 est le modèle de synthèse vocale Realtime TTS-2 d’Inworld, sorti le 31 août 2026. Il lit un script dans l’une des quatre-vingt-quinze voix du catalogue. Cette identité vocale tient ensuite sur plus de 100 langues, et l’audio revient à vitesse temps réel.
Inworld TTS 2 parle-t-il français ?
Oui. La lecture crosslingue couvre plus de 100 langues, français compris, et n’importe quelle voix du catalogue peut lire dans cette langue. Le point qui compte pour un travail de voix off : le timbre ne change pas quand la langue change. Attention à un raccourci fréquent. Les quatorze langues natives décrivent la façon dont les voix ont été enregistrées à l’origine, pas la limite de ce qu’elles savent lire. Une voix castée ailleurs lira donc votre script français en gardant son identité.
Combien de voix et de langues sont disponibles ?
Quatre-vingt-quinze voix prêtes à l’emploi, réparties sur quatorze langues natives, avec une lecture crosslingue sur plus de 100 langues. Chaque voix peut lire n’importe quelle langue prise en charge. La langue native d’une voix renseigne donc sur son casting d’origine, jamais sur ce qu’elle sait faire.
Qu’est-ce qui le rend aussi rapide ?
Le temps médian avant le premier son passe sous les 200 millisecondes. La synthèse vocale quitte ainsi la catégorie du rendu que l’on lance puis que l’on attend. Elle devient utilisable pour un personnage interactif ou un agent en direct, et plus seulement pour une voix off générée une fois pour toutes.
Quelle différence entre Inworld TTS 2 et Inworld TTS 2 Flash ?
Les deux paliers partagent le même catalogue de quatre-vingt-quinze voix. Inworld TTS 2 signe la lecture la plus aboutie. Inworld TTS 2 Flash va plus vite et coûte moins cher, ce qui convient aux gros volumes et aux versions de travail. Vous passez de l’un à l’autre sans recaster la voix.
Quelle longueur de script est acceptée ?
Jusqu’à 2 000 signes par génération. Au-delà, découpez le texte en passages et générez-les à la suite. La voix castée reste la même d’un passage au suivant, si bien qu’un format long garde son unité.
En quoi se distingue-t-il d’ElevenLabs sur Morphic ?
Les deux produisent une voix de qualité humaine sur Morphic. ElevenLabs couvre tout l’audio, parole, musique et effets sonores, avec un réglage fin de la voix. Inworld TTS 2 ne fait que de la parole, et ses deux atouts sont la latence et la voix unique tenue d’une langue à l’autre. Beaucoup de créateurs gardent les deux, l’un pour la voix, l’autre pour la musique et les effets.
Comment utiliser Inworld TTS 2 sur Morphic ?
Ouvrez Morphic, basculez la barre de prompt sur Audio, puis choisissez Speech. Sélectionnez Inworld TTS 2 comme modèle, choisissez une voix, collez votre script et lancez la génération. L’audio se dépose sur votre Canvas, à côté de vos plans vidéo.