Gemini 3.1 Flash TTS
par Google DeepMind
La synthèse vocale la plus expressive de Google, avec balises audio et dialogue multi‑locuteurs.

Fonctionnalités clés
Spécifications techniques
Multilingue
Contrôle du style, du rythme et de l'accent dans de nombreuses langues
Jusqu'à 2
Deux voix distinctes dans une génération multi-locuteurs
Balises audio
Notes en langage naturel et indices entre crochets
SynthID
Filigrane imperceptible de provenance IA sur la sortie
Cas d'utilisation
Narration et voix off vidéo
Ajoutez une narration naturelle à une vidéo IA ou en prises réelles, avec le ton et le rythme définis en langage clair.
Dialogue de personnages
Donnez voix à des scènes à deux locuteurs pour shorts, jeux et explicatifs, chaque personnage avec sa propre voix.
Voix off localisée
Narrez le même script dans de nombreuses langues avec un rythme et un accent natifs.
Livre audio et format long
Gardez un rendu naturel et constant sur de longs passages de narration.
Explicatifs et tutoriels
Une narration claire et dirigeable pour walkthroughs produit, leçons et tutoriels.
Spots et promos
Des lectures vocales expressives et fidèles à la marque, avec l'énergie et l'emphase que vous dirigez.
Exemples de prompts
Narration douce
Dis ceci avec douceur et lenteur, comme pour rassurer un enfant : La tempête est passée. Tu es en sécurité maintenant.
Edit promptRéaction intégrée
Je n'arrive pas à croire que tu aies fait ça [laughs]. La meilleure surprise de l'année.
Edit promptContrôle de l'accent
Lis ceci avec un accent britannique : Quel beau temps aujourd'hui, n'est-ce pas ?
Edit promptScène à deux voix
Maya : Tu as eu des nouvelles pour le poste ? Tom : Oui. Je commence lundi.
Edit promptAperçu
Gemini 3.1 Flash TTS est le modèle de synthèse vocale de Google, annoncé le 15 avril 2026 et intégré à Morphic comme modèle audio pour la parole. Il transforme le texte en narration expressive et naturelle que vous dirigez avec des instructions en langage clair et des balises audio intégrées, donne voix au dialogue multi-locuteurs et appose un filigrane SynthID sur chaque clip.
Ce qui distingue Gemini 3.1 Flash TTS
La plupart des synthèses vocales relisent vos mots avec un rendu figé. Gemini 3.1 Flash TTS prend la direction. Écrivez une instruction en langage clair avant une ligne pour fixer le ton, le rythme ou l'accent, et déposez des indices entre crochets, comme [laughs] ou [whispering], exactement où vous les voulez. Le modèle joue la direction au lieu de la lire, de sorte qu'un même script peut passer d'un aparté feutré à une lecture pleine d'énergie.
Gemini 3.1 Flash TTS sur Morphic
Sur Morphic, Gemini 3.1 Flash TTS se trouve dans le sélecteur de modèles audio pour la Parole, aux côtés d'ElevenLabs. Passez la barre de prompt en mode Audio, choisissez Parole, sélectionnez Gemini 3.1 Flash TTS, puis écrivez votre script avec la direction ou les balises de votre choix, choisissez une voix et une langue, et générez. L'audio se dépose directement dans Canvas à côté de vos clips vidéo.
Tarifs simples
Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.
Basic
1100 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Standard
3625 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Pro
6350 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Pro Max
24650 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Enterprise
Pour des limites plus élevées
Personnalisé
conditions de tarification et de facturation

Free
Pour expérimenter
$0
gratuit pour toujours
Questions fréquentes
ChatGPT Images 2.5
OpenAI
Le modèle d'image d'OpenAI, sorti en septembre 2026. Plus de détail, des retouches ciblées, plus de vitesse.
Lyria 3.5
Google DeepMind
Le meilleur modèle musical de Google. Des chansons entières, voix et paroles.
MiniMax H3 Max Turbo
fal.ai
Le palier rapide du H3 signé fal. Deux fois plus vite, rendu quasi égal.
Inworld TTS 2
Inworld
95 voix, plus de 100 langues. La voix part en moins d’une seconde.