Gemini 3.1 Flash TTS
de Google DeepMind
El texto a voz más expresivo de Google, con etiquetas de audio y diálogo de varios hablantes.

Funciones clave
Especificaciones técnicas
Multilingual
Control de estilo, ritmo y acento en muchos idiomas
Up to 2
Dos voces distintas en una generación de varios hablantes
Audio tags
Notas en lenguaje natural más indicaciones entre corchetes
SynthID
Marca de agua imperceptible de origen de IA en el resultado
Casos de uso
Narración y locución de video
Agrega narración natural a video con IA o de acción real, con el tono y el ritmo definidos en lenguaje simple.
Diálogo de personajes
Interpreta escenas de dos hablantes para cortos, juegos y explicativos, cada personaje con su propia voz.
Locución localizada
Narra el mismo guion en muchos idiomas con ritmo y acento nativos.
Audiolibros y contenido extenso
Mantén una entrega natural y constante en pasajes largos de narración.
Explicativos y tutoriales
Narración clara y dirigible para recorridos de producto, lecciones y guías paso a paso.
Anuncios y promos
Locuciones expresivas y con la identidad de tu marca, con la energía y el énfasis que tú dirijas.
Ejemplos de prompts
Narración cálida
Di esto con calidez y lentitud, como si consolaras a un niño: La tormenta ya pasó. Ahora estás a salvo.
Edit promptDe susurro a voz normal
[whispering] No hagas ningún ruido. [normal voice] Listo, ya estamos a salvo.
Edit promptEscena de dos hablantes
Maya: ¿Ya te avisaron sobre el trabajo? Tom: Sí. Empiezo el lunes.
Edit promptDescripción general
Gemini 3.1 Flash TTS es el modelo de texto a voz de Google, anunciado el 15 de abril de 2026 e integrado en Morphic como modelo de audio para voz. Convierte texto en narración expresiva y natural que diriges con instrucciones en lenguaje simple y etiquetas de audio en línea, interpreta diálogo de varios hablantes y marca cada clip con SynthID.
Qué hace diferente Gemini 3.1 Flash TTS
La mayoría de los modelos de texto a voz leen tus palabras con una entrega fija. Gemini 3.1 Flash TTS acepta dirección. Escribe una instrucción en lenguaje simple antes de una línea para fijar el tono, el ritmo o el acento, y coloca indicaciones entre corchetes, como [laughs] o [whispering], exactamente donde las quieras. El modelo interpreta la indicación en vez de leerla en voz alta, así que un mismo guion puede pasar de un aparte susurrado a una lectura llena de energía.
Gemini 3.1 Flash TTS en Morphic
En Morphic, Gemini 3.1 Flash TTS está en el selector de modelos de audio para Speech, junto a ElevenLabs. Cambia la barra de prompt a Audio, elige Speech, selecciona Gemini 3.1 Flash TTS, escribe tu guion con la dirección o las etiquetas que quieras, elige una voz y un idioma, y genera. El audio se integra directo en Canvas junto a tus clips de video.
Precios simples
Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.
Basic
1100 mensual créditos
1 usuario
Todos los modelos
Workflows
Standard
3625 mensual créditos
1 usuario
Todos los modelos
Workflows
Pro
6350 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Pro Max
24650 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Enterprise
Para límites más altos
Personalizado
términos de precios y facturación

Free
Para experimentar
$0
gratis para siempre
Preguntas frecuentes
ChatGPT Images 2.5
OpenAI
El modelo de imagen de OpenAI, de septiembre de 2026. Más detalle, ediciones precisas, más rápido.
Lyria 3.5
Google DeepMind
El mejor modelo musical de Google. Canciones con estructura, voz y letra.
MiniMax H3 Max Turbo
fal.ai
El nivel rápido del H3 afinado por fal. El doble de rápido, casi igual de bueno.
Inworld TTS 2
Inworld
95 voces y más de 100 idiomas. La voz arranca en menos de un segundo.