Gemini 3.1 Flash TTS
de Google DeepMind
El texto a voz más expresivo de Google, con etiquetas de audio y diálogo de varios hablantes.

Funciones clave
Especificaciones técnicas
Multilingual
Control de estilo, ritmo y acento en muchos idiomas
Up to 2
Dos voces distintas en una generación de varios hablantes
Audio tags
Notas en lenguaje natural más indicaciones entre corchetes
SynthID
Marca de agua imperceptible de origen de IA en el resultado
Casos de uso
Narración y locución de video
Agrega narración natural a video con IA o de acción real, con el tono y el ritmo definidos en lenguaje simple.
Diálogo de personajes
Interpreta escenas de dos hablantes para cortos, juegos y explicativos, cada personaje con su propia voz.
Locución localizada
Narra el mismo guion en muchos idiomas con ritmo y acento nativos.
Audiolibros y contenido extenso
Mantén una entrega natural y constante en pasajes largos de narración.
Explicativos y tutoriales
Narración clara y dirigible para recorridos de producto, lecciones y guías paso a paso.
Anuncios y promos
Locuciones expresivas y con la identidad de tu marca, con la energía y el énfasis que tú dirijas.
Ejemplos de prompts
Narración cálida
Di esto con calidez y lentitud, como si consolaras a un niño: La tormenta ya pasó. Ahora estás a salvo.
Edit promptDe susurro a voz normal
[whispering] No hagas ningún ruido. [normal voice] Listo, ya estamos a salvo.
Edit promptEscena de dos hablantes
Maya: ¿Ya te avisaron sobre el trabajo? Tom: Sí. Empiezo el lunes.
Edit promptPrecios simples
Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.
Basic
900 mensual créditos
1 usuario
Todos los modelos
Workflows
Standard
3200 mensual créditos
1 usuario
Todos los modelos
Workflows
Pro
6200 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Pro Max
24000 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Enterprise
Para límites más altos
Personalizado
términos de precios y facturación

Free
Para experimentar
$0
gratis para siempre
Preguntas frecuentes
Seedance 2.5
ByteDance
El nuevo modelo de video de ByteDance. Hasta 30s en una toma, 50 referencias y audio nativo.
Kling 4.0
Kling
El próximo buque insignia de Kling de Kuaishou, esperado pronto. Clips más largos y mayor detalle están en camino.
MiniMax H3
MiniMax
Modelo de video multimodal de MiniMax. 2K, audio estéreo nativo y clips de hasta 15s.
Flux 3
Black Forest Labs
El modelo del mundo de Black Forest Labs para imagen, video y audio, con sonido que corresponde a la acción.