Generación de audio
Disponible ahora

Gemini 3.1 Flash TTS

de Google DeepMind

El texto a voz más expresivo de Google, con etiquetas de audio y diálogo de varios hablantes.

Gemini 3.1 Flash TTS

Funciones clave

Especificaciones técnicas

Multilingual

Control de estilo, ritmo y acento en muchos idiomas

Up to 2

Dos voces distintas en una generación de varios hablantes

Audio tags

Notas en lenguaje natural más indicaciones entre corchetes

SynthID

Marca de agua imperceptible de origen de IA en el resultado

Casos de uso

Narración y locución de video

Agrega narración natural a video con IA o de acción real, con el tono y el ritmo definidos en lenguaje simple.

Diálogo de personajes

Interpreta escenas de dos hablantes para cortos, juegos y explicativos, cada personaje con su propia voz.

Locución localizada

Narra el mismo guion en muchos idiomas con ritmo y acento nativos.

Audiolibros y contenido extenso

Mantén una entrega natural y constante en pasajes largos de narración.

Explicativos y tutoriales

Narración clara y dirigible para recorridos de producto, lecciones y guías paso a paso.

Anuncios y promos

Locuciones expresivas y con la identidad de tu marca, con la energía y el énfasis que tú dirijas.

Ejemplos de prompts

Narración cálida

Di esto con calidez y lentitud, como si consolaras a un niño: La tormenta ya pasó. Ahora estás a salvo.

Edit prompt

Reacción en línea

No puedo creer que hicieras eso [laughs]. La mejor sorpresa del año.

Edit prompt

De susurro a voz normal

[whispering] No hagas ningún ruido. [normal voice] Listo, ya estamos a salvo.

Edit prompt

Control de acento

Lee esto con acento español: Qué lindo clima tenemos hoy, ¿no crees?

Edit prompt

Ritmo dramático

Lee esto despacio y con calma: Cada. Palabra. Importa.

Edit prompt

Escena de dos hablantes

Maya: ¿Ya te avisaron sobre el trabajo? Tom: Sí. Empiezo el lunes.

Edit prompt

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

900 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3200 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6200 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24000 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Qué es Gemini 3.1 Flash TTS?
Gemini 3.1 Flash TTS es el modelo de texto a voz de Google, anunciado el 15 de abril de 2026. Produce narración expresiva y natural que diriges con instrucciones en lenguaje simple y etiquetas de audio en línea, admite diálogo de varios hablantes y marca cada clip con SynthID.
¿Qué puedo crear con él en Morphic?
Usa Gemini 3.1 Flash TTS para locución, narración, diálogo de personajes, lecturas localizadas y anuncios expresivos. Genera el audio en Morphic y luego llévalo directo a Canvas junto a tus clips de video, en el mismo flujo de trabajo.
¿Cómo dirijo la voz?
De dos maneras, y puedes combinarlas. Escribe una instrucción en lenguaje simple antes de tu línea, como 'Di esto con calidez y lentitud:', y agrega indicaciones entre corchetes donde las necesites, como [laughs] o [whispering]. Gemini interpreta la indicación en vez de leerla en voz alta.
¿Admite varios hablantes?
Sí. Gemini 3.1 Flash TTS puede interpretar un intercambio entre dos hablantes en una sola generación, con una voz distinta para cada uno. Etiqueta cada línea con el nombre del hablante y asigna una voz a cada uno antes de generar.
¿Cuántos idiomas admite?
Gemini 3.1 Flash TTS narra en muchos idiomas, con control de acento, ritmo y estilo en cada uno. Elige la voz y el idioma que mejor se ajusten a tu guion antes de generar.
¿En qué se diferencia de ElevenLabs en Morphic?
Ambos producen voz de calidad humana en Morphic. ElevenLabs es un conjunto de audio completo que abarca voz, música y efectos de sonido, con controles finos de ajuste de voz. Gemini 3.1 Flash TTS se enfoca en voz expresiva y dirigible, con instrucciones en lenguaje simple, etiquetas de audio en línea y diálogo de varios hablantes. Muchos creadores usan ambos, uno para voz y el otro para música y efectos.
¿Marca el audio con marca de agua?
Sí. Cada clip generado por Gemini 3.1 Flash TTS lleva la marca de agua imperceptible SynthID de Google para verificar el origen de la IA. Es inaudible para quien escucha y está hecha para resistir ediciones comunes como la recodificación.
¿Cómo uso Gemini 3.1 Flash TTS en Morphic?
Abre Morphic, cambia la barra de prompt a Audio y elige Speech. Selecciona Gemini 3.1 Flash TTS como modelo de audio, escribe tu guion con la dirección o las etiquetas que necesites, elige una voz y un idioma, y genera.