Control de emoción de la voz
Las etiquetas, la configuración de emociones y los controles de ritmo que dirigen cómo interpreta una línea una voz generada.
El control de emoción de voz en Morphic te permite moldear cómo suena el habla generada, desde el tono emocional hasta las reacciones, el ritmo y el estilo de interpretación. Escribe tu prompt con las indicaciones adecuadas y la voz actuará como tú la dirijas.
Cómo usar el control de emoción de voz
Aquí tienes un breve tutorial sobre cómo usar el control de emoción de voz en Morphic:
Abre Morphic y ve a tu proyecto.
Crea un archivo nuevo o abre uno existente.
En la barra de prompt de la parte inferior, cambia el modo a 'Audio' y selecciona 'Speech'.
Elige tu modelo de audio: 'ElevenLabs' o 'MiniMax'.
Selecciona una voz y un idioma en el selector de voces.
Escribe tu prompt usando el formato de control de emociones para el modelo seleccionado (ver abajo).
Haz clic en el botón azul de la barra de prompt.
Morphic admite dos modelos de voz. Cada uno usa una sintaxis diferente para el control de emociones. Selecciona tu modelo y luego sigue la guía de abajo.
ElevenLabs
ElevenLabs usa etiquetas entre corchetes escritas directamente en tu prompt. Encierra cualquier emoción, reacción o indicación entre corchetes, y el modelo la interpreta como una indicación de interpretación, no como texto hablado.
Cómo funciona
[tag] Tu texto de diálogo aquí.Las etiquetas afectan a todo lo que viene después de ellas hasta que aparece una nueva etiqueta. Puedes colocar etiquetas en cualquier parte de tu texto y combinar varias etiquetas en secuencia.
Conseguí el papel. De hecho, conseguí el papel.
[excited] Conseguí el papel. De hecho, conseguí el papel.
Tenemos que irnos. Ahora.
[whispers][tense] Tenemos que irnos. Ahora.
No creo que esto vaya a funcionar.
[sad][hesitant] No creo que esto vaya a funcionar.
El tesoro está enterrado bajo la vieja capilla.
[pirate voice] El tesoro está enterrado bajo la vieja capilla.
ElevenLabs es flexible. No hay una lista fija. Escribe cualquier emoción o indicación entre corchetes, y el modelo intentará interpretarla. Etiquetas como [jealous], [romantic], [awkward], [suspicious tone], o [continues after a beat] funcionan.
Las etiquetas de abajo se usan comúnmente y funcionan de forma fiable, pero no te limitas a ellas.
Etiquetas
Emociones
[excited]
Interpretación enérgica y entusiasta
[happy]
Tono cálido y optimista
[cheerfully]
Interpretación ligera y brillante
[sad]
Tono abatido y contenido
[sorrowful]
Profunda tristeza, duelo
[angry]
Interpretación aguda y contundente
[nervous]
Inseguro, ligeramente tembloroso
[frustrated]
Tono tenso e impaciente
[calm]
Interpretación estable y relajada
[tired]
Baja energía, agotado
[curious]
Tono inquisitivo y de curiosidad
[sarcastic]
Interpretación seca e irónica
[playful]
Energía ligera y juguetona
[deadpan]
Interpretación plana y sin emoción
Pruébalo:
Matiz emocional
Para cambios más sutiles de tono. Esto añade profundidad a una línea sin anular toda la interpretación.
[hesitant]
Inseguro, reteniéndose
[relieved]
Peso levantado, tensión liberada
[tense]
Al límite, preparándose para algo
[warm]
Tono suave y cariñoso
[resigned tone]
Cediendo, aceptando la derrota
[stammers]
Tropiezos con las palabras, nervioso
[regretful]
Desear que algo fuera diferente
[sympathetic]
Compasivo, comprensivo
[reassuring]
Reconfortante, estable
[awe]
Asombrado o maravillado
Pruébalo:
Reacciones
Sonidos no verbales que añaden realismo entre líneas o dentro de ellas.
[laughs]
Risa completa
[giggles]
Risa suave y ligera
[light chuckle]
Risa breve y contenida
[sigh]
Exhalación de fatiga, alivio o frustración
[gasps]
Inspiración brusca, sorpresa o conmoción
[gulps]
Trago nervioso
[crying]
Voz quebrada y llorosa
[clears throat]
Reinicio vocal rápido
Pruébalo:
Interpretación
Controla cómo la voz interpreta físicamente la línea, independientemente de la emoción.
[whispers]
Interpretación suave, susurrada y cercana
[shouts]
Voz alta y proyectada
[quietly]
Volumen bajo, contenido
[loudly]
Volumen elevado, contundente
[rushed]
Ritmo rápido y urgente
[drawn out]
Interpretación lenta y alargada
[dramatic tone]
Intensidad teatral y elevada
Pruébalo:
Acentos y personajes
Cambia el acento sin cambiar la voz, o dale a la voz una personalidad de personaje.
[American accent]
Inglés americano estándar
[British accent]
Inglés británico estándar
[French accent]
Inglés con acento francés
[Southern US accent]
Acento sureño estadounidense
[Australian accent]
Inglés australiano
[strong Russian accent]
Fuerte inflexión rusa
[strong X accent]
Sustituye X por cualquier nacionalidad
[pirate voice]
Personaje áspero de marinero
[old man voice]
Interpretación envejecida y curtida
[robot voice]
Tono mecánico y sintético
[fantasy narrator]
Narración épica de cuento
[film noir narrator]
Narración oscura, melancólica y cínica
[sarcastically]
Lectura seca e irónica del personaje
Pruébalo:
Diálogo entre varios personajes
Cuando escribas escenas con dos o más personajes en un mismo prompt, usa esto para moldear cómo interactúan las líneas.
[interrupting]
Interrumpe antes de que la otra línea termine
[overlapping]
Empieza a hablar mientras otra voz se desvanece
Pruébalo:
Pausas y ritmo
ElevenLabs no admite duraciones de pausa explícitas. La duración de la pausa se infiere del contexto, las etiquetas y la puntuación.
[pause]
Silencio dramático (el modelo decide la duración)
...
Pausa vacilante y arrastrada
MAYÚSCULAS
Énfasis en la palabra
Nuevo párrafo
Pausa clara y reinicio de la entonación
Pruébalo:
Consejos para obtener mejores resultados
Haz coincidir las etiquetas con el texto
[crying] No me dejes. suena natural. Añadir [crying] a una frase casual no. El modelo lee toda la línea para obtener contexto.
Combina etiquetas
[whispers][tense] o [hesitant][nervous] le da al modelo dos indicaciones para combinarlas y obtener un resultado más matizado.
Elige la voz adecuada
Una voz tranquila no gritará de forma convincente. Una voz de alta energía no susurrará bien. Haz coincidir la voz con el papel.
Usa estabilidad Creativa o Natural
Estos ajustes le dan al modelo más margen para expresar etiquetas. Robusto es más consistente, pero menos expresivo.
Usa la puntuación como indicador de ritmo
Las comas ralentizan el ritmo. Los puntos crean paradas tajantes. Los puntos suspensivos se van desvaneciendo. El modelo lee y responde a la puntuación.
Google Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS te ofrece narración expresiva y multilingüe con un control preciso del tono, el ritmo y el acento en una amplia gama de idiomas. Tú lo diriges de dos maneras: con instrucciones en lenguaje natural y con indicaciones en línea escritas en tu guion.
Cómo funciona
Gemini lee la dirección que escribes en lenguaje natural y adapta la interpretación para que coincida. Coloca primero la instrucción y luego tu línea.
La tormenta ha pasado. Ahora estás a salvo.
Di esto con calidez y despacio, como si estuvieras consolando a un niño: La tormenta ha pasado. Ahora estás a salvo.
También puedes insertar indicaciones en línea entre corchetes para añadir reacciones y cambiar la interpretación a mitad de línea. Gemini ejecuta la indicación en lugar de leerla en voz alta.
Pruébalo: No puedo creer que hicieras eso [laughs]. La mejor sorpresa de todo el año.
Etiquetas
Coloca una indicación entre corchetes exactamente donde la quieres en la línea. Gemini ejecuta la indicación en lugar de leerla en voz alta, y puedes usar más de una en un solo guion.
Reacciones y sonidos:
[laughs]
Añade una risa natural
[laughs nervously]
Añade una risa nerviosa
[sighs]
Añade un suspiro
[gasps]
Añade una inspiración brusca
[exhales]
Añade una exhalación audible
[scoffs]
Añade un resoplido despectivo
[clears throat]
Añade una carraspera antes de la línea
[crying]
Pronuncia la línea entre lágrimas
Interpretación y tono:
[whispering]
Baja la voz a un susurro
[normal voice]
Vuelve a una voz normal de habla
[softly]
Suaviza la interpretación
[shouting]
Sube la voz hasta un grito
[slowly]
Reduce el ritmo
[excited]
Añade energía y entusiasmo
[nervously]
Añade un tono nervioso y vacilante
Pruébalo: [whispering] No hagas ruido. [normal voice] Vale, estamos despejados.
Para el tono, la energía o el acento, describe en lenguaje natural lo que quieres antes de la línea. Gemini admite el control del acento en todos sus idiomas.
Pruébalo: Léelo con acento británico: Qué tiempo tan estupendo hace, ¿verdad?
Diálogo con varios hablantes
Gemini puede dar voz a un intercambio entre dos hablantes en una sola generación, asignando a cada uno una voz distinta. Etiqueta cada línea con el nombre del hablante y luego asigna una voz a cada hablante antes de generar. Gemini admite hasta dos hablantes por diálogo.
Pruébalo:
Etiqueta del hablante
Empieza cada línea con el nombre del hablante seguido de dos puntos
Voz por hablante
Asigna a cada hablante con nombre su propia voz antes de generar
Límite de hablantes
Hasta dos hablantes distintos en un mismo diálogo
Pausas y ritmo
Usa puntos suspensivos para añadir un momento de silencio y pide el ritmo que quieres en tu indicación.
Puntos suspensivos para una pausa
Espera... ... ... ¿oíste eso?
Ritmo en la indicación
Léelo despacio y deliberadamente: Cada. Palabra. Importa.
Consejos para obtener mejores resultados
Pon la indicación antes de la línea
Gemini aplica la instrucción al texto que le sigue
Establece la escena
Contexto como Narrando un documental de naturaleza, con calma y en voz baja: moldea el tono y la interpretación
Combina métodos
Combina una indicación en lenguaje natural con indicaciones entre corchetes en línea en el mismo guion
Haz coincidir el idioma con la voz
Elige una voz y un idioma que se adapten a tu guion antes de generar
MiniMax
MiniMax usa etiquetas sonoras entre paréntesis en tu prompt y un selector de emoción separado en la interfaz de Morphic.
Emoción
Selecciona la emoción en el menú desplegable al generar. Esto establece el tono general de toda la salida.
Automático
El modelo lee el texto y elige la mejor emoción (predeterminada)
Feliz
Optimista, positivo
Triste
Abatido, melancólico
Enfadado
Contundente, agresivo
Atemorizado
Ansioso, asustado
Asqueado
Repelido, averso
Sorprendido
Sobresaltado, asombrado
Calmado
Relajado, sereno
Fluido
Limpio, estilo de transmisión — ideal para noticias o narración técnica
Neutral
Sin sesgo emocional
Etiquetas sonoras
Añade sonidos no verbales directamente en tu prompt usando paréntesis. Estos son solo preestablecidos — solo se admiten las etiquetas que se enumeran abajo.
(ríe)
(se ríe entre dientes)
(tose)
(se aclara la garganta)
(gime)
(respira)
(jadea)
(inhala)
(exhala)
(jadea)
(olfatea)
(suspira)
(resopla)
(eructa)
(chasquido de labios)
(tararea)
(sisea)
(emm)
(silba)
(estornuda)
(llora)
(aplausos)
(bosteza)
A diferencia de ElevenLabs, tú no puedes inventar etiquetas personalizadas. Escribir
(nervioso)o(celoso)no funcionará — el modelo las leerá como texto. Usa el selector de emociones para el tono emocional.
Pausas
Inserta silencios temporizados usando <#x#> donde x son segundos (0.01–99.99).
Consejos
Usa las etiquetas de sonido con moderación — demasiadas pueden sonar antinaturales.
Establece la emoción en Automático para la mayoría de los casos. Anúlala manualmente cuando necesites un tono coherente en textos largos.
La puntuación importa — las comas y los puntos guían el ritmo y la entonación del modelo.
Si tienes algún problema o alguna pregunta, no dudes en ponerte en contacto. Estaremos encantados de ayudarte. Escríbenos a support@morphic.com.
Última actualización