Controle de emoção da voz
As tags, configurações de emoção e controles de ritmo que orientam como uma voz gerada interpreta uma linha.
O controle de emoção da voz no Morphic permite que você molde como a fala gerada soa, do tom emocional às reações, ao ritmo e ao estilo de entrega. Escreva seu prompt com os sinais certos, e a voz performa do jeito que você direcionar.
Como usar o controle de emoção da voz
Aqui está um tutorial rápido sobre como usar o controle de emoção da voz no Morphic:
Abra o Morphic e vá para seu projeto.
Crie um novo arquivo ou abra um existente.
Na barra de prompt na parte inferior, altere o modo para 'Áudio' e selecione 'Fala'.
Escolha seu modelo de áudio: 'ElevenLabs' ou 'MiniMax'.
Selecione uma voz e um idioma no seletor de vozes.
Escreva seu prompt usando o formato de controle de emoção para o modelo selecionado (veja abaixo).
Clique no botão azul na barra de prompt.
O Morphic oferece suporte a dois modelos de fala. Cada um usa uma sintaxe diferente para controle de emoção. Selecione seu modelo e siga o guia abaixo.
ElevenLabs
O ElevenLabs usa tags entre colchetes escritas diretamente no seu prompt. Coloque qualquer emoção, reação ou direção entre colchetes, e o modelo a interpreta como uma indicação de performance, não como texto falado.
Como funciona
[tag] Seu texto de diálogo aqui.As tags afetam tudo que vem depois delas até que uma nova tag apareça. Você pode colocar tags em qualquer lugar do seu texto e combinar várias tags em sequência.
Consegui o papel. Eu realmente consegui o papel.
[animado] Consegui o papel. Eu realmente consegui o papel.
Precisamos sair. Agora.
[sussurrando][tenso] Precisamos sair. Agora.
Acho que isso não vai dar certo.
[triste][hesitante] Acho que isso não vai dar certo.
O tesouro está enterrado abaixo da velha capela.
[voz de pirata] O tesouro está enterrado abaixo da velha capela.
O ElevenLabs é aberto. Não há uma lista fixa. Escreva qualquer emoção ou direção entre colchetes, e o modelo tentará interpretá-la. Tags como [ciumento], [romântico], [constrangedor], [tom suspeito], ou [continua depois de uma pausa] funcionam.
As tags abaixo são comumente usadas e funcionam de forma confiável, mas você não está limitado a elas.
Tags
Emoções
[animado]
Alta energia, entrega entusiasmada
[feliz]
Tom caloroso e animado
[alegremente]
Entrega leve e brilhante
[triste]
Tom abatido e contido
[tristonho]
Profunda tristeza, luto
[irritado]
Entrega afiada e firme
[nervoso]
Inseguro, levemente trêmulo
[frustrado]
Tom tenso e impaciente
[calmo]
Entrega estável e relaxada
[cansado]
Baixa energia, exausto
[curioso]
Tom inquisitivo, de dúvida
[sarcástico]
Entrega seca e irônica
[brincalhão]
Energia leve e provocadora
[impassível]
Entrega plana, sem emoção
Tente isto:
Nuance emocional
Para mudanças mais sutis de tom. Elas acrescentam profundidade a uma linha sem dominar toda a entrega.
[hesitante]
Inseguro, contendo-se
[aliviado]
Peso tirado, tensão liberada
[tenso]
Em alerta, se preparando para algo
[carinhoso]
Tom suave e cuidadoso
[tom resignado]
Cedendo, aceitando a derrota
[gagueja]
Tropeçando nas palavras, atrapalhado
[arrependido]
Desejando que algo fosse diferente
[solidário]
Compreensivo, acolhedor
[tranquilizador]
Confortante, firme
[maravilhado]
Tomado por admiração ou espanto
Tente isto:
Reações
Sons não verbais que adicionam realismo entre ou dentro das falas.
[ri]
Risada completa
[dá uma risadinha]
Risada suave e leve
[risada curta]
Risada breve e contida
[suspiro]
Expiração de cansaço, alívio ou frustração
[ofega]
Inspiração brusca, surpresa ou choque
[engole em seco]
Deglutição nervosa
[chorando]
Voz embargada, aos prantos
[limpa a garganta]
Reinício vocal rápido
Tente isto:
Entrega
Controle como a voz executa fisicamente a linha, independentemente da emoção.
[sussurra]
Entrega suave, ofegante e próxima
[grita]
Voz alta e projetada
[baixinho]
Baixo volume, contido
[em voz alta]
Volume elevado, firme
[apressado]
Ritmo rápido, urgente
[arrastado]
Entrega lenta e alongada
[tom dramático]
Intensidade teatral e elevada
Tente isto:
Sotaques e personagens
Altere o sotaque sem mudar a voz, ou dê à voz uma persona de personagem.
[sotaque americano]
Inglês americano padrão
[sotaque britânico]
Inglês britânico padrão
[sotaque francês]
Inglês com influência francesa
[sotaque sulista dos EUA]
Sotaque arrastado do sul dos EUA
[sotaque australiano]
Inglês australiano
[forte sotaque russo]
Inflexão russa pesada
[forte sotaque X]
Substitua X por qualquer nacionalidade
[voz de pirata]
Personagem rústico, marinheiro
[voz de velho]
Entrega envelhecida, desgastada
[voz de robô]
Tom mecânico, sintético
[narrador de fantasia]
Narração épica, de conto
[narrador noir]
Narração sombria, melancólica, cínica
[ironicamente]
Leitura de personagem seca, irônica
Tente isto:
Diálogo entre vários personagens
Ao escrever cenas com dois ou mais personagens em um único prompt, use isso para moldar como as falas interagem.
[interrompendo]
Entra antes que a outra fala termine
[sobrepondo]
Começa a falar enquanto a outra voz vai se apagando
Tente isto:
Pausas e ritmo
O ElevenLabs não oferece suporte a durações de pausa explícitas. A duração da pausa é inferida pelo contexto, pelas tags e pela pontuação.
[pausa]
Silêncio dramático (o modelo decide a duração)
...
Pausa hesitante, que se arrasta
TUDO EM MAIÚSCULAS
Ênfase na palavra
Novo parágrafo
Pausa clara e redefinição da entonação
Tente isto:
Dicas para melhores resultados
Combine as tags com o texto
[chorando] Não me deixe. soa natural. Adicionar [chorando] a uma frase casual não soa natural. O modelo lê a linha inteira como contexto.
Combine as tags
[sussurra][tenso] ou [hesitante][nervoso] dá ao modelo dois sinais para misturar e gerar um resultado mais nuançado.
Escolha a voz certa
Uma voz calma não vai gritar de forma convincente. Uma voz de alta energia não vai sussurrar bem. Combine a voz com o papel.
Use estabilidade Criativa ou Natural
Essas configurações dão ao modelo mais espaço para expressar as tags. Robust é mais consistente, mas menos expressivo.
Use a pontuação como pistas de ritmo
Vírgulas desaceleram o ritmo. Pontos criam paradas bruscas. Reticências deixam a fala se arrastar. O modelo lê e responde à pontuação.
Google Gemini 3.1 Flash TTS
O Gemini 3.1 Flash TTS oferece narração expressiva e multilíngue com controle fino sobre tom, ritmo e sotaque em uma ampla variedade de idiomas. Você o direciona de duas maneiras: com instruções em linguagem natural e com pistas inline escritas no seu roteiro.
Como funciona
O Gemini lê a direção que você escreve em linguagem natural e molda a entrega para corresponder. Coloque a instrução primeiro, depois sua fala.
A tempestade passou. Você está seguro agora.
Diga isto de forma calorosa e devagar, como se estivesse confortando uma criança: A tempestade passou. Você está seguro agora.
Você também pode inserir pistas inline entre colchetes para adicionar reações e mudar a entrega no meio da linha. O Gemini executa a pista em vez de lê-la em voz alta.
Tente isto: Não acredito que você fez isso [ri]. A melhor surpresa de todo o ano.
Tags
Coloque uma pista entre colchetes exatamente onde você quer na linha. O Gemini executa a pista em vez de lê-la em voz alta, e você pode usar mais de uma em um único roteiro.
Reações e sons:
[ri]
Adiciona uma risada natural
[ri nervosamente]
Adiciona uma risada nervosa
[suspira]
Adiciona um suspiro
[ofega]
Adiciona uma inspiração brusca
[expira]
Adiciona uma expiração audível
[dá uma bufada]
Adiciona uma bufada de desdém
[limpa a garganta]
Adiciona uma limpeza de garganta antes da fala
[chorando]
Entrega a fala entre lágrimas
Entrega e tom:
[sussurrando]
Baixa a voz para um sussurro
[voz normal]
Volta para uma voz normal de fala
[de leve]
Suaviza a entrega
[gritando]
Eleva a voz para um grito
[lentamente]
Desacelera o ritmo
[animado]
Adiciona energia e empolgação
[nervosamente]
Adiciona um tom nervoso e hesitante
Tente isto: [sussurrando] Não faça nenhum barulho. [voz normal] Tudo bem, estamos livres.
Para tom, energia ou sotaque, descreva em linguagem natural o que você quer antes da fala. O Gemini oferece controle de sotaque em seus idiomas.
Tente isto: Leia isto com um sotaque britânico: Que clima adorável estamos tendo, não é?
Diálogo com vários falantes
O Gemini pode dar voz a uma troca entre dois falantes em uma única geração, dando a cada um uma voz distinta. Rotule cada linha com o nome do falante e depois atribua uma voz a cada falante antes de gerar. O Gemini oferece suporte a até dois falantes por diálogo.
Tente isto:
Rótulo do falante
Comece cada linha com o nome do falante seguido de dois-pontos
Voz por falante
Atribua a cada falante nomeado sua própria voz antes de gerar
Limite de falantes
Até dois falantes distintos em um único diálogo
Pausas e ritmo
Use reticências para adicionar uma pausa, e peça o ritmo que você quer na direção.
Reticências para uma pausa
Espere... ... ... você ouviu isso?
Ritmo na direção
Leia isto devagar e com intenção: Cada. Palavra. Importa.
Dicas para melhores resultados
Coloque a direção antes da fala
O Gemini aplica a instrução ao texto que vem depois
Defina a cena
Contexto como Narrando um documentário sobre a natureza, de forma calma e sussurrada: molda o tom e a entrega
Combine métodos
Combine uma direção em linguagem natural com pistas inline entre colchetes no mesmo roteiro
Combine o idioma com a voz
Escolha uma voz e um idioma que combinem com seu roteiro antes de gerar
MiniMax
O MiniMax usa tags sonoras entre parênteses no seu prompt e um seletor de emoção separado na interface do Morphic.
Emoção
Selecione a emoção no menu suspenso ao gerar. Isso define o tom geral de toda a saída.
Automático
O modelo lê o texto e escolhe a melhor emoção (padrão)
Feliz
Animado, positivo
Triste
Abatido, melancólico
Zangado
Firme, agressivo
Medroso
Ansioso, assustado
Enojado
Repelido, avesso
Surpreso
Assustado, pasmo
Calmo
Relaxado, sereno
Fluente
Limpo, estilo transmissão — ideal para notícias ou narração técnica
Neutro
Sem viés emocional
Tags sonoras
Adicione sons não verbais diretamente ao seu prompt usando parênteses. Estes são apenas predefinições — somente as tags listadas abaixo são compatíveis.
(risos)
(risadinha)
(tosse)
(pigarra)
(geme)
(respiração)
(ofegante)
(inspira)
(expira)
(arqueja)
(funga)
(suspira)
(bufa)
(arrota)
(estalando os lábios)
(cantarolando)
(sibilando)
(hum)
(assobia)
(espirra)
(chorando)
(aplausos)
(boceja)
Ao contrário da ElevenLabs, você não pode inventar tags personalizadas. Escrever
(nervoso)ou(com ciúmes)não vai funcionar — o modelo vai pronunciá-las como texto. Use o seletor de emoções para o tom emocional.
Pausas
Insira silêncios com duração usando <#x#> onde x é o número de segundos (0,01–99,99).
Dicas
Use tags sonoras com moderação — muitas podem soar artificiais.
Defina a emoção como Automático na maioria dos casos. Substitua manualmente quando precisar de um tom consistente em textos longos.
A pontuação importa — vírgulas e pontos orientam o ritmo e a entonação do modelo.
Se você tiver algum problema ou alguma dúvida, entre em contato. Teremos prazer em ajudar. Escreva para nós em support@morphic.com.
Atualizado