For the complete documentation index, see llms.txt. This page is also available as Markdown.

Controle de emoção da voz

As tags, configurações de emoção e controles de ritmo que orientam como uma voz gerada interpreta uma linha.

O controle de emoção da voz no Morphic permite que você molde como a fala gerada soa, do tom emocional às reações, ao ritmo e ao estilo de entrega. Escreva seu prompt com os sinais certos, e a voz performa do jeito que você direcionar.

Como usar o controle de emoção da voz

Aqui está um tutorial rápido sobre como usar o controle de emoção da voz no Morphic:

  1. Abra o Morphic e vá para seu projeto.

  2. Crie um novo arquivo ou abra um existente.

  3. Na barra de prompt na parte inferior, altere o modo para 'Áudio' e selecione 'Fala'.

  4. Escolha seu modelo de áudio: 'ElevenLabs' ou 'MiniMax'.

  5. Selecione uma voz e um idioma no seletor de vozes.

  6. Escreva seu prompt usando o formato de controle de emoção para o modelo selecionado (veja abaixo).

  7. Clique no botão azul na barra de prompt.

O Morphic oferece suporte a dois modelos de fala. Cada um usa uma sintaxe diferente para controle de emoção. Selecione seu modelo e siga o guia abaixo.

ElevenLabs

O ElevenLabs usa tags entre colchetes escritas diretamente no seu prompt. Coloque qualquer emoção, reação ou direção entre colchetes, e o modelo a interpreta como uma indicação de performance, não como texto falado.

Como funciona

[tag] Seu texto de diálogo aqui.

As tags afetam tudo que vem depois delas até que uma nova tag apareça. Você pode colocar tags em qualquer lugar do seu texto e combinar várias tags em sequência.

Sem tags
Com tags

Consegui o papel. Eu realmente consegui o papel.

[animado] Consegui o papel. Eu realmente consegui o papel.

Precisamos sair. Agora.

[sussurrando][tenso] Precisamos sair. Agora.

Acho que isso não vai dar certo.

[triste][hesitante] Acho que isso não vai dar certo.

O tesouro está enterrado abaixo da velha capela.

[voz de pirata] O tesouro está enterrado abaixo da velha capela.

O ElevenLabs é aberto. Não há uma lista fixa. Escreva qualquer emoção ou direção entre colchetes, e o modelo tentará interpretá-la. Tags como [ciumento], [romântico], [constrangedor], [tom suspeito], ou [continua depois de uma pausa] funcionam.

As tags abaixo são comumente usadas e funcionam de forma confiável, mas você não está limitado a elas.

Tags

Emoções

Tag
O que faz

[animado]

Alta energia, entrega entusiasmada

[feliz]

Tom caloroso e animado

[alegremente]

Entrega leve e brilhante

[triste]

Tom abatido e contido

[tristonho]

Profunda tristeza, luto

[irritado]

Entrega afiada e firme

[nervoso]

Inseguro, levemente trêmulo

[frustrado]

Tom tenso e impaciente

[calmo]

Entrega estável e relaxada

[cansado]

Baixa energia, exausto

[curioso]

Tom inquisitivo, de dúvida

[sarcástico]

Entrega seca e irônica

[brincalhão]

Energia leve e provocadora

[impassível]

Entrega plana, sem emoção

Tente isto:

Nuance emocional

Para mudanças mais sutis de tom. Elas acrescentam profundidade a uma linha sem dominar toda a entrega.

Tag
O que faz

[hesitante]

Inseguro, contendo-se

[aliviado]

Peso tirado, tensão liberada

[tenso]

Em alerta, se preparando para algo

[carinhoso]

Tom suave e cuidadoso

[tom resignado]

Cedendo, aceitando a derrota

[gagueja]

Tropeçando nas palavras, atrapalhado

[arrependido]

Desejando que algo fosse diferente

[solidário]

Compreensivo, acolhedor

[tranquilizador]

Confortante, firme

[maravilhado]

Tomado por admiração ou espanto

Tente isto:

Reações

Sons não verbais que adicionam realismo entre ou dentro das falas.

Tag
O que faz

[ri]

Risada completa

[dá uma risadinha]

Risada suave e leve

[risada curta]

Risada breve e contida

[suspiro]

Expiração de cansaço, alívio ou frustração

[ofega]

Inspiração brusca, surpresa ou choque

[engole em seco]

Deglutição nervosa

[chorando]

Voz embargada, aos prantos

[limpa a garganta]

Reinício vocal rápido

Tente isto:

Entrega

Controle como a voz executa fisicamente a linha, independentemente da emoção.

Tag
O que faz

[sussurra]

Entrega suave, ofegante e próxima

[grita]

Voz alta e projetada

[baixinho]

Baixo volume, contido

[em voz alta]

Volume elevado, firme

[apressado]

Ritmo rápido, urgente

[arrastado]

Entrega lenta e alongada

[tom dramático]

Intensidade teatral e elevada

Tente isto:

Sotaques e personagens

Altere o sotaque sem mudar a voz, ou dê à voz uma persona de personagem.

Tag
O que faz

[sotaque americano]

Inglês americano padrão

[sotaque britânico]

Inglês britânico padrão

[sotaque francês]

Inglês com influência francesa

[sotaque sulista dos EUA]

Sotaque arrastado do sul dos EUA

[sotaque australiano]

Inglês australiano

[forte sotaque russo]

Inflexão russa pesada

[forte sotaque X]

Substitua X por qualquer nacionalidade

[voz de pirata]

Personagem rústico, marinheiro

[voz de velho]

Entrega envelhecida, desgastada

[voz de robô]

Tom mecânico, sintético

[narrador de fantasia]

Narração épica, de conto

[narrador noir]

Narração sombria, melancólica, cínica

[ironicamente]

Leitura de personagem seca, irônica

Tente isto:

Diálogo entre vários personagens

Ao escrever cenas com dois ou mais personagens em um único prompt, use isso para moldar como as falas interagem.

Tag
O que faz

[interrompendo]

Entra antes que a outra fala termine

[sobrepondo]

Começa a falar enquanto a outra voz vai se apagando

Tente isto:

Pausas e ritmo

O ElevenLabs não oferece suporte a durações de pausa explícitas. A duração da pausa é inferida pelo contexto, pelas tags e pela pontuação.

Escreva isso
O que faz

[pausa]

Silêncio dramático (o modelo decide a duração)

...

Pausa hesitante, que se arrasta

TUDO EM MAIÚSCULAS

Ênfase na palavra

Novo parágrafo

Pausa clara e redefinição da entonação

Tente isto:

Dicas para melhores resultados

Dica
Por que funciona

Combine as tags com o texto

[chorando] Não me deixe. soa natural. Adicionar [chorando] a uma frase casual não soa natural. O modelo lê a linha inteira como contexto.

Combine as tags

[sussurra][tenso] ou [hesitante][nervoso] dá ao modelo dois sinais para misturar e gerar um resultado mais nuançado.

Escolha a voz certa

Uma voz calma não vai gritar de forma convincente. Uma voz de alta energia não vai sussurrar bem. Combine a voz com o papel.

Use estabilidade Criativa ou Natural

Essas configurações dão ao modelo mais espaço para expressar as tags. Robust é mais consistente, mas menos expressivo.

Use a pontuação como pistas de ritmo

Vírgulas desaceleram o ritmo. Pontos criam paradas bruscas. Reticências deixam a fala se arrastar. O modelo lê e responde à pontuação.

Google Gemini 3.1 Flash TTS

O Gemini 3.1 Flash TTS oferece narração expressiva e multilíngue com controle fino sobre tom, ritmo e sotaque em uma ampla variedade de idiomas. Você o direciona de duas maneiras: com instruções em linguagem natural e com pistas inline escritas no seu roteiro.

Como funciona

O Gemini lê a direção que você escreve em linguagem natural e molda a entrega para corresponder. Coloque a instrução primeiro, depois sua fala.

Sem direção
Com direção

A tempestade passou. Você está seguro agora.

Diga isto de forma calorosa e devagar, como se estivesse confortando uma criança: A tempestade passou. Você está seguro agora.

Você também pode inserir pistas inline entre colchetes para adicionar reações e mudar a entrega no meio da linha. O Gemini executa a pista em vez de lê-la em voz alta.

Tente isto: Não acredito que você fez isso [ri]. A melhor surpresa de todo o ano.

Tags

Coloque uma pista entre colchetes exatamente onde você quer na linha. O Gemini executa a pista em vez de lê-la em voz alta, e você pode usar mais de uma em um único roteiro.

Reações e sons:

Tag
O que faz

[ri]

Adiciona uma risada natural

[ri nervosamente]

Adiciona uma risada nervosa

[suspira]

Adiciona um suspiro

[ofega]

Adiciona uma inspiração brusca

[expira]

Adiciona uma expiração audível

[dá uma bufada]

Adiciona uma bufada de desdém

[limpa a garganta]

Adiciona uma limpeza de garganta antes da fala

[chorando]

Entrega a fala entre lágrimas

Entrega e tom:

Tag
O que faz

[sussurrando]

Baixa a voz para um sussurro

[voz normal]

Volta para uma voz normal de fala

[de leve]

Suaviza a entrega

[gritando]

Eleva a voz para um grito

[lentamente]

Desacelera o ritmo

[animado]

Adiciona energia e empolgação

[nervosamente]

Adiciona um tom nervoso e hesitante

Tente isto: [sussurrando] Não faça nenhum barulho. [voz normal] Tudo bem, estamos livres.

Para tom, energia ou sotaque, descreva em linguagem natural o que você quer antes da fala. O Gemini oferece controle de sotaque em seus idiomas.

Tente isto: Leia isto com um sotaque britânico: Que clima adorável estamos tendo, não é?

Diálogo com vários falantes

O Gemini pode dar voz a uma troca entre dois falantes em uma única geração, dando a cada um uma voz distinta. Rotule cada linha com o nome do falante e depois atribua uma voz a cada falante antes de gerar. O Gemini oferece suporte a até dois falantes por diálogo.

Tente isto:

Elemento
O que fazer

Rótulo do falante

Comece cada linha com o nome do falante seguido de dois-pontos

Voz por falante

Atribua a cada falante nomeado sua própria voz antes de gerar

Limite de falantes

Até dois falantes distintos em um único diálogo

Pausas e ritmo

Use reticências para adicionar uma pausa, e peça o ritmo que você quer na direção.

Método
Exemplo

Reticências para uma pausa

Espere... ... ... você ouviu isso?

Ritmo na direção

Leia isto devagar e com intenção: Cada. Palavra. Importa.

Dicas para melhores resultados

Dica
Por que ajuda

Coloque a direção antes da fala

O Gemini aplica a instrução ao texto que vem depois

Defina a cena

Contexto como Narrando um documentário sobre a natureza, de forma calma e sussurrada: molda o tom e a entrega

Combine métodos

Combine uma direção em linguagem natural com pistas inline entre colchetes no mesmo roteiro

Combine o idioma com a voz

Escolha uma voz e um idioma que combinem com seu roteiro antes de gerar

MiniMax

O MiniMax usa tags sonoras entre parênteses no seu prompt e um seletor de emoção separado na interface do Morphic.

Emoção

Selecione a emoção no menu suspenso ao gerar. Isso define o tom geral de toda a saída.

Emoção
Efeito

Automático

O modelo lê o texto e escolhe a melhor emoção (padrão)

Feliz

Animado, positivo

Triste

Abatido, melancólico

Zangado

Firme, agressivo

Medroso

Ansioso, assustado

Enojado

Repelido, avesso

Surpreso

Assustado, pasmo

Calmo

Relaxado, sereno

Fluente

Limpo, estilo transmissão — ideal para notícias ou narração técnica

Neutro

Sem viés emocional

Tags sonoras

Adicione sons não verbais diretamente ao seu prompt usando parênteses. Estes são apenas predefinições — somente as tags listadas abaixo são compatíveis.

Tag
Tag
Tag

(risos)

(risadinha)

(tosse)

(pigarra)

(geme)

(respiração)

(ofegante)

(inspira)

(expira)

(arqueja)

(funga)

(suspira)

(bufa)

(arrota)

(estalando os lábios)

(cantarolando)

(sibilando)

(hum)

(assobia)

(espirra)

(chorando)

(aplausos)

(boceja)

Ao contrário da ElevenLabs, você não pode inventar tags personalizadas. Escrever (nervoso) ou (com ciúmes) não vai funcionar — o modelo vai pronunciá-las como texto. Use o seletor de emoções para o tom emocional.

Pausas

Insira silêncios com duração usando <#x#> onde x é o número de segundos (0,01–99,99).

Dicas

  • Use tags sonoras com moderação — muitas podem soar artificiais.

  • Defina a emoção como Automático na maioria dos casos. Substitua manualmente quando precisar de um tom consistente em textos longos.

  • A pontuação importa — vírgulas e pontos orientam o ritmo e a entonação do modelo.


Se você tiver algum problema ou alguma dúvida, entre em contato. Teremos prazer em ajudar. Escreva para nós em support@morphic.com.

Atualizado