Geração de áudio
Disponível agora

Gemini 3.1 Flash TTS

por Google DeepMind

O texto para voz mais expressivo do Google, com tags de áudio e diálogo com múltiplos falantes.

Gemini 3.1 Flash TTS

Principais recursos

Especificações técnicas

Multilingual

Controle de estilo, ritmo e sotaque em vários idiomas

Up to 2

Duas vozes distintas em uma geração com múltiplos falantes

Audio tags

Notas em linguagem natural somadas a sinais entre colchetes

SynthID

Marca d'água imperceptível de proveniência de IA na saída

Casos de uso

Narração e locução de vídeo

Adicione narração natural a vídeos com IA ou filmados, com tom e ritmo definidos em linguagem comum.

Diálogo de personagens

Dê voz a cenas com dois personagens para curtas, jogos e vídeos explicativos, cada personagem com sua própria voz.

Locução localizada

Narre o mesmo roteiro em vários idiomas, com ritmo e sotaque nativos em cada um.

Audiobook e conteúdo longo

Mantenha a entrega natural e consistente em passagens longas de narração.

Explicações e tutoriais

Narração clara e direcionável para demonstrações de produto, aulas e passo a passo.

Anúncios e promoções

Leituras de voz expressivas e alinhadas à marca, com a energia e a ênfase que você direcionar.

Exemplos de prompts

Narração calorosa

Say this warmly and slowly, like comforting a child: The storm has passed. You're safe now.

Edit prompt

Reação embutida

I can't believe you did that [laughs]. Best surprise all year.

Edit prompt

De sussurro a voz normal

[whispering] Don't make a sound. [normal voice] Okay, we're clear.

Edit prompt

Controle de sotaque

Read this in a British accent: Lovely weather we're having, isn't it?

Edit prompt

Ritmo dramático

Read this slowly and deliberately: Every. Word. Matters.

Edit prompt

Cena com dois falantes

Maya: Did you hear back about the job? Tom: I did. I start Monday.

Edit prompt

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

900 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3200 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6200 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24000 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

O que é o Gemini 3.1 Flash TTS?
O Gemini 3.1 Flash TTS é o modelo de texto para voz do Google, anunciado em 15 de abril de 2026. Ele produz narração expressiva e natural que você direciona com instruções em linguagem comum e tags de áudio embutidas, dá suporte a diálogo com múltiplos falantes e marca cada clipe com o SynthID.
O que dá para criar com ele no Morphic?
Use o Gemini 3.1 Flash TTS para locução, narração, diálogo de personagens, leituras localizadas e anúncios expressivos. Gere o áudio no Morphic e leve direto para o Canvas junto com seus clipes de vídeo, no mesmo fluxo.
Como eu direciono a voz?
Duas formas, e você pode combinar as duas. Escreva uma instrução em linguagem comum antes da fala, como 'Diga isso com calma e devagar:', e adicione sinais entre colchetes, como [laughs] ou [whispering], onde quiser. O Gemini interpreta o sinal em vez de lê-lo em voz alta.
Ele funciona com mais de um falante?
Sim. O Gemini 3.1 Flash TTS dá voz a uma conversa entre dois falantes em uma única geração, cada um com uma voz distinta. Identifique cada fala com o nome do falante e atribua uma voz a cada um antes de gerar.
Quantos idiomas ele suporta?
O Gemini 3.1 Flash TTS narra em vários idiomas, com controle de sotaque, ritmo e estilo em cada um. Escolha a voz e o idioma que combinam com seu roteiro antes de gerar.
Qual a diferença para o ElevenLabs no Morphic?
Os dois entregam voz com qualidade humana no Morphic. O ElevenLabs é um pacote de áudio completo, com fala, música e efeitos sonoros e controles finos de ajuste de voz. O Gemini 3.1 Flash TTS foca em fala expressiva e direcionável, com direção em linguagem natural, tags de áudio embutidas e diálogo com múltiplos falantes. Muitos criadores usam os dois, um para voz, o outro para música e efeitos.
Ele coloca marca d'água no áudio?
Sim. Todo clipe gerado pelo Gemini 3.1 Flash TTS carrega a marca d'água imperceptível SynthID do Google para proveniência de IA. Ela é inaudível para quem escuta e feita para resistir a edições comuns, como recodificação.
Como uso o Gemini 3.1 Flash TTS no Morphic?
Abra o Morphic, mude a barra de prompt para Áudio e escolha Fala. Selecione o Gemini 3.1 Flash TTS como modelo de áudio, escreva seu roteiro com qualquer direção ou tag, escolha uma voz e um idioma, e gere.