Gemini 3.1 Flash TTS
por Google DeepMind
O texto para voz mais expressivo do Google, com tags de áudio e diálogo com múltiplos falantes.

Principais recursos
Especificações técnicas
Multilingual
Controle de estilo, ritmo e sotaque em vários idiomas
Up to 2
Duas vozes distintas em uma geração com múltiplos falantes
Audio tags
Notas em linguagem natural somadas a sinais entre colchetes
SynthID
Marca d'água imperceptível de proveniência de IA na saída
Casos de uso
Narração e locução de vídeo
Adicione narração natural a vídeos com IA ou filmados, com tom e ritmo definidos em linguagem comum.
Diálogo de personagens
Dê voz a cenas com dois personagens para curtas, jogos e vídeos explicativos, cada personagem com sua própria voz.
Locução localizada
Narre o mesmo roteiro em vários idiomas, com ritmo e sotaque nativos em cada um.
Audiobook e conteúdo longo
Mantenha a entrega natural e consistente em passagens longas de narração.
Explicações e tutoriais
Narração clara e direcionável para demonstrações de produto, aulas e passo a passo.
Anúncios e promoções
Leituras de voz expressivas e alinhadas à marca, com a energia e a ênfase que você direcionar.
Exemplos de prompts
Narração calorosa
Say this warmly and slowly, like comforting a child: The storm has passed. You're safe now.
Edit promptDe sussurro a voz normal
[whispering] Don't make a sound. [normal voice] Okay, we're clear.
Edit promptVisão geral
O Gemini 3.1 Flash TTS é o modelo de texto para voz do Google, anunciado em 15 de abril de 2026 e integrado ao Morphic como modelo de áudio para fala. Ele transforma texto em narração expressiva e natural que você direciona com instruções em linguagem comum e tags de áudio embutidas, dá voz a diálogos com múltiplos falantes e marca cada clipe com o SynthID.
O que o Gemini 3.1 Flash TTS faz de diferente
A maioria dos modelos de texto para voz apenas lê suas palavras de volta com uma entrega fixa. O Gemini 3.1 Flash TTS aceita direção. Escreva uma instrução em linguagem comum antes de uma fala para definir o tom, o ritmo ou o sotaque, e insira sinais entre colchetes, como [laughs] ou [whispering], exatamente onde você quiser. O modelo interpreta a direção em vez de lê-la em voz alta, então um único roteiro pode alternar entre um aparte sussurrado e uma leitura em plena energia.
O Gemini 3.1 Flash TTS no Morphic
No Morphic, o Gemini 3.1 Flash TTS fica no seletor de modelos de áudio para Fala, ao lado do ElevenLabs. Mude a barra de prompt para Áudio, escolha Fala, selecione o Gemini 3.1 Flash TTS, escreva seu roteiro com qualquer direção ou tag, escolha uma voz e um idioma, e gere. O áudio vai direto para o Canvas, ao lado dos seus clipes de vídeo.
Preços simples
Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.
Basic
1100 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Standard
3625 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Pro
6350 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Pro Max
24650 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Enterprise
Para limites maiores
Personalizado
termos de preços e cobrança

Free
Para experimentar
$0
grátis para sempre
Perguntas frequentes
ChatGPT Images 2.5
OpenAI
Detalhe mais nítido e edição que não bagunça o resto do quadro. O modelo de imagem da OpenAI, de setembro de 2026.
Lyria 3.5
Google DeepMind
O melhor modelo de música do Google. Músicas inteiras, com voz e letra.
MiniMax H3 Max Turbo
fal.ai
O nível rápido do H3 da fal. O dobro da velocidade, quase igual.
Inworld TTS 2
Inworld
Noventa e cinco vozes, 100+ idiomas. A fala começa em menos de um segundo.