Inworld TTS 2
por Inworld
Noventa e cinco vozes, 100+ idiomas.
A fala começa em menos de um segundo.

Principais recursos
Especificações técnicas
95
Vozes prontas em catorze idiomas nativos
100+
Crosslingual, com a mesma identidade de voz em todos
2.000 caracteres
Tamanho máximo do roteiro por geração
Menos de 200 ms
Mediana até o primeiro áudio
MP3, 48 kHz
Áudio em taxa cheia, pronto para a timeline
2
Inworld TTS 2 e Inworld TTS 2 Flash
Casos de uso

Personagens interativos
A fala começa rápido o bastante para sustentar uma conversa. Aqui a latência é o recurso, não uma nota de rodapé.

Narração e locução
Escolha o narrador uma vez só. A mesma voz volta em cada corte, em cada regravação e em cada revisão.

Locução localizada
Rode o mesmo roteiro em vários idiomas com uma voz só, e a marca sobrevive à tradução.

Audiolivros e textos longos
Avance pelo livro um trecho por vez. O narrador chega firme ao fim do capítulo seguinte.

Diálogo de jogo e de NPC
Monte um elenco inteiro. Noventa e cinco vozes dão conta de uma vila sem repetir ninguém duas vezes.

Explicativos e tutoriais
Quando o produto muda, você regrava só aquela linha. Ninguém precisa remarcar uma sessão inteira.
Exemplos de prompts


Abertura de capítulo
Capítulo um. A maré baixou naquela manhã e nunca mais voltou por inteiro.
Edit prompt



O que é o Inworld TTS 2
O Inworld TTS 2 é o modelo de texto para voz Realtime TTS-2 da Inworld. Ele saiu em 31 de agosto de 2026 e chegou ao Morphic no mesmo dia. Você escreve o roteiro e escolhe uma das noventa e cinco vozes prontas. Essa voz atravessa mais de 100 idiomas, e o áudio volta rápido o bastante para caber dentro de uma conversa ao vivo.
O que o Inworld TTS 2 faz de diferente
Duas coisas o separam do resto da prateleira de fala. A primeira é a latência. A mediana até o primeiro áudio fica abaixo de 200 milissegundos. Com isso, o texto para voz deixa de ser algo que você manda gerar e espera. Ele passa a servir para uso interativo, quando um personagem precisa responder enquanto a pessoa ainda está ouvindo.
A segunda é que a voz não fica presa a um idioma. Qualquer voz do catálogo fala qualquer idioma suportado, e a identidade se mantém na virada. Um roteiro bilíngue volta soando como uma pessoa só, não como duas gravações emendadas. É esse detalhe que faz uma voz de marca sobreviver à localização.
Inworld TTS 2 no Morphic
No Morphic, o Inworld TTS 2 fica no seletor de modelos de áudio, em Speech. Ele aparece ao lado do ElevenLabs e do Gemini 3.1 Flash TTS. Mude a barra de prompt para Audio, escolha Speech, selecione o Inworld TTS 2, escolha uma voz, cole o roteiro e gere. Cada geração aceita até 2.000 caracteres e volta em MP3 de 48 kHz, direto no seu Canvas.
São dois níveis disponíveis. O Inworld TTS 2 vem como padrão. O Inworld TTS 2 Flash puxa do mesmo catálogo de noventa e cinco vozes. O ajuste é mais rápido e mais barato, bom para volume e para rascunho. Trocar de um para o outro não obriga ninguém a escalar a voz de novo. E como a fala começa quase na hora, dá para conferir uma linha refeita no celular. Você ouve entre uma tarefa e outra, sem parar o dia numa fila de render.
Preços simples
Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.
Basic
1100 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Standard
3625 mensal créditos
1 apenas usuário
Todos os modelos
Workflows
Pro
6350 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Pro Max
24650 compartilhado mensal créditos
1 usuário
Todos os modelos
Workflows
Enterprise
Para limites maiores
Personalizado
termos de preços e cobrança

Free
Para experimentar
$0
grátis para sempre
Perguntas frequentes
ChatGPT Images 2.5
OpenAI
Detalhe mais nítido e edição que não bagunça o resto do quadro. O modelo de imagem da OpenAI, de setembro de 2026.
Lyria 3.5
Google DeepMind
O melhor modelo de música do Google. Músicas inteiras, com voz e letra.
MiniMax H3 Max Turbo
fal.ai
O nível rápido do H3 da fal. O dobro da velocidade, quase igual.
Gemini Omni Flash 1.1
Google DeepMind
O modelo de vídeo do Google: a edição é uma frase. Agora em 4K e com cenas de 40 segundos.