Geração de áudio
Disponível agora

Inworld TTS 2

por Inworld

Noventa e cinco vozes, 100+ idiomas.
A fala começa em menos de um segundo.

Inworld TTS 2

Principais recursos

Especificações técnicas

95

Vozes prontas em catorze idiomas nativos

100+

Crosslingual, com a mesma identidade de voz em todos

2.000 caracteres

Tamanho máximo do roteiro por geração

Menos de 200 ms

Mediana até o primeiro áudio

MP3, 48 kHz

Áudio em taxa cheia, pronto para a timeline

2

Inworld TTS 2 e Inworld TTS 2 Flash

Casos de uso

Dois pontos de luz ligados por um fio tenso, um respondendo ao outro

Personagens interativos

A fala começa rápido o bastante para sustentar uma conversa. Aqui a latência é o recurso, não uma nota de rodapé.

Uma faixa longa e firme de luz, com grão uniforme de ponta a ponta

Narração e locução

Escolha o narrador uma vez só. A mesma voz volta em cada corte, em cada regravação e em cada revisão.

Uma fita de luz que se divide em fitas paralelas, todas no mesmo compasso

Locução localizada

Rode o mesmo roteiro em vários idiomas com uma voz só, e a marca sobrevive à tradução.

Uma espiral lenta de luz âmbar, de voltas iguais, sumindo na profundidade

Audiolivros e textos longos

Avance pelo livro um trecho por vez. O narrador chega firme ao fim do capítulo seguinte.

Muitos pontinhos de luz espalhados na profundidade, unidos por fios tênues

Diálogo de jogo e de NPC

Monte um elenco inteiro. Noventa e cinco vozes dão conta de uma vila sem repetir ninguém duas vezes.

Uma série limpa de degraus luminosos que sobem e somem na profundidade

Explicativos e tutoriais

Quando o produto muda, você regrava só aquela linha. Ninguém precisa remarcar uma sessão inteira.

Exemplos de prompts

Um brilho suave de luz dourada se abrindo na borda do quadro

Boas-vindas

Botei a água pro café. Senta aqui e me conta tudo.

Edit prompt
Uma dobra suave de luz branca de osso, acesa ao longo do vinco

Abertura de capítulo

Capítulo um. A maré baixou naquela manhã e nunca mais voltou por inteiro.

Edit prompt
Um único fio macio de luz cor de marfim, com uma curva só

Passo da receita

Misture a farinha com a manteiga só até dar liga.

Edit prompt
Duas linhas finas de luz branca e fria, convergindo para um ponto

Notícia de última hora

Você não vai acreditar em quem acabou de ligar.

Edit prompt
Uma malha fina de luz cinza-prateada, vista bem de perto

Abertura de aula

Que bom te ver de novo. Vamos continuar de onde a gente parou.

Edit prompt
Um afunilamento lento de luz âmbar suave, terminando em ponta

Aviso do passeio

O passeio começa às nove, logo do lado de fora do portão norte.

Edit prompt

O que é o Inworld TTS 2

O Inworld TTS 2 é o modelo de texto para voz Realtime TTS-2 da Inworld. Ele saiu em 31 de agosto de 2026 e chegou ao Morphic no mesmo dia. Você escreve o roteiro e escolhe uma das noventa e cinco vozes prontas. Essa voz atravessa mais de 100 idiomas, e o áudio volta rápido o bastante para caber dentro de uma conversa ao vivo.

O que o Inworld TTS 2 faz de diferente

Duas coisas o separam do resto da prateleira de fala. A primeira é a latência. A mediana até o primeiro áudio fica abaixo de 200 milissegundos. Com isso, o texto para voz deixa de ser algo que você manda gerar e espera. Ele passa a servir para uso interativo, quando um personagem precisa responder enquanto a pessoa ainda está ouvindo.

A segunda é que a voz não fica presa a um idioma. Qualquer voz do catálogo fala qualquer idioma suportado, e a identidade se mantém na virada. Um roteiro bilíngue volta soando como uma pessoa só, não como duas gravações emendadas. É esse detalhe que faz uma voz de marca sobreviver à localização.

Inworld TTS 2 no Morphic

No Morphic, o Inworld TTS 2 fica no seletor de modelos de áudio, em Speech. Ele aparece ao lado do ElevenLabs e do Gemini 3.1 Flash TTS. Mude a barra de prompt para Audio, escolha Speech, selecione o Inworld TTS 2, escolha uma voz, cole o roteiro e gere. Cada geração aceita até 2.000 caracteres e volta em MP3 de 48 kHz, direto no seu Canvas.

São dois níveis disponíveis. O Inworld TTS 2 vem como padrão. O Inworld TTS 2 Flash puxa do mesmo catálogo de noventa e cinco vozes. O ajuste é mais rápido e mais barato, bom para volume e para rascunho. Trocar de um para o outro não obriga ninguém a escalar a voz de novo. E como a fala começa quase na hora, dá para conferir uma linha refeita no celular. Você ouve entre uma tarefa e outra, sem parar o dia numa fila de render.

Preços simples

Comece grátis hoje mesmo, com a opção de fazer upgrade ou cancelar quando quiser.

Basic

$9/ mês
cobrado como $0 por ano

1100 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Standard

$24/ mês
cobrado como $0 por ano

3625 mensal créditos

1 apenas usuário

Todos os modelos

Workflows

Pro

$45/ mês
cobrado como $0 por ano

6350 compartilhado mensal créditos

1 usuário

+ até 4 mais com custo adicional

Todos os modelos

Workflows

Pro Max

$170/ mês
cobrado como $0 por ano

24650 compartilhado mensal créditos

1 usuário

+ até 9 mais com custo adicional

Todos os modelos

Workflows

Enterprise

Para limites maiores

Personalizado

termos de preços e cobrança

Créditos de alto volume
Limites de vagas personalizados
Todos os modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

grátis para sempre

Até 20 créditos
apenas 1 usuário
Modelos limitados
Workflows

Perguntas frequentes

O que é o Inworld TTS 2?
O Inworld TTS 2 é o modelo de texto para voz Realtime TTS-2 da Inworld, lançado em 31 de agosto de 2026. Ele lê o seu roteiro em uma das noventa e cinco vozes prontas do catálogo. Essa mesma identidade de voz se mantém em mais de 100 idiomas, e o áudio volta em velocidade de tempo real.
Quantas vozes e quantos idiomas ele tem?
São noventa e cinco vozes prontas, distribuídas em catorze idiomas nativos, com entrega crosslingual em mais de 100 idiomas. Qualquer voz fala qualquer idioma suportado. Ou seja, o idioma nativo de uma voz conta como ela foi escalada, e não onde ela para.
O Inworld TTS 2 fala português?
Sim. O português está entre os mais de 100 idiomas suportados, e qualquer voz do catálogo pode falar nele. Quais são os catorze idiomas nativos do catálogo não é algo que esta página lista. Para o português, o que vale é a cobertura crosslingual. A voz que você escolheu continua sendo a mesma pessoa quando muda de idioma. Um roteiro que começa em português e emenda uma frase em inglês volta numa gravação só.
Por que ele é tão rápido?
A mediana até o primeiro áudio fica abaixo de 200 milissegundos. Isso tira o texto para voz da categoria de gerar e esperar. Com essa margem, ele serve para personagens interativos e agentes ao vivo. Não só para a locução que você gera uma vez e guarda.
Qual a diferença entre o Inworld TTS 2 e o Inworld TTS 2 Flash?
Os dois usam o mesmo catálogo de noventa e cinco vozes. O Inworld TTS 2 entrega a leitura mais completa. O Flash é o nível rápido e mais barato, feito para volume e para rascunho. Você troca de um para o outro sem escalar a voz de novo.
Qual o tamanho máximo do roteiro?
São 2.000 caracteres por geração. Para textos maiores, quebre o roteiro em trechos e gere um de cada vez. A voz escalada continua a mesma em todos eles, então uma peça longa não muda de narrador no meio.
Como ele se compara ao ElevenLabs no Morphic?
Os dois entregam fala com qualidade humana no Morphic. O ElevenLabs é uma suíte de áudio completa, com fala, música, efeitos sonoros e ajuste fino de voz. O Inworld TTS 2 faz só fala, e ganha na latência e em segurar a mesma voz entre idiomas. Muita gente usa os dois: um para a voz, o outro para música e efeitos.
Como usar o Inworld TTS 2 no Morphic?
Abra o Morphic e mude a barra de prompt para Audio, depois escolha Speech. Selecione o Inworld TTS 2 como modelo, escolha uma voz, cole o roteiro e gere. O áudio cai no seu Canvas, junto dos clipes de vídeo.