Inworld TTS 2
de Inworld
95 voces y más de 100 idiomas.
La voz arranca en menos de un segundo.

Funciones clave
Especificaciones técnicas
95
Voces listas en catorce idiomas nativos
100+
Crosslingüe, con una sola identidad de voz en todos
2,000 caracteres
Largo máximo del guion por generación
Menos de 200 ms
Mediana hasta el primer audio
MP3, 48 kHz
Audio a tasa completa, listo para la línea de tiempo
2
Inworld TTS 2 e Inworld TTS 2 Flash
Casos de uso

Personajes interactivos
La voz entra tan rápido que aguanta una conversación. Aquí la latencia es la función, no una nota al pie.

Narración y locución
Eliges narrador una vez y esa misma voz te acompaña en cada corte, cada retoma y cada revisión.

Locución localizada
Corres el mismo guion en varios idiomas sin cambiar de voz. Así la marca sobrevive a la traducción.

Audiolibros y formatos largos
Avanzas por el libro pasaje por pasaje. El narrador se mantiene parejo capítulo tras capítulo.

Diálogos de videojuego
Puedes armar un reparto entero. Con 95 voces llenas un pueblo sin repetir ninguna dos veces.

Explicativos y tutoriales
Cuando el producto cambia, vuelves a generar solo esa línea. No hay que agendar otra sesión de grabación.
Ejemplos de prompts






Qué es Inworld TTS 2
Inworld TTS 2 es el modelo de texto a voz Realtime TTS-2 de Inworld. Salió el 31 de agosto de 2026 y ese mismo día quedó disponible en Morphic. Lee tu guion con una de sus 95 voces listas, sostiene esa voz en más de 100 idiomas y devuelve el audio lo bastante rápido como para caber dentro de una conversación en vivo.
Qué hace distinto a Inworld TTS 2
Hay dos cosas que lo separan del resto del estante de voz. La primera es la latencia. La mediana hasta el primer audio baja de 200 milisegundos, y eso mueve al texto a voz fuera de la categoría de generar y esperar. Entra en el terreno interactivo, donde un personaje tiene que responder mientras el jugador sigue escuchando.
La segunda es que la voz no está amarrada a un idioma. Cualquier voz del catálogo puede hablar cualquier idioma soportado, y la identidad se sostiene si el cambio ocurre dentro de una sola generación. Un guion bilingüe regresa sonando a una misma persona, no a dos tomas pegadas. Por eso una voz de marca puede sobrevivir a la localización.
Inworld TTS 2 en Morphic
En Morphic, Inworld TTS 2 aparece en el selector de modelos de audio para Speech, junto a ElevenLabs y Gemini 3.1 Flash TTS. Cambia la barra de prompt a Audio, elige Speech, selecciona Inworld TTS 2, elige una voz, pega tu guion y genera. Cada generación admite hasta 2,000 caracteres y devuelve un MP3 a 48 kHz que cae directo en tu Canvas. De ahí sale listo para montarlo en un video, subirlo a YouTube o mandarlo por WhatsApp.
Hay dos niveles disponibles. Inworld TTS 2 viene por defecto. Inworld TTS 2 Flash usa el mismo catálogo de 95 voces en un ajuste más rápido y de menor costo, que le queda bien al trabajo por volumen y a los borradores. Cambiar de nivel no te obliga a volver a elegir voz.
Precios simples
Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.
Basic
1100 mensual créditos
1 usuario
Todos los modelos
Workflows
Standard
3625 mensual créditos
1 usuario
Todos los modelos
Workflows
Pro
6350 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Pro Max
24650 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Enterprise
Para límites más altos
Personalizado
términos de precios y facturación

Free
Para experimentar
$0
gratis para siempre
Preguntas frecuentes
ChatGPT Images 2.5
OpenAI
El modelo de imagen de OpenAI, de septiembre de 2026. Más detalle, ediciones precisas, más rápido.
Lyria 3.5
Google DeepMind
El mejor modelo musical de Google. Canciones con estructura, voz y letra.
MiniMax H3 Max Turbo
fal.ai
El nivel rápido del H3 afinado por fal. El doble de rápido, casi igual de bueno.
Gemini Omni Flash 1.1
Google DeepMind
El modelo de video de Google que diriges escribiendo. Ahora con 4K y escenas de 40 segundos.