Generación de audio
Disponible ahora

Inworld TTS 2

de Inworld

95 voces y más de 100 idiomas.
La voz arranca en menos de un segundo.

Inworld TTS 2

Funciones clave

Especificaciones técnicas

95

Voces listas en catorce idiomas nativos

100+

Crosslingüe, con una sola identidad de voz en todos

2,000 caracteres

Largo máximo del guion por generación

Menos de 200 ms

Mediana hasta el primer audio

MP3, 48 kHz

Audio a tasa completa, listo para la línea de tiempo

2

Inworld TTS 2 e Inworld TTS 2 Flash

Casos de uso

Dos nodos luminosos unidos por un hilo de luz tenso, uno respondiéndole al otro

Personajes interactivos

La voz entra tan rápido que aguanta una conversación. Aquí la latencia es la función, no una nota al pie.

Una banda de luz larga y estable, con grano parejo de un extremo al otro

Narración y locución

Eliges narrador una vez y esa misma voz te acompaña en cada corte, cada retoma y cada revisión.

Una cinta de luz que se abre en cintas paralelas y avanzan al mismo ritmo

Locución localizada

Corres el mismo guion en varios idiomas sin cambiar de voz. Así la marca sobrevive a la traducción.

Una espiral lenta de luz ámbar que se hunde en la profundidad con vueltas parejas

Audiolibros y formatos largos

Avanzas por el libro pasaje por pasaje. El narrador se mantiene parejo capítulo tras capítulo.

Muchos puntos pequeños de luz repartidos en profundidad, unidos por hilos apenas visibles

Diálogos de videojuego

Puedes armar un reparto entero. Con 95 voces llenas un pueblo sin repetir ninguna dos veces.

Una serie limpia de escalones luminosos que suben y se alejan en profundidad

Explicativos y tutoriales

Cuando el producto cambia, vuelves a generar solo esa línea. No hay que agendar otra sesión de grabación.

Ejemplos de prompts

Un destello suave de luz dorada que se abre en el borde del encuadre

Bienvenida cálida

Ya puse el agua. Siéntate y cuéntame todo.

Edit prompt
Un pliegue delicado de luz color hueso que brilla a lo largo del doblez

Inicio de capítulo

Capítulo uno. Esa mañana bajó la marea y nunca terminó de volver.

Edit prompt
Un solo hilo suave de luz color marfil que se enrosca una vez

Paso de receta

Integra la harina con la mantequilla, solo hasta que se junten.

Edit prompt
Dos líneas delgadas de luz blanca y fría que convergen en un punto

Noticia de último momento

No vas a creer quién acaba de llamar.

Edit prompt
Una malla fina de luz gris plateada vista muy de cerca

Bienvenida de curso

Qué bueno verte de nuevo. Seguimos donde nos quedamos.

Edit prompt
Un afinamiento lento de luz ámbar suave que se cierra en punta

Información del recorrido

El recorrido sale a las nueve, afuera de la puerta norte.

Edit prompt

Qué es Inworld TTS 2

Inworld TTS 2 es el modelo de texto a voz Realtime TTS-2 de Inworld. Salió el 31 de agosto de 2026 y ese mismo día quedó disponible en Morphic. Lee tu guion con una de sus 95 voces listas, sostiene esa voz en más de 100 idiomas y devuelve el audio lo bastante rápido como para caber dentro de una conversación en vivo.

Qué hace distinto a Inworld TTS 2

Hay dos cosas que lo separan del resto del estante de voz. La primera es la latencia. La mediana hasta el primer audio baja de 200 milisegundos, y eso mueve al texto a voz fuera de la categoría de generar y esperar. Entra en el terreno interactivo, donde un personaje tiene que responder mientras el jugador sigue escuchando.

La segunda es que la voz no está amarrada a un idioma. Cualquier voz del catálogo puede hablar cualquier idioma soportado, y la identidad se sostiene si el cambio ocurre dentro de una sola generación. Un guion bilingüe regresa sonando a una misma persona, no a dos tomas pegadas. Por eso una voz de marca puede sobrevivir a la localización.

Inworld TTS 2 en Morphic

En Morphic, Inworld TTS 2 aparece en el selector de modelos de audio para Speech, junto a ElevenLabs y Gemini 3.1 Flash TTS. Cambia la barra de prompt a Audio, elige Speech, selecciona Inworld TTS 2, elige una voz, pega tu guion y genera. Cada generación admite hasta 2,000 caracteres y devuelve un MP3 a 48 kHz que cae directo en tu Canvas. De ahí sale listo para montarlo en un video, subirlo a YouTube o mandarlo por WhatsApp.

Hay dos niveles disponibles. Inworld TTS 2 viene por defecto. Inworld TTS 2 Flash usa el mismo catálogo de 95 voces en un ajuste más rápido y de menor costo, que le queda bien al trabajo por volumen y a los borradores. Cambiar de nivel no te obliga a volver a elegir voz.

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

1100 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3625 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6350 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24650 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Qué es Inworld TTS 2?
Inworld TTS 2 es el modelo de texto a voz Realtime TTS-2 de Inworld, publicado el 31 de agosto de 2026. Lee tu guion con una de sus 95 voces listas, sostiene esa misma identidad de voz en más de 100 idiomas y devuelve el audio a velocidad de tiempo real.
¿Cuántas voces e idiomas maneja?
Son 95 voces listas, repartidas en catorce idiomas nativos, con entrega crosslingüe en más de 100 idiomas. Cualquier voz puede hablar cualquier idioma soportado. Por eso el idioma nativo de una voz te dice cómo fue creada, no hasta dónde llega.
¿Inworld TTS 2 habla español?
Sí. El español está entre los más de 100 idiomas soportados, y ahí cualquier voz del catálogo puede leer tu guion. La entrega es crosslingüe, así que la voz que elegiste suena igual aunque su idioma nativo sea otro. Lo que Inworld no publica es cuáles son los catorce idiomas nativos del catálogo, así que aquí no lo damos por hecho. Escribe tu guion en español, con acentos y signos de apertura, y elige la voz por su carácter.
¿Una misma voz puede hablar varios idiomas?
Sí, y puede cambiar dentro de una sola generación. La identidad se sostiene durante el cambio, así que un guion bilingüe regresa sonando a una sola persona y no a dos tomas pegadas. Eso es justo lo que vuelve práctica la locución de marca localizada.
¿Por qué es tan rápido?
La mediana hasta el primer audio baja de 200 milisegundos. Con eso el texto a voz sale de la categoría de generar y esperar. Sirve para personajes interactivos y agentes en vivo, no solo para una locución que produces una vez y montas después.
¿Cuál es la diferencia entre Inworld TTS 2 e Inworld TTS 2 Flash?
Comparten el mismo catálogo de 95 voces. Inworld TTS 2 entrega la lectura más completa. Inworld TTS 2 Flash es el nivel rápido y de menor costo, pensado para volumen o para borradores. Puedes moverte de uno a otro sin volver a elegir voz.
¿En qué se diferencia de ElevenLabs en Morphic?
Los dos generan voz de calidad humana en Morphic. ElevenLabs es una suite de audio completa: voz, música y efectos de sonido, con ajuste fino de la voz. Inworld TTS 2 hace solo voz, y sus ventajas son la latencia y sostener una misma voz entre idiomas. Muchos creadores usan los dos, uno para la voz y el otro para música y efectos.
¿Cómo uso Inworld TTS 2 en Morphic?
Abre Morphic, cambia la barra de prompt a Audio y elige Speech. Selecciona Inworld TTS 2 como modelo, elige una voz, pega tu guion y genera. El audio cae en tu Canvas, junto a tus clips de video.