Seed Audio 1.0
de ByteDance
El modelo TTS todo en uno de ByteDance.
Voz, música y efectos de sonido en una generación.

Funciones clave
Escucha el rango
Una voz en off documental cálida y mesurada.
Una línea susurrada y tensa, cercana e íntima.
Una base sonora de mercado al aire libre, en capas.
Una tormenta que crece hasta un trueno distante.
Un breve cue ascendente para cuerdas y metales.
Un ritmo relajado con teclas suaves y crujido de vinilo.
Especificaciones técnicas
ByteDance
Desarrollado por el equipo de investigación Seed de ByteDance.
20
Inglés, chino, japonés, coreano, español, francés, alemán y más.
Hasta 2 min
Máximo dos minutos de audio generado por pasada.
3.000 car.
Espacio para un brief de escena completo, diálogo incluido.
Hasta 3
Hasta tres clips de referencia, de 30 segundos cada uno.
Sin streaming
Renderiza la pista completa, no un flujo en tiempo real.
Casos de uso
Audiolibros
Narración, voces y diseño sonoro para un libro entero. ByteDance sitúa el coste cerca de una décima parte del estudio.
Doblaje de vídeo
Describe la voz o sube una imagen de personaje, y usa códigos de tiempo para colocar cada línea donde la imagen la pide.
Audio para videojuegos
Líneas de personaje, escenas interpretadas y efectos de entorno para momentos inmersivos, generados desde el guion.
Audio de vídeo en una pasada
Dale a un clip su narración, su diseño sonoro y su música en una generación, sin un paso de mezcla después.
Anuncios y promos
Una línea hablada, efectos de sonido y música como una pista lista para usar, pensada para formatos cortos.
Diálogo y ficción sonora
Varios personajes, cada uno con su voz y su interpretación, en una escena con el ambiente y el ritmo que le corresponden.
Ejemplos de prompts
Explicación narrada
Narrador calmado, ambiente suave de cocina: “Mezcla la harina y la mantequilla.”
Edit promptControl de tiempo
Ryan (cálido, sin aliento): “[5.5s:8.0s] ¡Maya! ¿De verdad te vas esta noche?”
Edit promptEscena de audiolibro
Lluvia en la ventana. Narradora, grave y pausada: “Lo leyó dos veces.”
Edit promptVisión general
Seed Audio 1.0 es el modelo de audio todo en uno de ByteDance, planteado como el siguiente paso de la síntesis de voz y no como una ruptura con ella. Los flujos de audio tradicionales usan herramientas separadas para voz, música y efectos de sonido, cada una generada por su lado y luego mezclada. Seed Audio 1.0 produce las tres juntas a partir de un solo prompt de texto, y la salida es una pista de audio completa y lista para usar.
De la síntesis de voz al audio por referencia
La TTS de siempre toma una voz y un bloque de texto. Seed Audio 1.0 toma una escena: el tiempo que hace y la sala, la música por debajo, los efectos alrededor de la acción, qué aspecto y qué sonido tiene cada personaje, y las líneas que dicen. Todo lo que puedas describir entra en la misma generación, y por eso un prompt puede llegar a 3.000 caracteres sin ser relleno.
El modelo entiende el contexto de la escena. Un prompt de conversación en una cafetería recibe murmullo de fondo y el espacio acústico correcto, no un ruido de sala genérico. Una escena de acción recibe efectos secos y una música dinámica, no música de fondo pegada sobre el silencio. Las tres capas salen proporcionadas y mezcladas para la escena, no montadas a partir de exportaciones sueltas.
Cuatro modos
El más sencillo es la síntesis de voz: eliges una voz, escribes un texto y el modelo lo lee. La clonación de voz añade un paso: subes un solo clip de audio y la voz clonada queda disponible para esa misma síntesis de voz. Los otros dos modos son los que separan a este modelo de la TTS de siempre.
En texto a audio (T2A), cada voz sale de tu descripción. Indica la edad, el acento, la emoción, el tono y la velocidad de un personaje, y el modelo lo reparte.
En texto más audio a audio (TA2A), subes hasta tres clips de referencia de 30 segundos como máximo y asignas cada uno a un personaje en el prompt. La voz generada sigue entonces a la grabación en lugar de a una descripción. Los clips de referencia se pueden subir para un solo trabajo o guardarse en una biblioteca de recursos y reutilizarse en toda una serie.
Veinte idiomas
Seed Audio 1.0 genera en inglés, chino, japonés, coreano, español de México, español de España, indonesio, alemán, portugués de Brasil, francés, tailandés, vietnamita, malayo, filipino, italiano, ruso, neerlandés, polaco, turco y sueco. El idioma del prompt y el del guion deben coincidir: escribe el brief en el idioma que hablan los personajes.
Un tiempo que puedes fijar al segundo
Seed Audio 1.0 acepta un código de tiempo en cualquier línea, escrito en línea como [5.5s:8.0s], y ajusta la interpretación a esa ventana exacta. En doblaje, esa es la diferencia entre un audio que encaja más o menos y un audio que cae justo en el corte. La generación es sin streaming: el modelo renderiza la pista acabada en una sola pasada, de hasta dos minutos.
Precios simples
Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.
Basic
1100 mensual créditos
1 usuario
Todos los modelos
Workflows
Standard
3625 mensual créditos
1 usuario
Todos los modelos
Workflows
Pro
6350 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Pro Max
24650 compartidos mensual créditos
1 usuario
Todos los modelos
Workflows
Enterprise
Para límites más altos
Personalizado
términos de precios y facturación

Free
Para experimentar
$0
gratis para siempre
Preguntas frecuentes
ChatGPT Images 2.5
OpenAI
El modelo de imagen de OpenAI, de septiembre de 2026. Más detalle, ediciones precisas, más rápido.
Lyria 3.5
Google DeepMind
El mejor modelo musical de Google. Canciones con estructura, voz y letra.
MiniMax H3 Max Turbo
fal.ai
El nivel rápido del H3 afinado por fal. El doble de rápido, casi igual de bueno.
Inworld TTS 2
Inworld
95 voces y más de 100 idiomas. La voz arranca en menos de un segundo.