Generación de audio

Seed Audio 1.0

de ByteDance

El modelo TTS todo en uno de ByteDance.
Voz, música y efectos de sonido en una generación.

Seed Audio 1.0

Funciones clave

Escucha el rango

Narración documentalSpeech

Una voz en off documental cálida y mesurada.

0:00
0:12
Voz en off de suspensoSpeech

Una línea susurrada y tensa, cercana e íntima.

0:00
0:12
Ambiente de mercado de especiasSound effects

Una base sonora de mercado al aire libre, en capas.

0:00
0:12
Tormenta eléctricaSound effects

Una tormenta que crece hasta un trueno distante.

0:00
0:12
Cue orquestalMusic

Un breve cue ascendente para cuerdas y metales.

0:00
0:12
Ritmo lo-fiMusic

Un ritmo relajado con teclas suaves y crujido de vinilo.

0:00
0:12

Especificaciones técnicas

ByteDance

Desarrollado por el equipo de investigación Seed de ByteDance.

20

Inglés, chino, japonés, coreano, español, francés, alemán y más.

Hasta 2 min

Máximo dos minutos de audio generado por pasada.

3.000 car.

Espacio para un brief de escena completo, diálogo incluido.

Hasta 3

Hasta tres clips de referencia, de 30 segundos cada uno.

Sin streaming

Renderiza la pista completa, no un flujo en tiempo real.

Casos de uso

Audiolibros

Narración, voces y diseño sonoro para un libro entero. ByteDance sitúa el coste cerca de una décima parte del estudio.

Doblaje de vídeo

Describe la voz o sube una imagen de personaje, y usa códigos de tiempo para colocar cada línea donde la imagen la pide.

Audio para videojuegos

Líneas de personaje, escenas interpretadas y efectos de entorno para momentos inmersivos, generados desde el guion.

Audio de vídeo en una pasada

Dale a un clip su narración, su diseño sonoro y su música en una generación, sin un paso de mezcla después.

Anuncios y promos

Una línea hablada, efectos de sonido y música como una pista lista para usar, pensada para formatos cortos.

Diálogo y ficción sonora

Varios personajes, cada uno con su voz y su interpretación, en una escena con el ambiente y el ritmo que le corresponden.

Ejemplos de prompts

Explicación narrada

Narrador calmado, ambiente suave de cocina: “Mezcla la harina y la mantequilla.”

Edit prompt

Control de tiempo

Ryan (cálido, sin aliento): “[5.5s:8.0s] ¡Maya! ¿De verdad te vas esta noche?”

Edit prompt

Escena de audiolibro

Lluvia en la ventana. Narradora, grave y pausada: “Lo leyó dos veces.”

Edit prompt

Comentario deportivo

Estadio lleno, público rugiendo. Comentarista, eufórico: “¡GOOOL!”

Edit prompt

Ficción sonora

Detective, tenso: “No te muevas.” Los pasos paran, una puerta cruje.

Edit prompt

Momento de juego

Voz grave y heroica: “El sello antiguo se ha roto.” Piedra que rechina.

Edit prompt

Visión general

Seed Audio 1.0 es el modelo de audio todo en uno de ByteDance, planteado como el siguiente paso de la síntesis de voz y no como una ruptura con ella. Los flujos de audio tradicionales usan herramientas separadas para voz, música y efectos de sonido, cada una generada por su lado y luego mezclada. Seed Audio 1.0 produce las tres juntas a partir de un solo prompt de texto, y la salida es una pista de audio completa y lista para usar.

De la síntesis de voz al audio por referencia

La TTS de siempre toma una voz y un bloque de texto. Seed Audio 1.0 toma una escena: el tiempo que hace y la sala, la música por debajo, los efectos alrededor de la acción, qué aspecto y qué sonido tiene cada personaje, y las líneas que dicen. Todo lo que puedas describir entra en la misma generación, y por eso un prompt puede llegar a 3.000 caracteres sin ser relleno.

El modelo entiende el contexto de la escena. Un prompt de conversación en una cafetería recibe murmullo de fondo y el espacio acústico correcto, no un ruido de sala genérico. Una escena de acción recibe efectos secos y una música dinámica, no música de fondo pegada sobre el silencio. Las tres capas salen proporcionadas y mezcladas para la escena, no montadas a partir de exportaciones sueltas.

Cuatro modos

El más sencillo es la síntesis de voz: eliges una voz, escribes un texto y el modelo lo lee. La clonación de voz añade un paso: subes un solo clip de audio y la voz clonada queda disponible para esa misma síntesis de voz. Los otros dos modos son los que separan a este modelo de la TTS de siempre.

En texto a audio (T2A), cada voz sale de tu descripción. Indica la edad, el acento, la emoción, el tono y la velocidad de un personaje, y el modelo lo reparte.

En texto más audio a audio (TA2A), subes hasta tres clips de referencia de 30 segundos como máximo y asignas cada uno a un personaje en el prompt. La voz generada sigue entonces a la grabación en lugar de a una descripción. Los clips de referencia se pueden subir para un solo trabajo o guardarse en una biblioteca de recursos y reutilizarse en toda una serie.

Veinte idiomas

Seed Audio 1.0 genera en inglés, chino, japonés, coreano, español de México, español de España, indonesio, alemán, portugués de Brasil, francés, tailandés, vietnamita, malayo, filipino, italiano, ruso, neerlandés, polaco, turco y sueco. El idioma del prompt y el del guion deben coincidir: escribe el brief en el idioma que hablan los personajes.

Un tiempo que puedes fijar al segundo

Seed Audio 1.0 acepta un código de tiempo en cualquier línea, escrito en línea como [5.5s:8.0s], y ajusta la interpretación a esa ventana exacta. En doblaje, esa es la diferencia entre un audio que encaja más o menos y un audio que cae justo en el corte. La generación es sin streaming: el modelo renderiza la pista acabada en una sola pasada, de hasta dos minutos.

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

1100 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3625 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6350 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24650 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Qué es Seed Audio 1.0?
Seed Audio 1.0 es el modelo de síntesis de voz todo en uno de ByteDance. A partir de un solo prompt de texto produce voz, música instrumental y efectos de sonido juntos, como una pista acabada y mezclada. Funciona en dos modos principales: texto a audio (T2A), donde todo sale de tu descripción, y texto más audio a audio (TA2A), donde añades clips de referencia para repartir voces concretas.
¿Qué idiomas admite Seed Audio 1.0?
Seed Audio 1.0 admite 20 idiomas: inglés, chino, japonés, coreano, español de México, español de España, indonesio, alemán, portugués de Brasil, francés, tailandés, vietnamita, malayo, filipino, italiano, ruso, neerlandés, polaco, turco y sueco. Para el mejor resultado, escribe el prompt en el mismo idioma que las líneas habladas.
¿Cómo funciona el audio de referencia en Seed Audio 1.0?
En modo TA2A aportas hasta tres clips de referencia de 30 segundos como máximo y los asignas en el prompt, de modo que cada personaje corresponda a una grabación. El modelo toma el carácter vocal y la emoción de la referencia y los mantiene durante toda la generación. También puedes definir una voz con una descripción de texto o una imagen de personaje.
¿Seed Audio 1.0 puede clonar una voz?
Sí. Junto a T2A y TA2A hay un modo de clonación de voz: subes un solo clip de audio y la voz clonada queda disponible para síntesis de voz normal. ByteDance lo documenta como una clonación a partir de un único clip. Cuando la voz tiene que encajar en una escena completa con música, efectos y otros personajes, usa TA2A y sus tres clips de referencia.
¿Seed Audio 1.0 puede controlar el tiempo de cada línea?
Sí. Seed Audio 1.0 admite control preciso del tiempo: pon un código como [5.5s:8.0s] al inicio de una línea y el modelo la ajusta exactamente a esa ventana. Eso es lo que lo hace utilizable para doblaje, donde el diálogo tiene que encajar con la imagen.
¿Seed Audio 1.0 puede generar varios hablantes a la vez?
Sí. Escribe una escena con varios personajes y describe cada voz dentro del texto. Seed Audio 1.0 da a cada hablante una voz, una emoción y un ritmo distintos en una sola generación, junto con el ambiente y los efectos que los rodean.
¿Cuánto puede durar una generación de Seed Audio 1.0?
Seed Audio 1.0 genera hasta dos minutos de audio en una sola pasada, a partir de un prompt de 3.000 caracteres como máximo. Las producciones más largas se construyen escena a escena.
¿En qué se diferencia Seed Audio 1.0 de la síntesis de voz normal?
La síntesis de voz normal elige una voz y lee un texto. Seed Audio 1.0 pasa de la síntesis de voz al audio por referencia: un solo prompt describe el entorno, la música, los efectos y la voz de cada personaje, y el modelo devuelve la escena entera ya mezclada. La diferencia es de alcance: una producción de audio acabada frente a solo la voz.