Generación de audio

Seed Audio 1.0

de ByteDance

El modelo TTS todo en uno de ByteDance.
Voz, música y efectos de sonido en una generación.

Seed Audio 1.0

Funciones clave

Escucha el rango

Narración documentalSpeech

Una voz en off documental cálida y mesurada.

0:00
0:12
Voz en off de suspensoSpeech

Una línea susurrada y tensa, cercana e íntima.

0:00
0:12
Ambiente de mercado de especiasSound effects

Una base sonora de mercado al aire libre, en capas.

0:00
0:12
Tormenta eléctricaSound effects

Una tormenta que crece hasta un trueno distante.

0:00
0:12
Cue orquestalMusic

Un breve cue ascendente para cuerdas y metales.

0:00
0:12
Ritmo lo-fiMusic

Un ritmo relajado con teclas suaves y crujido de vinilo.

0:00
0:12

Especificaciones técnicas

ByteDance

Desarrollado por el equipo de investigación Seed de ByteDance.

20

Inglés, chino, japonés, coreano, español, francés, alemán y más.

Hasta 2 min

Máximo dos minutos de audio generado por pasada.

3.000 car.

Espacio para un brief de escena completo, diálogo incluido.

Hasta 3

Hasta tres clips de referencia, de 30 segundos cada uno.

Sin streaming

Renderiza la pista completa, no un flujo en tiempo real.

Casos de uso

Audiolibros

Narración, voces y diseño sonoro para un libro entero. ByteDance sitúa el coste cerca de una décima parte del estudio.

Doblaje de vídeo

Describe la voz o sube una imagen de personaje, y usa códigos de tiempo para colocar cada línea donde la imagen la pide.

Audio para videojuegos

Líneas de personaje, escenas interpretadas y efectos de entorno para momentos inmersivos, generados desde el guion.

Audio de vídeo en una pasada

Dale a un clip su narración, su diseño sonoro y su música en una generación, sin un paso de mezcla después.

Anuncios y promos

Una línea hablada, efectos de sonido y música como una pista lista para usar, pensada para formatos cortos.

Diálogo y ficción sonora

Varios personajes, cada uno con su voz y su interpretación, en una escena con el ambiente y el ritmo que le corresponden.

Ejemplos de prompts

Explicación narrada

Narrador calmado, ambiente suave de cocina: “Mezcla la harina y la mantequilla.”

Edit prompt

Control de tiempo

Ryan (cálido, sin aliento): “[5.5s:8.0s] ¡Maya! ¿De verdad te vas esta noche?”

Edit prompt

Escena de audiolibro

Lluvia en la ventana. Narradora, grave y pausada: “Lo leyó dos veces.”

Edit prompt

Comentario deportivo

Estadio lleno, público rugiendo. Comentarista, eufórico: “¡GOOOL!”

Edit prompt

Ficción sonora

Detective, tenso: “No te muevas.” Los pasos paran, una puerta cruje.

Edit prompt

Momento de juego

Voz grave y heroica: “El sello antiguo se ha roto.” Piedra que rechina.

Edit prompt

Precios simples

Comienza gratis hoy, con la opción de mejorar tu plan o cancelar cuando quieras.

Basic

$9/ mes
facturado como $0 por año

900 mensual créditos

1 usuario

Todos los modelos

Workflows

Standard

$24/ mes
facturado como $0 por año

3200 mensual créditos

1 usuario

Todos los modelos

Workflows

Pro

$45/ mes
facturado como $0 por año

6200 compartidos mensual créditos

1 usuario

+ hasta 4 más con costo adicional

Todos los modelos

Workflows

Pro Max

$170/ mes
facturado como $0 por año

24000 compartidos mensual créditos

1 usuario

+ hasta 9 más con costo adicional

Todos los modelos

Workflows

Enterprise

Para límites más altos

Personalizado

términos de precios y facturación

Créditos de alto volumen
Límites de asientos personalizados
Todos los modelos
Workflows
Pricing Gradient

Free

Para experimentar

$0

gratis para siempre

Hasta 20 créditos
Solo 1 usuario
Modelos limitados
Workflows

Preguntas frecuentes

¿Qué es Seed Audio 1.0?
Seed Audio 1.0 es el modelo de síntesis de voz todo en uno de ByteDance. A partir de un solo prompt de texto produce voz, música instrumental y efectos de sonido juntos, como una pista acabada y mezclada. Funciona en dos modos principales: texto a audio (T2A), donde todo sale de tu descripción, y texto más audio a audio (TA2A), donde añades clips de referencia para repartir voces concretas.
¿Qué idiomas admite Seed Audio 1.0?
Seed Audio 1.0 admite 20 idiomas: inglés, chino, japonés, coreano, español de México, español de España, indonesio, alemán, portugués de Brasil, francés, tailandés, vietnamita, malayo, filipino, italiano, ruso, neerlandés, polaco, turco y sueco. Para el mejor resultado, escribe el prompt en el mismo idioma que las líneas habladas.
¿Cómo funciona el audio de referencia en Seed Audio 1.0?
En modo TA2A aportas hasta tres clips de referencia de 30 segundos como máximo y los asignas en el prompt, de modo que cada personaje corresponda a una grabación. El modelo toma el carácter vocal y la emoción de la referencia y los mantiene durante toda la generación. También puedes definir una voz con una descripción de texto o una imagen de personaje.
¿Seed Audio 1.0 puede clonar una voz?
Sí. Junto a T2A y TA2A hay un modo de clonación de voz: subes un solo clip de audio y la voz clonada queda disponible para síntesis de voz normal. ByteDance lo documenta como una clonación a partir de un único clip. Cuando la voz tiene que encajar en una escena completa con música, efectos y otros personajes, usa TA2A y sus tres clips de referencia.
¿Seed Audio 1.0 puede controlar el tiempo de cada línea?
Sí. Seed Audio 1.0 admite control preciso del tiempo: pon un código como [5.5s:8.0s] al inicio de una línea y el modelo la ajusta exactamente a esa ventana. Eso es lo que lo hace utilizable para doblaje, donde el diálogo tiene que encajar con la imagen.
¿Seed Audio 1.0 puede generar varios hablantes a la vez?
Sí. Escribe una escena con varios personajes y describe cada voz dentro del texto. Seed Audio 1.0 da a cada hablante una voz, una emoción y un ritmo distintos en una sola generación, junto con el ambiente y los efectos que los rodean.
¿Cuánto puede durar una generación de Seed Audio 1.0?
Seed Audio 1.0 genera hasta dos minutos de audio en una sola pasada, a partir de un prompt de 3.000 caracteres como máximo. Las producciones más largas se construyen escena a escena.
¿En qué se diferencia Seed Audio 1.0 de la síntesis de voz normal?
La síntesis de voz normal elige una voz y lee un texto. Seed Audio 1.0 pasa de la síntesis de voz al audio por referencia: un solo prompt describe el entorno, la música, los efectos y la voz de cada personaje, y el modelo devuelve la escena entera ya mezclada. La diferencia es de alcance: una producción de audio acabada frente a solo la voz.