Escucha Seed Audio 1.0
Narración documental
Voz, cálida y pausada
Voz en off de thriller
Voz, susurrante y tensa
Ambiente de mercado de especias
Efectos de sonido, ambiente al aire libre
Tormenta eléctrica
Efectos de sonido, de tormenta a un trueno
Cue orquestal
Música, cuerdas y metales en ascenso
Beat lo-fi
Música, teclas suaves y vinilo
Casos de uso de Seed Audio 1.0
Audio de vídeo en una pasada
Dale a un clip su narración, su diseño sonoro y su música en una generación. Describe la escena, quién habla, qué ocurre y el ambiente, y el modelo se encarga de toda la pista de audio.

Explicaciones y tutoriales narrados
Una voz compuesta con ruido de sala y una base musical ligera en una sola salida. La narración lleva el contenido, y el modelo llena el espacio acústico para que suene situado y acabado.

Anuncios y promos cortos
Línea hablada, efectos de sonido y música como una pista lista para usar. Escribe el tiempo en el prompt, y el modelo marca el acento en la palabra correcta y baja la música justo a tiempo.

Diálogo guionizado y ficción sonora
Escenas con varios personajes, voces distintas, interpretación precisa y ambiente a juego, todo en un prompt. Escribe el guion, describe cada voz, y el modelo reparte y dirige.

Audiolibros y narración larga
Narración, voces de personajes y diseño sonoro sin sesión de estudio, con un coste que ByteDance sitúa cerca de una décima parte de una grabación humana. Reparte al narrador desde un clip o una descripción y avanza escena a escena.

Doblaje ajustado al fotograma
Pon un código de tiempo en cada línea y el modelo ajusta la interpretación a esa ventana exacta, para que el diálogo caiga en el corte y no cerca. Funciona en los veinte idiomas admitidos.

Cómo escribir un prompt de Seed Audio 1.0
Un buen prompt se lee como un brief de escena corto, no como una línea de síntesis de voz: así el modelo puede encajar voz, música y efectos en una misma escena. Repasa SCENE antes de enviarlo.
| SCENE | Qué incluir | Ejemplo |
|---|---|---|
| Situación | Tiempo, lugar, contexto, acústica | Pasillo al salir de clase, pasos lejanos, reverberación |
| Casting | Qué hace o lleva cada personaje | Mochila al hombro, saludo desde la puerta |
| Efectos | Ambiente y género musical, efectos de sonido | Tambores de guerra, metales graves, un “clac” de taquilla |
| Notas de voz | Género, edad, acento, emoción, tono, velocidad | Adolescente, acento estadounidense, voz clara y chulesca |
| Enunciados | Qué dice cada personaje, entre comillas | “Oye, Emma, ¿estás libre el sábado?” |
Tres hábitos separan los prompts buenos de los genéricos.
Escribe largo. El límite es de 3.000 caracteres, y los ejemplos oficiales usan casi todo. Aquí la descripción no es relleno: el entorno, la música y la interpretación de cada personaje son cosas que el modelo renderiza, así que cada frase que recortas es una decisión que le devuelves.
Escribe los sonidos. Las onomatopeyas funcionan. La cremallera de una mochila “zzzip”, un timbre de colegio “rin-rin” que se aleja, el “fum, fum” de una hoja cortando el aire. Deletrear el sonido es más fiable que nombrarlo.
Haz coincidir los idiomas. Escribe el prompt en el mismo idioma que las líneas habladas. Un guion en español con brief en inglés es la causa más común de un acento raro.
Timbre de colegio “rin-rin” que se aleja de cerca a lejos, pasillo al salir de clase con pasos lejanos, conversación de estudiantes, algún “clac” de taquilla y reverberación de pasillo. Jake (chico adolescente, acento estadounidense, voz joven y luminosa, alegre y chulesco) dice juguetón y burlón: “Oye, Emma, ¿estás libre el sábado? Invito yo, ¡al parque de atracciones nuevo!” La cremallera de una mochila hace “zzzip”. Emma (chica adolescente, acento estadounidense, voz dulce, suave y aireada, tímida) baja la voz, aturullada: “Eh… todavía no he acabado los deberes.” Jake insiste, alargando las palabras: “Los haces el domingo, ¡si es solo medio día!” Emma murmura, ablandándose: “Pero… son para el lunes.” Jake dice con suavidad: “Los hago contigo y luego salimos, ¿trato?” Emma no puede evitar reírse y cede con timidez: “Vale, solo medio día, ¿eh?” Jake, emocionado: “¡Trato!” Termina con los pasos de los dos alejándose.
Controlar el tiempo al segundo
Seed Audio 1.0 admite control preciso del tiempo. Pon un código al principio de una línea, con la forma [inicio:fin], y el modelo ajusta la interpretación de esa línea a la ventana exacta. Acelera, frena y coloca las pausas para que encaje.
Ryan (hombre joven, voz cálida) llama con inquietud, un poco sin aliento: “[5.5s:8.0s] ¡Maya! Espera, ¿de verdad te vas esta noche?” Maya (mujer joven, voz suave) responde en voz baja, obligándose a mantener la compostura: “[8.5s:11.5s] Tengo que irme. Llevo años detrás de esto, no puedo dejarlo ahora.”
Esto es lo que hace el modelo utilizable para doblaje. Saca los puntos de entrada y salida de cada línea de tu línea de tiempo, escríbelos en el prompt, y la pista devuelta se coloca sobre la imagen sin estirar ni recortar. Sin códigos de tiempo, el modelo da a la escena un ritmo natural.
Repartir voces desde audio de referencia (TA2A)
Hay dos formas de meter una voz en una escena. En T2A la describes y el modelo la reparte. En TA2A subes audio de referencia y la voz generada sigue a la grabación.
También existe un modo más sencillo de clonación de voz, al margen del trabajo de escena: subes un solo clip y la voz clonada queda disponible para síntesis de voz normal. Úsalo cuando solo necesites que una voz lea un guion. Pásate a TA2A en cuanto esa voz tenga que convivir en una escena con música, efectos y otros personajes.
TA2A acepta hasta tres clips de referencia de 30 segundos como máximo. Asigna cada clip a un personaje dentro del texto, para que el modelo sepa qué voz pertenece a cada hablante, y luego escribe la escena igual que harías en T2A.
[Sonido ambiente de calle: coches pasando, conversación lejana, una brisa leve.] Marcus (voz masculina, suave y segura, tono de presentador cálido y juguetón, articulación clara, el actor es <<TGT_SPK1>>), animado y cercano, dice: “¡Hola! Pregunta rápida, ¿qué es lo más vergonzoso que te ha pasado?” Tyler (voz masculina más joven, algo nerviosa, expresiva con una risa ligera, el actor es <<TGT_SPK2>>), soltando un gemido largo y una risa dolorida, dice: “Uf, NO quieres saberlo. Vale, está bien, pero esto queda entre nosotros.” Marcus (el actor es <<TGT_SPK1>>), inclinándose, intrigado, dice: “Ahora TENGO que oírlo. Venga.” [Los dos rompen a reír; el ambiente de calle sube y se desvanece.]
Tres cosas que hay que dejar claras en un prompt TA2A: qué contenido generar, qué audio de referencia usar y para qué sirve cada audio de referencia. Los clips se seleccionan con @Audio1, @Audio2 y @Audio3, subidos para el trabajo actual o elegidos de tu biblioteca de recursos y reutilizados en toda una serie.
Las indicaciones entre corchetes como [Sonido ambiente de calle: coches pasando, conversación lejana] son una forma limpia de abrir y cerrar una escena sin atar el sonido a un hablante.
Prepara los clips de referencia con la lista CLEAR:
- Grabación limpia, con poco ruido de fondo
- Duración por debajo de 30 segundos por clip
- Emoción alineada con la interpretación que quieres
- Acento constante dentro de cada clip
- Ruido de sala estable entre clips
Sin ningún clip, describe la voz en texto, dando edad, acento y velocidad en lugar de “agradable” o “profesional”. Una imagen de personaje también sirve: el modelo deduce una voz coherente con la edad y el carácter aparentes, lo que va bien para hablantes de ficción o animados.
Cómo usar Seed Audio 1.0
Conseguir una pista acabada son cuatro pasos.
- Escribe el brief de escena. Describe el escenario, el reparto, la música y los efectos, cada voz y las líneas, siguiendo la lista SCENE de arriba. Hasta 3.000 caracteres.
- Fija las voces. Descríbelas en el prompt para T2A, o sube hasta tres clips de referencia y asígnalos para TA2A. Una imagen de personaje también vale.
- Añade el tiempo si lo necesitas. Pon códigos
[inicio:fin]en las líneas que tengan que caer en una ventana exacta. - Genera. Una pasada devuelve voz, música y efectos de sonido juntos, ya mezclados, de hasta dos minutos.
Para cualquier cosa de más de dos minutos, un capítulo de audiolibro o un episodio entero, avanza escena a escena y mantén la misma referencia de voz entre generaciones para que el reparto no cambie.
Preguntas frecuentes
T2A, texto a audio, construye todo a partir de tu descripción: el entorno, la música, los efectos de sonido y la voz de cada personaje. TA2A, texto más audio a audio, añade hasta tres grabaciones de referencia que asignas a personajes concretos, de modo que esas voces siguen a las grabaciones en lugar de a una descripción escrita. Todo lo demás del prompt es igual.
Sí. Más allá de T2A y TA2A hay un modo de clonación de voz: subes un clip de audio y la voz clonada queda disponible para síntesis de voz normal. ByteDance lo documenta como una clonación a partir de un único clip. Si la voz tiene que aparecer en una escena completa con música, efectos y otros hablantes, usa TA2A, que admite hasta tres clips de referencia y asigna cada uno a un personaje.
Pon un código con la forma [5.5s:8.0s] al inicio de una línea y el modelo ajusta su interpretación exactamente a esa ventana, adaptando el ritmo y las pausas para que encaje. Es la función que hace el modelo práctico para doblaje, donde el audio tiene que casar con la imagen. Las líneas sin código llevan un ritmo natural.
Veinte: inglés, chino, japonés, coreano, español de México, español de España, indonesio, alemán, portugués de Brasil, francés, tailandés, vietnamita, malayo, filipino, italiano, ruso, neerlandés, polaco, turco y sueco. Escribe el prompt en el mismo idioma que el guion para el resultado más constante.
Sí. Describe la voz de cada personaje según escribes la escena, y el modelo da a cada hablante una voz, una emoción y un ritmo distintos en una sola generación, junto con el ambiente y los efectos que los rodean. En modo TA2A puedes asignar hasta tres de esos personajes a grabaciones de referencia.
Hasta dos minutos de audio por pasada, a partir de un prompt de 3.000 caracteres como máximo. La generación es sin streaming: el modelo renderiza la pista mezclada completa en lugar de devolver audio en tiempo real. Las producciones más largas se construyen escena a escena.
Es uno de los usos donde mejor encaja el modelo. Un solo prompt cubre la voz del narrador, las voces de los personajes y el diseño sonoro alrededor, así que una escena llega acabada y no como pistas sueltas para mezclar. Mantén la misma referencia de voz entre capítulos y el narrador se mantiene constante en todo el libro.
Bastante. La síntesis de voz normal elige una voz y lee un texto. Seed Audio 1.0 pasa de la síntesis de voz al audio por referencia: un solo prompt describe el entorno, la música, los efectos y la voz de cada personaje, y el modelo devuelve la escena entera ya mezclada. La diferencia de alcance es una producción de audio completa frente a solo la voz.
