Flux 3: guía completa, funciones, prompts y video con audio nativo

Flux 3: guía completa, funciones, prompts y video con audio nativo

La guía completa de Flux 3: video con audio nativo de hasta 20 segundos, los cuatro formatos de prompt, el esquema CASTLE, keyframes, continuación de clips y ejemplos resueltos.

Funciones y capacidades de Flux 3

Flux 3 es el modelo fundacional multimodal de Black Forest Labs. En vez de entrenar un modelo distinto para cada tipo de salida, aprende imagen, video y audio como un solo sistema. Así, un mismo prompt devuelve una toma que se mueve, que suena y que se comporta como el mundo real.

Black Forest Labs presentó Flux 3 el 23 de julio de 2026 y abrió la generación de video de forma general el 4 de agosto de 2026. Los clips duran de 5 a 20 segundos, en HD 720p o Full HD 1080p, en siete relaciones de aspecto que van de 21:9 a 9:16, con audio generado junto a los fotogramas por defecto. Todo lo que sigue está basado en la guía de prompts publicada por Black Forest Labs.

FunciónQué haceIdeal para
Video con audio nativoGenera el clip y su sonido sincronizado en una sola pasadaEscenas con sonido, diálogo, efectos
Física del mundo realEl movimiento sigue la masa y el impulso; el sonido corresponde al impactoFilm de producto, acción, explicativos
KeyframesInterpola una toma a través de hasta 10 imágenes fijasTransiciones controladas, storyboards
Continuación de videoExtiende un clip existente a partir de sus últimos fotogramasEscenas más largas, rescatar una buena toma
Diálogo multilingüeHabla más de 13 idiomas en cámara con sincronía de labiosVideo localizado, presentadores, anuncios
Generación de varias tomasArma distintos ángulos dentro de una sola generaciónCortometrajes, anuncios, revelaciones
Modo borradorVista previa rápida, luego un render final que coincide con ellaExplorar direcciones antes de comprometerse

Video con audio nativo

Lo más destacado es que la imagen y el sonido llegan juntos. Flux 3 genera cada clip con audio nativo sincronizado en la misma pasada, así que un impacto, una pisada o una línea hablada ya está ligada a la acción, en vez de añadirse después. Nombra el sonido que quieres en el prompt y define un idioma cuando la escena tenga diálogo.

Física del mundo real

Flux 3 aprende el movimiento, la masa y el sonido como un solo sistema. Por eso el peso, el impulso y las colisiones siguen reglas reales, y los materiales conservan su aspecto mientras la cámara se mueve. Describe cómo evoluciona el movimiento a lo largo de la toma, y la física se leerá como algo filmado, no simulado.

Keyframes y continuación

Hay dos formas de tomar control del movimiento. La primera: fija imágenes como keyframes y Flux 3 interpola una sola toma continua entre ellas. Una imagen define el fotograma de apertura, dos fijan un inicio y un final, y hasta diez ubicadas en marcas de tiempo convierten el clip en un storyboard que el modelo debe recorrer en orden. La segunda: entrega metraje que ya tienes, y la continuación retoma desde los últimos fotogramas, llevando el impulso, el comportamiento de cámara y la base de audio a través del corte sin que se note la unión.

Diálogo multilingüe y tipografía

Escribe la línea entre comillas, nombra el idioma y describe la entrega, y Flux 3 la habla en cámara con el acento y la sincronía de labios correspondientes. Entre los idiomas compatibles están el inglés y sus variantes, chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi y punyabí. La tipografía se renderiza como parte de la escena y se mantiene legible mientras la cámara se mueve, así que los títulos y los letreros sobreviven al movimiento.

Casos de uso de Flux 3

Escenas con audio nativo

Un clip llega con su sonido ya sincronizado, así que un efecto o una línea hablada cae junto con la acción y no necesitas arreglar después una toma muda.

Film de producto y de marca

Los reflejos, el peso y los materiales se mantienen fieles mientras la cámara se mueve, así que un giro, una caída o un vertido se ve filmado y no simulado.

Secuencias de varias tomas

Arma distintos ángulos dentro de una sola generación, o extiende un clip con continuación, manteniendo el mismo personaje en cada corte.

La misma mujer pelirroja mantenida constante en tres escenas

Video localizado

El diálogo multilingüe y el texto en pantalla preciso permiten lanzar una misma escena en varios idiomas, sin una pasada aparte de títulos ni de voz.

Un rótulo inferior de transmisión con la misma frase en inglés y coreano

Borrador y luego versión final

Previsualiza una dirección rápido y barato, evalúala, y luego renderiza la aprobada a calidad completa con los mismos sujetos, composición y movimiento.

Una vista previa rápida junto al render de calidad completa de la misma toma

Explicativos con física real

La gravedad, las colisiones y el movimiento siguen reglas reales, así que el material de cómo funciona algo se mantiene preciso mientras se ve limpio.

Cómo escribir prompts para Flux 3

Dirige una escena, no describas un montón de objetos. Black Forest Labs recomienda nombrar qué pasa, cómo se mueven los sujetos, cómo se comporta la cámara y a qué suena la toma, usando sustantivos y verbos concretos que una cámara pueda captar. Los adjetivos vagos dejan el resultado al azar.

Elige un formato de prompt

Flux 3 acepta cuatro formatos, y la extensión no es la meta. Empieza corto para explorar, y alarga el prompt solo donde necesites más control.

FormatoCuándo usarloEjemplo
Frase cortaPara explorar rápido, un solo sujeto claro, hallazgos felicesUn zorro rojo saltando sobre nieve fresca, con teleobjetivo
Línea en lenguaje naturalEl estándar diario para una sola tomaUna toma baja de seguimiento de un zorro corriendo entre pinos mojados al amanecer
Campos etiquetadosPara ajustar una sola palanca sin tocar el restoToma de cámara: amplia, ángulo bajo. Sujeto: un jinete cruza un río
TimestepCuando la acción tiene que caer en una marca exacta0.0–1.5s plano amplio fijo de un puerto. 1.5–3.0s empieza un acercamiento lento

La línea en lenguaje natural tiene una forma confiable que vale la pena memorizar: [cámara] de [sujeto] [acción] en [entorno], y luego el detalle visual y de movimiento que la respalda. Mantén los tiempos del formato timestep alcanzables, dos o tres por cada cinco segundos de clip, y marca un corte duro cada vez que cambie el ángulo.

Arma un CASTLE para trabajo de varias tomas

Cuando el aspecto y la historia tienen que sostenerse en varias tomas, Black Forest Labs documenta un esquema de seis partes. Las seis forman CASTLE en inglés, que es nuestro apodo para su esquema y no un nombre oficial, y es la forma más rápida de recordar qué le falta a un prompt largo.

ElementoQué va ahí
CResumen generalUna línea que cubre toda la secuencia: quién, dónde y el arco de la historia
AAudioPor toma: el paisaje sonoro, renderizado en sincronía con los fotogramas
SSujetoIdéntico palabra por palabra entre tomas, para que la identidad no cambie
TLínea de tiempoPor toma, con marcas de tiempo: el movimiento de cámara y la acción del sujeto
LAspectoEl acabado global: nivel de realismo, paleta de color y grano
EEntornoPor toma: escenario, calidad de la luz y profundidad de campo

Llena cada parte en el orden que prefieras, y luego arma el prompt en la secuencia documentada por Black Forest Labs: resumen general, entorno, sujeto, línea de tiempo, audio, aspecto. Mantener la descripción del sujeto idéntica palabra por palabra entre tomas es lo que evita que un personaje cambie en un corte. Es el truco de continuidad más barato de toda la guía.

Nombra el sonido que quieres

El audio se genera junto con la imagen, así que una escena que sugiere sonido le da al modelo más con qué trabajar que una escena abstracta. Pisadas, impactos, lluvia, motores y multitudes se leen con claridad. Hay cuatro capas, y casi nunca necesitas las cuatro a la vez.

CapaQué describirEjemplo
VozQuién habla, las palabras exactas entre comillas y cómo las diceEl mecánico dice: “Pruébalo ahora.” Tranquilo, sin rodeos
AmbienteEl sonido del lugarLluvia contra las ventanas, murmullo bajo de un restaurante
EfectosSonidos ligados a acciones visiblesUna taza de cerámica choca contra el plato
MúsicaEstilo, ritmo y dónde se ubica en la mezclaUn tema de piano austero bajo la escena, bajo en la mezcla

Dos hábitos hacen casi todo el trabajo. Nombra una fuente de sonido en vez de pedir silencio, porque un “ambiente en silencio” puede convertirse en un vacío sin sonido, mientras que “lluvia contra la ventana” le da al modelo algo que renderizar. Y para una línea hablada, di si quien habla está en cámara o si es voz en off, porque de lo contrario una línea entre comillas puede tratarse como texto para poner en la escena.

Dirige la voz, no la sensación

“Profesional, cálida y atractiva” produce siempre la misma lectura pulida de locutor. Los anclajes concretos funcionan mejor: edad y acento cuando importan, registro, cómo fue grabada, la entrega, y un límite como “sin tono de locutor”. Después, lee la línea en voz alta antes de generarla. La dirección de voz no puede salvar un texto rígido.

Errores comunes

  • Describir una imagen fija. Un modelo de video necesita movimiento en el tiempo, no una fotografía en palabras.
  • Olvidar el sonido. El audio se genera por defecto, así que nombra el efecto, el ambiente o la línea que quieres.
  • Acumular términos de cámara. “Toma baja de seguimiento” es clara; “órbita aérea baja con push-in a mano” no lo es.
  • Escribir negativos. Los modelos Flux no admiten prompts negativos, así que di lo que sí quieres.
  • Sobrecargar un clip corto. Varios hablantes, un guion largo y muchos momentos en cinco segundos cortan la última palabra. Acorta la línea o alarga la duración.

Para la lista completa de funciones y las especificaciones, consulta la página del modelo Flux 3.

Preguntas frecuentes

¿Cómo escribo un buen prompt para Flux 3?
Dirige una escena en vez de describir objetos sueltos. Nombra el sujeto, qué hace, cómo se comporta la cámara, el escenario y la luz, y una señal de audio, con sustantivos y verbos concretos que una cámara podría captar. Como Flux 3 genera sonido junto con la imagen, di siempre a qué debe sonar la toma.
¿Cuáles son los cuatro formatos de prompt de Flux 3?
Una frase corta para explorar rápido, una línea en lenguaje natural como estándar diario, campos etiquetados cuando quieres ajustar una sola palanca, y el formato timestep cuando la acción debe caer en una marca exacta. Empieza corto y alarga el prompt solo donde necesites más control.
¿Flux 3 genera audio junto con el video?
Sí, y viene activado por defecto. Cada clip vuelve con audio generado en la misma pasada, así que un impacto, unas pisadas, el ambiente o una línea hablada ya están sincronizados con la acción. Nombra la fuente del sonido que quieres en vez de pedir silencio, porque una petición de silencio puede convertirse en un vacío sin sonido.
¿Cuánto puede durar un video hecho con Flux 3?
Flux 3 genera de 5 a 20 segundos en una sola pasada, en segundos completos, o puede elegir una duración según el prompt. Para piezas más largas, usa la continuación de video para extender un clip desde sus últimos fotogramas, o arma varias tomas dentro de una sola generación con cortes duros entre ellas.
¿Cómo mantengo un personaje constante en Flux 3?
Repite la descripción del sujeto palabra por palabra en cada toma del prompt. El esquema de Black Forest Labs trata esa descripción fija como lo que sostiene la identidad entre cortes. Los keyframes y la generación de varias tomas después llevan ese aspecto a lo largo de la secuencia. Ya se anunciaron referencias combinadas de imagen y video para más adelante.
¿Cómo funcionan los keyframes en Flux 3?
Fijas imágenes y Flux 3 interpola una sola toma continua entre ellas. Una imagen define el fotograma de apertura, dos fijan un inicio y un final, y hasta diez ubicadas en marcas de tiempo convierten el clip en un storyboard que la toma debe recorrer en orden, mientras el modelo rellena el movimiento entre esas marcas.
¿Flux 3 puede generar diálogo en español?
Sí. El español está entre los más de 13 idiomas compatibles para diálogo hablado en cámara, con acento y sincronía de labios ajustados a la línea. Escribe la frase entre comillas, indica el idioma y describe cómo se entrega, y Flux 3 la habla como parte de la escena.