Funciones y capacidades de Flux 3
Flux 3 es el modelo fundacional multimodal de Black Forest Labs. En vez de entrenar un modelo distinto para cada tipo de salida, aprende imagen, video y audio como un solo sistema. Así, un mismo prompt devuelve una toma que se mueve, que suena y que se comporta como el mundo real.
Black Forest Labs presentó Flux 3 el 23 de julio de 2026 y abrió la generación de video de forma general el 4 de agosto de 2026. Los clips duran de 5 a 20 segundos, en HD 720p o Full HD 1080p, en siete relaciones de aspecto que van de 21:9 a 9:16, con audio generado junto a los fotogramas por defecto. Todo lo que sigue está basado en la guía de prompts publicada por Black Forest Labs.
| Función | Qué hace | Ideal para |
|---|---|---|
| Video con audio nativo | Genera el clip y su sonido sincronizado en una sola pasada | Escenas con sonido, diálogo, efectos |
| Física del mundo real | El movimiento sigue la masa y el impulso; el sonido corresponde al impacto | Film de producto, acción, explicativos |
| Keyframes | Interpola una toma a través de hasta 10 imágenes fijas | Transiciones controladas, storyboards |
| Continuación de video | Extiende un clip existente a partir de sus últimos fotogramas | Escenas más largas, rescatar una buena toma |
| Diálogo multilingüe | Habla más de 13 idiomas en cámara con sincronía de labios | Video localizado, presentadores, anuncios |
| Generación de varias tomas | Arma distintos ángulos dentro de una sola generación | Cortometrajes, anuncios, revelaciones |
| Modo borrador | Vista previa rápida, luego un render final que coincide con ella | Explorar direcciones antes de comprometerse |
Video con audio nativo
Lo más destacado es que la imagen y el sonido llegan juntos. Flux 3 genera cada clip con audio nativo sincronizado en la misma pasada, así que un impacto, una pisada o una línea hablada ya está ligada a la acción, en vez de añadirse después. Nombra el sonido que quieres en el prompt y define un idioma cuando la escena tenga diálogo.
Física del mundo real
Flux 3 aprende el movimiento, la masa y el sonido como un solo sistema. Por eso el peso, el impulso y las colisiones siguen reglas reales, y los materiales conservan su aspecto mientras la cámara se mueve. Describe cómo evoluciona el movimiento a lo largo de la toma, y la física se leerá como algo filmado, no simulado.
Keyframes y continuación
Hay dos formas de tomar control del movimiento. La primera: fija imágenes como keyframes y Flux 3 interpola una sola toma continua entre ellas. Una imagen define el fotograma de apertura, dos fijan un inicio y un final, y hasta diez ubicadas en marcas de tiempo convierten el clip en un storyboard que el modelo debe recorrer en orden. La segunda: entrega metraje que ya tienes, y la continuación retoma desde los últimos fotogramas, llevando el impulso, el comportamiento de cámara y la base de audio a través del corte sin que se note la unión.
Diálogo multilingüe y tipografía
Escribe la línea entre comillas, nombra el idioma y describe la entrega, y Flux 3 la habla en cámara con el acento y la sincronía de labios correspondientes. Entre los idiomas compatibles están el inglés y sus variantes, chino, español, francés, alemán, japonés, portugués, ruso, italiano, indonesio, turco, hindi y punyabí. La tipografía se renderiza como parte de la escena y se mantiene legible mientras la cámara se mueve, así que los títulos y los letreros sobreviven al movimiento.
Casos de uso de Flux 3
Escenas con audio nativo
Un clip llega con su sonido ya sincronizado, así que un efecto o una línea hablada cae junto con la acción y no necesitas arreglar después una toma muda.
Film de producto y de marca
Los reflejos, el peso y los materiales se mantienen fieles mientras la cámara se mueve, así que un giro, una caída o un vertido se ve filmado y no simulado.
Secuencias de varias tomas
Arma distintos ángulos dentro de una sola generación, o extiende un clip con continuación, manteniendo el mismo personaje en cada corte.

Video localizado
El diálogo multilingüe y el texto en pantalla preciso permiten lanzar una misma escena en varios idiomas, sin una pasada aparte de títulos ni de voz.

Borrador y luego versión final
Previsualiza una dirección rápido y barato, evalúala, y luego renderiza la aprobada a calidad completa con los mismos sujetos, composición y movimiento.

Explicativos con física real
La gravedad, las colisiones y el movimiento siguen reglas reales, así que el material de cómo funciona algo se mantiene preciso mientras se ve limpio.
Cómo escribir prompts para Flux 3
Dirige una escena, no describas un montón de objetos. Black Forest Labs recomienda nombrar qué pasa, cómo se mueven los sujetos, cómo se comporta la cámara y a qué suena la toma, usando sustantivos y verbos concretos que una cámara pueda captar. Los adjetivos vagos dejan el resultado al azar.
Elige un formato de prompt
Flux 3 acepta cuatro formatos, y la extensión no es la meta. Empieza corto para explorar, y alarga el prompt solo donde necesites más control.
| Formato | Cuándo usarlo | Ejemplo |
|---|---|---|
| Frase corta | Para explorar rápido, un solo sujeto claro, hallazgos felices | Un zorro rojo saltando sobre nieve fresca, con teleobjetivo |
| Línea en lenguaje natural | El estándar diario para una sola toma | Una toma baja de seguimiento de un zorro corriendo entre pinos mojados al amanecer |
| Campos etiquetados | Para ajustar una sola palanca sin tocar el resto | Toma de cámara: amplia, ángulo bajo. Sujeto: un jinete cruza un río |
| Timestep | Cuando la acción tiene que caer en una marca exacta | 0.0–1.5s plano amplio fijo de un puerto. 1.5–3.0s empieza un acercamiento lento |
La línea en lenguaje natural tiene una forma confiable que vale la pena memorizar: [cámara] de [sujeto] [acción] en [entorno], y luego el detalle visual y de movimiento que la respalda. Mantén los tiempos del formato timestep alcanzables, dos o tres por cada cinco segundos de clip, y marca un corte duro cada vez que cambie el ángulo.
Arma un CASTLE para trabajo de varias tomas
Cuando el aspecto y la historia tienen que sostenerse en varias tomas, Black Forest Labs documenta un esquema de seis partes. Las seis forman CASTLE en inglés, que es nuestro apodo para su esquema y no un nombre oficial, y es la forma más rápida de recordar qué le falta a un prompt largo.
| Elemento | Qué va ahí | |
|---|---|---|
| C | Resumen general | Una línea que cubre toda la secuencia: quién, dónde y el arco de la historia |
| A | Audio | Por toma: el paisaje sonoro, renderizado en sincronía con los fotogramas |
| S | Sujeto | Idéntico palabra por palabra entre tomas, para que la identidad no cambie |
| T | Línea de tiempo | Por toma, con marcas de tiempo: el movimiento de cámara y la acción del sujeto |
| L | Aspecto | El acabado global: nivel de realismo, paleta de color y grano |
| E | Entorno | Por toma: escenario, calidad de la luz y profundidad de campo |
Llena cada parte en el orden que prefieras, y luego arma el prompt en la secuencia documentada por Black Forest Labs: resumen general, entorno, sujeto, línea de tiempo, audio, aspecto. Mantener la descripción del sujeto idéntica palabra por palabra entre tomas es lo que evita que un personaje cambie en un corte. Es el truco de continuidad más barato de toda la guía.
Nombra el sonido que quieres
El audio se genera junto con la imagen, así que una escena que sugiere sonido le da al modelo más con qué trabajar que una escena abstracta. Pisadas, impactos, lluvia, motores y multitudes se leen con claridad. Hay cuatro capas, y casi nunca necesitas las cuatro a la vez.
| Capa | Qué describir | Ejemplo |
|---|---|---|
| Voz | Quién habla, las palabras exactas entre comillas y cómo las dice | El mecánico dice: “Pruébalo ahora.” Tranquilo, sin rodeos |
| Ambiente | El sonido del lugar | Lluvia contra las ventanas, murmullo bajo de un restaurante |
| Efectos | Sonidos ligados a acciones visibles | Una taza de cerámica choca contra el plato |
| Música | Estilo, ritmo y dónde se ubica en la mezcla | Un tema de piano austero bajo la escena, bajo en la mezcla |
Dos hábitos hacen casi todo el trabajo. Nombra una fuente de sonido en vez de pedir silencio, porque un “ambiente en silencio” puede convertirse en un vacío sin sonido, mientras que “lluvia contra la ventana” le da al modelo algo que renderizar. Y para una línea hablada, di si quien habla está en cámara o si es voz en off, porque de lo contrario una línea entre comillas puede tratarse como texto para poner en la escena.
Dirige la voz, no la sensación
“Profesional, cálida y atractiva” produce siempre la misma lectura pulida de locutor. Los anclajes concretos funcionan mejor: edad y acento cuando importan, registro, cómo fue grabada, la entrega, y un límite como “sin tono de locutor”. Después, lee la línea en voz alta antes de generarla. La dirección de voz no puede salvar un texto rígido.
Errores comunes
- Describir una imagen fija. Un modelo de video necesita movimiento en el tiempo, no una fotografía en palabras.
- Olvidar el sonido. El audio se genera por defecto, así que nombra el efecto, el ambiente o la línea que quieres.
- Acumular términos de cámara. “Toma baja de seguimiento” es clara; “órbita aérea baja con push-in a mano” no lo es.
- Escribir negativos. Los modelos Flux no admiten prompts negativos, así que di lo que sí quieres.
- Sobrecargar un clip corto. Varios hablantes, un guion largo y muchos momentos en cinco segundos cortan la última palabra. Acorta la línea o alarga la duración.
Para la lista completa de funciones y las especificaciones, consulta la página del modelo Flux 3.
