Funciones y capacidades de Flux 3
Flux 3 es el modelo fundacional multimodal de Black Forest Labs. En vez de un modelo distinto por salida, aprende imagen, video y audio juntos, así que un solo prompt puede devolver una toma en movimiento y con sonido que se comporta como lo hace el mundo real.
Black Forest Labs anunció Flux 3 el 23 de julio de 2026 y lo está desplegando en acceso anticipado. Las capacidades de abajo son las que han descrito; la guía de prompts que sigue es práctica general para un modelo de video con audio nativo, y las palancas exactas pueden afinarse a medida que Flux 3 esté disponible de forma amplia.
| Función | Qué hace | Ideal para |
|---|---|---|
| Video con audio nativo | Genera el clip y su sonido sincronizado en una sola pasada | Escenas con sonido, diálogo, efectos |
| Física del mundo real | El movimiento obedece a la masa y el impulso; el sonido corresponde al impacto | Film de producto, acción, explicativos |
| Personajes constantes | Mantiene un sujeto entre tomas a partir de una referencia visual | Secuencias, series, trabajo de marca |
| Texto y habla multilingües | Renderiza texto en pantalla y diálogo hablado con precisión | Video localizado, títulos, subtítulos |
| Edición en contexto | Cambia un elemento sin repetir todo el render | Corregir una toma, ajustes puntuales |
| Encadenado de varias tomas | Une clips en una secuencia continua más larga | Cortometrajes, anuncios, revelaciones |
Video con audio nativo
Lo principal es que la imagen y el sonido llegan juntos. Flux 3 genera cada clip con audio nativo sincronizado en la misma pasada, así que un impacto, una pisada o una línea hablada ya está ligada a la acción en vez de añadirse después. Nombra el sonido que quieres en el prompt y fija un idioma cuando la escena tiene diálogo.
Física del mundo real
Flux 3 aprende el movimiento, la masa y el sonido como un solo sistema, así que el peso, el impulso y las colisiones siguen reglas reales y los materiales conservan su aspecto mientras la cámara se mueve. Describe cómo evoluciona el movimiento a lo largo de la toma, y la física se ve filmada en vez de desviarse.
Personajes constantes
Aporta una referencia visual clara y Flux 3 conserva el mismo rostro, la misma ropa y el mismo aspecto de toma en toma. Reutiliza esa referencia entre cortes para mantener un personaje a lo largo de una secuencia que dura minutos, que es lo que mantiene una serie reconocible en vez de reiniciarse en cada escena.
Texto multilingüe y edición en contexto
El renderizado de texto mejora mucho respecto a versiones anteriores de Flux, incluido el texto en pantalla preciso en varios idiomas, así que una placa de título se lee bien sin una pasada aparte. La edición es puntual: cambia un elemento de un fotograma, o lleva un sujeto de un clip de origen a una escena nueva, y el resto queda intacto.
Casos de uso de Flux 3
Escenas con audio nativo
Un clip vuelve con su sonido ya sincronizado, así que un efecto o una línea hablada cae con la acción en vez de una toma silenciosa que corriges después.
Film de producto y marca
Los reflejos, el peso y los materiales se mantienen fieles mientras la cámara se mueve, así que un servido, una rotación o una caída se ve filmada y no simulada.
Secuencias de varias tomas
Encadena clips en una escena más larga y mantén un personaje en cada corte con una referencia visual, así una secuencia se mantiene constante.

Video localizado
El diálogo multilingüe y el texto en pantalla preciso permiten que una escena salga en varios idiomas, sin una pasada aparte de títulos o de voz.

Generación y edición de imágenes
Sintetiza entre estilos y relaciones de aspecto, renderiza texto nítido, y luego edita una zona en su sitio sin repetir toda la imagen.

Explicativos con física real
La gravedad, las colisiones y el movimiento siguen reglas reales, así que el material de cómo funciona algo se mantiene preciso y limpio.
Cómo hacer prompts en Flux 3
Escribe el prompt como una breve indicación de toma, no como un pie de foto. Recorre SPACE, y como Flux 3 crea sonido junto con la imagen, incluye siempre una señal de audio.
| SPACE | Incluir | Ejemplo |
|---|---|---|
| Sujeto | Quién o qué está en cuadro, descrito de forma concreta | Un mensajero con una chaqueta roja de lluvia |
| Actuación | El movimiento: qué hace el sujeto y cómo | Se abre paso entre los puestos del mercado, con el aliento empañado |
| Ambiente | Escenario, momento del día y luz | Un mercado nocturno bajo la lluvia, piedra mojada bajo los pies |
| Cámara | Tipo de toma más un movimiento | Toma de seguimiento baja, un acercamiento constante |
| Señales extra | Audio, idioma, ritmo | Lluvia y murmullo lejano, una línea hablada en japonés |
Errores comunes
- Describir una imagen fija. Un modelo de video necesita movimiento en el tiempo, no una fotografía en palabras.
- Olvidar el sonido. Flux 3 genera audio, así que nombra el efecto, el ambiente o la línea que quieres.
- Meter una secuencia en un solo prompt. Mantén una acción clara por toma, y encadena clips para alargar.
- Dejar las referencias sin etiquetar. Di para qué sirve cada referencia para que el modelo sepa cuál dirige la escena.
Para la lista completa de capacidades y las especificaciones, consulta la página del modelo Flux 3.
