Flux 3: guía completa, funciones, prompts y video de audio nativo

Flux 3: guía completa, funciones, prompts y video de audio nativo

La guía completa de Flux 3: el modelo del mundo multimodal, video con audio nativo, movimiento que obedece la física, personajes constantes, edición en contexto y ejemplos de prompts.

Funciones y capacidades de Flux 3

Flux 3 es el modelo fundacional multimodal de Black Forest Labs. En vez de un modelo distinto por salida, aprende imagen, video y audio juntos, así que un solo prompt puede devolver una toma en movimiento y con sonido que se comporta como lo hace el mundo real.

Black Forest Labs anunció Flux 3 el 23 de julio de 2026 y lo está desplegando en acceso anticipado. Las capacidades de abajo son las que han descrito; la guía de prompts que sigue es práctica general para un modelo de video con audio nativo, y las palancas exactas pueden afinarse a medida que Flux 3 esté disponible de forma amplia.

FunciónQué haceIdeal para
Video con audio nativoGenera el clip y su sonido sincronizado en una sola pasadaEscenas con sonido, diálogo, efectos
Física del mundo realEl movimiento obedece a la masa y el impulso; el sonido corresponde al impactoFilm de producto, acción, explicativos
Personajes constantesMantiene un sujeto entre tomas a partir de una referencia visualSecuencias, series, trabajo de marca
Texto y habla multilingüesRenderiza texto en pantalla y diálogo hablado con precisiónVideo localizado, títulos, subtítulos
Edición en contextoCambia un elemento sin repetir todo el renderCorregir una toma, ajustes puntuales
Encadenado de varias tomasUne clips en una secuencia continua más largaCortometrajes, anuncios, revelaciones

Video con audio nativo

Lo principal es que la imagen y el sonido llegan juntos. Flux 3 genera cada clip con audio nativo sincronizado en la misma pasada, así que un impacto, una pisada o una línea hablada ya está ligada a la acción en vez de añadirse después. Nombra el sonido que quieres en el prompt y fija un idioma cuando la escena tiene diálogo.

Física del mundo real

Flux 3 aprende el movimiento, la masa y el sonido como un solo sistema, así que el peso, el impulso y las colisiones siguen reglas reales y los materiales conservan su aspecto mientras la cámara se mueve. Describe cómo evoluciona el movimiento a lo largo de la toma, y la física se ve filmada en vez de desviarse.

Personajes constantes

Aporta una referencia visual clara y Flux 3 conserva el mismo rostro, la misma ropa y el mismo aspecto de toma en toma. Reutiliza esa referencia entre cortes para mantener un personaje a lo largo de una secuencia que dura minutos, que es lo que mantiene una serie reconocible en vez de reiniciarse en cada escena.

Texto multilingüe y edición en contexto

El renderizado de texto mejora mucho respecto a versiones anteriores de Flux, incluido el texto en pantalla preciso en varios idiomas, así que una placa de título se lee bien sin una pasada aparte. La edición es puntual: cambia un elemento de un fotograma, o lleva un sujeto de un clip de origen a una escena nueva, y el resto queda intacto.

Casos de uso de Flux 3

Escenas con audio nativo

Un clip vuelve con su sonido ya sincronizado, así que un efecto o una línea hablada cae con la acción en vez de una toma silenciosa que corriges después.

Film de producto y marca

Los reflejos, el peso y los materiales se mantienen fieles mientras la cámara se mueve, así que un servido, una rotación o una caída se ve filmada y no simulada.

Secuencias de varias tomas

Encadena clips en una escena más larga y mantén un personaje en cada corte con una referencia visual, así una secuencia se mantiene constante.

La misma mujer pelirroja mantenida constante en tres escenas

Video localizado

El diálogo multilingüe y el texto en pantalla preciso permiten que una escena salga en varios idiomas, sin una pasada aparte de títulos o de voz.

Un rótulo inferior de transmisión que lee la misma frase en inglés y coreano

Generación y edición de imágenes

Sintetiza entre estilos y relaciones de aspecto, renderiza texto nítido, y luego edita una zona en su sitio sin repetir toda la imagen.

Un antes y después de un retrato con solo el fondo cambiado

Explicativos con física real

La gravedad, las colisiones y el movimiento siguen reglas reales, así que el material de cómo funciona algo se mantiene preciso y limpio.

Cómo hacer prompts en Flux 3

Escribe el prompt como una breve indicación de toma, no como un pie de foto. Recorre SPACE, y como Flux 3 crea sonido junto con la imagen, incluye siempre una señal de audio.

SPACEIncluirEjemplo
SujetoQuién o qué está en cuadro, descrito de forma concretaUn mensajero con una chaqueta roja de lluvia
ActuaciónEl movimiento: qué hace el sujeto y cómoSe abre paso entre los puestos del mercado, con el aliento empañado
AmbienteEscenario, momento del día y luzUn mercado nocturno bajo la lluvia, piedra mojada bajo los pies
CámaraTipo de toma más un movimientoToma de seguimiento baja, un acercamiento constante
Señales extraAudio, idioma, ritmoLluvia y murmullo lejano, una línea hablada en japonés

Errores comunes

  • Describir una imagen fija. Un modelo de video necesita movimiento en el tiempo, no una fotografía en palabras.
  • Olvidar el sonido. Flux 3 genera audio, así que nombra el efecto, el ambiente o la línea que quieres.
  • Meter una secuencia en un solo prompt. Mantén una acción clara por toma, y encadena clips para alargar.
  • Dejar las referencias sin etiquetar. Di para qué sirve cada referencia para que el modelo sepa cuál dirige la escena.

Para la lista completa de capacidades y las especificaciones, consulta la página del modelo Flux 3.

Preguntas frecuentes

¿Cómo escribo un buen prompt de Flux 3?
Escríbelo como una breve indicación de toma, no como un pie de foto. Nombra el sujeto, el movimiento, el escenario y la luz, la cámara y una señal de audio. Como Flux 3 genera sonido junto con la imagen, di cómo debe sonar la toma y describe cómo evoluciona el movimiento en el tiempo en vez de un solo fotograma congelado.
¿Flux 3 genera audio con el video?
Sí. Cada clip de Flux 3 vuelve con audio nativo generado en la misma pasada, así que un impacto, unas pisadas, el ambiente o una línea hablada ya está sincronizado con la acción. Nombra el sonido que quieres en el prompt y añade un idioma cuando la escena tiene diálogo, ya que Flux 3 maneja habla multilingüe.
¿Cuánto puede durar un video de Flux 3?
Flux 3 genera hasta 20 segundos en una sola pasada. Para piezas más largas, encadena clips en una secuencia de varias tomas y reutiliza la misma referencia visual para que un personaje se mantenga constante en escenas que pueden durar varios minutos.
¿Cómo mantengo un personaje constante en Flux 3?
Adjunta una referencia visual clara del sujeto y reutilízala de toma en toma. Flux 3 conserva el mismo rostro, la misma ropa y el mismo aspecto entre cortes, que es lo que mantiene una secuencia reconocible en vez de que se desvíe de escena en escena.
¿Flux 3 puede editar una imagen o un clip sin volver a generarlo?
Sí. Flux 3 hace edición en contexto tanto para imagen como para video. Cambia un elemento y el resto del fotograma se queda igual, o lleva un sujeto de un clip de origen a una escena nueva, lo que es más rápido que repetir todo el render y conserva una toma que ya te gusta.
¿Cómo uso Flux 3?
Escribe la toma como una breve indicación, nombrando el sujeto, su movimiento, la cámara y una señal de audio. Adjunta cualquier imagen de referencia de un personaje, producto o set que deba mantenerse constante. Ejecuta el prompt y luego refina la toma buena con edición en contexto o encadena otro clip para una secuencia más larga.