Multimodal

Flux 3

par Black Forest Labs

Le modèle du monde de Black Forest Labs pour l’image, la vidéo et l’audio : un son qui colle enfin à l’action.

Flux 3

Fonctionnalités clés

Spécifications techniques

5–20 s

En secondes entières en une seule passe, ou durée automatique selon le prompt

720p / 1080p

Sur Morphic ; l’API de Black Forest Labs ajoute 2K et 4K

T2V·I2V·V2V

Texte, image et images clés, ou poursuite d’un clip existant

Natif

Audio synchronisé généré avec chaque clip, activé par défaut

Cas d'utilisation

Vidéo et son en une seule passe

Un prompt renvoie un clip et son audio ensemble. Un effet ou une réplique est déjà calé sur l’action, sans passe de post-production.

Séquences multi-plans

Enchaînez plusieurs angles en une génération, ou prolongez un clip par poursuite. Un même personnage reste reconnaissable sur chaque coupe.

Film produit et de marque

Matières, poids et reflets restent fidèles quand la caméra bouge. Un produit se lit comme filmé, jamais comme simulé.

Vidéo localisée

Un dialogue multilingue et un texte à l’écran fidèle permettent de sortir une même scène en plusieurs langues, sans repasse de titrage ni de voix.

Transitions chorégraphiées

Épinglez les poses et les cadrages qu’un plan doit traverser. Le modèle construit le mouvement entre chaque repère comme un seul plan continu.

Explications avec une vraie physique

Gravité, collisions et mouvement suivent des règles réelles. Une vidéo scientifique ou pédagogique reste juste tout en restant soignée.

Exemples de prompts

Clip fidèle à la physique

Clip fidèle à la physique

Une tasse en céramique glisse d’un plan de travail en marbre et se brise au sol, les éclats se dispersent, un bruit d’impact net en synchronisation

Edit prompt
Séquence multi-plans

Séquence multi-plans

Même coursier en veste rouge : un plan où il se faufile dans un marché, le suivant où il arrive devant une porte éclairée au crépuscule

Edit prompt
Carton-titre localisé

Carton-titre localisé

Plan phare d’une marque de café, la vapeur monte d’un service tout juste tiré, le titre à l’écran affiche « Freshly Roasted » en gras net

Edit prompt
Du caméscope au cinéma

Du caméscope au cinéma

Images de caméscope à l’épaule lors d’un anniversaire, puis la même scène reprise en plan large chaleureux et cinématographique, avec l’ambiance de la pièce

Edit prompt
Poursuite de clip

Poursuite de clip

Elle se détourne de la fenêtre et sort dans une rue de Tokyo baignée de pluie, la caméra la suit sans coupe

Edit prompt
Produit en studio

Produit en studio

Sneaker avant-gardiste qui tourne sur un socle en titane, lumière clé dure, reflets métalliques fidèles, léger ronronnement mécanique

Edit prompt

Aperçu

Flux 3 est le modèle du monde multimodal de Black Forest Labs, annoncé le 23 juillet 2026 ; sa génération vidéo est passée en disponibilité générale le 4 août 2026. Il apprend conjointement à partir d’images, de vidéo et d’audio au sein d’une seule architecture unifiée. Un même modèle peut donc restituer un plan en mouvement et le son qui lui appartient, en gardant une compréhension cohérente de l’aspect, du mouvement et du son du monde.

Ce que Flux 3 fait différemment

La plupart des générateurs traitent chaque modalité comme un problème séparé. Flux 3, lui, traite l’image, la vidéo et l’audio comme des indices sur une même réalité. Le tout est entraîné ensemble selon l’approche Self-Flow de Black Forest Labs, avec plus de 95 % du calcul d’entraînement total consacré à la prédiction vidéo. Le résultat se voit dans la constance physique : le son colle à l’impact, le mouvement obéit à la masse, et un sujet garde son identité d’un plan à l’autre. C’est cette même compréhension du monde, précise et cohérente, qui parle à un public français habitué à juger la qualité d’image et le soin du détail avant tout le reste. Elle permet aussi au socle de s’étendre à la prédiction d’action pour la robotique, déjà testée sur de vraies tâches de production chez Audi via le partenariat FLUX-mimic.

Ce qui a été lancé, et ce qui ne l’est pas encore

Flux 3 Video est arrivé en premier : texte vers vidéo, image vers vidéo avec images clés, et poursuite d’un clip existant, le tout jusqu’à 20 secondes avec un audio synchronisé, auxquels s’ajoute la retouche sur place avec Flux Video Edit. Depuis, Black Forest Labs a lancé Flux 3 Action, un modèle de robotique à poids ouverts, et Flux 3 Image pour la génération et l’édition d’images. Restent à venir la version Flux 3 Dev à poids ouverts et la génération vidéo à partir de références combinées d’image, de vidéo et d’audio. Les dates de sortie figurent dans les notes de version de Black Forest Labs.

Flux 3 sur Morphic

Flux 3 tourne sur Morphic, aux côtés de modèles vidéo comme Veo, Kling, Seedance et Vidu, et du reste de la famille Flux pour l’image. Un même prompt peut partir vers deux modèles sur un seul Canvas : c’est le moyen le plus rapide de savoir si Flux 3 est le bon choix pour un plan donné, plutôt que de s’en remettre à un tableau comparatif publié au lancement.

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$19/ mois
facturé comme $0 par an

2400 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3625 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6350 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Max

$170/ mois
facturé comme $0 par an

24650 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Qu’est-ce que Flux 3 ?
Flux 3 est le modèle du monde multimodal de Black Forest Labs, annoncé le 23 juillet 2026. Il apprend conjointement à partir d’images, de vidéo et d’audio dans une seule architecture unifiée. Un même modèle peut donc générer une vidéo avec un son synchronisé, tout en gardant une compréhension cohérente de l’aspect, du mouvement et du son du monde réel. La génération vidéo est passée en disponibilité générale le 4 août 2026.
Flux 3 est-il un modèle d’image ou un modèle vidéo ?
C’est un seul modèle multimodal, lancé par étapes. Black Forest Labs a consacré plus de 95 % de son calcul d’entraînement total à la prédiction vidéo, et Flux 3 Video est arrivé en premier, le 4 août 2026. Flux 3 Action pour la robotique a suivi le 23 septembre, puis Flux 3 Image le 1er octobre ; une version Flux 3 Dev à poids ouverts reste à venir.
Quelle est la durée des vidéos Flux 3 ?
Flux 3 génère de 5 à 20 secondes en une seule passe, en secondes entières, ou il peut choisir une durée adaptée au prompt. Pour des formats plus longs, la poursuite prolonge un clip depuis ses dernières images, et une même génération peut enchaîner plusieurs plans et angles de caméra avec des coupes franches entre eux.
Flux 3 génère-t-il de l’audio, y compris en français ?
Oui, et c’est activé par défaut. Chaque clip est généré avec un audio synchronisé dans la même passe, si bien qu’effets, ambiance et dialogue sont déjà liés à ce qui se passe à l’écran. Le son suit les événements physiques : un impact colle au choc. La parole et le texte à l’écran fonctionnent dans plusieurs langues, français compris, avec un lip-sync qui suit les mots prononcés. Il reste possible de couper l’audio pour obtenir un clip muet.
Quels modes vidéo Flux 3 prend-il en charge ?
Trois modes. Le texte vers vidéo fonctionne à partir d’un simple prompt. L’image vers vidéo part de visuels fixes, en image d’ouverture ou en jusqu’à dix images clés épinglées à des instants précis. La poursuite de vidéo prolonge un clip source de 15 secondes maximum depuis ses dernières images. La retouche d’un clip sur place passe par Flux Video Edit, un modèle distinct de Black Forest Labs, et les références combinées d’image, de vidéo et d’audio restent à venir.
Quelle résolution et quels formats d’image Flux 3 prend-il en charge ?
Sur Morphic, Flux 3 rend en HD 720p par défaut ou en Full HD 1080p. Depuis le 10 septembre 2026, l’API de Black Forest Labs rend aussi en 2K et en 4K. Sept formats sont pris en charge : 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 et 9:16, si bien qu’un seul modèle couvre aussi bien un cadre cinémascope qu’un format vertical pour mobile.
En quoi Flux 3 diffère-t-il de Flux 2 ?
Flux 2 Pro est un modèle d’image. Flux 3 est un modèle du monde multimodal qui ajoute la vidéo à audio natif, un mouvement qui suit une vraie physique et une seule représentation partagée entre image, vidéo et audio. C’est le premier modèle vidéo de Black Forest Labs, là où la lignée Flux 2 se concentrait sur les images fixes.
Flux 3 est-il meilleur que les autres modèles vidéo ?
Dans l’évaluation humaine interne de Black Forest Labs au lancement, Flux 3 arrivait en tête en texte vers vidéo face à tous les modèles testés, et faisait jeu égal avec Seedance 2.0 tout en devançant le reste en image vers vidéo. Ce sont des résultats internes à l’éditeur : à prendre comme un signal fort plutôt que comme un benchmark indépendant.
Flux 3 est-il open source ?
En partie seulement. Flux 3 Action, un modèle de robotique de 7 milliards de paramètres, est sorti avec ses poids ouverts le 23 septembre 2026. Flux 3 Dev, le socle multimodal à poids ouverts pour l’image, la vidéo et l’audio, est annoncé mais pas encore disponible, et Flux 3 Image est proposé sous une licence commerciale de poids, avec des poids ouverts promis pour plus tard.
Comment utiliser Flux 3 sur Morphic ?
Flux 3 tourne dès aujourd’hui sur Morphic. Ouvrez le Canvas, décrivez le plan en ajoutant une ligne sur le son attendu, puis générez. Morphic fait tourner Flux 3 aux côtés de modèles comme Veo, Kling et Seedance : vous pouvez envoyer le même prompt à deux d’entre eux et garder la prise qui rend le mieux.