Flux 3
par Black Forest Labs
Le modèle du monde de Black Forest Labs pour l’image, la vidéo et l’audio : un son qui colle enfin à l’action.

Fonctionnalités clés
Spécifications techniques
5–20 s
En secondes entières en une seule passe, ou durée automatique selon le prompt
720p / 1080p
HD par défaut, Full HD via l’upscaling
T2V·I2V·V2V
Texte, image et images clés, ou poursuite d’un clip existant
Natif
Audio synchronisé généré avec chaque clip, activé par défaut
Cas d'utilisation
Vidéo et son en une seule passe
Un prompt renvoie un clip et son audio ensemble. Un effet ou une réplique est déjà calé sur l’action, sans passe de post-production.
Séquences multi-plans
Enchaînez plusieurs angles en une génération, ou prolongez un clip par poursuite. Un même personnage reste reconnaissable sur chaque coupe.
Film produit et de marque
Matières, poids et reflets restent fidèles quand la caméra bouge. Un produit se lit comme filmé, jamais comme simulé.
Vidéo localisée
Un dialogue multilingue et un texte à l’écran fidèle permettent de sortir une même scène en plusieurs langues, sans repasse de titrage ni de voix.
Transitions chorégraphiées
Épinglez les poses et les cadrages qu’un plan doit traverser. Le modèle construit le mouvement entre chaque repère comme un seul plan continu.
Explications avec une vraie physique
Gravité, collisions et mouvement suivent des règles réelles. Une vidéo scientifique ou pédagogique reste juste tout en restant soignée.
Exemples de prompts

Clip fidèle à la physique
Une tasse en céramique glisse d’un plan de travail en marbre et se brise au sol, les éclats se dispersent, un bruit d’impact net en synchronisation
Edit prompt
Séquence multi-plans
Même coursier en veste rouge : un plan où il se faufile dans un marché, le suivant où il arrive devant une porte éclairée au crépuscule
Edit prompt
Carton-titre localisé
Plan phare d’une marque de café, la vapeur monte d’un service tout juste tiré, le titre à l’écran affiche « Freshly Roasted » en gras net
Edit prompt
Du caméscope au cinéma
Images de caméscope à l’épaule lors d’un anniversaire, puis la même scène reprise en plan large chaleureux et cinématographique, avec l’ambiance de la pièce
Edit prompt
Poursuite de clip
Elle se détourne de la fenêtre et sort dans une rue de Tokyo baignée de pluie, la caméra la suit sans coupe
Edit prompt
Produit en studio
Sneaker avant-gardiste qui tourne sur un socle en titane, lumière clé dure, reflets métalliques fidèles, léger ronronnement mécanique
Edit promptAperçu
Flux 3 est le modèle du monde multimodal de Black Forest Labs, annoncé le 23 juillet 2026 ; sa génération vidéo est passée en disponibilité générale le 4 août 2026. Il apprend conjointement à partir d’images, de vidéo et d’audio au sein d’une seule architecture unifiée. Un même modèle peut donc restituer un plan en mouvement et le son qui lui appartient, en gardant une compréhension cohérente de l’aspect, du mouvement et du son du monde.
Ce que Flux 3 fait différemment
La plupart des générateurs traitent chaque modalité comme un problème séparé. Flux 3, lui, traite l’image, la vidéo et l’audio comme des indices sur une même réalité. Le tout est entraîné ensemble selon l’approche Self-Flow de Black Forest Labs, avec plus de 95 % du calcul d’entraînement total consacré à la prédiction vidéo. Le résultat se voit dans la constance physique : le son colle à l’impact, le mouvement obéit à la masse, et un sujet garde son identité d’un plan à l’autre. C’est cette même compréhension du monde, précise et cohérente, qui parle à un public français habitué à juger la qualité d’image et le soin du détail avant tout le reste. Elle permet aussi au socle de s’étendre à la prédiction d’action pour la robotique, déjà testée sur de vraies tâches de production chez Audi via le partenariat FLUX-mimic.
Ce qui a été lancé, et ce qui ne l’est pas encore
Flux 3 Video est la partie en disponibilité générale : texte vers vidéo, image vers vidéo avec images clés, et poursuite d’un clip existant, le tout jusqu’à 20 secondes avec un audio synchronisé. Black Forest Labs a par ailleurs annoncé Flux 3 Image pour la génération et l’édition d’images, Flux 3 Action pour la robotique, une version Flux 3 Dev à poids ouverts, ainsi que l’édition vidéo et des références combinées d’image, de vidéo et d’audio. Ces briques restent sur la feuille de route : elles ne sont pas encore entre vos mains.
Flux 3 sur Morphic
Flux 3 tourne sur Morphic, aux côtés de modèles vidéo comme Veo, Kling, Seedance et Vidu, et du reste de la famille Flux pour l’image. Un même prompt peut partir vers deux modèles sur un seul Canvas : c’est le moyen le plus rapide de savoir si Flux 3 est le bon choix pour un plan donné, plutôt que de s’en remettre à un tableau comparatif publié au lancement.
Tarifs simples
Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.
Basic
1100 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Standard
3625 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Pro
6350 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Pro Max
24650 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Enterprise
Pour des limites plus élevées
Personnalisé
conditions de tarification et de facturation

Free
Pour expérimenter
$0
gratuit pour toujours
Questions fréquentes
ChatGPT Images 2.5
OpenAI
Le modèle d'image d'OpenAI, sorti en septembre 2026. Plus de détail, des retouches ciblées, plus de vitesse.
Lyria 3.5
Google DeepMind
Le meilleur modèle musical de Google. Des chansons entières, voix et paroles.
MiniMax H3 Max Turbo
fal.ai
Le palier rapide du H3 signé fal. Deux fois plus vite, rendu quasi égal.
Inworld TTS 2
Inworld
95 voix, plus de 100 langues. La voix part en moins d’une seconde.