Fonctionnalités et capacités de Flux 3
Flux 3 est le modèle de fondation multimodal de Black Forest Labs. Plutôt qu'un modèle distinct par type de sortie, il apprend l'image, la vidéo et l'audio ensemble. Un seul prompt renvoie donc un plan en mouvement et sonore, qui se comporte comme le ferait le monde réel.
Black Forest Labs a annoncé Flux 3 le 23 juillet 2026, puis a rendu la génération vidéo disponible pour tous le 4 août 2026. Les clips durent de 5 à 20 secondes en HD 720p ou en Full HD 1080p, dans l'un des sept formats d'image proposés (de 21:9 à 9:16), avec un audio généré par défaut en même temps que l'image. Tout ce qui suit reprend le guide de prompting publié par Black Forest Labs.
| Fonctionnalité | Ce qu'elle fait | Idéale pour |
|---|---|---|
| Vidéo à audio natif | Génère le clip et son son synchronisé en une seule passe | Scènes sonores, dialogue, effets |
| Physique du monde réel | Le mouvement obéit à la masse et à l'élan ; le son colle à l'impact | Film produit, action, explications |
| Images clés | Interpole un plan à travers jusqu'à 10 images fixes épinglées | Transitions maîtrisées, storyboards |
| Suite de clip | Prolonge un clip existant depuis ses dernières images | Scènes plus longues, sauver une bonne prise |
| Dialogue multilingue | Parle plus de 13 langues à l'écran, synchronisation labiale incluse | Vidéo localisée, présentateurs, publicités |
| Génération multi-plans | Bloque plusieurs angles dans une seule génération | Courts métrages, publicités, révélations |
| Mode brouillon | Aperçu rapide, puis un rendu final qui lui correspond | Explorer des pistes avant de valider |
Vidéo à audio natif
Le point fort, c'est que l'image et le son arrivent ensemble. Flux 3 génère chaque clip avec un audio natif synchronisé dans la même passe. Un impact, un pas ou une réplique parlée sont donc déjà liés à l'action, au lieu d'être ajoutés après coup. Nommez le son que vous voulez dans le prompt, et réglez une langue dès que la scène comporte du dialogue.
Physique du monde réel
Flux 3 apprend le mouvement, la masse et le son comme un seul système. Le poids, l'élan et les collisions suivent donc des règles réelles, et les matières gardent leur aspect quand la caméra bouge. Décrivez comment le mouvement évolue au fil du plan : la physique se lira comme filmée plutôt que comme flottante.
Images clés et suite de clip
Deux façons de maîtriser le mouvement. Épinglez des images fixes comme images clés, et Flux 3 interpole un plan continu à travers elles : une seule image fixe le cadre d'ouverture, deux fixent un début et une fin, et jusqu'à dix épinglées à des repères temporels transforment le clip en storyboard que le modèle doit suivre dans l'ordre. Ou bien confiez-lui des images que vous possédez déjà, et la suite de clip reprend depuis les dernières images, en conservant l'élan, le comportement de caméra et la bande son sans coupure visible.
Dialogue multilingue et typographie
Citez la réplique, nommez la langue, décrivez le ton, et Flux 3 la parle à l'écran avec un accent et une synchronisation labiale qui suivent. Le français fait partie des langues prises en charge, aux côtés de l'anglais et de ses variantes, du chinois, de l'espagnol, de l'allemand, du japonais, du portugais, du russe, de l'italien, de l'indonésien, du turc, de l'hindi et du pendjabi. Le texte à l'écran fait partie de la scène et tient la route pendant que la caméra bouge, si bien que titres et enseignes survivent au mouvement.
Cas d'usage de Flux 3
Scènes à audio natif
Un clip revient avec son son déjà synchronisé. Un effet ou une réplique parlée tombe donc avec l'action, au lieu d'une prise muette à corriger plus tard.
Film produit et de marque
Reflets, poids et matières restent fidèles quand la caméra bouge. Un versement, une rotation ou une chute se lisent comme filmés plutôt que simulés.
Séquences multi-plans
Bloquez plusieurs angles dans une seule génération, ou prolongez un clip avec la suite de clip, en tenant un même personnage sur chaque coupe.

Vidéo localisée
Le dialogue multilingue, français compris, et un texte à l'écran fidèle permettent de sortir une même scène en plusieurs langues sans repasser par le titrage ou la voix.

Brouillon, puis validation
Prévisualisez une piste vite et à moindre coût, jugez-la, puis rendez celle que vous avez retenue en qualité finale, avec les mêmes sujets, le même cadrage et le même mouvement.

Vidéos explicatives avec une vraie physique
Gravité, collisions et mouvement suivent des règles réelles, si bien qu'une vidéo explicative reste juste tout en restant nette.
Comment prompter Flux 3
Dirigez une scène, ne décrivez pas un tas d'objets. Black Forest Labs recommande de nommer ce qui se passe, comment les sujets bougent, comment la caméra se comporte, et ce que le plan doit donner à entendre, avec des noms et des verbes concrets qu'une caméra pourrait réellement voir. Des adjectifs vagues laissent le résultat au hasard.
Choisir un format de prompt
Flux 3 en accepte quatre, et la longueur n'est pas l'objectif. Commencez court pour explorer, puis n'allongez que là où vous avez besoin de contrôle.
| Format | À utiliser quand | Exemple |
|---|---|---|
| Phrase courte | Vous explorez vite, un seul sujet clair, place au hasard | Un renard roux bondissant dans la neige fraîche, téléobjectif |
| Ligne en langage naturel | Le réglage par défaut pour un plan unique | Un travelling bas sur un renard filant dans les sous-bois humides à l'aube |
| Champs étiquetés | Ajuster un seul levier sans toucher au reste | Plan caméra : large, angle bas. Sujet : un cavalier traverse une rivière |
| Intervalles | L'action doit tomber pile sur un repère | 0,0–1,5 s plan large fixe d'un port. 1,5–3,0 s un lent travelling avant commence |
La ligne en langage naturel a une forme fiable à retenir : [caméra] plan sur [sujet] qui [action] dans [décor], puis les détails visuels et de mouvement à l'appui. Gardez des repères d'intervalles atteignables, deux ou trois pour un clip de cinq secondes, et marquez une coupe franche à chaque changement d'angle.
Construire un CASTLE pour le travail multi-plans
Quand un style et une histoire doivent tenir sur plusieurs plans, Black Forest Labs documente un schéma en six parties. Les six parties forment CASTLE (« château » en anglais), notre repère pour ce schéma plutôt qu'un terme officiel de Black Forest Labs, et c'est le moyen le plus rapide de se souvenir de ce qui manque à un prompt trop long.
| Élément | Ce qui va dedans | |
|---|---|---|
| C | Contexte | Une ligne qui couvre toute la séquence : qui, où, et l'arc narratif |
| A | Audio | Par plan : l'ambiance sonore, rendue en synchronisation avec l'image |
| S | Sujet | Repris mot pour mot d'un plan à l'autre, pour que l'identité tienne |
| T | Trame | Par plan, horodatée : le mouvement de caméra et l'action du sujet |
| L | Look | La finition globale : niveau de réalisme, palette de référence et grain |
| E | Environnement | Par plan : décor, qualité de lumière et profondeur de champ |
Remplissez-les dans l'ordre qui vous convient, puis assemblez le prompt dans l'ordre documenté par Black Forest Labs : contexte, environnement, sujet, trame, audio, look. Garder la description du sujet identique mot pour mot d'un plan à l'autre est ce qui empêche un personnage de dériver sur une coupe. C'est l'astuce de continuité la moins coûteuse du guide.
Nommer le son que vous voulez
L'audio est généré avec l'image, si bien qu'une scène qui suggère du son donne plus de matière au modèle qu'une scène abstraite. Pas, impacts, pluie, moteurs et foule se lisent tous clairement. Il y a quatre couches, et vous n'avez rarement besoin des quatre.
| Couche | Ce qu'il faut décrire | Exemple |
|---|---|---|
| Parole | Qui parle, les mots exacts entre guillemets, et comment | Le mécanicien dit : « Essayez maintenant. » Ton neutre, direct |
| Ambiance | Le son du lieu | Pluie contre les fenêtres, brouhaha bas du restaurant |
| Effets | Sons liés à des actions visibles | Une tasse en céramique cliquette contre la soucoupe |
| Musique | Style, tempo et place dans le mixage | Un piano épuré sous la scène, bas dans le mixage |
Deux réflexes font l'essentiel du travail. Nommez une source de son plutôt que de demander le silence, car « bruit de fond calme » peut virer au vide sonore, alors que « pluie contre la fenêtre » donne au modèle quelque chose à rendre. Et pour une réplique parlée, précisez si le locuteur est à l'écran ou s'il s'agit d'une voix off, sinon une réplique entre guillemets peut être traitée comme un texte à afficher dans le cadre.
Diriger la voix, pas l'ambiance
« Professionnelle, chaleureuse et engageante » produit à chaque fois la même diction d'animateur bien léchée. Des repères concrets marchent mieux : l'âge et l'accent quand ils comptent, le registre, la façon dont la voix a été enregistrée, la diction, et un garde-fou du type « pas de ton d'animateur ». Lisez ensuite la réplique à voix haute avant de générer : la direction vocale ne rattrapera jamais un texte figé.
Erreurs courantes
- Décrire une image fixe. Un modèle vidéo a besoin de mouvement dans le temps, pas d'une photo mise en mots.
- Oublier le son. L'audio se génère par défaut, alors nommez l'effet, l'ambiance ou la réplique que vous voulez.
- Empiler les termes de caméra. « Travelling bas » est clair ; « orbite aérienne portée à l'épaule avec travelling avant » ne l'est pas.
- Écrire des négations. Les modèles Flux ne prennent pas en charge les prompts négatifs : formulez ce que vous voulez, pas ce que vous ne voulez pas.
- Surcharger un clip court. Plusieurs locuteurs, un long texte et plusieurs temps forts en cinq secondes couperont le dernier mot. Raccourcissez la réplique ou allongez la durée.
Pour la liste complète des capacités et les spécifications, consultez la page du modèle Flux 3.
