Flux 3 : guide complet, fonctionnalités, prompts et vidéo à audio natif

Flux 3 : guide complet, fonctionnalités, prompts et vidéo à audio natif

Le guide complet de Flux 3 : vidéo à audio natif jusqu'à 20 secondes, les quatre formats de prompt, le schéma CASTLE, les images clés, la suite de clip et des exemples travaillés.

Fonctionnalités et capacités de Flux 3

Flux 3 est le modèle de fondation multimodal de Black Forest Labs. Plutôt qu'un modèle distinct par type de sortie, il apprend l'image, la vidéo et l'audio ensemble. Un seul prompt renvoie donc un plan en mouvement et sonore, qui se comporte comme le ferait le monde réel.

Black Forest Labs a annoncé Flux 3 le 23 juillet 2026, puis a rendu la génération vidéo disponible pour tous le 4 août 2026. Les clips durent de 5 à 20 secondes en HD 720p ou en Full HD 1080p, dans l'un des sept formats d'image proposés (de 21:9 à 9:16), avec un audio généré par défaut en même temps que l'image. Tout ce qui suit reprend le guide de prompting publié par Black Forest Labs.

FonctionnalitéCe qu'elle faitIdéale pour
Vidéo à audio natifGénère le clip et son son synchronisé en une seule passeScènes sonores, dialogue, effets
Physique du monde réelLe mouvement obéit à la masse et à l'élan ; le son colle à l'impactFilm produit, action, explications
Images clésInterpole un plan à travers jusqu'à 10 images fixes épingléesTransitions maîtrisées, storyboards
Suite de clipProlonge un clip existant depuis ses dernières imagesScènes plus longues, sauver une bonne prise
Dialogue multilingueParle plus de 13 langues à l'écran, synchronisation labiale incluseVidéo localisée, présentateurs, publicités
Génération multi-plansBloque plusieurs angles dans une seule générationCourts métrages, publicités, révélations
Mode brouillonAperçu rapide, puis un rendu final qui lui correspondExplorer des pistes avant de valider

Vidéo à audio natif

Le point fort, c'est que l'image et le son arrivent ensemble. Flux 3 génère chaque clip avec un audio natif synchronisé dans la même passe. Un impact, un pas ou une réplique parlée sont donc déjà liés à l'action, au lieu d'être ajoutés après coup. Nommez le son que vous voulez dans le prompt, et réglez une langue dès que la scène comporte du dialogue.

Physique du monde réel

Flux 3 apprend le mouvement, la masse et le son comme un seul système. Le poids, l'élan et les collisions suivent donc des règles réelles, et les matières gardent leur aspect quand la caméra bouge. Décrivez comment le mouvement évolue au fil du plan : la physique se lira comme filmée plutôt que comme flottante.

Images clés et suite de clip

Deux façons de maîtriser le mouvement. Épinglez des images fixes comme images clés, et Flux 3 interpole un plan continu à travers elles : une seule image fixe le cadre d'ouverture, deux fixent un début et une fin, et jusqu'à dix épinglées à des repères temporels transforment le clip en storyboard que le modèle doit suivre dans l'ordre. Ou bien confiez-lui des images que vous possédez déjà, et la suite de clip reprend depuis les dernières images, en conservant l'élan, le comportement de caméra et la bande son sans coupure visible.

Dialogue multilingue et typographie

Citez la réplique, nommez la langue, décrivez le ton, et Flux 3 la parle à l'écran avec un accent et une synchronisation labiale qui suivent. Le français fait partie des langues prises en charge, aux côtés de l'anglais et de ses variantes, du chinois, de l'espagnol, de l'allemand, du japonais, du portugais, du russe, de l'italien, de l'indonésien, du turc, de l'hindi et du pendjabi. Le texte à l'écran fait partie de la scène et tient la route pendant que la caméra bouge, si bien que titres et enseignes survivent au mouvement.

Cas d'usage de Flux 3

Scènes à audio natif

Un clip revient avec son son déjà synchronisé. Un effet ou une réplique parlée tombe donc avec l'action, au lieu d'une prise muette à corriger plus tard.

Film produit et de marque

Reflets, poids et matières restent fidèles quand la caméra bouge. Un versement, une rotation ou une chute se lisent comme filmés plutôt que simulés.

Séquences multi-plans

Bloquez plusieurs angles dans une seule génération, ou prolongez un clip avec la suite de clip, en tenant un même personnage sur chaque coupe.

La même femme rousse tenue constante à travers trois scènes

Vidéo localisée

Le dialogue multilingue, français compris, et un texte à l'écran fidèle permettent de sortir une même scène en plusieurs langues sans repasser par le titrage ou la voix.

Un bandeau télé affichant la même phrase en anglais et en coréen

Brouillon, puis validation

Prévisualisez une piste vite et à moindre coût, jugez-la, puis rendez celle que vous avez retenue en qualité finale, avec les mêmes sujets, le même cadrage et le même mouvement.

Un aperçu brouillon rapide à côté du rendu final du même plan

Vidéos explicatives avec une vraie physique

Gravité, collisions et mouvement suivent des règles réelles, si bien qu'une vidéo explicative reste juste tout en restant nette.

Comment prompter Flux 3

Dirigez une scène, ne décrivez pas un tas d'objets. Black Forest Labs recommande de nommer ce qui se passe, comment les sujets bougent, comment la caméra se comporte, et ce que le plan doit donner à entendre, avec des noms et des verbes concrets qu'une caméra pourrait réellement voir. Des adjectifs vagues laissent le résultat au hasard.

Choisir un format de prompt

Flux 3 en accepte quatre, et la longueur n'est pas l'objectif. Commencez court pour explorer, puis n'allongez que là où vous avez besoin de contrôle.

FormatÀ utiliser quandExemple
Phrase courteVous explorez vite, un seul sujet clair, place au hasardUn renard roux bondissant dans la neige fraîche, téléobjectif
Ligne en langage naturelLe réglage par défaut pour un plan uniqueUn travelling bas sur un renard filant dans les sous-bois humides à l'aube
Champs étiquetésAjuster un seul levier sans toucher au restePlan caméra : large, angle bas. Sujet : un cavalier traverse une rivière
IntervallesL'action doit tomber pile sur un repère0,0–1,5 s plan large fixe d'un port. 1,5–3,0 s un lent travelling avant commence

La ligne en langage naturel a une forme fiable à retenir : [caméra] plan sur [sujet] qui [action] dans [décor], puis les détails visuels et de mouvement à l'appui. Gardez des repères d'intervalles atteignables, deux ou trois pour un clip de cinq secondes, et marquez une coupe franche à chaque changement d'angle.

Construire un CASTLE pour le travail multi-plans

Quand un style et une histoire doivent tenir sur plusieurs plans, Black Forest Labs documente un schéma en six parties. Les six parties forment CASTLE (« château » en anglais), notre repère pour ce schéma plutôt qu'un terme officiel de Black Forest Labs, et c'est le moyen le plus rapide de se souvenir de ce qui manque à un prompt trop long.

ÉlémentCe qui va dedans
CContexteUne ligne qui couvre toute la séquence : qui, où, et l'arc narratif
AAudioPar plan : l'ambiance sonore, rendue en synchronisation avec l'image
SSujetRepris mot pour mot d'un plan à l'autre, pour que l'identité tienne
TTramePar plan, horodatée : le mouvement de caméra et l'action du sujet
LLookLa finition globale : niveau de réalisme, palette de référence et grain
EEnvironnementPar plan : décor, qualité de lumière et profondeur de champ

Remplissez-les dans l'ordre qui vous convient, puis assemblez le prompt dans l'ordre documenté par Black Forest Labs : contexte, environnement, sujet, trame, audio, look. Garder la description du sujet identique mot pour mot d'un plan à l'autre est ce qui empêche un personnage de dériver sur une coupe. C'est l'astuce de continuité la moins coûteuse du guide.

Nommer le son que vous voulez

L'audio est généré avec l'image, si bien qu'une scène qui suggère du son donne plus de matière au modèle qu'une scène abstraite. Pas, impacts, pluie, moteurs et foule se lisent tous clairement. Il y a quatre couches, et vous n'avez rarement besoin des quatre.

CoucheCe qu'il faut décrireExemple
ParoleQui parle, les mots exacts entre guillemets, et commentLe mécanicien dit : « Essayez maintenant. » Ton neutre, direct
AmbianceLe son du lieuPluie contre les fenêtres, brouhaha bas du restaurant
EffetsSons liés à des actions visiblesUne tasse en céramique cliquette contre la soucoupe
MusiqueStyle, tempo et place dans le mixageUn piano épuré sous la scène, bas dans le mixage

Deux réflexes font l'essentiel du travail. Nommez une source de son plutôt que de demander le silence, car « bruit de fond calme » peut virer au vide sonore, alors que « pluie contre la fenêtre » donne au modèle quelque chose à rendre. Et pour une réplique parlée, précisez si le locuteur est à l'écran ou s'il s'agit d'une voix off, sinon une réplique entre guillemets peut être traitée comme un texte à afficher dans le cadre.

Diriger la voix, pas l'ambiance

« Professionnelle, chaleureuse et engageante » produit à chaque fois la même diction d'animateur bien léchée. Des repères concrets marchent mieux : l'âge et l'accent quand ils comptent, le registre, la façon dont la voix a été enregistrée, la diction, et un garde-fou du type « pas de ton d'animateur ». Lisez ensuite la réplique à voix haute avant de générer : la direction vocale ne rattrapera jamais un texte figé.

Erreurs courantes

  • Décrire une image fixe. Un modèle vidéo a besoin de mouvement dans le temps, pas d'une photo mise en mots.
  • Oublier le son. L'audio se génère par défaut, alors nommez l'effet, l'ambiance ou la réplique que vous voulez.
  • Empiler les termes de caméra. « Travelling bas » est clair ; « orbite aérienne portée à l'épaule avec travelling avant » ne l'est pas.
  • Écrire des négations. Les modèles Flux ne prennent pas en charge les prompts négatifs : formulez ce que vous voulez, pas ce que vous ne voulez pas.
  • Surcharger un clip court. Plusieurs locuteurs, un long texte et plusieurs temps forts en cinq secondes couperont le dernier mot. Raccourcissez la réplique ou allongez la durée.

Pour la liste complète des capacités et les spécifications, consultez la page du modèle Flux 3.

Questions fréquentes

Comment écrire un bon prompt Flux 3 ?
Dirigez une scène plutôt que de décrire des objets. Nommez le sujet, ce qu'il fait, comment la caméra se comporte, le décor et la lumière, et une indication audio, avec des noms et des verbes concrets qu'une caméra pourrait voir. Comme Flux 3 génère le son avec l'image, précisez toujours ce que le plan doit donner à entendre.
Quels sont les quatre formats de prompt Flux 3 ?
Une phrase courte pour explorer vite, une ligne en langage naturel comme réglage par défaut, des champs étiquetés pour ajuster un seul levier à la fois, et le prompt par intervalles quand l'action doit tomber pile sur un repère. Commencez court, puis n'allongez que là où vous avez besoin de plus de contrôle.
Flux 3 génère-t-il de l'audio avec la vidéo ?
Oui, et c'est activé par défaut. Chaque clip revient avec un audio généré dans la même passe, si bien qu'un impact, des pas, une ambiance ou une réplique parlée sont déjà synchronisés à l'action. Nommez la source du son que vous voulez plutôt que de demander le silence, car une demande de calme peut virer au vide sonore.
Quelle durée peut atteindre une vidéo Flux 3 ?
Flux 3 génère de 5 à 20 secondes en une seule passe, en secondes entières, ou il peut choisir une durée adaptée au prompt. Pour des pièces plus longues, utilisez la suite de clip pour prolonger une vidéo à partir de ses dernières images, ou bloquez plusieurs plans dans une seule génération avec des coupes franches entre eux.
Comment garder un personnage constant dans Flux 3 ?
Reprenez la description du sujet mot pour mot dans chaque plan du prompt. Le schéma de Black Forest Labs traite cette description fixe comme ce qui tient l'identité à travers une coupe. Les images clés et la génération multi-plans font ensuite tenir ce visuel sur toute la séquence. Combiner des références image et vidéo est annoncé comme une prochaine étape.
Comment fonctionnent les images clés dans Flux 3 ?
Vous épinglez des images fixes et Flux 3 interpole un plan continu à travers elles. Une image fixe le cadre d'ouverture, deux fixent un début et une fin, et jusqu'à dix épinglées à des repères temporels deviennent un storyboard que le plan doit suivre dans l'ordre, le modèle comblant le mouvement entre les repères.
Flux 3 fonctionne-t-il en français ?
Oui. Le français fait partie des treize langues et plus que Flux 3 gère pour le dialogue parlé à l'écran, avec un accent et une synchronisation labiale adaptés. Nommez la langue dans le prompt et décrivez la réplique et le ton pour obtenir une voix française crédible.