Flux 3
von Black Forest Labs
Das Weltmodell von Black Forest Labs für Bild, Video und Audio – mit Ton, der zur Handlung passt.

Hauptfunktionen
Technische Spezifikationen
5–20s
Ganze Sekunden in einem Durchgang oder automatisch passend zum Prompt
720p / 1080p
HD als Standard, Full HD per Upscaling
T2V·I2V·V2V
Text, Bild und Keyframes oder Fortsetzung eines bestehenden Clips
Nativ
Synchroner Ton wird bei jedem Clip mitgeneriert, standardmäßig aktiv
Anwendungsfälle
Video mit Ton in einem Durchgang
Ein Prompt liefert Clip und Ton gemeinsam. Ein Effekt oder eine Zeile sitzt sofort im Bild, statt später nachbearbeitet zu werden.
Sequenzen mit mehreren Einstellungen
Planen Sie mehrere Kamerawinkel in einer Generierung, oder verlängern Sie einen Clip per Fortsetzung. Ein Charakter bleibt über jeden Schnitt hinweg gleich.
Produkt- und Markenfilm
Materialien, Gewicht und Reflexionen bleiben stimmig, während die Kamera sich bewegt. So wirkt ein Produkt wie gefilmt statt simuliert – ideal für Agenturen und Markenteams, die belastbare Produktfilme brauchen.
Lokalisiertes Video
Mehrsprachiger Dialog und präziser Bildschirmtext lassen eine Szene auf Deutsch und in weiteren Sprachen ausliefern, ohne separaten Titel- oder Sprachdurchgang.
Choreografierte Übergänge
Legen Sie die Posen und Bildkompositionen fest, die eine Einstellung durchlaufen muss. Das Modell baut die Bewegung dazwischen als eine durchgehende Aufnahme.
Erklärvideos mit echter Physik
Schwerkraft, Kollisionen und Bewegung folgen echten Regeln. Wissenschafts- und Erklärinhalte bleiben dadurch akkurat und trotzdem übersichtlich.
Prompt-Beispiele

Physikalisch korrekter Clip
Eine Keramiktasse rutscht von einer Marmortheke, zerspringt am Boden, Scherben fliegen auseinander – scharfer Aufprallton exakt im Takt
Edit prompt
Mehrteilige Sequenz
Derselbe Kurier in roter Jacke: eine Einstellung schlängelt sich durch einen Markt, die nächste erreicht in der Dämmerung eine erleuchtete Tür
Edit prompt
Lokalisierte Titelkarte
Hero-Shot einer Kaffeemarke, Dampf steigt vom frischen Aufguss auf, Bildschirmtitel „Freshly Roasted“ in klarer, fetter Schrift
Edit prompt
Camcorder zu Kino
Wackelige Camcorder-Aufnahmen einer Geburtstagsfeier, dann dieselbe Szene als warme, kinoreife Totale mit Raumton
Edit prompt
Clip-Fortsetzung
Sie dreht sich vom Fenster weg und tritt hinaus auf die regennasse Straße in Tokio, die Kamera folgt ohne Schnitt
Edit prompt
Studioprodukt
Avantgardistischer Sneaker rotiert auf einem Titansockel, hartes Führungslicht, präzise Metallreflexionen, leises mechanisches Summen
Edit promptÜberblick
Flux 3 ist das multimodale Foundation-Modell von Black Forest Labs, vorgestellt am 23. Juli 2026; die Videogenerierung ist seit dem 4. August 2026 allgemein verfügbar. Das Modell lernt gemeinsam aus Bildern, Video und Audio in einer einzigen Architektur. So kann ein Modell eine bewegte Einstellung und den passenden Ton dazu erzeugen und dabei ein einheitliches Gespür dafür behalten, wie die Welt aussieht, sich bewegt und klingt.
Was Flux 3 anders macht
Die meisten Generatoren behandeln jede Modalität getrennt. Flux 3 versteht Bild, Video und Audio als Belege für dieselbe zugrunde liegende Realität. Trainiert wurde das mit dem Self-Flow-Ansatz von Black Forest Labs, wobei über 95 % der gesamten Trainingsleistung in die Videovorhersage floss. Der Effekt zeigt sich in physischer Konsistenz: Der Ton trifft den Aufprall, die Bewegung folgt der Masse, und ein Motiv behält seine Identität von einer Einstellung zur nächsten. Dasselbe Weltverständnis erweitert das Rückgrat auf Handlungsvorhersage für die Robotik – getestet an realen Produktionsaufgaben bei Audi über die FLUX-mimic-Partnerschaft.
Was bereits verfügbar ist – und was noch nicht
Flux 3 Video ist der Teil, der allgemein verfügbar ist: Text-to-Video, Image-to-Video mit Keyframes und die Fortsetzung bestehender Clips, jeweils bis zu 20 Sekunden mit synchronem Ton. Black Forest Labs hat außerdem Flux 3 Image für Bildgenerierung und -bearbeitung, Flux 3 Action für die Robotik sowie ein offenes Flux 3 Dev angekündigt, dazu Videobearbeitung und kombinierte Bild-, Video- und Audioreferenzen. Das steht auf der Roadmap, ist aber noch nicht nutzbar.
Flux 3 auf Morphic
Flux 3 läuft auf Morphic, neben Videomodellen wie Veo, Kling, Seedance und Vidu sowie der übrigen Flux-Familie für Bilder. Ein Prompt lässt sich auf derselben Canvas an zwei Modelle schicken – für Agenturen und Studios in Deutschland der schnellste Weg herauszufinden, ob Flux 3 für eine bestimmte Einstellung die richtige Wahl ist, statt sich auf einen Launch-Vergleich zu verlassen.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
2400 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Inworld TTS 2
Inworld
Eine Stimme, über 100 Sprachen. 95 Stimmen, erster Ton in Echtzeit.