Multimodal

Gemini Omni Flash 1.1

von Google DeepMind

Googles Videomodell: Die Änderung ist ein Satz.
Jetzt mit 4K und Szenen bis 40 Sekunden.

Gemini Omni Flash 1.1

Hauptfunktionen

Technische Spezifikationen

Gemini Omni

Zweite Omni-Flash-Fassung in Googles Omni-Reihe

5 Aufgaben

Text, Bild, Referenz, Bearbeitung und Verlängerung

3 bis 10 s

Pro Generierung; Verlängerungen reichen bis 40 Sekunden gesamt

Bis zu 4K

360p und 720p nativ, 1080p und 4K hochskaliert

10 + 3

Zehn Bilder plus drei Videoclips von je bis zu 3 Sekunden

Nativ

Dialog, Effekte und Musik im selben Durchgang

16:9, 9:16

Quer- und Hochformat in jeder Auflösung

SynthID

Unsichtbares Herkunftszeichen in jedem erzeugten Clip

Anwendungsfälle

Geteiltes Bild derselben Straßencafé-Szene, links fotorealistisch, rechts im Anime-Stil

Änderungen per Satz

Clip übergeben, Änderung nennen: anderes Wetter, Anime-Look, neuer Schriftzug. Der Rest des Bildes bleibt, wie er gedreht wurde.

Eine Frau spricht mitten im Satz in die Kamera, weiches Fensterlicht

Figuren, die sprechen

Sie schreiben die Zeile, die Figur spricht sie lippensynchron. Die Stimme übersteht jeden Schnitt und jede weitere Bearbeitung.

Referenzkarten von Flakon, Model und Schauplatz neben dem fertigen Bild des Parfüm-Spots

Spots nah an der Referenz

Produktfoto, Porträt und ein Drei-Sekunden-Clip der Bewegung ergeben einen Spot, in dem das Produkt bleibt, was es ist.

Vierteiliger Filmstreifen mit demselben Radfahrer in einer Bäckergasse, am Hafen, am Leuchtturm und auf der Küstenstraße

Szenen bis 40 Sekunden

Erst den Auftakt erzeugen, dann in Zehn-Sekunden-Schritten auf 40 Sekunden verlängern. Besetzung, Ort und Musik bleiben.

Eine kinetische Skulptur aus Dominosteinen, die eine Stahlkugel auf eine geschwungene Holzbahn stoßen

Erklärvideos mit Physik

Schwerkraft, Flüssigkeiten und Stöße folgen realen Regeln. Geminis Wissen aus Wissenschaft und Geschichte hält Details korrekt.

Interviewbild eines Fischers am nebligen Hafen, mit einer Bauchbinde mit der Zeile THE COAST ROAD

Titel direkt im Bild

Text im Bild kommt lesbar zurück, von der Bauchbinde bis zum Ladenschild. Eine Folgeanweisung schreibt ihn bei Bedarf um.

Prompt-Beispiele

Nachtmarkt

Regennasser Nachtmarkt, rufende Händler, zischende Woks

Edit prompt

Getaktete Schnitte

Alle zwei Sekunden Schnitt auf ein neues Dach zur goldenen Stunde

Edit prompt

Text im Bild

Ein Imbissschild flackert Buchstabe für Buchstabe an: OPEN ALL NIGHT

Edit prompt

Eine Einstellung

Kugelbahn durch eine sonnige Werkstatt, eine einzige Einstellung

Edit prompt

Gesprochene Zeile

Eine Bergsteigerin flüstert den Gipfelsatz in den Wind

Edit prompt

Ton führt das Bild

Nahaufnahme Filterkaffee, jeder Tropfen und jedes Zischen hörbar

Edit prompt

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

1100 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3625 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6350 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24650 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Gemini Omni Flash 1.1?
Gemini Omni Flash 1.1 ist die zweite Fassung von Googles multimodalem Videomodell, erschienen Ende August 2026. Es erzeugt Video mit synchronem nativem Ton aus Text, Bildern und Videoreferenzen. Bestehendes Material bearbeitet und verlängert es über Anweisungen in normaler Sprache. Version 1.1 ergänzt die Auflösungsstufen bis 4K, funktionierende Videoreferenzen, die Interpolation vom ersten zum letzten Frame und Verlängerungen bis 40 Sekunden.
Was ist an Gemini Omni Flash 1.1 neu gegenüber der ersten Fassung?
Vier Dinge. Die Auflösung ist jetzt wählbar, von 360p bis 4K, während die erste Fassung fest bei 720p lag. Die Verlängerung ist da: zehn Sekunden pro Schritt bis 40 Sekunden, statt einer einzigen Generierung von zehn Sekunden. Videoreferenzen steuern das Ergebnis nun wirklich, bis zu drei Clips von je drei Sekunden. Und ein Standbild lässt sich mit einem Endbild kombinieren, sodass das Modell zwischen beiden interpoliert.
In welcher Auflösung gibt Gemini Omni Flash 1.1 aus?
Vier Optionen: 360p, 720p, 1080p und 4K, in 16:9 oder 9:16. Nativ rendert das Modell in 360p und 720p; 1080p und 4K entstehen als Hochskalierung dieser Generierung. In der Praxis heißt das: günstig in 360p entwerfen, die Aufnahme in 720p festzurren und die Lieferauflösung erst anfordern, wenn die Einstellung sitzt.
Wie lang kann ein Video mit Gemini Omni Flash 1.1 sein?
Eine einzelne Generierung läuft 3 bis 10 Sekunden, voreingestellt sind 8 Sekunden. Danach verlängert das Modell in Schritten von zehn Sekunden, bis insgesamt 40 Sekunden erreicht sind. Figuren, Bewegung und Ton laufen über jeden Anschluss weiter. Die Verlängerung hängt ausschließlich hinten an: Sie kann nichts voranstellen und die Mitte nicht dehnen.
Wie funktioniert die Videoverlängerung in Gemini Omni Flash 1.1?
Sie fordern die Fortsetzung in normaler Sprache an, etwa mit „extend this video“ oder „the scene continues as the camera pans across the mountains“. Das Modell liest die letzten zehn Sekunden als Kontext und erzeugt den nächsten Takt. Dabei passt es die Schlussframes leicht an, damit der Anschluss unauffällig bleibt. Das gilt für selbst erzeugte Clips und für hochgeladenes Material, solange der Upload höchstens zehn Sekunden lang ist.
Welche Referenzen nimmt Gemini Omni Flash 1.1 an?
Bis zu zehn Referenzbilder und bis zu drei Referenzvideos von je drei Sekunden, dazu den Textprompt. Bilder legen eine Figur, ein Produkt, einen Schauplatz oder einen Stil fest, und Tags im Prompt weisen jedem seine Rolle zu. Videoreferenzen tragen ein Aussehen oder eine Bewegung; ihr Ton wird ignoriert. Über mehrere vollständige Videos gleichzeitig zu schlussfolgern, unterstützt das Modell nicht.
Wie funktioniert das Bearbeiten im Dialog bei Gemini Omni Flash 1.1?
Jeder Folgeprompt bearbeitet das vorherige Ergebnis, statt neu zu generieren, und das Modell behält den Zustand der Szene zwischen den Zügen. Kurz schlägt ausführlich: „make the phone invisible, keep everything else the same“ wirkt besser als ein Absatz, der das ganze Bild beschreibt. Weil jeder Zug auf dem letzten aufbaut, hält eine Änderung pro Zug Figuren und Bewegung über eine ganze Kette stabil.
Erzeugt Gemini Omni Flash 1.1 Ton und Dialog?
Ja, der Ton entsteht im selben Durchgang wie das Bild: Dialog mit Lippensynchronität, Effekte, Atmo und Musik, getimt auf die Handlung. Schreiben Sie den gewünschten Ton in den Prompt. Sagt der Prompt nichts über Ton, erfindet das Modell eine eigene Spur. Für eine gesprochene Zeile genügt es aufzuschreiben, was die Figur sagt.
Kann ich Gemini Omni Flash 1.1 auf Morphic nutzen?
Ja. Wählen Sie Gemini Omni in der Modellauswahl für Video, schreiben Sie die Einstellung samt gewünschtem Ton und generieren Sie. Die Aufnahme landet auf dem Canvas, neben Ergebnissen von Veo, Seedance und Kling, für den direkten Vergleich. Folgeprompts bearbeiten dieselbe Szene, und Referenzbilder fahren im Briefing einfach mit.
Sind die erzeugten Clips als KI-Inhalt gekennzeichnet?
Ja. Jeder erzeugte Clip trägt SynthID, Googles unsichtbares Herkunftszeichen. Im Bild ist davon nichts zu sehen, es liegt trotzdem in jeder Ausgabe des Modells. Wenn Sie Material an Kunden, Redaktionen oder Plattformen weitergeben, bleibt die Herkunft damit im Clip selbst hinterlegt und nicht nur in Ihrer Dokumentation.
Worin unterscheidet sich Gemini Omni Flash 1.1 von Veo 3.1?
Veo 3.1 ist auf filmische Qualität in einer einzigen Einstellung ausgelegt, Omni Flash 1.1 auf das Weiterarbeiten. Omni ist das Modell, das Sie führen: Es bearbeitet seine eigene Ausgabe Zug um Zug, nimmt gemischte Bild- und Videoreferenzen an, verlängert eine Aufnahme auf 40 Sekunden und hält dabei Figur und Stimme. Für die eine große Einstellung liegt Veo beim Feinschliff vorn; für eine Szene, die Sie ausbauen, ist Omni Flash der Arbeitsweg. Beide stammen von Google DeepMind, sind aber getrennte Modelle: Ein Modell namens Veo 4 hat Google nie veröffentlicht.