Gemini Omni Flash 1.1: kompletter Guide, Prompts und neue Funktionen

Gemini Omni Flash 1.1: kompletter Guide, Prompts und neue Funktionen

Der komplette Guide zu Gemini Omni Flash 1.1: die fünf Aufgaben, die Prompt-Formel, Referenz- und Frame-Tags, Änderungen per Satz, Verlängerung auf 40 Sekunden und Tonregie, mit Beispielen.

Gemini Omni Flash 1.1: Funktionen und Fähigkeiten

Google DeepMinds multimodales Videomodell, aktualisiert im August 2026. Es erzeugt Clips von 3 bis 10 Sekunden mit nativem Ton und arbeitet danach weiter daran: Ein Folgeprompt bearbeitet dieselbe Aufnahme, Verlängerungen bringen sie auf 40 Sekunden.

FunktionWas sie machtAm besten für
Bearbeiten im DialogEin Folgeprompt ändert die Aufnahme, Ungenanntes bleibt stehenKorrigieren statt neu würfeln
VideoverlängerungFührt einen Clip in Schritten von 10 s bis auf 40 s fortSzenen über eine Generierung hinaus
Referenzeingabe10 Bilder und 3 Clips steuern eine Generierung, jedes mit RolleWiederkehrende Figuren, Produkte, Stile
Erstes und letztes FrameInterpoliert zwischen zwei Standbildern, dasselbe zweimal ergibt eine SchleifeÜbergänge, Schleifen, Storyboard-Paare
Nativer TonLippensynchrone Sprache, Effekte, Atmo und Musik zum BildSprechszenen, tongeführte Aufnahmen
Auflösungsstufen360p bis 4K, wobei 1080p und 4K Hochskalierungen sindGünstige Entwürfe, volle Auslieferung
Text im BildStellt den angegebenen englischen Text dar, bis zum Schild im HintergrundTitel, Bauchbinden, Untertitel

Gemini Omni Flash 1.1: Anwendungsfälle

Bearbeitungsketten auf einer Aufnahme

Den Raum neu ausleuchten, die Jacke tauschen, das Schild umschreiben. Jede Anweisung landet auf derselben Aufnahme, während der Rest des Bildes hält.

Dasselbe Wohnzimmer geteilt, links flaches Mittagslicht, rechts goldene Dämmerung

Szenen, die durch Verlängern entstehen

Mit einem Takt von zehn Sekunden beginnen, dann wachsen lassen. Das Modell liest Ihre letzten Sekunden und führt Bewegung, Besetzung und Musik bis 40 Sekunden fort.

Vierteiliger Filmstreifen eines gestreiften Heißluftballons über einem Alpental im Morgengrauen

Von der Skizze zum Material

Sagen Sie, dass die Zeichnung nur als Vorlage dient. Das Modell übernimmt Silhouette und Bewegungsbahn und baut Textur, Licht und Tiefe neu auf.

Eine Bleistiftskizze eines springenden Fuchses neben derselben Pose als fotorealistischer Fuchs im Wald

Figuren, die für Sie sprechen

Sie schreiben die Zeile, die Figur spricht sie lippensynchron, in einer Stimme, die ihr auch nach jeder späteren Bearbeitung bleibt.

Ein Markthändler spricht freundlich über Kisten mit Orangen im späten Nachmittagslicht

Getaktete Sequenzen

Ein Timecode-Block macht aus einem Prompt eine Sequenz mit fester Schnittfolge: schnelle Produktbilder oder ein Takt alle zwei Sekunden.

Drei Panels derselben Frau mit rotem Schal, gehend, zurückblickend und rennend

Saubere Schleifen

Übergeben Sie dasselbe Bild als erstes und letztes Frame, dann kehrt der Clip an seinen Anfang zurück, bereit für die Produktseite.

Ein Papierflieger fliegt eine Schleife, nachgezeichnet von einer geschlossenen Lichtspur in einer dunklen Werkstatt

Schritt 1: die Aufgabe wählen

Alles, was das Modell tut, fällt in eine von fünf Aufgaben. Nennen Sie sie, wenn die Absicht missverständlich wäre; sonst leitet das Modell sie aus Prompt und Material ab.

AufgabeWas sie machtPasst, wenn
Text to videoErzeugt einen Clip aus einem geschriebenen BriefingSie bei null anfangen
Image to videoBelebt ein Standbild oder interpoliert zwischen zwei FramesDas Bild steht, die Bewegung fehlt
Reference to videoBaut eine Aufnahme aus getaggten Bildern und ClipsFigur oder Stil müssen übertragen werden
EditVerändert ein bestehendes VideoDie Aufnahme sitzt, ein Element stört
ExtendHängt eine Fortsetzung anDie Aufnahme sitzt und ist zu kurz

Schritt 2: den Prompt schreiben

Ein Prompt ist eine kurze Regieanweisung für die Einstellung, in dieser Reihenfolge. Seitenverhältnis, Auflösung und Dauer sind Einstellungen, kein Prompt-Text.

ElementWas es abdecktPflicht
Motiv und HandlungWer im Bild ist und was er tutJa
SzeneOrt, Tageszeit, Wetter, HintergrundOptional
Kamera und LichtEinstellungsgröße, Bewegung, Objektiv, LichtquelleOptional
TonDialog, Atmo, Effekte, Musik oder StilleDringend empfohlen
AufbauEine durchgehende Einstellung, oder Schnitte und ihr TimingOptional

So sieht ein solches Briefing aus. Die Beispiele bleiben englisch, denn Englisch ist die Sprache, für die Google dieses Modell dokumentiert:

Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.

Die fünf Prompt-Hebel

HebelSo schreiben Sie esWarum es zählt
AufbauSingle continuous shot, no scene cuts. Or: every 2s cut to a new locationOhne Vorgabe erzählt das Modell über mehrere Einstellungen hinweg
TonNo music, just room tone. Or a spoken line: she says, third one todayStille müssen Sie anfordern, sonst kommt erfundene Musik
TimingAfter 3 seconds, a woman enters. Or a timecode blockZeitspannen sind Budgets, keine framegenauen Schnittpunkte
Text im BildA street sign that says MARKET LANEUndefinierter Text wird erfunden. Englisch rendert, andere Schriften nicht
AuslöserWhen the person touches the mirror, it ripples like liquidEreignisbezogene Anweisungen sitzen genauer als abstrakte Zeitangaben

Für eine Sequenz mit festen Takten schreiben Sie die Zeiten als Block:

[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running

Negatives gehören in den Prompt selbst, etwa no dialogue oder do not add captions. Ein eigenes Feld für negative Prompts gibt es nicht.

Schritt 3: Referenzen und Frames ergänzen

Zehn Referenzbilder und drei Referenzvideos pro Generierung. Tags weisen jeder Datei ihre Rolle zu, gezählt ab null in der Reihenfolge des Uploads.

TagRolleBeispiel
FIRST_FRAMEStartbild<FIRST_FRAME> a woman is walking
LAST_FRAMEEndbild, kombiniert mit einem Startbild<FIRST_FRAME> <LAST_FRAME> a woman is walking
IMAGE_REF_0Referenz für Motiv, Produkt oder Stilin the style of <IMAGE_REF_0>, a woman is walking
VIDEO_REF_0Referenz für Figur oder Objektthe person in <VIDEO_REF_0> is playing the violin
  • Alles vorab anhängen. Eine Referenz, die mitten im Gespräch dazukommt, bringt eine stabile Szene ins Wanken.
  • Jeder Referenz eine Aufgabe geben. Stil aus dem ersten Bild, Motiv aus dem zweiten, schlägt Raten lassen.
  • Videoreferenzen kurz halten. Je drei Sekunden, ein Aussehen funktioniert am besten, ihr Ton wird ignoriert.
  • Dasselbe Bild als erstes und letztes Frame ergibt eine Schleife ohne sichtbaren Übergang.

Schritt 4: Ergebnis bearbeiten und verlängern

Eine erzeugte Aufnahme bleibt im Gespräch verfügbar, und hochgeladenes Material von höchstens 10 Sekunden kann dazukommen. Alles, was Sie beschreiben, darf das Modell neu rendern. Beschreiben Sie deshalb nur die Änderung.

VermeidenStattdessen schreiben
In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its headAdd a cat that jumps onto his lap, he begins to pet it. Keep everything else the same.
Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadowsChange the lighting to be more dramatic. Keep everything else the same.
RegelDetail
Eine Änderung pro ZugKombinierte Anweisungen brechen die Konsistenz etwa doppelt so oft
Vier Bearbeitungen pro KetteDanach schleicht sich Drift ein. Neu verankern mit: keep all character details exactly as they are, only change X
Verlängert wird nur hinten10 s pro Schritt bis 40 s gesamt. Kein Vorspann, keine gedehnte Mitte
Die Uhr startet neuAfter 2s meint zwei Sekunden im neuen Material
Referenzen dürfen mitfahrenEine neue Figur betritt die verlängerte Szene aus einem Bild, das Sie anhängen

Eine Verlängerung mit Regieanweisung liest sich so:

Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.

Grenzen von Gemini Omni Flash 1.1

GrenzeWas passiertSo umgehen Sie es
Nicht-lateinische SchriftJapanische und chinesische Zeichen werden überzeugend erfundenText im Bild englisch halten oder jedes Frame prüfen
Überfüllte SzenenAb vier verfolgten Figuren verschmelzen sie oder driften abBei drei bleiben
Keine StimmbearbeitungKeine Audio-Referenzen, keine Eingriffe an der StimmeDie Stimme im Text führen, die Konsistenz hält sie
Richtlinien-GrenzenEchte Marken und erkennbare Personen sind gesperrt, je nach RegionMarkenelemente generisch halten

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

1100 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3625 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6350 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24650 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Wie schreibe ich einen guten Prompt für Gemini Omni Flash 1.1?
Schreiben Sie ein kurzes Briefing für die Einstellung: Motiv und Handlung, Schauplatz, Kamera, Licht und den gewünschten Ton, in klaren Sätzen. Omni Flash baut von sich aus eine kleine Erzählung aus mehreren Einstellungen. Wollen Sie eine ununterbrochene Aufnahme, ergänzen Sie „single continuous shot, no scene cuts“. Beschreiben Sie immer den Ton, denn ein Prompt ohne Tonangabe bekommt eine Tonspur, die sich das Modell selbst ausdenkt.
Wie funktionieren Bearbeitungs-Prompts in Gemini Omni Flash 1.1?
Kurz und gezielt: „make the phone invisible, keep everything else the same“. Ausführliche Bearbeitungs-Prompts erzeugen ungewollte Änderungen, denn alles, was Sie beschreiben, darf das Modell neu rendern. Nennen Sie die eine Änderung, hängen Sie „keep everything else the same“ an und bleiben Sie bei einer Änderung pro Zug, statt drei in einen Satz zu stapeln.
Wie verlängere ich ein Video mit Gemini Omni Flash 1.1?
Fordern Sie die Fortsetzung an: „extend this video“ genügt, „the scene continues: the camera pans across the mountains“ gibt zusätzlich Richtung. Jede Verlängerung ergänzt bis zu zehn Sekunden, insgesamt bis 40. Als Kontext dienen die letzten zehn Sekunden, und die Schlussframes werden angeglichen, damit der Anschluss wie eine einzige Aufnahme wirkt. Verlängert wird nur am Ende: kein Vorspann, keine gedehnte Mitte.
Was bedeuten die Tags in einem Prompt für Gemini Omni Flash 1.1?
Tags binden hochgeladene Dateien an Rollen. FIRST_FRAME und LAST_FRAME in spitzen Klammern setzen Start- und Endbild, IMAGE_REF_0 und VIDEO_REF_0 kennzeichnen Referenzen, gezählt ab null in der Reihenfolge des Uploads. Dasselbe Bild als erstes und letztes Frame ergibt einen Clip, der zu seinem Anfang zurückkehrt. Ohne Tags leitet das Modell jede Rolle aus dem Prompt ab. Bei einfachen Fällen genügt das, ab zwei oder drei Dateien wird es mehrdeutig.
Ist das 4K von Gemini Omni Flash 1.1 natives 4K?
Nein, und das gehört in die Planung. Nativ rendert das Modell in 360p und 720p; 1080p und 4K entstehen als Hochskalierung genau dieser Generierung. Die Bildschärfe entscheidet sich also bei 720p und nicht bei der Lieferauflösung. Zurren Sie die Aufnahme günstig in 360p oder 720p fest und fordern Sie die große Stufe erst an, wenn die Einstellung sitzt.
Wie steuere ich Ton und Dialog in Gemini Omni Flash 1.1?
Beschreiben Sie die Tonspur im selben Prompt wie das Bild: „no music, just room tone“, „a high energy techno beat“ oder eine ausgeschriebene Zeile, die die Figur sagt. Dialog kommt lippensynchron zurück, in einer Stimme, die über Bearbeitungen und Verlängerungen erhalten bleibt. Auch Stille müssen Sie anfordern, denn ohne Angabe liefert das Modell meist generische Hintergrundmusik.
Kann Gemini Omni Flash 1.1 Text im Video darstellen?
Ja, im Englischen gehört das zu den Stärken des Modells: Schilder, Bauchbinden und Wort-für-Wort-Animationen kommen lesbar zurück, wenn Sie ausschreiben, was auf jeder Fläche steht. Definieren Sie auch Text im Hintergrund, sonst erfindet ihn das Modell. Nicht-lateinische Schriften sind die Schwachstelle. Google dokumentiert Englisch als die geprüfte Sprache, prüfen Sie deutsche Beschriftungen deshalb Frame für Frame.
Wie halte ich Figuren über mehrere Bearbeitungen konsistent?
Eine gezielte Änderung pro Zug, den Rest übernimmt das Szenengedächtnis des Modells: Gesicht, Garderobe und Stimme bleiben in Folgeprompts automatisch erhalten. Bei längeren Ketten verankern Sie neu, etwa mit „keep all character details and motion exactly as they are, only change the lighting“, bevor Sie die Änderung nennen. Ketten von etwa vier Bearbeitungen bleiben stabil; danach planen Sie besser eine frische Generierung mit erneut angehängten Referenzen.