Gemini Omni Flash 1.1: Funktionen und Fähigkeiten
Google DeepMinds multimodales Videomodell, aktualisiert im August 2026. Es erzeugt Clips von 3 bis 10 Sekunden mit nativem Ton und arbeitet danach weiter daran: Ein Folgeprompt bearbeitet dieselbe Aufnahme, Verlängerungen bringen sie auf 40 Sekunden.
| Funktion | Was sie macht | Am besten für |
|---|---|---|
| Bearbeiten im Dialog | Ein Folgeprompt ändert die Aufnahme, Ungenanntes bleibt stehen | Korrigieren statt neu würfeln |
| Videoverlängerung | Führt einen Clip in Schritten von 10 s bis auf 40 s fort | Szenen über eine Generierung hinaus |
| Referenzeingabe | 10 Bilder und 3 Clips steuern eine Generierung, jedes mit Rolle | Wiederkehrende Figuren, Produkte, Stile |
| Erstes und letztes Frame | Interpoliert zwischen zwei Standbildern, dasselbe zweimal ergibt eine Schleife | Übergänge, Schleifen, Storyboard-Paare |
| Nativer Ton | Lippensynchrone Sprache, Effekte, Atmo und Musik zum Bild | Sprechszenen, tongeführte Aufnahmen |
| Auflösungsstufen | 360p bis 4K, wobei 1080p und 4K Hochskalierungen sind | Günstige Entwürfe, volle Auslieferung |
| Text im Bild | Stellt den angegebenen englischen Text dar, bis zum Schild im Hintergrund | Titel, Bauchbinden, Untertitel |
Gemini Omni Flash 1.1: Anwendungsfälle
Bearbeitungsketten auf einer Aufnahme
Den Raum neu ausleuchten, die Jacke tauschen, das Schild umschreiben. Jede Anweisung landet auf derselben Aufnahme, während der Rest des Bildes hält.

Szenen, die durch Verlängern entstehen
Mit einem Takt von zehn Sekunden beginnen, dann wachsen lassen. Das Modell liest Ihre letzten Sekunden und führt Bewegung, Besetzung und Musik bis 40 Sekunden fort.

Von der Skizze zum Material
Sagen Sie, dass die Zeichnung nur als Vorlage dient. Das Modell übernimmt Silhouette und Bewegungsbahn und baut Textur, Licht und Tiefe neu auf.

Figuren, die für Sie sprechen
Sie schreiben die Zeile, die Figur spricht sie lippensynchron, in einer Stimme, die ihr auch nach jeder späteren Bearbeitung bleibt.

Getaktete Sequenzen
Ein Timecode-Block macht aus einem Prompt eine Sequenz mit fester Schnittfolge: schnelle Produktbilder oder ein Takt alle zwei Sekunden.

Saubere Schleifen
Übergeben Sie dasselbe Bild als erstes und letztes Frame, dann kehrt der Clip an seinen Anfang zurück, bereit für die Produktseite.

Schritt 1: die Aufgabe wählen
Alles, was das Modell tut, fällt in eine von fünf Aufgaben. Nennen Sie sie, wenn die Absicht missverständlich wäre; sonst leitet das Modell sie aus Prompt und Material ab.
| Aufgabe | Was sie macht | Passt, wenn |
|---|---|---|
| Text to video | Erzeugt einen Clip aus einem geschriebenen Briefing | Sie bei null anfangen |
| Image to video | Belebt ein Standbild oder interpoliert zwischen zwei Frames | Das Bild steht, die Bewegung fehlt |
| Reference to video | Baut eine Aufnahme aus getaggten Bildern und Clips | Figur oder Stil müssen übertragen werden |
| Edit | Verändert ein bestehendes Video | Die Aufnahme sitzt, ein Element stört |
| Extend | Hängt eine Fortsetzung an | Die Aufnahme sitzt und ist zu kurz |
Schritt 2: den Prompt schreiben
Ein Prompt ist eine kurze Regieanweisung für die Einstellung, in dieser Reihenfolge. Seitenverhältnis, Auflösung und Dauer sind Einstellungen, kein Prompt-Text.
| Element | Was es abdeckt | Pflicht |
|---|---|---|
| Motiv und Handlung | Wer im Bild ist und was er tut | Ja |
| Szene | Ort, Tageszeit, Wetter, Hintergrund | Optional |
| Kamera und Licht | Einstellungsgröße, Bewegung, Objektiv, Lichtquelle | Optional |
| Ton | Dialog, Atmo, Effekte, Musik oder Stille | Dringend empfohlen |
| Aufbau | Eine durchgehende Einstellung, oder Schnitte und ihr Timing | Optional |
So sieht ein solches Briefing aus. Die Beispiele bleiben englisch, denn Englisch ist die Sprache, für die Google dieses Modell dokumentiert:
Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.
Die fünf Prompt-Hebel
| Hebel | So schreiben Sie es | Warum es zählt |
|---|---|---|
| Aufbau | Single continuous shot, no scene cuts. Or: every 2s cut to a new location | Ohne Vorgabe erzählt das Modell über mehrere Einstellungen hinweg |
| Ton | No music, just room tone. Or a spoken line: she says, third one today | Stille müssen Sie anfordern, sonst kommt erfundene Musik |
| Timing | After 3 seconds, a woman enters. Or a timecode block | Zeitspannen sind Budgets, keine framegenauen Schnittpunkte |
| Text im Bild | A street sign that says MARKET LANE | Undefinierter Text wird erfunden. Englisch rendert, andere Schriften nicht |
| Auslöser | When the person touches the mirror, it ripples like liquid | Ereignisbezogene Anweisungen sitzen genauer als abstrakte Zeitangaben |
Für eine Sequenz mit festen Takten schreiben Sie die Zeiten als Block:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
Negatives gehören in den Prompt selbst, etwa no dialogue oder do not add captions. Ein eigenes Feld für negative Prompts gibt es nicht.
Schritt 3: Referenzen und Frames ergänzen
Zehn Referenzbilder und drei Referenzvideos pro Generierung. Tags weisen jeder Datei ihre Rolle zu, gezählt ab null in der Reihenfolge des Uploads.
| Tag | Rolle | Beispiel |
|---|---|---|
| FIRST_FRAME | Startbild | <FIRST_FRAME> a woman is walking |
| LAST_FRAME | Endbild, kombiniert mit einem Startbild | <FIRST_FRAME> <LAST_FRAME> a woman is walking |
| IMAGE_REF_0 | Referenz für Motiv, Produkt oder Stil | in the style of <IMAGE_REF_0>, a woman is walking |
| VIDEO_REF_0 | Referenz für Figur oder Objekt | the person in <VIDEO_REF_0> is playing the violin |
- Alles vorab anhängen. Eine Referenz, die mitten im Gespräch dazukommt, bringt eine stabile Szene ins Wanken.
- Jeder Referenz eine Aufgabe geben. Stil aus dem ersten Bild, Motiv aus dem zweiten, schlägt Raten lassen.
- Videoreferenzen kurz halten. Je drei Sekunden, ein Aussehen funktioniert am besten, ihr Ton wird ignoriert.
- Dasselbe Bild als erstes und letztes Frame ergibt eine Schleife ohne sichtbaren Übergang.
Schritt 4: Ergebnis bearbeiten und verlängern
Eine erzeugte Aufnahme bleibt im Gespräch verfügbar, und hochgeladenes Material von höchstens 10 Sekunden kann dazukommen. Alles, was Sie beschreiben, darf das Modell neu rendern. Beschreiben Sie deshalb nur die Änderung.
| Vermeiden | Stattdessen schreiben |
|---|---|
| In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its head | Add a cat that jumps onto his lap, he begins to pet it. Keep everything else the same. |
| Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadows | Change the lighting to be more dramatic. Keep everything else the same. |
| Regel | Detail |
|---|---|
| Eine Änderung pro Zug | Kombinierte Anweisungen brechen die Konsistenz etwa doppelt so oft |
| Vier Bearbeitungen pro Kette | Danach schleicht sich Drift ein. Neu verankern mit: keep all character details exactly as they are, only change X |
| Verlängert wird nur hinten | 10 s pro Schritt bis 40 s gesamt. Kein Vorspann, keine gedehnte Mitte |
| Die Uhr startet neu | After 2s meint zwei Sekunden im neuen Material |
| Referenzen dürfen mitfahren | Eine neue Figur betritt die verlängerte Szene aus einem Bild, das Sie anhängen |
Eine Verlängerung mit Regieanweisung liest sich so:
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.
Grenzen von Gemini Omni Flash 1.1
| Grenze | Was passiert | So umgehen Sie es |
|---|---|---|
| Nicht-lateinische Schrift | Japanische und chinesische Zeichen werden überzeugend erfunden | Text im Bild englisch halten oder jedes Frame prüfen |
| Überfüllte Szenen | Ab vier verfolgten Figuren verschmelzen sie oder driften ab | Bei drei bleiben |
| Keine Stimmbearbeitung | Keine Audio-Referenzen, keine Eingriffe an der Stimme | Die Stimme im Text führen, die Konsistenz hält sie |
| Richtlinien-Grenzen | Echte Marken und erkennbare Personen sind gesperrt, je nach Region | Markenelemente generisch halten |

