Multimodal

Gemini Omni

von Google DeepMind

Googles erstes Any‑to‑any‑KI‑Modell.
Text, Bild, Audio und Video rein, ein fertiges Video raus.

Gemini Omni

Hauptfunktionen

Technische Spezifikationen

Omni Flash

Erstes Modell in Googles Gemini-Omni-Reihe

Video

Bild- und Audioausgabe sind für die Gemini-Omni-Roadmap geplant

Bis zu 10s

Flash-Clips sind zum Start auf 10 Sekunden begrenzt, um den Zugang zu erweitern

720p

Gemini Omni Flash gibt Video in 720p aus

Beliebige Mischung

Text, Bild, Audio und Video in einem Prompt

Nativ

Synchronisiertes Audio wird mit jedem Clip erzeugt; Stimme über Avatare

SynthID

Unmerkliches KI-Herkunftswasserzeichen auf jedem Clip

Google DeepMind

Positioniert als Nachfolger von Veo für Any-to-any-Videoerstellung

Anwendungsfälle

Multimodales Storyboarding

Ein Charakterbild, ein Ortsfoto, ein Musik-Cue und ein Stichwort gehen ein, das Modell baut die Einstellung und arbeitet iterativ weiter.

Konversationelle Videobearbeitung

Bearbeiten Sie jeden Clip in normaler Sprache: Garderobe tauschen, Hintergrund ändern oder einen Moment neu timen. Der Rest bleibt stabil.

Marketingvideo

Werbeschnitte, die Markenfarben, Produktform und Bildschirmtext respektieren. Ein Foto, ein Briefing, ein fertiger Spot.

Lehrvideos und Erklärvideos

Visualisieren Sie Naturwissenschaft, Geschichte und Technik mit eingebauter Physik. Die Fakten bleiben korrekt, das Material sauber.

Sprecher-Video

Ein Porträt plus eine Stimmreferenz ergibt denselben Präsentator vor der Kamera über Shorts, Kurse und Anleitungen hinweg.

Social Shorts

10-Sekunden-Clips passen zu YouTube Shorts, Reels und TikTok. Erzeugen Sie Varianten und veröffentlichen Sie die beste.

Prompt-Beispiele

Cinematic Noir

Cinematic Noir

Detektiv in einer regennassen Tokioter Gasse, Natriumlampen-Glühen, Teal-Amber-Noir

Edit prompt
Produktlaunch

Produktlaunch

Avantgardistischer Sneaker schwebt über einem Titan-Sockel, hartes Streiflicht, Launch-Stimmung

Edit prompt
Naturerklärung

Naturerklärung

Wassertropfen erstarrt zur kristallinen Krone auf einem taufeuchten Blatt, Gegenlicht bei Sonnenaufgang, Makro

Edit prompt
Avatar-Sprecher

Avatar-Sprecher

Souveräner Studio-Moderator blickt in die Kamera, warmes Dreipunktlicht, 85mm-Bokeh

Edit prompt
Architektur-Rundgang

Architektur-Rundgang

Goldenes Licht durch eine brutalistische Betonvilla, lange Schatten, treibender Staub

Edit prompt
Erzählmoment

Erzählmoment

Frau am regenbenetzten Fenster liest einen Brief, Sorge weicht Erleichterung

Edit prompt

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

900 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3200 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6200 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24000 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Gemini Omni?
Gemini Omni ist Googles erstes Any-to-any-Multimodalmodell, vorgestellt auf der Google I/O 2026. Die erste Version, Gemini Omni Flash, akzeptiert Text, Bilder, Audio und Video als Eingabe und erzeugt Video als Ausgabe, mit konversationeller Bearbeitung, Charakterkonsistenz und SynthID-Wasserzeichen auf jedem Clip.
Ist Gemini Omni ein Bildmodell?
Nein. Gemini Omni gibt Video aus. Das Modell akzeptiert Bilder als Eingabe neben Text, Audio und Video, aber das erzeugte Ergebnis ist immer ein Videoclip. Google hat Bild- und Audioausgabe als geplante Erweiterungen der Gemini-Omni-Roadmap angekündigt, sie sind aber nicht Teil des ersten Starts.
Wie nutze ich Gemini Omni auf Morphic?
Öffnen Sie Morphic, wechseln Sie die Prompt-Leiste in den Video-Modus und wählen Sie Gemini Omni aus der Modellauswahl. Fügen Sie eine beliebige Kombination aus Text-, Bild-, Audio- und Videoreferenzen hinzu und starten Sie den Prompt. Für eine Überarbeitung schreiben Sie einfach die nächste Nachricht, die Szene behält den bisherigen Kontext.
Wie lang sind Gemini-Omni-Videos?
Gemini Omni Flash ist zum Start auf 10 Sekunden pro Clip begrenzt. Google bezeichnet dieses Limit als bewusste Entscheidung für den breiteren Zugang während des ersten Rollouts, nicht als feste Modellgrenze – längere Laufzeiten sind in künftigen Versionen möglich.
Welche Eingaben akzeptiert Gemini Omni?
Gemini Omni akzeptiert Text, Bilder, Audio und Video in beliebiger Kombination innerhalb eines einzigen Prompts. Stimmreferenzen sind die erste unterstützte Audioeingabe; weitere Audioeingaben und zusätzliche Ausgabemodalitäten sind geplant.
Wie unterscheidet sich Gemini Omni von Veo 3.1?
Veo 3.1 ist Google DeepMinds fotorealistisches Videomodell mit 4K-Auflösung, nativem Audio und 8-Sekunden-Clips, ausgelegt auf sendefähigen Realismus. Gemini Omni Flash ist das Any-to-any-Geschwistermodell, mit kürzerer Länge (bis zu 10 Sekunden), fokussiert auf Multi-Input-Verknüpfung, konversationelle Bearbeitung und durchgehende Charakterkonsistenz über mehrere Bearbeitungen hinweg. Veo ist der Realismus-Spezialist, Gemini Omni der multimodale Regisseur.
Wie unterscheidet sich Gemini Omni von Seedance 2.0?
Gemini Omni und Seedance 2.0 sind beide multimodale Videomodelle. Seedance 2.0 akzeptiert bis zu 12 gemischte Assets pro Generierung mit nativer Audiosynthese und Beat-Sync zur Musik, in 1080p, 4 bis 15 Sekunden. Gemini Omni Flash konzentriert sich auf konversationelle Bearbeitung Zug um Zug und auf Googles Physik- und Realwelt-Modellierung, aktuell auf 10 Sekunden begrenzt.
Enthält Gemini Omni ein Wasserzeichen?
Ja. Jedes von Gemini Omni erzeugte Video trägt Googles unmerkliches SynthID-Wasserzeichen zur KI-Herkunftskennzeichnung. Das Wasserzeichen ist für Betrachter unsichtbar und übersteht gängige Bearbeitungen wie Re-Encoding und Größenänderungen.
Unterstützt Gemini Omni Charakterkonsistenz?
Ja. Figuren, die in einer Gemini-Omni-Einstellung eingeführt werden, behalten Gesicht, Kleidung und Stimme über Schnitte und über folgende Bearbeitungen im selben Gespräch hinweg, ohne dass die Referenz jedes Mal neu hochgeladen werden muss.
Wann wurde Gemini Omni veröffentlicht?
Google hat Gemini Omni auf der Google I/O 2026 am 19. Mai 2026 vorgestellt. Gemini Omni Flash ist die erste Version der Reihe, Bild- und Audioausgabe sind als geplante künftige Erweiterungen angekündigt.