Grok Imagine Video 1.5: Funktionen und Fähigkeiten
| Funktion | Was es macht | Am besten für |
|---|---|---|
| Native, synchronisierte Audiospur | Dialoge, Effekte, Umgebungsgeräusche und Musik entstehen synchron zur Bewegung | Sprecher, Produktclips, Musikvideos |
| Standbild animieren | Verwandelt ein Standbild in Bewegung und behält dabei Licht, Farbe und Textur bei | Fotos, Produktaufnahmen, Kunstwerke |
| Video-Verlängerung | Setzt am letzten Frame an und führt die Sequenz fort | Story-Sequenzen, längere Szenen |
| Referenzbasierte Generierung | Hält Charakter oder Stil über mehrere Clips hinweg mittels Referenzbildern | Konsistente Charaktere, stilfeste Serien |
| Prompt-Treue und Kamerakontrolle | Einstellungsgröße, Kamerabewegung und Timing-Vorgaben werden wie beschrieben umgesetzt | Storyboard-Vorschauen, präzise Einstellungen |
Native, synchronisierte Audiospur
Audio entsteht in einem einzigen Durchgang zusammen mit dem Video: gesprochener Dialog mit Lippensynchronisation, Soundeffekte, Umgebungsgeräusche und Musik. Sie beschreiben den Ton im selben Prompt wie die Bewegung, ein separater Audioschritt entfällt.
Standbild animieren
Ein von Ihnen bereitgestelltes Bild dient als erster Frame, von dem aus das Modell die Animation entwickelt. Ursprüngliches Licht, Farbe und Detailgrad bleiben erhalten, statt neu generiert zu werden, das eignet sich für Fotos, Produktaufnahmen oder fertige Kunstwerke.

Video-Verlängerung
Ein bestehender Clip lässt sich ab seinem letzten Frame fortsetzen, für eine längere Einstellung mit gleichbleibendem Motiv, Licht und Bewegung. Wiederholen Sie den Schritt, um aus einem Startclip eine mehrteilige Sequenz aufzubauen.

Referenzbasierte Generierung
Referenzbilder steuern Stil und Charakter, ohne den ersten Frame festzulegen. Das Modell überträgt diesen Look auf neue Einstellungen und hält so einen Charakter oder visuellen Stil über mehrere Generierungen hinweg konsistent.

Starke Prompt-Treue und Kamerakontrolle
Das Modell folgt detaillierten Vorgaben, darunter Einstellungsgröße, eine bestimmte Kamerabewegung wie Dolly oder Schwenk, sowie Timing für den Ablauf einer Handlung. Das macht eine geplante Einstellung leichter reproduzierbar.
Grok Imagine Video 1.5: Technische Daten
| Spezifikation | Grok Imagine Video 1.5 |
|---|---|
| Anbieter | xAI |
| Modi | Bild-zu-Video, Text-zu-Video, Referenz-zu-Video, Videobearbeitung, Video-Verlängerung |
| Audio | Nativ, synchronisiert (Dialog, Effekte, Umgebungsgeräusche, Musik) |
| Auflösung | 480p oder 720p |
| Dauer | 1 bis 15 Sekunden |
| Bildrate | 24 fps |
| Seitenverhältnisse | 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 1:1 |
So holen Sie das Beste aus Grok Imagine Video 1.5 heraus
Das Modell belohnt einen starken Startframe und einen klaren, bewegungsfokussierten Prompt. Ein paar Praktiken machen den größten Unterschied für die Qualität:
- Beginnen Sie mit einem Standbild. Erstellen oder laden Sie zuerst ein 16:9-Bild hoch und animieren Sie es anschließend. Ein guter erster Frame ist der wichtigste Hebel für das Ergebnis.
- Halten Sie den Bewegungs-Prompt kurz und präzise. Benennen Sie die Handlung und eine Kamerabewegung, die Komposition und den Stil übernimmt das Bild.
- Benennen Sie immer den Ton. Dialog, Soundeffekte, Umgebungsgeräusche oder Musik, in einfacher Sprache, damit das Modell den Ton zur Bewegung erzeugt statt eines stummen Clips.
- Eine Handlung pro Clip. Packen Sie einen einzelnen Moment in wenige Sekunden und nutzen Sie die Video-Verlängerung für längere Sequenzen.
- Nutzen Sie für sprechende Charaktere ein frontales Porträt mit dem Mund im Bild und halten Sie die Sätze kurz für eine saubere Lippensynchronisation.
- Verwenden Sie Referenzbilder, wenn ein Look oder ein Charakter über mehrere Clips hinweg gleich bleiben muss.
Grok Imagine Video 1.5: Prompt-Guide
Ein starker Prompt liest sich wie ein kurzes Einstellungs-Briefing, nicht wie eine Bildunterschrift. Zwei Dinge entscheiden über das Ergebnis: eine klare Auflistung dessen, was die Einstellung enthält, und konkrete statt vage Formulierungen.
Was gehört in einen Prompt
| Element | Was hinein gehört | Beispiel |
|---|---|---|
| Motiv | Wer oder was im Bild ist, konkret beschrieben | eine Moderatorin in einem anthrazitfarbenen Pullover |
| Bewegung | Was sich bewegt, und wie | sie lächelt und blickt in die Kamera |
| Kamera | Einstellungsgröße plus eine Bewegung | Halbtotale, langsamer Zoom-in |
| Audio | Dialog, Effekte, Umgebungsgeräusche oder Musik | sie sagt: „Willkommen“; leiser Raumton |
| Dauer | Cliplänge und Seitenverhältnis | 5 Sekunden, 16:9 |
Schwache vs. starke Prompts
Benennen Sie Kamera, Bewegung samt Timing und Audio, statt sie dem Zufall zu überlassen.
| Fokus | Schwach | Stark |
|---|---|---|
| Kamera | Eine Frau in einer Stadt bei Nacht | Handkamera-Verfolgungsfahrt hinter einer Frau durch regennasse Straßen, Lichtreflexionen auf dem Asphalt, geringe Schärfentiefe |
| Bewegung und Timing | Die Tür öffnet sich und jemand kommt herein | Die Tür schwingt langsam auf, nach einem kurzen Moment tritt eine Gestalt hindurch, dann beruhigt sich die Kamera |
| Audio | Ein Koch richtet ein Gericht an | Nahaufnahme eines Kochs beim Anrichten, aufsteigender Dampf. Audio: brutzelnde Pfanne, leise Küchengeräusche und „Service.“ |
Wichtige Einstellungen
| Einstellung | Hinweise |
|---|---|
| Dauer | 1 bis 15 Sekunden; eine Handlung pro Clip |
| Auflösung | 480p oder 720p |
| Seitenverhältnis | Folgt Ihrem Eingabebild oder wählen Sie 16:9, 9:16 oder 1:1 |
| Referenzbilder | Hinzufügen, um Stil oder Charakter über mehrere Clips hinweg zu halten |
| Längere Sequenzen | Nutzen Sie die Video-Verlängerung, um am letzten Frame fortzusetzen |
Häufige Fehler
- Den Prompt ohne Ton lassen: Schreiben Sie immer mindestens einen Audio-Hinweis.
- Vage Kameraangaben: „cinematic“ sagt dem Modell nichts, benennen Sie Einstellung und Bewegung.
- Zu viel in einem Clip: eine Handlung pro Clip, dann verlängern.
Häufig gestellte Fragen
Beginnen Sie mit einem starken 16:9-Standbild, halten Sie den Bewegungs-Prompt kurz und präzise, benennen Sie eine Kamerabewegung und geben Sie immer einen Audio-Hinweis an. Beschränken Sie sich auf eine Handlung pro Clip und nutzen Sie die Video-Verlängerung für längere Sequenzen.
Ja. Audio entsteht nativ zusammen mit dem Video und bleibt synchron zur Bewegung. Eine einzige Generierung kann lippensynchronen Dialog, Soundeffekte, Umgebungsgeräusche und Musik enthalten, ganz ohne separaten Audioschritt.
Ein Bild plus Text-Prompt für Bild-zu-Video, oder allein einen Text-Prompt für Text-zu-Video. Sie können außerdem Referenzbilder übergeben, um Stil und Charakter zu steuern, und einen bestehenden Clip mit Video-Verlängerung und Bearbeitung fortsetzen oder verändern.
Clips laufen 1 bis 15 Sekunden bei 480p oder 720p, 24 fps. Bei Bild-zu-Video folgt das Seitenverhältnis Ihrem Eingabebild, alternativ legen Sie ein Verhältnis für Querformat, Quadrat oder Hochformat fest.
Das ursprüngliche Grok Imagine ist xAIs cross-modales Modell, das Text-zu-Bild, Bildbearbeitung und mehrere Video-Pfade abdeckt. Grok Imagine Video 1.5 ist die eigenständige Video-Version, optimiert für Bild-zu-Video mit nativer, synchronisierter Audiospur, lippensynchronem Dialog und Video-Verlängerung.
