Fitur dan kemampuan Grok Imagine Video 1.5
| Fitur | Yang dilakukan | Paling cocok untuk |
|---|---|---|
| Audio tersinkronisasi native | Dialog, efek, ambience, dan musik dihasilkan bersama gerakan, dalam sinkron | Talking head, iklan produk, klip musik |
| Animasikan gambar diam | Mengubah gambar diam jadi gerak sambil menjaga cahaya, warna, dan teksturnya | Foto, foto produk, karya seni |
| Perpanjangan video | Melanjutkan dari frame terakhir menjadi urutan yang lebih panjang | Urutan cerita, beat yang lebih panjang |
| Generasi berpandu referensi | Menjaga karakter atau gaya tetap konsisten di berbagai klip lewat gambar referensi | Karakter konsisten, seri dengan gaya terkunci |
| Pengikutan prompt + kontrol kamera | Jenis shot, gerakan kamera, dan cue timing muncul sesuai yang ditulis | Preview storyboard, shot presisi |
Audio tersinkronisasi native
Audio dihasilkan bersamaan dengan video dalam satu proses: dialog dengan lip-sync, efek suara, ambience latar, dan musik. Anda mendeskripsikan suara dalam prompt yang sama dengan gerakannya, jadi tidak ada langkah audio terpisah.
Animasikan gambar diam
Gambar yang Anda unggah dipakai sebagai frame pertama, dan model mengembangkan gerakan dari sana. Pencahayaan, warna, dan detail asli dipertahankan, bukan dihasilkan ulang, yang cocok untuk menganimasikan foto, foto produk, atau karya seni yang sudah jadi.

Perpanjangan video
Klip yang sudah ada bisa dilanjutkan dari frame terakhirnya untuk membuat shot yang lebih panjang, dengan subjek, pencahayaan, dan gerakan yang tetap sama. Ulangi langkah ini untuk membangun urutan multi-bagian dari satu klip awal.

Generasi berpandu referensi
Gambar referensi mengarahkan gaya dan karakter tanpa mengunci frame pertama. Model membawa tampilan itu ke shot baru, sehingga karakter atau gaya visual tetap konsisten di berbagai generasi terpisah.

Pengikutan prompt dan kontrol kamera yang kuat
Model mengikuti arahan detail, termasuk jenis shot, gerakan kamera spesifik seperti dolly atau pan, dan timing kapan sebuah aksi terjadi. Ini membuat shot yang sudah direncanakan lebih mudah direproduksi sesuai keinginan.
Spesifikasi teknis Grok Imagine Video 1.5
| Spesifikasi | Grok Imagine Video 1.5 |
|---|---|
| Provider | xAI |
| Mode | Image-to-video, text-to-video, reference-to-video, editing video, perpanjangan video |
| Audio | Native, tersinkronisasi (dialog, efek, ambience, musik) |
| Resolusi | 480p atau 720p |
| Durasi | 1 sampai 15 detik |
| Frame rate | 24 fps |
| Rasio aspek | 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 1:1 |
Cara memaksimalkan Grok Imagine Video 1.5
Model ini memberi hasil terbaik saat Anda mulai dari frame yang kuat dan brief yang jelas serta fokus pada gerakan. Beberapa praktik ini membawa sebagian besar kualitas hasil:
- Mulai dari gambar diam. Hasilkan atau lampirkan gambar 16:9 lebih dulu, baru animasikan. Frame pertama yang bagus adalah pengungkit tunggal terbesar untuk hasilnya.
- Buat prompt gerakan singkat dan spesifik. Sebutkan aksinya dan satu gerakan kamera; biarkan gambar yang membawa komposisi dan gaya.
- Selalu sebutkan audionya. Dialog, efek suara, ambience, atau musik, dalam bahasa yang jelas, supaya model menghasilkan suara bersama gerakan alih-alih klip bisu.
- Satu aksi per klip. Padatkan satu beat dalam beberapa detik dan pakai perpanjangan video untuk urutan yang lebih panjang.
- Untuk karakter yang berbicara, pakai potret menghadap depan dengan mulut masuk frame dan jaga dialog tetap singkat untuk lip-sync yang bersih.
- Pakai gambar referensi saat sebuah tampilan atau karakter harus tetap konsisten di berbagai klip.
Panduan prompt Grok Imagine Video 1.5
Prompt yang kuat terasa seperti brief shot singkat, bukan caption. Dua hal yang menentukan hasilnya: daftar jelas apa yang ada di frame, dan kata-kata yang konkret alih-alih samar.
Apa yang masuk dalam prompt
| Elemen | Apa yang disertakan | Contoh |
|---|---|---|
| Subjek | Siapa atau apa yang ada di frame, dijelaskan secara konkret | seorang presenter berkemeja sweater abu-abu tua |
| Gerakan | Apa yang bergerak, dan bagaimana | dia tersenyum dan menatap kamera |
| Kamera | Jenis shot plus satu gerakan | medium shot, push-in perlahan |
| Audio | Dialog, efek, ambience, atau musik | dia berkata, 'Selamat datang'; room tone yang lembut |
| Durasi | Panjang klip dan rasio aspek | 5 detik, 16:9 |
Prompt lemah vs kuat
Sebutkan kameranya, gerakan dan timingnya, serta audionya, alih-alih membiarkannya jadi kebetulan.
| Fokus | Lemah | Kuat |
|---|---|---|
| Kamera | Seorang wanita di kota pada malam hari | Handheld tracking shot mengikuti seorang wanita menyusuri jalanan basah hujan, pantulan neon, depth of field dangkal |
| Gerakan dan timing | Pintu terbuka dan seseorang masuk | Pintu terbuka perlahan, sebuah sosok melangkah masuk setelah jeda sesaat, lalu kamera stabil |
| Audio | Seorang koki menata hidangan | Close-up seorang koki menata hidangan, uap mengepul. Audio: suara sizzle wajan, ambience dapur yang lembut, dan 'Service.' |
Pengaturan yang perlu diketahui
| Pengaturan | Catatan |
|---|---|
| Durasi | 1 sampai 15 detik; jaga satu aksi per klip |
| Resolusi | 480p atau 720p |
| Rasio aspek | Mengikuti gambar input Anda, atau atur 16:9, 9:16, atau 1:1 |
| Gambar referensi | Tambahkan untuk menjaga gaya atau karakter tetap konsisten di berbagai klip |
| Urutan lebih panjang | Pakai perpanjangan video untuk melanjutkan dari frame terakhir |
Kesalahan umum
- Membiarkan prompt bisu: selalu tulis minimal satu cue suara.
- Kamera samar: "sinematik" tidak memberi tahu model apa pun; sebutkan jenis shot dan gerakannya.
- Terlalu banyak dalam satu klip: satu aksi per klip, lalu perpanjang.
FAQ
Mulai dari gambar diam 16:9 yang kuat, buat prompt gerakan singkat dan spesifik, sebutkan satu gerakan kamera, dan selalu sertakan cue audio. Jaga satu aksi per klip dan pakai perpanjangan video untuk urutan yang lebih panjang.
Ya. Audio dihasilkan secara native bersama video dan tetap sinkron dengan gerakannya. Satu generasi bisa mencakup dialog dengan lip-sync, efek suara, ambience, dan musik, tanpa proses audio terpisah.
Sebuah gambar plus prompt teks untuk image-to-video, atau prompt teks saja untuk text-to-video. Anda juga bisa menyertakan gambar referensi untuk mengarahkan gaya dan karakter, serta melanjutkan atau memodifikasi klip yang sudah ada lewat perpanjangan video dan editing.
Klip berdurasi 1 sampai 15 detik pada 480p atau 720p, 24 fps. Untuk image-to-video, rasio aspek mengikuti gambar input Anda, dan Anda bisa mengatur rasio untuk hasil landscape, persegi, atau vertikal.
Grok Imagine versi awal adalah model cross-modal xAI yang mencakup text-to-image, edit gambar, dan beberapa jalur video. Grok Imagine Video 1.5 adalah rilis video khusus, disetel untuk image-to-video dengan audio tersinkronisasi native, dialog ber-lip-sync, dan perpanjangan video.
