Fitur dan kemampuan Gemini Omni Flash 1.1
Model video multimodal dari Google DeepMind, diperbarui pada Agustus 2026. Model ini membuat klip 3 sampai 10 detik dengan audio native, lalu terus mengerjakannya: prompt lanjutan mengedit take yang sama, dan extension menumbuhkannya sampai 40 detik.
| Fitur | Fungsinya | Cocok untuk |
|---|---|---|
| Edit lewat percakapan | Prompt lanjutan mengubah take; yang tidak disebut tetap di tempatnya | Membenahi shot tanpa generate ulang |
| Extension video | Melanjutkan klip 10 detik sekali jalan, sampai total 40 detik | Adegan yang lebih panjang dari satu generasi |
| Input referensi | 10 gambar dan 3 klip mengarahkan satu generasi, tiap file diberi peran | Karakter, produk, dan gaya yang berulang |
| Frame pertama dan terakhir | Menginterpolasi dua gambar diam; gambar yang sama dua kali jadi loop | Transisi, loop, pasangan storyboard |
| Audio native | Dialog ber-lip sync, efek, ambience, dan musik bersama gambarnya | Adegan berdialog, shot yang dipimpin suara |
| Tangga resolusi | 360p sampai 4K; 1080p dan 4K berupa upscale | Draft murah, pengiriman ukuran penuh |
| Teks di layar | Merender teks bahasa Inggris yang Anda tentukan, sampai papan di latar | Judul, lower third, caption |
Contoh penggunaan Gemini Omni Flash 1.1
Rantai edit di satu take
Ganti pencahayaan ruangannya, tukar jaketnya, tulis ulang papan namanya. Tiap instruksi mendarat di shot yang sama, sementara sisa frame tetap bertahan.

Adegan yang dibangun lewat extension
Buka dengan beat sepuluh detik, lalu tumbuhkan. Model membaca detik-detik terakhir Anda dan melanjutkan gerakan, pemain, serta musiknya sampai 40 detik.

Sketsa jadi footage
Sebutkan bahwa gambarnya cuma jadi panduan. Model meminjam siluet dan lintasannya, lalu membangun ulang tekstur, cahaya, dan kedalamannya.

Presenter yang berbicara
Tulis kalimatnya dan karakter menyampaikannya dengan lip sync, dalam suara yang tetap jadi miliknya di setiap edit berikutnya.

Sekuens berbasis timecode
Satu blok timecode mengubah satu prompt jadi sekuens potong demi potong: frame produk yang beruntun, atau satu beat tiap dua detik.

Loop yang sempurna
Berikan gambar yang sama sebagai frame pertama dan frame terakhir, dan klipnya kembali ke titik awal, siap dipasang di halaman produk.

Langkah 1: pilih tugasnya
Semua yang bisa dilakukan model masuk ke salah satu dari lima tugas. Sebutkan tugasnya kalau maksud Anda berpotensi salah dibaca; kalau tidak, model menyimpulkannya sendiri dari prompt dan file Anda.
| Tugas | Fungsinya | Pakai saat |
|---|---|---|
| Text to video | Membuat klip dari brief tertulis | Mulai dari nol |
| Image to video | Menganimasikan gambar diam, atau menginterpolasi dua frame | Framenya sudah ada, geraknya yang belum |
| Reference to video | Menyusun shot dari gambar dan klip yang sudah diberi tag | Karakter atau gaya harus terbawa |
| Edit | Mengubah video yang sudah ada | Takenya sudah pas, satu elemen meleset |
| Extend | Menambahkan lanjutan | Takenya sudah pas tapi kependekan |
Langkah 2: tulis promptnya
Prompt adalah brief shot yang pendek, dalam urutan ini. Rasio aspek, resolusi, dan durasi adalah setelan, bukan teks prompt.
| Elemen | Cakupannya | Wajib |
|---|---|---|
| Subjek dan aksi | Siapa yang ada di frame, dan sedang apa | Ya |
| Adegan | Lokasi, waktu, cuaca, latar belakang | Opsional |
| Kamera dan cahaya | Ukuran shot, gerakan, lensa, sumber cahaya | Opsional |
| Audio | Dialog, ambience, efek, musik, atau senyap | Sangat disarankan |
| Struktur shot | Satu shot menerus, atau potongan beserta waktunya | Opsional |
Begini bentuk brief-nya. Contohnya ditulis dalam bahasa Inggris, karena itu bahasa yang didokumentasikan dan dievaluasi Google untuk model ini:
Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.
Lima kendali prompt
| Kendali | Tulis ini | Kenapa penting |
|---|---|---|
| Struktur shot | Single continuous shot, no scene cuts. Atau: every 2s cut to a new location | Tanpa diminta, model bercerita lewat beberapa shot sekaligus |
| Audio | No music, just room tone. Atau satu kalimat terucap: she says, third one today | Senyap harus diminta, kalau tidak musiknya dikarang sendiri |
| Waktu | After 3 seconds, a woman enters. Atau satu blok timecode | Rentang waktu itu perkiraan, bukan titik potong yang presisi |
| Teks di layar | A street sign that says MARKET LANE | Teks yang tidak ditentukan akan dikarang. Bahasa Inggris terender rapi, aksara non-Latin tidak |
| Pemicu | When the person touches the mirror, it ripples like liquid | Instruksi berbasis kejadian mendarat lebih presisi daripada waktu yang abstrak |
Untuk sekuens dengan waktu yang pasti, tulis penandanya sebagai satu blok:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
Negasi ditulis di dalam prompt itu sendiri, misalnya no dialogue atau do not add captions. Tidak ada kolom terpisah untuk negative prompt.
Langkah 3: tambahkan referensi dan frame
Sepuluh gambar referensi dan tiga video referensi per generasi. Tag menetapkan peran tiap file, dinomori dari nol sesuai urutan unggahnya.
| Tag | Peran | Contoh |
|---|---|---|
| FIRST_FRAME | Frame awal | <FIRST_FRAME> a woman is walking |
| LAST_FRAME | Frame akhir, dipasangkan dengan frame awal | <FIRST_FRAME> <LAST_FRAME> a woman is walking |
| IMAGE_REF_0 | Referensi subjek, produk, atau gaya | in the style of <IMAGE_REF_0>, a woman is walking |
| VIDEO_REF_0 | Referensi karakter atau objek | the person in <VIDEO_REF_0> is playing the violin |
- Lampirkan semuanya di awal. Referensi yang ditambahkan di tengah percakapan mengguncang adegan yang tadinya sudah stabil.
- Beri satu tugas untuk tiap referensi. Gaya dari gambar pertama, subjek dari gambar kedua, lebih baik daripada membiarkan model menebak.
- Jaga video referensi tetap pendek. Tiga detik masing-masing, paling cocok untuk kemiripan wajah, dan audio di dalamnya diabaikan.
- Gambar yang sama sebagai frame pertama dan terakhir menghasilkan loop yang menutup rapi.
Langkah 4: edit dan perpanjang hasilnya
Take yang sudah digenerate tetap hidup di dalam percakapan, dan footage milik Anda yang berdurasi 10 detik atau kurang bisa ikut bergabung. Semua yang Anda deskripsikan berpotensi dirender ulang oleh model, jadi deskripsikan perubahannya saja.
| Hindari | Tulis ini |
|---|---|
| In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its head | Add a cat that jumps onto his lap, he begins to pet it. Keep everything else the same. |
| Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadows | Change the lighting to be more dramatic. Keep everything else the same. |
| Aturan | Detail |
|---|---|
| Satu perubahan per giliran | Instruksi majemuk merusak konsistensi kira-kira dua kali lebih sering |
| Empat edit per rantai | Lewat itu, penyimpangan mulai muncul. Jangkarkan ulang dengan: keep all character details exactly as they are, only change X |
| Extension hanya menambah di akhir | 10 detik sekali jalan sampai total 40 detik. Tidak bisa menyisipkan di depan atau memanjangkan bagian tengah |
| Jam extension dimulai dari nol | After 2s berarti dua detik ke dalam footage yang baru |
| Referensi bisa ikut serta | Karakter baru masuk ke adegan yang diperpanjang lewat gambar yang Anda lampirkan |
Instruksi extension yang terarah terbaca seperti ini:
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.
Batasan Gemini Omni Flash 1.1
| Batasan | Yang terjadi | Cara menyiasatinya |
|---|---|---|
| Teks non-Latin | Glyph Jepang dan Mandarin keluar sebagai karangan yang meyakinkan | Pertahankan teks di layar dalam bahasa Inggris, atau periksa tiap frame |
| Adegan yang padat | Empat subjek terlacak atau lebih akan melebur atau melenceng | Tahan di angka tiga |
| Tidak ada editing suara | Tidak menerima unggahan audio referensi, tidak ada bedah suara | Arahkan suaranya lewat teks; konsistensi model yang menjaganya |
| Batas kebijakan | Merek asli dan orang yang dikenali diblokir, tergantung wilayah | Jaga elemen bermerek tetap generik |

