Gemini Omni Flash 1.1: panduan lengkap, prompt, dan fitur barunya

Gemini Omni Flash 1.1: panduan lengkap, prompt, dan fitur barunya

Panduan lengkap Gemini Omni Flash 1.1: lima tugasnya, formula prompt, tag referensi dan frame, edit yang cukup diketik, extension 40 detik, dan arahan audio, lengkap dengan contohnya.

Fitur dan kemampuan Gemini Omni Flash 1.1

Model video multimodal dari Google DeepMind, diperbarui pada Agustus 2026. Model ini membuat klip 3 sampai 10 detik dengan audio native, lalu terus mengerjakannya: prompt lanjutan mengedit take yang sama, dan extension menumbuhkannya sampai 40 detik.

FiturFungsinyaCocok untuk
Edit lewat percakapanPrompt lanjutan mengubah take; yang tidak disebut tetap di tempatnyaMembenahi shot tanpa generate ulang
Extension videoMelanjutkan klip 10 detik sekali jalan, sampai total 40 detikAdegan yang lebih panjang dari satu generasi
Input referensi10 gambar dan 3 klip mengarahkan satu generasi, tiap file diberi peranKarakter, produk, dan gaya yang berulang
Frame pertama dan terakhirMenginterpolasi dua gambar diam; gambar yang sama dua kali jadi loopTransisi, loop, pasangan storyboard
Audio nativeDialog ber-lip sync, efek, ambience, dan musik bersama gambarnyaAdegan berdialog, shot yang dipimpin suara
Tangga resolusi360p sampai 4K; 1080p dan 4K berupa upscaleDraft murah, pengiriman ukuran penuh
Teks di layarMerender teks bahasa Inggris yang Anda tentukan, sampai papan di latarJudul, lower third, caption

Contoh penggunaan Gemini Omni Flash 1.1

Rantai edit di satu take

Ganti pencahayaan ruangannya, tukar jaketnya, tulis ulang papan namanya. Tiap instruksi mendarat di shot yang sama, sementara sisa frame tetap bertahan.

Ruang tamu yang sama terbelah dua, cahaya siang yang datar di kiri dan senja keemasan di kanan

Adegan yang dibangun lewat extension

Buka dengan beat sepuluh detik, lalu tumbuhkan. Model membaca detik-detik terakhir Anda dan melanjutkan gerakan, pemain, serta musiknya sampai 40 detik.

Filmstrip empat panel balon udara bergaris yang melayang di atas lembah pegunungan saat fajar

Sketsa jadi footage

Sebutkan bahwa gambarnya cuma jadi panduan. Model meminjam siluet dan lintasannya, lalu membangun ulang tekstur, cahaya, dan kedalamannya.

Sketsa pensil rubah melompat di samping pose yang sama dirender sebagai rubah fotoreal di hutan

Presenter yang berbicara

Tulis kalimatnya dan karakter menyampaikannya dengan lip sync, dalam suara yang tetap jadi miliknya di setiap edit berikutnya.

Pedagang pasar berbicara hangat di atas peti-peti jeruk saat matahari sore

Sekuens berbasis timecode

Satu blok timecode mengubah satu prompt jadi sekuens potong demi potong: frame produk yang beruntun, atau satu beat tiap dua detik.

Tiga panel perempuan yang sama berselendang merah berjalan, menoleh ke belakang, lalu berlari

Loop yang sempurna

Berikan gambar yang sama sebagai frame pertama dan frame terakhir, dan klipnya kembali ke titik awal, siap dipasang di halaman produk.

Pesawat kertas terbang membentuk loop yang dilacak jejak cahaya tertutup di bengkel yang remang

Langkah 1: pilih tugasnya

Semua yang bisa dilakukan model masuk ke salah satu dari lima tugas. Sebutkan tugasnya kalau maksud Anda berpotensi salah dibaca; kalau tidak, model menyimpulkannya sendiri dari prompt dan file Anda.

TugasFungsinyaPakai saat
Text to videoMembuat klip dari brief tertulisMulai dari nol
Image to videoMenganimasikan gambar diam, atau menginterpolasi dua frameFramenya sudah ada, geraknya yang belum
Reference to videoMenyusun shot dari gambar dan klip yang sudah diberi tagKarakter atau gaya harus terbawa
EditMengubah video yang sudah adaTakenya sudah pas, satu elemen meleset
ExtendMenambahkan lanjutanTakenya sudah pas tapi kependekan

Langkah 2: tulis promptnya

Prompt adalah brief shot yang pendek, dalam urutan ini. Rasio aspek, resolusi, dan durasi adalah setelan, bukan teks prompt.

ElemenCakupannyaWajib
Subjek dan aksiSiapa yang ada di frame, dan sedang apaYa
AdeganLokasi, waktu, cuaca, latar belakangOpsional
Kamera dan cahayaUkuran shot, gerakan, lensa, sumber cahayaOpsional
AudioDialog, ambience, efek, musik, atau senyapSangat disarankan
Struktur shotSatu shot menerus, atau potongan beserta waktunyaOpsional

Begini bentuk brief-nya. Contohnya ditulis dalam bahasa Inggris, karena itu bahasa yang didokumentasikan dan dievaluasi Google untuk model ini:

Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.

Lima kendali prompt

KendaliTulis iniKenapa penting
Struktur shotSingle continuous shot, no scene cuts. Atau: every 2s cut to a new locationTanpa diminta, model bercerita lewat beberapa shot sekaligus
AudioNo music, just room tone. Atau satu kalimat terucap: she says, third one todaySenyap harus diminta, kalau tidak musiknya dikarang sendiri
WaktuAfter 3 seconds, a woman enters. Atau satu blok timecodeRentang waktu itu perkiraan, bukan titik potong yang presisi
Teks di layarA street sign that says MARKET LANETeks yang tidak ditentukan akan dikarang. Bahasa Inggris terender rapi, aksara non-Latin tidak
PemicuWhen the person touches the mirror, it ripples like liquidInstruksi berbasis kejadian mendarat lebih presisi daripada waktu yang abstrak

Untuk sekuens dengan waktu yang pasti, tulis penandanya sebagai satu blok:

[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running

Negasi ditulis di dalam prompt itu sendiri, misalnya no dialogue atau do not add captions. Tidak ada kolom terpisah untuk negative prompt.

Langkah 3: tambahkan referensi dan frame

Sepuluh gambar referensi dan tiga video referensi per generasi. Tag menetapkan peran tiap file, dinomori dari nol sesuai urutan unggahnya.

TagPeranContoh
FIRST_FRAMEFrame awal<FIRST_FRAME> a woman is walking
LAST_FRAMEFrame akhir, dipasangkan dengan frame awal<FIRST_FRAME> <LAST_FRAME> a woman is walking
IMAGE_REF_0Referensi subjek, produk, atau gayain the style of <IMAGE_REF_0>, a woman is walking
VIDEO_REF_0Referensi karakter atau objekthe person in <VIDEO_REF_0> is playing the violin
  • Lampirkan semuanya di awal. Referensi yang ditambahkan di tengah percakapan mengguncang adegan yang tadinya sudah stabil.
  • Beri satu tugas untuk tiap referensi. Gaya dari gambar pertama, subjek dari gambar kedua, lebih baik daripada membiarkan model menebak.
  • Jaga video referensi tetap pendek. Tiga detik masing-masing, paling cocok untuk kemiripan wajah, dan audio di dalamnya diabaikan.
  • Gambar yang sama sebagai frame pertama dan terakhir menghasilkan loop yang menutup rapi.

Langkah 4: edit dan perpanjang hasilnya

Take yang sudah digenerate tetap hidup di dalam percakapan, dan footage milik Anda yang berdurasi 10 detik atau kurang bisa ikut bergabung. Semua yang Anda deskripsikan berpotensi dirender ulang oleh model, jadi deskripsikan perubahannya saja.

HindariTulis ini
In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its headAdd a cat that jumps onto his lap, he begins to pet it. Keep everything else the same.
Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadowsChange the lighting to be more dramatic. Keep everything else the same.
AturanDetail
Satu perubahan per giliranInstruksi majemuk merusak konsistensi kira-kira dua kali lebih sering
Empat edit per rantaiLewat itu, penyimpangan mulai muncul. Jangkarkan ulang dengan: keep all character details exactly as they are, only change X
Extension hanya menambah di akhir10 detik sekali jalan sampai total 40 detik. Tidak bisa menyisipkan di depan atau memanjangkan bagian tengah
Jam extension dimulai dari nolAfter 2s berarti dua detik ke dalam footage yang baru
Referensi bisa ikut sertaKarakter baru masuk ke adegan yang diperpanjang lewat gambar yang Anda lampirkan

Instruksi extension yang terarah terbaca seperti ini:

Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.

Batasan Gemini Omni Flash 1.1

BatasanYang terjadiCara menyiasatinya
Teks non-LatinGlyph Jepang dan Mandarin keluar sebagai karangan yang meyakinkanPertahankan teks di layar dalam bahasa Inggris, atau periksa tiap frame
Adegan yang padatEmpat subjek terlacak atau lebih akan melebur atau melencengTahan di angka tiga
Tidak ada editing suaraTidak menerima unggahan audio referensi, tidak ada bedah suaraArahkan suaranya lewat teks; konsistensi model yang menjaganya
Batas kebijakanMerek asli dan orang yang dikenali diblokir, tergantung wilayahJaga elemen bermerek tetap generik

Harga sederhana

Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.

Basic

$9/ bulan
ditagih sebagai $0 per tahun

1100 bulanan kredit

1 pengguna saja

Semua model

Workflows

Standard

$24/ bulan
ditagih sebagai $0 per tahun

3625 bulanan kredit

1 pengguna saja

Semua model

Workflows

Pro

$45/ bulan
ditagih sebagai $0 per tahun

6350 bersama bulanan kredit

1 pengguna

+ hingga 4 lainnya dengan biaya tambahan

Semua model

Workflows

Pro Max

$170/ bulan
ditagih sebagai $0 per tahun

24650 bersama bulanan kredit

1 pengguna

+ hingga 9 lainnya dengan biaya tambahan

Semua model

Workflows

Enterprise

Untuk batas yang lebih tinggi

Khusus

ketentuan harga dan penagihan

Kredit volume tinggi
Batas kursi khusus
Semua model
Workflows
Pricing Gradient

Free

Untuk bereksperimen

$0

gratis selamanya

Hingga 20 kredit
Hanya 1 pengguna
Model terbatas
Workflows

FAQ

Bagaimana cara menulis prompt Gemini Omni Flash 1.1 yang bagus?
Tulis brief shot yang pendek: subjek dan aksinya, lokasinya, kameranya, cahayanya, dan audio yang Anda mau, dalam kalimat biasa. Secara default Omni Flash menyusun mini-narasi beberapa shot, jadi tambahkan single continuous shot, no scene cuts kalau Anda mau satu take utuh. Tulis promptnya dalam bahasa Inggris, karena itu bahasa yang dievaluasi Google untuk model ini. Selalu deskripsikan suaranya, sebab prompt yang diam soal audio akan dapat trek karangan model sendiri.
Bagaimana cara kerja prompt edit di Gemini Omni Flash 1.1?
Pendek dan tepat sasaran: make the phone invisible, keep everything else the same. Prompt edit yang terlalu deskriptif justru memicu perubahan yang tidak Anda minta, karena semua yang Anda deskripsikan berpotensi dirender ulang. Sebutkan satu perubahan saja, tutup dengan keep everything else the same, dan kerjakan satu perubahan per giliran, bukan menumpuk tiga sekaligus dalam satu kalimat.
Bagaimana cara memperpanjang video dengan Gemini Omni Flash 1.1?
Minta lanjutannya: extend this video sudah cukup, dan the scene continues: the camera pans across the mountains memberi arah yang lebih jelas. Tiap extension menambah sampai sepuluh detik, hingga total 40 detik, memakai sepuluh detik terakhir sebagai konteks dan membaurkan frame penutupnya supaya sambungannya terbaca sebagai satu take. Extension hanya menambah di ujung akhir: tidak bisa menyisipkan di depan atau memanjangkan bagian tengah.
Apa arti tag di dalam prompt Gemini Omni Flash 1.1?
Tag mengikat media yang Anda unggah ke perannya masing-masing. FIRST_FRAME dan LAST_FRAME di dalam kurung sudut menetapkan gambar awal dan akhir; IMAGE_REF_0 dan VIDEO_REF_0 menandai referensi, dihitung dari nol sesuai urutan unggah. Memberikan gambar yang sama sebagai frame pertama sekaligus frame terakhir menghasilkan klip yang berputar kembali ke awal. Tanpa tag, model menebak peran tiap file dari promptnya, yang masih aman untuk kasus sederhana dan mulai kabur begitu filenya lebih dari dua atau tiga.
Bagaimana cara menyiapkan versi horizontal dan versi vertikal dari shot yang sama?
Perlakukan keduanya sebagai dua generasi, bukan satu klip yang dipotong ulang. Rasionya ditentukan saat generate, jadi jalankan brief yang sama dua kali, satu di 16:9 dan satu di 9:16, dengan gambar referensi yang persis sama dilampirkan di keduanya. Referensi itulah yang menahan wajah, kemasan, dan gayanya, sehingga kedua versi terbaca berasal dari satu pemotretan. Tulis kalimat audionya sama persis juga, karena suara digenerate bersama gambar di tiap take. Sesudah itu, edit dan extension dikerjakan terpisah di masing-masing take, karena tiap take membawa konteksnya sendiri.
Bagaimana cara mengarahkan audio dan dialog di Gemini Omni Flash 1.1?
Deskripsikan trek yang Anda mau di prompt yang sama dengan gambarnya: no music, just room tone, a high energy techno beat, atau satu kalimat yang ditulis apa adanya untuk diucapkan karakternya. Dialog kembali dengan lip sync, dalam suara yang bertahan lintas edit dan lintas extension. Senyap pun harus diminta, karena prompt yang tidak menyebutkannya biasanya kembali dengan musik latar generik.
Bisakah Gemini Omni Flash 1.1 merender teks di dalam video?
Bisa, dan ini salah satu kekuatannya dalam bahasa Inggris: papan nama, lower third, dan animasi teks kata demi kata kembali terbaca kalau Anda mengeja persis isi tiap permukaannya. Tentukan sampai teks latarnya, kalau tidak model akan mengarang sendiri. Aksara non-Latin adalah titik lemahnya, jadi periksa tiap frame kalau shot Anda butuh tulisan Jepang atau Mandarin.
Bagaimana menjaga karakter tetap konsisten antar edit di Gemini Omni Flash 1.1?
Lakukan satu perubahan terfokus per giliran, dan biarkan memori adegan model mengurus sisanya: wajah, kostum, dan suara bertahan sendiri dari satu giliran ke giliran berikutnya. Di rantai yang panjang, jangkarkan ulang dengan keep all character details and motion exactly as they are, only change the lighting sebelum perubahan yang Anda mau. Rantai sekitar empat edit masih stabil; lewat itu, siapkan generasi baru dengan referensi yang dilampirkan ulang.