Apa itu Kling 3.0?
Kling 3.0 adalah model generasi video yang dirilis Kuaishou pada Februari 2026. Model ini dibangun dengan menggabungkan dua model sebelumnya, Kling Video 2.6 dan Kling O1, menjadi satu arsitektur terpadu. Video 2.6 menangani generasi text-to-video dan image-to-video dengan kontrol gerakan. Kling O1 berfokus pada kualitas dan konsistensi visual. Kling 3.0 memadukan keduanya menjadi satu model yang menghasilkan video, audio, dan konsistensi elemen dalam sekali proses.
Hasilnya adalah model yang bekerja bukan seperti generator klip, melainkan lebih seperti sutradara adegan. Anda menjelaskan sebuah narasi di prompt, lalu Kling 3.0 merencanakan shot, menentukan sudut kamera, menghasilkan dialog tersinkronisasi dengan lip-sync, dan menjaga karakter tetap konsisten secara visual di setiap potongan. Output mendukung durasi 3 hingga 15 detik pada resolusi hingga 4K native.
Di Morphic, Kling 3.0 tersedia sebagai bagian dari suite generasi video. Anda bisa memakainya di workspace yang sama dengan tool gambar, musik, dan audio Morphic, yang berguna saat sebuah proyek membutuhkan aset dalam berbagai format.
Cara memberi prompt Kling 3.0
Cara Anda menulis prompt mengubah segalanya tentang output. Kling 3.0 adalah model video, yang berarti ia merespons gerakan, timing, dan arahan kamera, bukan sekadar tampilan visual. Prompt yang menghasilkan hasil terbaik terbaca seperti deskripsi adegan untuk film pendek, bukan keterangan untuk sebuah foto.
Berikut kerangka prompt untuk mendapatkan hasil kuat di berbagai jenis konten video.
1. Awali dengan bahasa kamera
Kata-kata pertama di prompt Anda menentukan nada visual untuk keseluruhan generasi. Kling 3.0 memahami terminologi sinematik dan meresponsnya secara langsung. Menyebut perilaku kamera tertentu sebelum mendeskripsikan apa pun yang lain mengunci model ke pendekatan visual yang konsisten.
| Prompt buruk | Prompt baik |
|---|---|
| "Seorang wanita berjalan menyusuri kota di malam hari, tampilan sinematik" | "Tracking shot handheld mengikuti seorang wanita bermantel gelap berjalan menyusuri jalan kota yang basah oleh hujan di malam hari, pantulan neon di aspal, depth of field dangkal" |
Prompt pertama menyerahkan perilaku kamera sepenuhnya kepada model. Prompt kedua memberi tahu persis bagaimana kamera bergerak: handheld, tracking, mengikuti subjek. Prompt itu juga membumikan adegan dengan detail lingkungan spesifik yang menginformasikan pencahayaan dan suasana.
Istilah kamera yang direspons Kling 3.0 dengan baik: tracking shot, orbital pan, macro close-up, POV, whip-pan, slow push-in, static wide shot, dan handheld dengan drift halus.
2. Susun prompt multi-shot dengan shot berlabel
Saat Anda ingin beberapa sudut kamera dalam satu generasi, beri label tiap shot secara eksplisit. Kling 3.0 mendukung mode multi-shot kustom di mana Anda menentukan jumlah shot, durasi tiap shot, dan apa yang terjadi di dalam frame. Makin jelas label shot Anda, makin presisi model mengikutinya.
| Prompt buruk | Prompt baik |
|---|---|
| "Seorang pria memesan makanan di restoran, lalu pelayan mengantar hidangannya, lalu ia makan" | "Shot 1: medium shot seorang pria berkemeja biru navy duduk di meja restoran, menelusuri menu, pencahayaan interior hangat. Shot 2: close-up over-the-shoulder menu di tangannya, jarinya menunjuk sebuah item. Shot 3: wide shot pelayan menghampiri meja membawa piring, pria itu mendongak. Shot 4: close-up piring diletakkan di meja, uap mengepul dari makanan." |
Prompt pertama mendeskripsikan urutan peristiwa tapi tidak memberi model arahan visual. Prompt kedua memecah narasi menjadi shot-shot berbeda, masing-masing dengan framing, posisi subjek, dan detail visual spesifik. Inilah yang dirancang untuk mode multi-shot kustom.
3. Tandai pembicara langsung dengan dialognya
Dalam adegan berdialog, Kling 3.0 perlu tahu karakter mana yang mengucapkan baris mana. Tanpa penandaan eksplisit, model bisa menyematkan suara ke wajah yang salah atau membingungkan pembicara, terutama dengan tiga karakter atau lebih.
| Prompt buruk | Prompt baik |
|---|---|
| "Dua orang duduk di meja kafe dan mengobrolkan rencana akhir pekan mereka dan apakah sebaiknya mendaki atau tetap di kota" | "Seorang wanita muda berblus putih dan seorang pria berjaket abu-abu duduk di meja kafe luar ruang. Wanita itu mengangkat cangkir kopinya dan berkata 'Aku pikir kita bisa menyusuri jalur pantai hari Sabtu.' Pria itu menyandarkan tubuhnya dan menjawab 'Boleh, tapi kita mesti berangkat pagi sebelum terlalu panas.'" |
Prompt pertama merangkum topik percakapan tanpa memberi model dialog nyata atau identifikasi pembicara. Prompt kedua memasangkan tiap karakter dengan deskripsi fisik dan baris spesifiknya, sehingga model bisa mencocokkan gerakan bibir dan suara ke wajah yang tepat.
4. Gunakan gambar referensi untuk menjangkarkan karakter
Saat Anda mengunggah gambar referensi, Kling 3.0 memakainya sebagai jangkar visual di sepanjang generasi. Ini lebih andal daripada mendeskripsikan tampilan karakter lewat teks saja, terutama untuk menjaga konsistensi di beberapa shot atau generasi terpisah.
Untuk memaksimalkan referensi:
- Unggah 2-4 gambar referensi yang menampilkan karakter dari sudut berbeda jika memungkinkan. Ini memberi model lebih banyak data visual untuk dijadikan pegangan.
- Jika Anda mengunggah referensi video, model bisa mengekstrak tampilan karakter sekaligus nada suara alaminya, menjaga keduanya konsisten di sepanjang generasi.
- Untuk video produk, unggah gambar produk sebagai referensi agar branding, teks, dan warna tetap konsisten selama gerakan kamera.
5. Deskripsikan gerakan dan aksi sepanjang waktu, bukan adegan statis
Kesalahan paling umum saat memberi prompt ke model video adalah menulis prompt yang mendeskripsikan sebuah foto. Kling 3.0 menghasilkan gerakan, jadi prompt Anda perlu mendeskripsikan bagaimana hal-hal berubah sepanjang durasi klip: bagaimana subjek bergerak, bagaimana kamera merespons, dan bagaimana adegan berkembang.
| Prompt buruk | Prompt baik |
|---|---|
| "Sebuah botol parfum di atas permukaan beludru dengan pencahayaan lembut dan kelopak mawar" | "Kamera perlahan mengorbit botol parfum kaca di atas permukaan beludru gelap, cahaya keemasan lembut menangkap faset botol saat berputar ke dalam pandangan, kelopak mawar yang berserakan bergeser lembut karena aliran udara, kamera perlahan mengetat dari framing lebar ke close-up label" |
Prompt pertama mendeskripsikan gambar diam. Prompt kedua mendeskripsikan bagaimana kamera bergerak, bagaimana cahaya berinteraksi dengan objek sepanjang waktu, dan bagaimana framing berubah. Ini memberi model jalur gerakan yang jelas untuk diikuti.
Apa yang baru di Kling 3.0
Kling 3.0 adalah peningkatan signifikan dari Kling Video 2.6. Tabel di bawah menunjukkan apa yang berubah, berdasarkan dokumentasi model resmi Kling 3.0.
| Kemampuan | Kling Video 2.6 | Kling Video 3.0 |
|---|---|---|
| Text-to-video | Ya | Ya |
| Image-to-video | Ya | Ya |
| Frame awal dan akhir ke video | Ya | Ya |
| Audio native | Ya | Ya |
| Generasi multi-shot | Tidak | Ya |
| Frame awal + referensi elemen | Tidak | Ya |
| Koreferensi multi-karakter (3+) | Tidak | Ya |
| Dukungan multibahasa (Mandarin, Inggris, Jepang, Korea, Spanyol) | Tidak | Ya |
| Dialek dan aksen | Tidak | Ya |
| Durasi output 15 detik | Tidak | Ya |
| Durasi fleksibel (3-15 detik) | Tidak | Ya |
| Resolusi 4K native | Tidak | Ya |
Tambahan yang paling mencolok adalah generasi multi-shot dan sistem referensi elemen. Multi-shot memungkinkan hingga enam potongan kamera dalam satu generasi, yang menghilangkan kebutuhan menghasilkan klip satu per satu lalu menyatukannya secara manual. Sistem referensi elemen membuat Anda bisa mengikat tampilan visual dan nada suara karakter ke sebuah elemen yang dapat dipakai ulang, sehingga konsistensi terbawa lintas shot bahkan lintas generasi video terpisah.
Dukungan multibahasa dengan rendering dialek dan aksen juga baru. Kling 2.6 mendukung audio native, tapi 3.0 memperluasnya ke lima bahasa dengan kemampuan meniru aksen tertentu (Amerika, Inggris, India untuk bahasa Inggris; Kanton, Timur Laut, Beijing, Sichuan, Taiwan untuk bahasa Mandarin) dan menangani code-switching dalam satu adegan.
Kemampuan Kling 3.0
Generasi storyboard multi-shot
Kling 3.0 menawarkan dua mode untuk video multi-shot. Di mode auto, Anda mengaktifkan toggle multi-shot dan model membaca deskripsi adegan Anda untuk merencanakan transisi kamera, framing shot, dan pacing sendiri. Di mode kustom, Anda menentukan tiap shot satu per satu, menyebutkan durasi, sudut kamera, dan isi naratifnya. Model mengikuti storyboard Anda persis.
Mode kustom sangat berguna untuk konten terstruktur seperti iklan produk atau sekuens dialog di mana timing tiap potongan penting. Mode auto bekerja baik saat Anda ingin model menafsirkan prompt naratif dan menentukan cakupan visualnya.
Audio native dengan pengikatan suara khas karakter
Video dan audio dihasilkan dalam sekali proses. Model menghasilkan dialog ber-lip-sync, dan Anda bisa mengatur karakter mana yang mengucapkan baris mana dengan memasangkan karakter dengan dialognya di prompt. Di luar lip-sync dasar, Kling 3.0 mendukung pembuatan elemen karakter dengan nada suara terikat. Begitu Anda mengikat suara ke elemen karakter, suara itu tetap konsisten setiap kali karakter tersebut muncul, tanpa perlu menyebutkannya lagi.
Model mendukung dialog dalam bahasa Inggris, Mandarin, Jepang, Korea, dan Spanyol, dengan dukungan dialek dan aksen serta code-switching multibahasa dalam satu adegan.
Sistem referensi elemen
Anda bisa membuat elemen karakter yang dapat dipakai ulang dengan mengunggah 2-4 gambar referensi atau video referensi pendek. Untuk elemen karakter, Anda juga bisa menetapkan nada suara dengan mengunggah audio atau memilih dari suara yang tersedia. Saat Anda memakai sebuah elemen di prompt, model mengunci tampilan dan suara karakter di sepanjang video, menjaga konsistensi bahkan melalui gerakan kamera, pergantian adegan, dan sekuens multi-shot.
Sistem ini mendukung tiga karakter berbeda atau lebih dalam frame yang sama tanpa mencampur fitur, yang krusial untuk adegan dialog dan video apa pun dengan banyak orang.
Pelestarian teks dan logo
Model bisa mengenali konten teks di gambar yang diunggah, seperti papan tanda, label produk, atau logo, dan menjaga konsistensi teks di sepanjang video. Model juga bisa menghasilkan konten teks baru di dalam video itu sendiri. Teks tetap terbaca bahkan selama gerakan kamera berkelanjutan, yang berguna untuk konten komersial di mana elemen brand perlu tetap tajam dan terbaca.
Durasi dan resolusi fleksibel
Kling 3.0 menghasilkan video dari 3 hingga 15 detik dalam sekali proses, dengan dukungan resolusi hingga 4K native. Durasi yang lebih panjang memberi model ruang untuk pengembangan naratif yang lebih kompleks, transisi adegan, dan sekuens aksi yang tidak muat di klip lebih pendek. Opsi resolusi juga mencakup 1080p dan 720p.
Spesifikasi teknis Kling 3.0
| Spesifikasi | Detail |
|---|---|
| Mode generasi | Text-to-video, image-to-video, frame awal dan akhir ke video |
| Durasi maksimal | 15 detik |
| Durasi minimal | 3 detik |
| Resolusi maksimal | 4K native |
| Resolusi lain | 1080p, 720p |
| Rasio aspek | 16:9, 9:16, 1:1 |
| Multi-shot | Hingga 6 potongan kamera per generasi |
| Mode multi-shot | Auto (model merencanakan shot) dan Kustom (pengguna menentukan tiap shot) |
| Audio native | Dialog ber-lip-sync, kontrol nada suara |
| Bahasa yang didukung | Inggris, Mandarin, Jepang, Korea, Spanyol |
| Dukungan dialek dan aksen | Ya (dialek Mandarin dan Inggris, aksen regional) |
| Code-switching | Ya (beberapa bahasa dalam satu adegan) |
| Elemen karakter | Dibuat dari 2-4 gambar atau referensi video |
| Pengikatan suara | Nada suara terikat ke elemen karakter |
| Koreferensi multi-karakter | 3+ karakter berbeda dalam satu frame |
| Pelestarian teks | Membaca dan mempertahankan teks dari gambar yang diunggah |
| Silsilah model | Terpadu dari Kling Video 2.6 + Kling O1 |
| Tanggal rilis | Februari 2026 |
Kasus penggunaan Kling 3.0
Pembuat film pendek dan kreator naratif
Generasi multi-shot adalah yang membuat Kling 3.0 sangat berguna untuk konten naratif pendek. Anda bisa menghasilkan adegan lengkap dengan dialog shot-reverse-shot, establishing shot, dan close-up dalam sekali proses. Bagi kreator yang menggarap drama pendek, mikroseri, atau konten sosial berbasis cerita, ini menghilangkan pekerjaan manual menghasilkan klip satu per satu dan menyuntingnya bersama. Durasi 15 detik dengan hingga enam potongan memberi cukup ruang untuk awal, tengah, dan penutup dalam satu generasi.
Video produk dan e-commerce
Iklan produk butuh kamera bergerak mengelilingi objek sementara teks brand dan logo tetap tajam. Pelestarian teks Kling 3.0 menangani ini secara native, menjaga label terbaca selama orbital shot dan gerakan tracking. Dipadukan dengan sistem referensi elemen, Anda bisa mengunci identitas visual produk dan menghasilkan beberapa variasi iklan dengan sudut kamera, setup pencahayaan, atau lingkungan latar berbeda sementara produknya sendiri tetap konsisten. Di Morphic, Anda bisa menghasilkan video produk lalu membuat thumbnail atau aset sosial yang senada di workspace yang sama.
Tim konten media sosial
Kombinasi rasio aspek fleksibel (16:9, 9:16, 1:1) dan iterasi cepat berarti Anda bisa menghasilkan konten video spesifik per platform tanpa workflow produksi terpisah untuk tiap format. Mode multi-shot dengan storyboard otomatis berguna di sini, di mana Anda menjelaskan konsep konten dan model menangani perencanaan shot. Bagi tim yang butuh volume di Instagram, TikTok, YouTube Shorts, dan postingan feed, ini mempercepat siklus pembuatan secara signifikan.
Konten multibahasa dan terlokalisasi
Dukungan dialek dan code-switching membuka kasus penggunaan yang tidak bisa ditangani sebagian besar model video AI. Video pelatihan di mana presenter berbicara bahasa Korea, iklan pariwisata di mana karakter beralih antara bahasa Inggris dan Spanyol di tengah percakapan, atau klip sosial yang menampilkan aksen regional otentik, semuanya terhasilkan dengan gerakan bibir alami dan ekspresi wajah yang koheren. Bagi brand yang menyasar banyak pasar, ini berarti memproduksi konten video terlokalisasi dari kerangka prompt yang sama tanpa merekam ulang audio.
Di Morphic, Anda bisa memadukan Kling 3.0 dengan tool gambar dan audio platform untuk membangun paket konten lengkap, dari video ke thumbnail hingga musik latar, tanpa berpindah antaraplikasi terpisah.
FAQ
Kling 3.0 tersedia di Morphic. Daftar paket Morphic, pilih mode Video dari prompt bar, dan pilih Kling 3.0 dari dropdown model. Model ini berdampingan dengan tool generasi gambar, musik, dan audio, jadi Anda bisa bekerja lintas berbagai jenis konten dalam satu workspace.
Kedua model menangani text-to-video dan image-to-video, tapi melayani kasus penggunaan yang berbeda. Kling 3.0 adalah model generasi inti dengan storyboard multi-shot dan audio native. Kling 3.0 Omni memperluasnya dengan kontrol konsistensi elemen yang lebih dalam, referensi karakter berbasis video, dan pengikatan nada suara. Kalau Anda butuh satu video rapi dari sebuah prompt, Kling 3.0 pilihan yang tepat. Kalau Anda membangun seri di mana karakter yang sama muncul di banyak generasi, Omni memberi Anda tool konsistensi untuk menjaganya.
Model menghasilkan dialog ber-lip-sync dalam lima bahasa: Inggris, Mandarin, Jepang, Korea, dan Spanyol. Model ini melampaui dukungan bahasa dasar dengan rendering dialek dan aksen tertentu, termasuk aksen Amerika, Inggris, dan India untuk bahasa Inggris, serta dialek Kanton, Timur Laut, Beijing, Sichuan, dan Taiwan untuk bahasa Mandarin. Karakter juga bisa beralih antarbahasa di tengah percakapan dalam klip yang sama.
Multi-shot menghasilkan hingga enam potongan kamera berbeda dalam satu video. Anda punya dua opsi: mode auto, di mana model merencanakan transisi potongan berdasarkan prompt Anda, dan mode kustom, di mana Anda sendiri menentukan framing, durasi, dan sudut kamera tiap shot. Di mode kustom, model mengikuti storyboard Anda persis. Di mode auto, model menafsirkan narasi Anda dan menentukan cakupan shot terbaik. Kedua mode menjaga konsistensi karakter di semua potongan.
Resolusi maksimalnya adalah 4K native, artinya video dihasilkan pada resolusi itu, bukan di-upscale. 1080p dan 720p juga tersedia untuk generasi lebih cepat atau ukuran file lebih kecil. Durasi berkisar 3 hingga 15 detik per generasi. Rasio aspek yang didukung adalah 16:9, 9:16, dan 1:1, mencakup format widescreen, vertikal, dan persegi.
