Wan 3.0
oleh Alibaba
Model video terbaru Alibaba, public beta.
Klip 30 detik dari prompt, dokumen, atau laman web.

Fitur utama
Fitur dikonfirmasi dari peluncuran public beta Wan 3.0 oleh Alibaba, Agustus 2026.
Spesifikasi teknis
Sampai 30s
30 detik native dalam sekali jalan, dengan kontrol durasi cerdas.
480p sampai 1080p
Tiga tingkat: 480p, 720p, dan 1080p. Tidak ada output 4K.
Public beta
Sudah jalan di Alibaba Cloud Model Studio dan Qwen Cloud sebagai wan3.0-video.
API saja
Tidak ada open weights. Lini Wan terbuka milik Alibaba berhenti di Wan 2.2.
Contoh penggunaan
Laporan jadi video
Serahkan deck, spreadsheet, atau pdf ke Wan 3.0, misalnya katalog produk toko Anda. Data dan teks di dalamnya disusun jadi satu rangkaian video.
Satu spot iklan 30 detik sekali jalan
Klip 30 detik memuat satu spot iklan penuh dalam sekali generate. Tidak ada potongan yang perlu disambung atau dicocokkan setelahnya.
Serial yang terkunci ke referensi
Omni-Reference menjaga karakter, produk, dan set tetap sama di tiap shot. Satu seri konten jualan pun terbaca sebagai satu kesatuan.
Contoh prompt
Sekali jalan panjang
Satu dorongan kamera tanpa putus menyusuri gang pasar pagi, uap dari gerobak melintas di depan lensa
Edit promptKonsistensi referensi
Kurir motor yang sama melewati tiga blok kota, dari kabut pagi sampai terik siang
Edit promptTampilan produk
Rotasi pelan kemasan kopi susu botolan di atas meja kayu, cahaya jendela yang lembut
Edit promptAkting karakter
Penyanyi menutup satu bait, menurunkan mikrofon, lalu menarik napas dalam cahaya redup
Edit promptLanskap terbuka
Tarikan udara pelan menjauh dari sawah berundak saat kabut pagi mulai terangkat
Edit promptTipografi di dalam frame
Tebing pantai selatan saat golden hour, dengan kartu judul lower third yang bersih
Edit promptIkhtisar
Wan 3.0 adalah model terbaru di lini video Wan milik Alibaba Tongyi Lab. Public beta-nya dibuka pada 6 Agustus 2026. Alibaba menyebutnya lompatan “dari membuat satu frame ke menceritakan satu kisah utuh”. Wujudnya: klip 30 detik native sekali jalan, dengan audio yang digenerate bersama gambar. Inputnya juga tidak berhenti di prompt, karena dokumen, deck, dan halaman web ikut diterima. Untuk kreator di sini, artinya satu klip 30 detik yang siap dibagikan tanpa perlu merakit potongan. Model ini berjalan di Alibaba Cloud Model Studio dan Qwen Cloud sebagai wan3.0-video. Harganya dihitung per detik di tiga tingkat resolusi.
Video dari dokumen jadi bintang utamanya
Kemampuan yang paling membedakan Wan 3.0 adalah Omni-Reference. Selain teks, gambar, audio, dan video, ia juga membaca file terstruktur. Formatnya: doc, xls, ppt, pdf, txt, key, pages, numbers, dan md. URL halaman web pun diterima. Isinya dibaca, lalu dirangkai jadi video. Alibaba menyebutnya mengubah “data statis yang padat teks menjadi konten video setara nyata”.
Serahkan deck laporan kuartalan atau katalog produk toko, dan yang pulang adalah klip jadi, bukan storyboard. Sejauh ini belum ada model video arus utama lain yang membaca dokumen seperti itu.
Take panjang dalam sekali jalan
Tiga puluh detik tanpa putus kira-kira dua kali lipat kemampuan lini ini di Wan 2.7. Lompatannya bukan cuma soal angka, tetapi soal satuan kerjanya. Satu spot iklan penuh, satu adegan pendek, atau satu reveal yang pelan kini muat dalam sekali generate. Tidak perlu lagi merakit beberapa klip, lalu mencocokkan cahaya, tempo, dan sambungannya. Kontrol durasi cerdas mencocokkan panjang klip dengan brief, jadi momen pendek tidak diisi detik kosong.
Shot panjang juga menuntut prompt yang berbeda. Tiga puluh detik butuh alur: pembuka, titik balik, dan penutup. Jadi tulis bagaimana frame itu berubah, bukan cuma apa isinya. Panjang tanpa titik balik hanya menghasilkan klip yang lambat, dan di situlah generasi panjang paling sering terbuang.
Kontrol referensi dan editing presisi
Omni-Reference menampung sampai 20 aset referensi. Karakter, produk, atau set dijaga konsisten sepanjang klip dan antar shot, sehingga satu rangkaian terbaca sebagai satu karya. Memberi label pada tiap referensi di dalam prompt sama pentingnya dengan mengunggahnya.
Editing kini ada di dalam model yang sama, bukan di alat terpisah. Wan 3.0 mendukung editing berbasis instruksi dan berbasis referensi. Anda bisa memilih satu rentang waktu, lalu generate ulang bagian itu saja tanpa mengusik sisanya. Visual, aksi, bahkan kalimat yang diucapkan karakter ikut bisa diubah. Media Tiongkok menggambarkan pergeserannya sebagai langkah “dari gacha ke produksi”. Prosesnya bisa dikendalikan, bukan reroll yang tidak habis-habis.
Rendering, audio, dan teks
Target visualnya disebut Alibaba “reality-grade rendering”, dengan perhatian besar pada manusia. Wajah dan kulit lebih detail, emosinya wajar dan tidak berlebihan, dan mikroekspresinya menempel pada gerak tubuh. Kustomisasi potret bahkan turun sampai struktur tulang dan detail mata.
Audio digenerate di proses yang sama dengan gambar. Karena itu tempo perlu ditulis di dalam prompt. Sebutkan bed suaranya, tentukan letak ketukannya, lalu gambar dan suara mendarat bersamaan. Teks di layar juga membaik, dengan render teks panjang di 12 bahasa. Bagan, rumus, dan infografisnya ikut lebih bersih. Meski begitu, peninjau mencatat kualitas audio dan teks di dalam frame masih bisa naik lagi.
Resolusi dan mitos 4K
Wan 3.0 keluar di 480p, 720p, dan 1080p. Tidak ada tingkat 4K. Klaim “Wan 3.0 bisa 4K” yang beredar di hasil pencarian tidak datang dari Alibaba. Daftar modelnya sendiri memberi harga untuk tepat tiga tingkat, dan 4K tidak disebut sama sekali. Perlakukan 4K, tabel spesifikasi “60B parameter”, dan “open weights Apache 2.0” sebagai karangan sampai Alibaba menerbitkan model card.
Soal open weights
Wan 3.0 tertutup dan hanya jalan lewat API. Tidak ada bobot yang muncul di organisasi Wan-AI di Hugging Face, organisasi Wan-Video di GitHub, maupun ModelScope. Open weights yang pernah dipublikasikan Alibaba berhenti di Wan 2.2 dengan lisensi Apache 2.0. Generasi 2.5, 2.6, dan 2.7 semuanya model API komersial. Untuk tim yang wajib self-hosting, Wan 2.2 tetap Wan terbaru yang bisa diunduh. Detail itulah yang menentukan cocok tidaknya lini ini.
Wan 3.0 dan Morphic
Wan 3.0 belum masuk katalog Morphic. Yang tersedia sekarang adalah jajaran model video yang luas, termasuk Seedance, Kling, dan Veo. Jadi Anda tetap bisa menggenerate video hari ini, lalu memilih model yang paling pas untuk shot itu. Kebiasaan prompt di atas terbawa ke semua model. Tulis take panjang sebagai alur, beri label pada tiap referensi, lalu taruh tempo di dalam prompt. Untuk konten TikTok maupun video jualan UMKM, melatih kebiasaan itu sekarang tidak memakan biaya apa pun.
Harga sederhana
Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.
Basic
1100 bulanan kredit
1 pengguna saja
Semua model
Workflows
Standard
3625 bulanan kredit
1 pengguna saja
Semua model
Workflows
Pro
6350 bersama bulanan kredit
1 pengguna
Semua model
Workflows
Pro Max
24650 bersama bulanan kredit
1 pengguna
Semua model
Workflows
Enterprise
Untuk batas yang lebih tinggi
Khusus
ketentuan harga dan penagihan

Free
Untuk bereksperimen
$0
gratis selamanya
FAQ
ChatGPT Images 2.5
OpenAI
Model gambar OpenAI, rilis September 2026. Detail lebih tajam, edit presisi, proses lebih cepat.
Lyria 3.5
Google DeepMind
Model musik terbaik dari Google. Lagu utuh: struktur, vokal, dan lirik.
MiniMax H3 Max Turbo
fal.ai
Tingkat cepat dari H3 racikan fal. Dua kali lebih gesit, tampilan mirip.
Inworld TTS 2
Inworld
95 suara, lebih dari 100 bahasa. Audio mulai di bawah satu detik.