Pembuatan video

Wan 3.0

oleh Alibaba

Model video terbaru Alibaba, public beta.
Klip 30 detik dari prompt, dokumen, atau laman web.

Wan 3.0

Fitur utama

Fitur dikonfirmasi dari peluncuran public beta Wan 3.0 oleh Alibaba, Agustus 2026.

Spesifikasi teknis

Sampai 30s

30 detik native dalam sekali jalan, dengan kontrol durasi cerdas.

480p sampai 1080p

Tiga tingkat: 480p, 720p, dan 1080p. Tidak ada output 4K.

Public beta

Sudah jalan di Alibaba Cloud Model Studio dan Qwen Cloud sebagai wan3.0-video.

API saja

Tidak ada open weights. Lini Wan terbuka milik Alibaba berhenti di Wan 2.2.

Contoh penggunaan

Laporan jadi video

Serahkan deck, spreadsheet, atau pdf ke Wan 3.0, misalnya katalog produk toko Anda. Data dan teks di dalamnya disusun jadi satu rangkaian video.

Satu spot iklan 30 detik sekali jalan

Klip 30 detik memuat satu spot iklan penuh dalam sekali generate. Tidak ada potongan yang perlu disambung atau dicocokkan setelahnya.

Serial yang terkunci ke referensi

Omni-Reference menjaga karakter, produk, dan set tetap sama di tiap shot. Satu seri konten jualan pun terbaca sebagai satu kesatuan.

Contoh prompt

Sekali jalan panjang

Satu dorongan kamera tanpa putus menyusuri gang pasar pagi, uap dari gerobak melintas di depan lensa

Edit prompt

Konsistensi referensi

Kurir motor yang sama melewati tiga blok kota, dari kabut pagi sampai terik siang

Edit prompt

Tampilan produk

Rotasi pelan kemasan kopi susu botolan di atas meja kayu, cahaya jendela yang lembut

Edit prompt

Akting karakter

Penyanyi menutup satu bait, menurunkan mikrofon, lalu menarik napas dalam cahaya redup

Edit prompt

Lanskap terbuka

Tarikan udara pelan menjauh dari sawah berundak saat kabut pagi mulai terangkat

Edit prompt

Tipografi di dalam frame

Tebing pantai selatan saat golden hour, dengan kartu judul lower third yang bersih

Edit prompt

Ikhtisar

Wan 3.0 adalah model terbaru di lini video Wan milik Alibaba Tongyi Lab. Public beta-nya dibuka pada 6 Agustus 2026. Alibaba menyebutnya lompatan “dari membuat satu frame ke menceritakan satu kisah utuh”. Wujudnya: klip 30 detik native sekali jalan, dengan audio yang digenerate bersama gambar. Inputnya juga tidak berhenti di prompt, karena dokumen, deck, dan halaman web ikut diterima. Untuk kreator di sini, artinya satu klip 30 detik yang siap dibagikan tanpa perlu merakit potongan. Model ini berjalan di Alibaba Cloud Model Studio dan Qwen Cloud sebagai wan3.0-video. Harganya dihitung per detik di tiga tingkat resolusi.

Video dari dokumen jadi bintang utamanya

Kemampuan yang paling membedakan Wan 3.0 adalah Omni-Reference. Selain teks, gambar, audio, dan video, ia juga membaca file terstruktur. Formatnya: doc, xls, ppt, pdf, txt, key, pages, numbers, dan md. URL halaman web pun diterima. Isinya dibaca, lalu dirangkai jadi video. Alibaba menyebutnya mengubah “data statis yang padat teks menjadi konten video setara nyata”.

Serahkan deck laporan kuartalan atau katalog produk toko, dan yang pulang adalah klip jadi, bukan storyboard. Sejauh ini belum ada model video arus utama lain yang membaca dokumen seperti itu.

Take panjang dalam sekali jalan

Tiga puluh detik tanpa putus kira-kira dua kali lipat kemampuan lini ini di Wan 2.7. Lompatannya bukan cuma soal angka, tetapi soal satuan kerjanya. Satu spot iklan penuh, satu adegan pendek, atau satu reveal yang pelan kini muat dalam sekali generate. Tidak perlu lagi merakit beberapa klip, lalu mencocokkan cahaya, tempo, dan sambungannya. Kontrol durasi cerdas mencocokkan panjang klip dengan brief, jadi momen pendek tidak diisi detik kosong.

Shot panjang juga menuntut prompt yang berbeda. Tiga puluh detik butuh alur: pembuka, titik balik, dan penutup. Jadi tulis bagaimana frame itu berubah, bukan cuma apa isinya. Panjang tanpa titik balik hanya menghasilkan klip yang lambat, dan di situlah generasi panjang paling sering terbuang.

Kontrol referensi dan editing presisi

Omni-Reference menampung sampai 20 aset referensi. Karakter, produk, atau set dijaga konsisten sepanjang klip dan antar shot, sehingga satu rangkaian terbaca sebagai satu karya. Memberi label pada tiap referensi di dalam prompt sama pentingnya dengan mengunggahnya.

Editing kini ada di dalam model yang sama, bukan di alat terpisah. Wan 3.0 mendukung editing berbasis instruksi dan berbasis referensi. Anda bisa memilih satu rentang waktu, lalu generate ulang bagian itu saja tanpa mengusik sisanya. Visual, aksi, bahkan kalimat yang diucapkan karakter ikut bisa diubah. Media Tiongkok menggambarkan pergeserannya sebagai langkah “dari gacha ke produksi”. Prosesnya bisa dikendalikan, bukan reroll yang tidak habis-habis.

Rendering, audio, dan teks

Target visualnya disebut Alibaba “reality-grade rendering”, dengan perhatian besar pada manusia. Wajah dan kulit lebih detail, emosinya wajar dan tidak berlebihan, dan mikroekspresinya menempel pada gerak tubuh. Kustomisasi potret bahkan turun sampai struktur tulang dan detail mata.

Audio digenerate di proses yang sama dengan gambar. Karena itu tempo perlu ditulis di dalam prompt. Sebutkan bed suaranya, tentukan letak ketukannya, lalu gambar dan suara mendarat bersamaan. Teks di layar juga membaik, dengan render teks panjang di 12 bahasa. Bagan, rumus, dan infografisnya ikut lebih bersih. Meski begitu, peninjau mencatat kualitas audio dan teks di dalam frame masih bisa naik lagi.

Resolusi dan mitos 4K

Wan 3.0 keluar di 480p, 720p, dan 1080p. Tidak ada tingkat 4K. Klaim “Wan 3.0 bisa 4K” yang beredar di hasil pencarian tidak datang dari Alibaba. Daftar modelnya sendiri memberi harga untuk tepat tiga tingkat, dan 4K tidak disebut sama sekali. Perlakukan 4K, tabel spesifikasi “60B parameter”, dan “open weights Apache 2.0” sebagai karangan sampai Alibaba menerbitkan model card.

Soal open weights

Wan 3.0 tertutup dan hanya jalan lewat API. Tidak ada bobot yang muncul di organisasi Wan-AI di Hugging Face, organisasi Wan-Video di GitHub, maupun ModelScope. Open weights yang pernah dipublikasikan Alibaba berhenti di Wan 2.2 dengan lisensi Apache 2.0. Generasi 2.5, 2.6, dan 2.7 semuanya model API komersial. Untuk tim yang wajib self-hosting, Wan 2.2 tetap Wan terbaru yang bisa diunduh. Detail itulah yang menentukan cocok tidaknya lini ini.

Wan 3.0 dan Morphic

Wan 3.0 belum masuk katalog Morphic. Yang tersedia sekarang adalah jajaran model video yang luas, termasuk Seedance, Kling, dan Veo. Jadi Anda tetap bisa menggenerate video hari ini, lalu memilih model yang paling pas untuk shot itu. Kebiasaan prompt di atas terbawa ke semua model. Tulis take panjang sebagai alur, beri label pada tiap referensi, lalu taruh tempo di dalam prompt. Untuk konten TikTok maupun video jualan UMKM, melatih kebiasaan itu sekarang tidak memakan biaya apa pun.

Harga sederhana

Mulai gratis hari ini, dengan opsi untuk upgrade atau membatalkan kapan saja.

Basic

$9/ bulan
ditagih sebagai $0 per tahun

1100 bulanan kredit

1 pengguna saja

Semua model

Workflows

Standard

$24/ bulan
ditagih sebagai $0 per tahun

3625 bulanan kredit

1 pengguna saja

Semua model

Workflows

Pro

$45/ bulan
ditagih sebagai $0 per tahun

6350 bersama bulanan kredit

1 pengguna

+ hingga 4 lainnya dengan biaya tambahan

Semua model

Workflows

Pro Max

$170/ bulan
ditagih sebagai $0 per tahun

24650 bersama bulanan kredit

1 pengguna

+ hingga 9 lainnya dengan biaya tambahan

Semua model

Workflows

Enterprise

Untuk batas yang lebih tinggi

Khusus

ketentuan harga dan penagihan

Kredit volume tinggi
Batas kursi khusus
Semua model
Workflows
Pricing Gradient

Free

Untuk bereksperimen

$0

gratis selamanya

Hingga 20 kredit
Hanya 1 pengguna
Model terbatas
Workflows

FAQ

Apa itu Wan 3.0?
Wan 3.0 adalah model video terbaru dari Alibaba Tongyi Lab, masuk public beta sejak 6 Agustus 2026. Model ini menghasilkan klip 30 detik native sampai 1080p, lengkap dengan audio di proses yang sama. Ciri khasnya ada di Omni-Reference. Selain teks, gambar, audio, dan video, ia juga menerima dokumen, spreadsheet, slide, pdf, dan halaman web. Video lalu dibangun dari isinya. Aksesnya lewat Alibaba Cloud Model Studio dan Qwen Cloud dengan nama model wan3.0-video.
Apakah Wan 3.0 bisa dipakai gratis?
Tidak. Wan 3.0 adalah model API berbayar. Harganya dihitung per detik di Alibaba Cloud Model Studio maupun Qwen Cloud. Bobot modelnya juga tidak pernah dirilis ke publik. Jadi situs mana pun yang menawarkan file bobot atau unduhan gratis Wan 3.0 bukan menawarkan model yang asli.
Berapa durasi klip Wan 3.0?
Sampai 30 detik dalam sekali jalan. Kontrol durasi cerdasnya mencocokkan panjang klip dengan isi prompt, jadi adegan pendek tidak dipanjang-panjangkan. Angka itu dua kali lipat batas 15 detik di Wan 2.7. Modelnya memang dirancang untuk satu take utuh, bukan potongan pendek yang disambung.
Apa yang bisa dibuat Wan 3.0 dari sebuah dokumen?
Wan 3.0 menerima file doc, xls, ppt, pdf, txt, key, pages, numbers, dan md, plus URL halaman web. Isinya dibaca, lalu dijadikan satu rangkaian video. Alibaba menyebutnya mengubah data statis yang padat teks menjadi video jadi. Kemampuan dokumen dan halaman web inilah yang paling membedakan Wan 3.0 dari model video lain saat ini.
Apakah Wan 3.0 open source?
Bukan. Wan 3.0 tertutup dan hanya bisa diakses lewat API. Tidak ada bobot yang dipublikasikan di Hugging Face, GitHub, maupun ModelScope. Flagship video open weight terakhir dari Alibaba tetap Wan 2.2 dengan lisensi Apache 2.0, rilis 2025. Kalau syarat Anda adalah self-hosting, Wan 2.2 masih jadi Wan terbaru yang bisa diunduh.
Wan 3.0 dibanding Seedance 2.5, bagaimana?
Keduanya rilis berdekatan di awal Agustus 2026, dan sama-sama membuat klip 30 detik sekali jalan dengan audio. Seedance 2.5 menampung lebih banyak input referensi, sampai 50 gambar, video, dan audio. Kekuatan khas Wan 3.0 justru ada di membangun video dari dokumen dan halaman web. Belum ada benchmark independen untuk keduanya, dan keduanya sama-sama tertutup serta API-only. Jadi perbandingan hari ini masih bersandar pada demo.