Wan 3.0
par Alibaba
Dernier modèle vidéo d’Alibaba, en bêta publique.
30 s natives depuis prompt, doc ou page web.

Fonctionnalités clés
Fonctionnalités confirmées lors du lancement en bêta publique de Wan 3.0 par Alibaba, en août 2026.
Spécifications techniques
Jusqu’à 30 s
Trente secondes natives en une passe, avec une durée pilotée intelligemment.
480p à 1080p
Trois paliers : 480p, 720p et 1080p. Aucune sortie 4K.
Bêta publique
En ligne sur Alibaba Cloud Model Studio et Qwen Cloud, sous le nom wan3.0-video.
API seule
Aucun poids ouvert. La ligne ouverte d’Alibaba s’arrête à Wan 2.2.
Cas d'utilisation
Du rapport à la vidéo
Donnez-lui une présentation, un tableur ou un pdf : il en tire une séquence vidéo à partir des données et du texte.
Un spot entier en une prise
Trente secondes couvrent un spot en une seule génération. Aucun raccord à recoller ni à faire correspondre ensuite.
Série tenue par références
Omni-Reference tient le personnage, le produit ou le décor d’un plan à l’autre. La séquence se lit comme un seul objet.
Exemples de prompts
Continuité des références
Le même coursier traverse trois pâtés d’immeubles, de la brume à midi
Edit promptPrésentation produit
Rotation en lumière d’atelier d’un flacon posé sur une dalle d’ardoise
Edit promptVue d’ensemble
Wan 3.0 est le dernier modèle de la ligne vidéo Wan, développée par le Tongyi Lab d’Alibaba. Il est en bêta publique depuis le 6 août 2026.
Alibaba résume l’ambition en une formule : passer « de la génération d’une image à la narration d’une histoire entière ». Dans les faits, cela tient en trois points. Trente secondes natives en une passe. Un son produit en même temps que l’image. Et une entrée qui dépasse le prompt, jusqu’aux documents, aux présentations et aux pages web.
Le modèle tourne sur Alibaba Cloud Model Studio et Qwen Cloud, sous le nom wan3.0-video. La facturation API se fait à la seconde, sur trois paliers de résolution.
La vidéo depuis un document, voilà la nouveauté
La capacité qui distingue Wan 3.0 s’appelle Omni-Reference. Au-delà du texte, de l’image, du son et de la vidéo, le modèle lit des fichiers structurés : doc, xls, ppt, pdf, txt, key, pages, numbers, md, et n’importe quelle adresse de page web. Il en tire une séquence vidéo.
Alibaba décrit l’opération comme la transformation d’« une donnée statique et très textuelle en contenu vidéo au niveau du réel ». Donnez-lui une présentation trimestrielle ou une fiche produit. Ce qui revient est un clip fini, pas un storyboard.
Aucun autre modèle vidéo grand public ne lit les documents de cette façon aujourd’hui.
Le plan long, en une passe
Trente secondes en une prise continue, c’est environ le double de ce que faisait la ligne à Wan 2.7. Le saut ne change pas seulement un chiffre, il change l’unité de travail.
Un spot complet, une scène courte, une révélation lente : tout cela tient désormais dans une seule génération. Fini l’assemblage de plusieurs clips qu’il faut ensuite raccorder en lumière, en rythme et en continuité. La gestion intelligente de la durée cale la longueur sur le brief, donc un battement court ne se remplit pas de secondes vides.
Un plan long réclame aussi une autre façon d’écrire. Trente secondes demandent un arc : un début, un basculement, une fin. Le brief doit dire comment le cadre évolue, pas seulement ce qu’il contient. Sans basculement, la durée ne donne qu’un clip lent, et c’est la première façon de gâcher une génération longue.
Références et retouche au plan près
Omni-Reference accepte jusqu’à 20 éléments de référence. Il tient un personnage, un produit ou un décor d’un plan à l’autre, et c’est ce qui fait qu’une séquence se lit comme un seul travail. Nommer chaque référence dans le prompt compte autant que la fournir.
L’édition fait maintenant partie du modèle lui-même, au lieu d’être un outil à part. Wan 3.0 accepte l’édition par instruction et par référence : vous sélectionnez un intervalle de temps et ne régénérez que lui, le reste ne bouge pas. Le visuel, l’action et jusqu’aux répliques d’un personnage s’ajustent. La presse chinoise a résumé le changement d’un passage « du gacha à la production » : une passe pilotable plutôt que des relances sans fin.
Rendu, son et texte à l’écran
Alibaba appelle sa cible visuelle le « rendu au niveau du réel », avec une insistance nette sur les personnes. Visages et peau détaillés, émotion naturelle et retenue, micro-expressions liées aux gestes. La personnalisation du portrait descend jusqu’à la structure osseuse et au détail de l’œil.
Le son est généré dans la même passe que l’image. Le rythme se travaille donc dans le prompt : nommez le lit sonore, placez le temps fort, et l’image et le son tombent ensemble.
Le texte à l’écran progresse également, avec un rendu de texte long sur 12 langues et des graphiques, formules et infographies plus propres. Les premiers retours notent malgré tout que la qualité audio et le texte dans l’image gardent de la marge.
Résolution : le mythe de la 4K
Wan 3.0 sort en 480p, en 720p et en 1080p. Il n’existe pas de palier 4K. Les affirmations « Wan 3.0 fait de la 4K » qui circulent dans les résultats de recherche ne viennent pas d’Alibaba : sa propre fiche de modèle facture exactement trois paliers et ne mentionne la 4K nulle part.
Traitez de la même façon les tableaux de specs annonçant 60 milliards de paramètres ou des poids ouverts sous Apache 2.0. Ce sont des inventions tant qu’Alibaba n’a pas publié de fiche officielle.
Sur les poids ouverts
Wan 3.0 est un modèle fermé, en API seule. Aucun poids n’est apparu sur l’organisation Hugging Face Wan-AI, sur l’organisation GitHub Wan-Video, ni sur ModelScope. Les poids ouverts publiés par Alibaba s’arrêtent à Wan 2.2, sous Apache 2.0. Les générations 2.5, 2.6 et 2.7 étaient toutes des modèles commerciaux en API.
Pour une équipe tenue par une contrainte d’auto-hébergement, Wan 2.2 reste donc le Wan téléchargeable le plus récent. C’est ce détail qui décide si cette ligne peut entrer dans un pipeline hébergé chez vous.
Wan 3.0 et Morphic
Wan 3.0 ne figure pas au catalogue Morphic. La gamme vidéo disponible y reste large, avec Seedance, Kling et Veo parmi d’autres. Vous générez donc aujourd’hui, en choisissant le modèle qui sert le plan.
Les réflexes d’écriture décrits plus haut se transposent partout. Écrire un plan long comme un arc, nommer chaque référence, inscrire le rythme dans le prompt : les prendre dès aujourd’hui ne coûte rien.
Tarifs simples
Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.
Basic
1100 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Standard
3625 mensuel crédits
1 utilisateur uniquement
Tous les modèles
Workflows
Pro
6350 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Pro Max
24650 partagé mensuel crédits
1 utilisateur
Tous les modèles
Workflows
Enterprise
Pour des limites plus élevées
Personnalisé
conditions de tarification et de facturation

Free
Pour expérimenter
$0
gratuit pour toujours
Questions fréquentes
ChatGPT Images 2.5
OpenAI
Le modèle d'image d'OpenAI, sorti en septembre 2026. Plus de détail, des retouches ciblées, plus de vitesse.
Lyria 3.5
Google DeepMind
Le meilleur modèle musical de Google. Des chansons entières, voix et paroles.
MiniMax H3 Max Turbo
fal.ai
Le palier rapide du H3 signé fal. Deux fois plus vite, rendu quasi égal.
Inworld TTS 2
Inworld
95 voix, plus de 100 langues. La voix part en moins d’une seconde.