Génération de vidéos

Wan 3.0

par Alibaba

Dernier modèle vidéo d’Alibaba, en bêta publique.
30 s natives depuis prompt, doc ou page web.

Wan 3.0

Fonctionnalités clés

Fonctionnalités confirmées lors du lancement en bêta publique de Wan 3.0 par Alibaba, en août 2026.

Spécifications techniques

Jusqu’à 30 s

Trente secondes natives en une passe, avec une durée pilotée intelligemment.

480p à 1080p

Trois paliers : 480p, 720p et 1080p. Aucune sortie 4K.

Bêta publique

En ligne sur Alibaba Cloud Model Studio et Qwen Cloud, sous le nom wan3.0-video.

API seule

Aucun poids ouvert. La ligne ouverte d’Alibaba s’arrête à Wan 2.2.

Cas d'utilisation

Du rapport à la vidéo

Donnez-lui une présentation, un tableur ou un pdf : il en tire une séquence vidéo à partir des données et du texte.

Un spot entier en une prise

Trente secondes couvrent un spot en une seule génération. Aucun raccord à recoller ni à faire correspondre ensuite.

Série tenue par références

Omni-Reference tient le personnage, le produit ou le décor d’un plan à l’autre. La séquence se lit comme un seul objet.

Exemples de prompts

Plan-séquence

Une avancée continue dans une ruelle mouillée, les vitrines défilent

Edit prompt

Continuité des références

Le même coursier traverse trois pâtés d’immeubles, de la brume à midi

Edit prompt

Présentation produit

Rotation en lumière d’atelier d’un flacon posé sur une dalle d’ardoise

Edit prompt

Interprétation

Une violoncelliste achève sa phrase, baisse l’archet et souffle

Edit prompt

Ouverture de paysage

Recul aérien lent au-dessus de la Camargue, la brume se lève au jour

Edit prompt

Texte dans l’image

Falaise d’Étretat à l’heure dorée, un cartouche de titre net en bas

Edit prompt

Vue d’ensemble

Wan 3.0 est le dernier modèle de la ligne vidéo Wan, développée par le Tongyi Lab d’Alibaba. Il est en bêta publique depuis le 6 août 2026.

Alibaba résume l’ambition en une formule : passer « de la génération d’une image à la narration d’une histoire entière ». Dans les faits, cela tient en trois points. Trente secondes natives en une passe. Un son produit en même temps que l’image. Et une entrée qui dépasse le prompt, jusqu’aux documents, aux présentations et aux pages web.

Le modèle tourne sur Alibaba Cloud Model Studio et Qwen Cloud, sous le nom wan3.0-video. La facturation API se fait à la seconde, sur trois paliers de résolution.

La vidéo depuis un document, voilà la nouveauté

La capacité qui distingue Wan 3.0 s’appelle Omni-Reference. Au-delà du texte, de l’image, du son et de la vidéo, le modèle lit des fichiers structurés : doc, xls, ppt, pdf, txt, key, pages, numbers, md, et n’importe quelle adresse de page web. Il en tire une séquence vidéo.

Alibaba décrit l’opération comme la transformation d’« une donnée statique et très textuelle en contenu vidéo au niveau du réel ». Donnez-lui une présentation trimestrielle ou une fiche produit. Ce qui revient est un clip fini, pas un storyboard.

Aucun autre modèle vidéo grand public ne lit les documents de cette façon aujourd’hui.

Le plan long, en une passe

Trente secondes en une prise continue, c’est environ le double de ce que faisait la ligne à Wan 2.7. Le saut ne change pas seulement un chiffre, il change l’unité de travail.

Un spot complet, une scène courte, une révélation lente : tout cela tient désormais dans une seule génération. Fini l’assemblage de plusieurs clips qu’il faut ensuite raccorder en lumière, en rythme et en continuité. La gestion intelligente de la durée cale la longueur sur le brief, donc un battement court ne se remplit pas de secondes vides.

Un plan long réclame aussi une autre façon d’écrire. Trente secondes demandent un arc : un début, un basculement, une fin. Le brief doit dire comment le cadre évolue, pas seulement ce qu’il contient. Sans basculement, la durée ne donne qu’un clip lent, et c’est la première façon de gâcher une génération longue.

Références et retouche au plan près

Omni-Reference accepte jusqu’à 20 éléments de référence. Il tient un personnage, un produit ou un décor d’un plan à l’autre, et c’est ce qui fait qu’une séquence se lit comme un seul travail. Nommer chaque référence dans le prompt compte autant que la fournir.

L’édition fait maintenant partie du modèle lui-même, au lieu d’être un outil à part. Wan 3.0 accepte l’édition par instruction et par référence : vous sélectionnez un intervalle de temps et ne régénérez que lui, le reste ne bouge pas. Le visuel, l’action et jusqu’aux répliques d’un personnage s’ajustent. La presse chinoise a résumé le changement d’un passage « du gacha à la production » : une passe pilotable plutôt que des relances sans fin.

Rendu, son et texte à l’écran

Alibaba appelle sa cible visuelle le « rendu au niveau du réel », avec une insistance nette sur les personnes. Visages et peau détaillés, émotion naturelle et retenue, micro-expressions liées aux gestes. La personnalisation du portrait descend jusqu’à la structure osseuse et au détail de l’œil.

Le son est généré dans la même passe que l’image. Le rythme se travaille donc dans le prompt : nommez le lit sonore, placez le temps fort, et l’image et le son tombent ensemble.

Le texte à l’écran progresse également, avec un rendu de texte long sur 12 langues et des graphiques, formules et infographies plus propres. Les premiers retours notent malgré tout que la qualité audio et le texte dans l’image gardent de la marge.

Résolution : le mythe de la 4K

Wan 3.0 sort en 480p, en 720p et en 1080p. Il n’existe pas de palier 4K. Les affirmations « Wan 3.0 fait de la 4K » qui circulent dans les résultats de recherche ne viennent pas d’Alibaba : sa propre fiche de modèle facture exactement trois paliers et ne mentionne la 4K nulle part.

Traitez de la même façon les tableaux de specs annonçant 60 milliards de paramètres ou des poids ouverts sous Apache 2.0. Ce sont des inventions tant qu’Alibaba n’a pas publié de fiche officielle.

Sur les poids ouverts

Wan 3.0 est un modèle fermé, en API seule. Aucun poids n’est apparu sur l’organisation Hugging Face Wan-AI, sur l’organisation GitHub Wan-Video, ni sur ModelScope. Les poids ouverts publiés par Alibaba s’arrêtent à Wan 2.2, sous Apache 2.0. Les générations 2.5, 2.6 et 2.7 étaient toutes des modèles commerciaux en API.

Pour une équipe tenue par une contrainte d’auto-hébergement, Wan 2.2 reste donc le Wan téléchargeable le plus récent. C’est ce détail qui décide si cette ligne peut entrer dans un pipeline hébergé chez vous.

Wan 3.0 et Morphic

Wan 3.0 ne figure pas au catalogue Morphic. La gamme vidéo disponible y reste large, avec Seedance, Kling et Veo parmi d’autres. Vous générez donc aujourd’hui, en choisissant le modèle qui sert le plan.

Les réflexes d’écriture décrits plus haut se transposent partout. Écrire un plan long comme un arc, nommer chaque référence, inscrire le rythme dans le prompt : les prendre dès aujourd’hui ne coûte rien.

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$9/ mois
facturé comme $0 par an

1100 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3625 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6350 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Pro Max

$170/ mois
facturé comme $0 par an

24650 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Qu’est-ce que Wan 3.0 ?
Wan 3.0 est le dernier modèle vidéo du Tongyi Lab d’Alibaba, en bêta publique depuis le 6 août 2026. Il produit des clips de 30 secondes natifs, jusqu’en 1080p, avec le son généré dans la même passe. Sa signature s’appelle Omni-Reference. En plus du texte, de l’image, du son et de la vidéo, il accepte documents, tableurs, présentations, pdf et pages web, et en fabrique de la vidéo. On y accède par Alibaba Cloud Model Studio et Qwen Cloud, sous le nom wan3.0-video.
Quelle est la durée des clips Wan 3.0 ?
Jusqu’à 30 secondes en une seule passe. Une gestion intelligente de la durée cale la longueur sur le prompt, si bien qu’une scène courte n’est pas étirée pour rien. C’est le double du plafond de 15 secondes de Wan 2.7. Le modèle vise le plan continu, pas la suite de fragments recollés au montage.
Wan 3.0 est-il disponible sur Morphic ?
Non, Wan 3.0 ne figure pas au catalogue Morphic. La gamme vidéo y est large : Seedance, Kling et Veo, entre autres. Vous générez donc dès maintenant, avec le modèle qui sert le mieux le plan. Les réflexes d’écriture décrits sur cette page se transposent partout. Construire un plan long comme un arc, nommer chaque référence, inscrire le rythme dans le prompt : rien de tout cela ne se perd en changeant de modèle.
Que peut produire Wan 3.0 à partir d’un document ?
Wan 3.0 accepte les fichiers doc, xls, ppt, pdf, txt, key, pages, numbers et md, ainsi que les adresses de pages web. Il lit le contenu et en génère une séquence vidéo. Alibaba décrit l’opération comme la transformation d’une donnée statique et très textuelle en vidéo finie. C’est cette capacité document et page web vers vidéo qui sépare le plus nettement Wan 3.0 des autres modèles vidéo du moment.
Wan 3.0 est-il open source ?
Non. Wan 3.0 est un modèle fermé, accessible par API uniquement, et aucun poids n’a été publié sur Hugging Face, GitHub ou ModelScope. Le dernier fleuron vidéo à poids ouverts d’Alibaba reste Wan 2.2, sous Apache 2.0, sorti en 2025. Si l’auto-hébergement est une contrainte, c’est donc Wan 2.2 qu’il faut regarder : c’est le Wan téléchargeable le plus récent. Tout site qui annonce des poids Wan 3.0 ou un téléchargement gratuit ne propose pas le vrai modèle.
Comment Wan 3.0 se compare-t-il à Seedance 2.5 ?
Les deux sont arrivés à quelques jours d’intervalle, début août 2026, et tous deux génèrent 30 secondes en une passe, avec le son. Seedance 2.5 accepte davantage de références, jusqu’à 50, entre images, vidéo et audio. Wan 3.0, lui, se distingue en fabriquant de la vidéo depuis des documents et des pages web. Aucun des deux n’a encore de mesure indépendante, et les deux sont fermés, en API seule. Tout duel se juge donc aujourd’hui sur des démonstrations, pas sur des scores.