视频生成

Wan 3.0

由 Alibaba 提供

阿里最新一代视频模型,公测中。
提示词、文档或网页,都能出原生30秒片段。

Wan 3.0

核心功能

功能信息来自阿里 Wan 3.0 公测发布,2026 年 8 月。

技术规格

最长30秒

单次生成原生30秒,配智能时长控制。

480p 到 1080p

480p、720p、1080p 三档。没有 4K 输出。

公测

已在 Alibaba Cloud Model Studio 与 Qwen Cloud 上线,模型名 wan3.0-video。

仅 API

不开放权重。阿里的开源 Wan 系列停在 Wan 2.2。

应用场景

把汇报变成视频

交给 Wan 3.0 一份演示稿、一张表格或一个 pdf,它会按里面的数据和文字排出一段视频。

一条广告一次生成

30秒够一条完整广告片。一次生成完,不用再拼素材、回头对光对节奏。

系列内容锁住形象

Omni-Reference 把人物、产品或场景固定住。一组镜头连着看下来,是一件作品。

提示词示例

一镜到底长镜头

清晨的老城巷子,镜头一路向前推,青石板上的水光缓缓退到身后

Edit prompt

参考一致性

同一位外卖骑手穿过三个街区,从清晨薄雾一直走到正午强光

Edit prompt

产品展示

电商棚拍,深色石板上的拉丝不锈钢电热水壶缓缓转过一圈

Edit prompt

人物表演

二胡演奏者收弓、放下琴,在低光里长舒一口气

Edit prompt

风景展开

航拍从江面缓缓拉远,晨雾散去,露出整片水乡河道

Edit prompt

画面内文字

黄昏的海岸悬崖,画面下方压一条干净的中文标题条

Edit prompt

概览

Wan 3.0 是阿里通义实验室 Wan(通义万相)视频系列的最新一代,2026 年 8 月 6 日开启公测。阿里给它的定位是“从生成一帧画面,到讲完一个故事”:单次原生30秒,声音和画面同一遍出,输入也不再只有提示词,文档、演示稿和网页都能直接读。它跑在 Alibaba Cloud Model Studio 和 Qwen Cloud 上,模型名为 wan3.0-video,三档分辨率按秒计费。

文档转视频才是重点

真正拉开差距的能力叫 Omni-Reference。除了文本、图片、音频和视频,它还读结构化文件,doc、xls、ppt、pdf、txt、key、pages、numbers、md 都收,网页链接也算,然后按读到的内容排出一段视频。阿里的说法是把“静态的、文字密集的数据变成真实级的视频内容”。交给它一份季度汇报或一张产品规格表,拿回来的是成片,不是分镜。当下的主流视频模型里,还没有第二个这样读文档的。

30秒一镜到底

单次连续生成30秒,大约是 Wan 2.7 的两倍。变的不只是数字,而是一次交付的单位。一条完整广告、一场短戏、一个慢慢展开的镜头,现在都能一次跑完,不必再拼几段素材、回头对光对节奏。智能时长会按脚本长短决定片长,短的段落不会硬撑时间。

长镜头也需要另一种写法。30秒得有起承转合:开场、转折、收尾。提示词该写画面怎么变,而不只是画面里有什么。没有转折的长度只是一段慢镜头,长视频生成被浪费掉,多半就浪费在这里。

参考控制与精准剪辑

Omni-Reference 最多接收20个参考素材,把人物、产品或场景在整条片子里、在镜头之间固定住。一组镜头能被看成一件作品,靠的就是这个。素材给了还不够,提示词里得给每个参考标清楚是谁。

剪辑也收进了同一个模型,不再另开工具。Wan 3.0 支持按指令改,也支持按参考素材改:圈定一段时间区间,只重新生成这一段,其余部分原封不动,画面、动作乃至角色的台词都能调。中文媒体把这个变化概括为“从抽卡到生产”,一次可控的修改,取代了反复重摇。

画面、声音与文字

阿里把画面目标称作“真实级渲染”,重点放在人身上:脸部和皮肤的细节、克制自然的情绪、跟着动作走的微表情,人像还能细调到骨相和眼神。声音与画面在同一遍生成,所以节奏要写进提示词:点明音床,标出节拍点,画面和声音才会一起落地。屏幕上的文字也有长进,支持12种语言的长文本渲染,图表、公式和信息图更干净。不过评测者也提到,音质和画面内文字仍有提升空间。

分辨率与 4K 传言

Wan 3.0 输出 480p、720p 和 1080p,没有 4K 档。搜索结果里流传的“Wan 3.0 支持 4K”不是阿里的说法,官方模型页明码标出的就是三档,通篇没提 4K。同理,凡是列出“600 亿参数”或“Apache 2.0 开源权重”的规格表,在阿里放出模型卡之前,都按编造处理。

关于开源权重

Wan 3.0 是闭源模型,只提供 API。Wan-AI 的 Hugging Face 组织、Wan-Video 的 GitHub 组织和 ModelScope 上都没有出现权重。阿里公开过的权重停在 Wan 2.2,协议是 Apache 2.0;2.5、2.6、2.7 三代都是商用 API 模型。如果团队必须私有化部署,能下载的最新一代 Wan 仍然是 Wan 2.2,这一条也就决定了这条产品线适不适合自建流水线。

Wan 3.0 与 Morphic

Morphic 目前没有上架 Wan 3.0。平台上的视频阵容很全,Seedance、Kling、Veo 都在,您可以现在就开始生成,在同一个 Canvas 里挑一个更适合这个镜头的模型。上面那些提示词习惯是通用的:长镜头按起承转合写、每个参考素材都标清楚、把节奏写进提示词。换到哪个模型都成立,所以现在就照这套起稿,不吃亏。

简单定价

今天就免费开始,随时可以升级或取消。

Basic

$9/
账单金额为 $0 每年

1100 每月 信用

1 个用户

所有模型

工作流

Standard

$24/
账单金额为 $0 每年

3625 每月 信用

1 个用户

所有模型

工作流

Pro

$45/
账单金额为 $0 每年

6350 共享 每月 信用

1 用户

+ 最多 4 人额外付费可增加

所有模型

工作流

Pro Max

$170/
账单金额为 $0 每年

24650 共享 每月 信用

1 用户

+ 最多 9 人额外付费可增加

所有模型

工作流

Enterprise

更高的限制

自定义

定价和账单条款

大容量信用
自定义席位限制
所有模型
工作流
Pricing Gradient

Free

供随意体验

$0

永久免费

最多 20 积分
仅1个用户
部分模型
工作流

常见问题

Wan 3.0 是什么?
Wan 3.0 是阿里通义实验室最新一代视频模型,2026 年 8 月 6 日起进入公测。它单次能生成原生30秒片段,最高 1080p,声音与画面在同一遍出。招牌能力叫 Omni-Reference:除了文本、图片、音频和视频,它还收文档、表格、幻灯片、pdf 和网页,并据此生成视频。目前通过 Alibaba Cloud Model Studio 与 Qwen Cloud 提供,模型名为 wan3.0-video。
Wan 3.0 支持 4K 吗?
不支持。Wan 3.0 只有 480p、720p、1080p 三档,没有 4K。搜索结果里流传的 4K 说法不是阿里放出来的,官方模型页明码标出的就是这三档,全篇没提 4K。同样,凡是列出“600 亿参数”或“Apache 2.0 开源权重”的规格表,在阿里公布模型卡之前都按编造处理。
Wan 3.0 已经发布了吗?
已经发布。阿里在 2026 年 8 月 6 日于 Alibaba Cloud Model Studio 与 Qwen Cloud 开启公测,wan.video 上的更大范围访问正在向会员陆续开放。模型名 wan3.0-video、分辨率档位和按秒计费的 API 价格都已公开,所以它是一个真实上线的模型,而不是 2026 年 7 月那阵子的传闻。
Wan 3.0 能从文档里做出什么?
它接收 doc、xls、ppt、pdf、txt、key、pages、numbers、md 文件,以及网页链接。读完内容后,它会按里面的信息排出一段视频序列。阿里的说法是把静态的、文字密集的数据变成成片。这套文档与网页转视频的能力,正是 Wan 3.0 和当下其他视频模型最不一样的地方。
Wan 3.0 开源吗?
不开源。Wan 3.0 是闭源模型,只提供 API,Hugging Face、GitHub 和 ModelScope 上都没有出现权重。阿里最后一次开放视频旗舰权重停在 2025 年发布的 Wan 2.2,协议为 Apache 2.0。如果私有化部署是硬要求,能下载的最新一代 Wan 仍然是 Wan 2.2;任何标称提供 Wan 3.0 权重或免费下载的站点,给的都不是真模型。
Wan 3.0 和 Seedance 2.5 比怎么样?
两者的发布只差几天,都在 2026 年 8 月初,也都能一次生成带声音的30秒片段。Seedance 2.5 收的参考素材更多,图片、视频和音频合计最多50个;Wan 3.0 的独门能力则是从文档和网页生成视频。两个模型目前都还没有独立评测,也都是闭源、仅 API,所以今天任何正面对比,靠的都是演示,而不是实测分数。