视频生成
已上线
MiniMax H3
由 MiniMax 提供
MiniMax的多模态视频模型,海螺3.0。
2K分辨率,原生立体声,单镜头最长15秒。

核心功能
技术规格
5至15秒
单次生成的时长,内部可以容纳多个镜头。
最高2K
短边1440像素;官方称768p模式即将上线。
24 FPS
电影和广播采用的标准帧率。
3种模式
文生视频、首尾帧和全模态参考。
应用场景
品牌影片与广告
预告片、电视广告和高端品牌影片,是MiniMax展示案例时重点呈现的方向之一。
竖屏短剧
9:16格式的短剧场景,靠对白、表演和正反打镜头,在15秒内完成一次转折。
产品与电商
一张实拍产品图,就能做出产品展示、功能演示和投放素材。
动态设计与片头
片头序列、字体动画和视觉特效包,文字动效可以单独作为一层来指导。
游戏与界面概念
游戏界面、网页界面、交互演示和功能走查,按节拍在片段长度内逐一安排。
风格化动画
定格黏土动画、动漫风预告和三维角色短片,靠身份参考让设计在多个镜头间保持统一。
提示词示例
简单定价
今天就免费开始,随时可以升级或取消。
Basic
$9/ 月
账单金额为 $0 每年900 每月 信用
1 个用户
所有模型
工作流
Standard
$24/ 月
账单金额为 $0 每年3200 每月 信用
1 个用户
所有模型
工作流
Pro
$45/ 月
账单金额为 $0 每年6200 共享 每月 信用
1 用户
+ 最多 4 人额外付费可增加
所有模型
工作流
Pro Max
$170/ 月
账单金额为 $0 每年24000 共享 每月 信用
1 用户
+ 最多 9 人额外付费可增加
所有模型
工作流
Enterprise
更高的限制
自定义
定价和账单条款
大容量信用
自定义席位限制
所有模型
工作流

Free
供随意体验
$0
永久免费
最多 20 积分
仅1个用户
部分模型
工作流
常见问题
什么是MiniMax H3?
MiniMax H3是MiniMax旗下的通用多模态视频模型,也就是海螺3.0。它把文字、图片、视频和音频放进同一个上下文里理解,生成一段5到15秒、最高2K、24帧的视频,并自带原生立体声。它支持三种生成方式:纯文字提示、首尾帧,或多种参考混合输入。
在中国大陆可以直接使用MiniMax H3(海螺3.0)吗?
可以。MiniMax是国内公司,海螺AI在中国大陆有官方App和网页版,不需要VPN就能直接体验H3模型。如果您打算通过Morphic调用MiniMax H3,那是另一回事:Morphic面向海外和已配置VPN的用户,与直接使用海螺AI并不是同一条路径。
MiniMax H3和海螺3.0是同一个模型吗?
是的。MiniMax H3是官方模型名,海螺3.0(也写作Hailuo 3.0、海螺03)是它在海螺AI(MiniMax旗下的国内应用)里的叫法,两者指向同一个模型,是海螺2.3的下一代。注意别和快手的Kling O3混淆,两个名字看着接近,实际是完全不同厂商的不同模型。
MiniMax H3生成的视频能有多长?
单次生成5到15秒。一个片段内部还能容纳多个镜头,所以带正反打的片头或短剧转折,可以一次生成完成,不用把几段素材再剪接在一起。
MiniMax H3的分辨率和帧率是多少?
短边1440像素,官方称为2K,帧率固定在24帧每秒。1440指的是画面短边的像素数,16:9到9:16之间的画面短边都是1440,更宽的比例(比如21:9)像素总量接近370万,约2976×1248。官方还公布了即将上线的768p模式,其输出可以放大到1440p。
MiniMax H3支持哪些画面比例?
一共六种:21:9、16:9、4:3、1:1、3:4和9:16。文生视频和全模态参考模式下可以自己选择比例,全模态参考还多一个自动模式,由H3根据您提供的参考自动判断构图;首尾帧模式则直接跟随您上传图片的比例。
MiniMax H3可以接受哪些参考素材?
最多9张图片、3段视频和3个音频文件,一次生成总计不超过12个文件。参考视频和参考音频单个片段2到15秒,加起来总时长不超过15秒。音频不能单独提交,必须搭配至少一张图片或一段视频一起上传。
怎么在Morphic上使用MiniMax H3?
在提示词输入框里选择MiniMax H3,切到视频模式,把镜头写成一段简短说明,交代主体、动作、运镜、光线和您想要的声音。镜头需要保持的参考图片、片段或音频一并上传,再点击生成。结果会落在Canvas上,您可以让H3和另一个模型跑同一份提示词,再挑出更好的那条。
MiniMax H3和海螺2.3有什么区别?
海螺2.3上限是1080p,靠一句提示词或一张图大约能出十秒左右的片段。MiniMax H3把分辨率提到2K、时长拉到15秒,但更大的差别在于它能接受的输入和输出:从单张图片变成图片、视频、音频混合参考,从无声变成原生立体声,从整段重新生成变成一句话就能定点修改。