MiniMax H3的功能与能力
MiniMax H3也写作Hailuo 3.0或Hailuo 03,是MiniMax开源的通用多模态视频模型。它不需要一个模型负责生成、另一个负责编辑、再找一个专门处理参考图,而是把文本、图像、视频与音频统一读作同一份上下文,直接产出一段成品级的音画短片。
| 能力 | 作用 | 适合 |
|---|---|---|
| 全能参考 | 一次最多读取9张图像、3段视频与3段音频,合成一份完整指令 | 同时锁定一张脸、一种动作与一种声音 |
| 原生立体声音频 | 台词、音效与环境声和画面同步生成 | 需要声音的剧情片、广告与片头 |
| 指令式编辑 | 只改你点名的那个元素,画面其余部分保持不动 | 修好一条满意的镜头,不必推倒重来 |
| 声音克隆与转移 | 用一段参考录音为角色配上全新的声音 | 配音、更换台词、语言替换 |
| 单条片段多镜头 | 在一次5到15秒的生成里容纳多个镜头 | 片头序列、正反打对话 |
| 24帧2K输出 | 短边1440像素,帧率贴合电影拍摄标准 | 无需升频即可直接交付 |
全能参考
这是真正改变工作方式的部分。一次生成最多可接受9张图像、3段视频与3段音频,合计不超过12个文件,而且每一份都能各司其职:一张图定角色,另一张定场景,一段视频带动作或剪辑节奏,一段音频带声音。参考视频与音频单条时长2到15秒,总时长不超过15秒,并且音频不能单独提交,必须搭配至少一张图像或一段视频。
原生立体声音频
声音不是后期才补上的一步。每次生成都会同步产出立体声音频,台词说出口、脚步声落地、房间的环境声都和画面一起完成。这也意味着你可以像导演一样去指挥声音,而不是被动接受结果。同一段提示词,写明用什么乐器、要哪些音效、提示音落在哪一刻,得到的效果会和什么都不写完全不同。
指令式编辑
如果一条片段只差一个地方不满意,直接点名要改的那个元素就行。换主体、去掉某个物体、换背景、把白天改成夜晚、加特效、改一句台词,都只动被点名的部分,画面其余地方保持不变。一条指令里可以列出多处修改,这比整段重新生成、再赌一次好镜头能不能留住要快得多。
声音克隆与转移
一段参考录音就能给角色配上原本没有的声音,提供一句新台词还能替换镜头里说的话,表演节奏也会随之调整。搭配一张身份参考图,脸和声音就都能在整段序列里保持一致,让角色一眼就能认出来。
画幅与成片
文生视频与参考生成支持六种画幅比例,从21:9到9:16都有,还有一个自动模式,让H3在参考图主导构图时自己判断比例。首尾帧生成则直接沿用上传图像的比例。输出为1440p、24帧,1440指的是短边,因此21:9的成片分辨率接近2976×1248。官方已宣布即将推出768p模式,其输出可以升频到1440p,届时会是很自然的草稿分辨率。
MiniMax H3使用场景
品牌广告与商业大片
无论是电商大促广告还是高端品牌短片,一套参考图就能把出镜人物、产品与片尾标识都锁定,胶片质感也由你写明,而不是交给随机结果。

竖屏短剧与对白
9:16竖屏短剧靠近景与正反打镜头推进剧情,这正是短剧赛道最常见的打法。台词和画面在同一次生成里完成,表演和台词的节奏天然对得上,不用再单独配音对轨。

片头设计与动效
文字作为独立图层参与设计:字幕一个字一个字打出来,图表逐步组装成形,音乐提示点也卡在你指定的节拍上,而不是事后再补。

产品与电商
用一张实物静态图就能生成产品短片,镜头从完整揭示推进到微距细节,再收在一个稳定的远景。产品的外形由参考图锁定,真正打动人的靠镜头运动与打光。

界面与游戏概念
菜单、HUD与交互演示按节拍逐帧排布:面板滑入、选项落定、场景加载,顺序全部由你写定,而不是让模型自己猜。

风格化与动画作品
剪纸、定格动画与风格化角色设计都适用。一张身份参考图能让设计跨镜头保持统一,角色的服装、比例与质感从这一镜到下一镜都不会跑偏。

如何充分发挥MiniMax H3
H3更吃一份像制片文件的说明,而不是一句话描述。提示词栏最多支持7000字符,官方给出的参考示例也几乎用满了这个空间。以下几个习惯决定了大部分成片质量:
- 给每个参考分配明确任务。写清楚“图1定基调与胶片质感,图2是出镜人物,图3是产品”,比塞进四张图听天由命有效得多。
- 按时间点写分镜。把片段拆成0到2秒、2到5秒这样的节拍,模型才知道整整15秒里该按什么顺序走。
- 写明哪些绝不能变。锁定的元素、固定不动的蒙版、始终保留发型与服装的脸,点名这些才能防止镜头走到一半漂移变样。
- 明确写出不要什么。不要字幕、不要水印、不要现代服装、不要柔化叠化,写清楚的限制才会被遵守。
- 把声音当独立轨道来编导。点名乐器、具体音效以及提示音落在哪一刻,反正音频本来就会和画面一起生成。
- 点名转场方式。划像、硬切、甩镜、形状匹配剪辑,写清楚转场类型,剪辑节奏才有韵律,而不是笼统的“顺滑”。
- 描述拍摄方式,而不只是场景本身。手持手机的轻微晃动、曝光呼吸感、对焦延迟、颗粒感,这些细节才是“像实拍”和“像渲染”的分水岭。
- 定义文字动效。给字幕规定入场方式、停留时长和禁用清单,标题就不会再莫名其妙地旋转弹跳。
- 修改时点名目标元素。要改哪里、保留哪里都写清楚,整段重新生成有可能把你原本满意的镜头一起丢掉。
- 规划好参考文件的数量。上限是12个文件,视频与音频参考各自总时长不超过15秒,而且音频必须搭配图像或视频才算数。
完整规格列表请查看MiniMax H3模型页面。
MiniMax H3提示词指南
一份扎实的H3提示词由五个模块组成。发送前逐一过一遍,模型原本要靠猜的部分就都定好了。
| 模块 | 包含内容 | 示例 |
|---|---|---|
| 角色分工 | 每个参考图的具体用途 | 图1定场景,图2是主角 |
| 节拍 | 带时间点的整段动作 | 0到5秒她坐下,5到11秒抛出那个问题 |
| 视觉风格 | 风格、色调、光线与胶片质感 | 16mm颗粒感,克制的色调,顶光打得很硬 |
| 声音 | 台词、音效、音乐及各自落点 | 全程环境声铺底,标题定格时一记重音 |
| 限制 | 锁定的元素与禁止出现的内容 | 服装保持不变,不要字幕,不要水印 |
弱提示词与强提示词
两者的差距几乎都出在时间、参考分工与声音写得够不够具体。
| 重点 | 弱 | 强 |
|---|---|---|
| 参考分工 | 用这些图片 | 图1定胶片质感,图2是主角,图3是她举起的那个瓶子 |
| 时间点 | 她拿起瓶子 | 0到5秒她沿长椅走动,5到10秒把瓶子举向光线,10到15秒放下 |
| 声音 | 加点音乐 | 全程滴灌水声与楼下车流声,光线穿过时响起一记延音大提琴 |
常见错误
- 上传参考图却不说明各自用途,模型只能自己猜哪张图在主导画面。
- 描述的是一帧静止画面,而不是贯穿整段片长的动作。
- 完全不写声音要求,等结果出来又把音效不合意怪到模型头上。
- 单独提交音频参考,如果不搭配图像或视频会被拒绝。
- 为改一个物体整段重新生成,其实一条编辑指令就能保住其余部分。

