MiniMax H3:完整指南、全能参考、编辑与音频

MiniMax H3:完整指南、全能参考、编辑与音频

MiniMax H3完整教程:全能参考锁定角色与声音,原生立体声音频同步生成,指令式编辑一句话改镜头,外加分镜节拍表与提示词结构,帮你把这款模型用到位。

MiniMax H3的功能与能力

MiniMax H3也写作Hailuo 3.0或Hailuo 03,是MiniMax开源的通用多模态视频模型。它不需要一个模型负责生成、另一个负责编辑、再找一个专门处理参考图,而是把文本、图像、视频与音频统一读作同一份上下文,直接产出一段成品级的音画短片。

能力作用适合
全能参考一次最多读取9张图像、3段视频与3段音频,合成一份完整指令同时锁定一张脸、一种动作与一种声音
原生立体声音频台词、音效与环境声和画面同步生成需要声音的剧情片、广告与片头
指令式编辑只改你点名的那个元素,画面其余部分保持不动修好一条满意的镜头,不必推倒重来
声音克隆与转移用一段参考录音为角色配上全新的声音配音、更换台词、语言替换
单条片段多镜头在一次5到15秒的生成里容纳多个镜头片头序列、正反打对话
24帧2K输出短边1440像素,帧率贴合电影拍摄标准无需升频即可直接交付

全能参考

这是真正改变工作方式的部分。一次生成最多可接受9张图像、3段视频与3段音频,合计不超过12个文件,而且每一份都能各司其职:一张图定角色,另一张定场景,一段视频带动作或剪辑节奏,一段音频带声音。参考视频与音频单条时长2到15秒,总时长不超过15秒,并且音频不能单独提交,必须搭配至少一张图像或一段视频。

原生立体声音频

声音不是后期才补上的一步。每次生成都会同步产出立体声音频,台词说出口、脚步声落地、房间的环境声都和画面一起完成。这也意味着你可以像导演一样去指挥声音,而不是被动接受结果。同一段提示词,写明用什么乐器、要哪些音效、提示音落在哪一刻,得到的效果会和什么都不写完全不同。

指令式编辑

如果一条片段只差一个地方不满意,直接点名要改的那个元素就行。换主体、去掉某个物体、换背景、把白天改成夜晚、加特效、改一句台词,都只动被点名的部分,画面其余地方保持不变。一条指令里可以列出多处修改,这比整段重新生成、再赌一次好镜头能不能留住要快得多。

声音克隆与转移

一段参考录音就能给角色配上原本没有的声音,提供一句新台词还能替换镜头里说的话,表演节奏也会随之调整。搭配一张身份参考图,脸和声音就都能在整段序列里保持一致,让角色一眼就能认出来。

画幅与成片

文生视频与参考生成支持六种画幅比例,从21:9到9:16都有,还有一个自动模式,让H3在参考图主导构图时自己判断比例。首尾帧生成则直接沿用上传图像的比例。输出为1440p、24帧,1440指的是短边,因此21:9的成片分辨率接近2976×1248。官方已宣布即将推出768p模式,其输出可以升频到1440p,届时会是很自然的草稿分辨率。

MiniMax H3使用场景

品牌广告与商业大片

无论是电商大促广告还是高端品牌短片,一套参考图就能把出镜人物、产品与片尾标识都锁定,胶片质感也由你写明,而不是交给随机结果。

一位女性把多棱瓶身举向天台玻璃房里最后一缕天光

竖屏短剧与对白

9:16竖屏短剧靠近景与正反打镜头推进剧情,这正是短剧赛道最常见的打法。台词和画面在同一次生成里完成,表演和台词的节奏天然对得上,不用再单独配音对轨。

两姐妹深夜坐在空荡的医院走廊里,手里端着纸杯

片头设计与动效

文字作为独立图层参与设计:字幕一个字一个字打出来,图表逐步组装成形,音乐提示点也卡在你指定的节拍上,而不是事后再补。

由轨道图与黑底等宽字体字幕组成的片头序列

产品与电商

用一张实物静态图就能生成产品短片,镜头从完整揭示推进到微距细节,再收在一个稳定的远景。产品的外形由参考图锁定,真正打动人的靠镜头运动与打光。

唱臂缓缓落在旋转的黑胶唱片上,一束硬光斜射而入

界面与游戏概念

菜单、HUD与交互演示按节拍逐帧排布:面板滑入、选项落定、场景加载,顺序全部由你写定,而不是让模型自己猜。

一款钓鱼模拟游戏界面,清晨码头旁分布着背包与天气面板

风格化与动画作品

剪纸、定格动画与风格化角色设计都适用。一张身份参考图能让设计跨镜头保持统一,角色的服装、比例与质感从这一镜到下一镜都不会跑偏。

分层剪纸动画中,一个孩子被风筝拽着穿过山坡

如何充分发挥MiniMax H3

H3更吃一份像制片文件的说明,而不是一句话描述。提示词栏最多支持7000字符,官方给出的参考示例也几乎用满了这个空间。以下几个习惯决定了大部分成片质量:

  • 给每个参考分配明确任务。写清楚“图1定基调与胶片质感,图2是出镜人物,图3是产品”,比塞进四张图听天由命有效得多。
  • 按时间点写分镜。把片段拆成0到2秒、2到5秒这样的节拍,模型才知道整整15秒里该按什么顺序走。
  • 写明哪些绝不能变。锁定的元素、固定不动的蒙版、始终保留发型与服装的脸,点名这些才能防止镜头走到一半漂移变样。
  • 明确写出不要什么。不要字幕、不要水印、不要现代服装、不要柔化叠化,写清楚的限制才会被遵守。
  • 把声音当独立轨道来编导。点名乐器、具体音效以及提示音落在哪一刻,反正音频本来就会和画面一起生成。
  • 点名转场方式。划像、硬切、甩镜、形状匹配剪辑,写清楚转场类型,剪辑节奏才有韵律,而不是笼统的“顺滑”。
  • 描述拍摄方式,而不只是场景本身。手持手机的轻微晃动、曝光呼吸感、对焦延迟、颗粒感,这些细节才是“像实拍”和“像渲染”的分水岭。
  • 定义文字动效。给字幕规定入场方式、停留时长和禁用清单,标题就不会再莫名其妙地旋转弹跳。
  • 修改时点名目标元素。要改哪里、保留哪里都写清楚,整段重新生成有可能把你原本满意的镜头一起丢掉。
  • 规划好参考文件的数量。上限是12个文件,视频与音频参考各自总时长不超过15秒,而且音频必须搭配图像或视频才算数。

完整规格列表请查看MiniMax H3模型页面

MiniMax H3提示词指南

一份扎实的H3提示词由五个模块组成。发送前逐一过一遍,模型原本要靠猜的部分就都定好了。

模块包含内容示例
角色分工每个参考图的具体用途图1定场景,图2是主角
节拍带时间点的整段动作0到5秒她坐下,5到11秒抛出那个问题
视觉风格风格、色调、光线与胶片质感16mm颗粒感,克制的色调,顶光打得很硬
声音台词、音效、音乐及各自落点全程环境声铺底,标题定格时一记重音
限制锁定的元素与禁止出现的内容服装保持不变,不要字幕,不要水印

弱提示词与强提示词

两者的差距几乎都出在时间、参考分工与声音写得够不够具体。

重点
参考分工用这些图片图1定胶片质感,图2是主角,图3是她举起的那个瓶子
时间点她拿起瓶子0到5秒她沿长椅走动,5到10秒把瓶子举向光线,10到15秒放下
声音加点音乐全程滴灌水声与楼下车流声,光线穿过时响起一记延音大提琴

常见错误

  • 上传参考图却不说明各自用途,模型只能自己猜哪张图在主导画面。
  • 描述的是一帧静止画面,而不是贯穿整段片长的动作。
  • 完全不写声音要求,等结果出来又把音效不合意怪到模型头上。
  • 单独提交音频参考,如果不搭配图像或视频会被拒绝。
  • 为改一个物体整段重新生成,其实一条编辑指令就能保住其余部分。

简单定价

今天就免费开始,随时可以升级或取消。

Basic

$9/
账单金额为 $0 每年

900 每月 信用

1 个用户

所有模型

工作流

Standard

$24/
账单金额为 $0 每年

3200 每月 信用

1 个用户

所有模型

工作流

Pro

$45/
账单金额为 $0 每年

6200 共享 每月 信用

1 用户

+ 最多 4 人额外付费可增加

所有模型

工作流

Pro Max

$170/
账单金额为 $0 每年

24000 共享 每月 信用

1 用户

+ 最多 9 人额外付费可增加

所有模型

工作流

Enterprise

更高的限制

自定义

定价和账单条款

大容量信用
自定义席位限制
所有模型
工作流
Pricing Gradient

Free

供随意体验

$0

永久免费

最多 20 积分
仅1个用户
部分模型
工作流

常见问题

怎样写好一条MiniMax H3提示词?
把提示词当成一份制片文件,而不是一句话描述,按五个模块来写:角色分工、节拍、视觉风格、声音与限制。写清楚每个参考图的用途,把动作按时间点铺满整段片长,定好视觉语言,把声音当独立轨道来编导,最后写明哪些绝不能变。提示词栏最多7000字符,足够把五个模块都写具体。
MiniMax H3的参考功能是怎么运作的?
最多可以上传9张图像、3段视频与3段音频,单次生成合计不超过12个文件。参考视频和音频单条时长2到15秒,总时长不超过15秒,而且音频不能单独提交,必须搭配至少一张图像或一段视频。在提示词里点名每个参考的用途,模型才知道哪张图定角色、哪张定场景、哪段视频定剪辑节奏。
MiniMax H3能生成台词和音效吗?
能。每次生成都会同步产出原生立体声音频,台词、音效和环境声与画面一起完成,不用事后再补。把声音当成独立轨道去编导:点名乐器和提示音落点,列出想要的具体音效,也写明哪些地方要保持安静。
MiniMax H3支持生成中文台词和中文配音吗?
MiniMax 并未公布 H3 的支持语言清单。已知的是:声音与画面在同一次生成中产出,声音克隆与转换依据你上传的参考录音,而不是一份封闭的语言列表。所以可行的做法是先测:用一段中文参考录音配一句台词生成一条短片段,确认效果之后再用在正式项目里。
MiniMax H3的片段能不重新生成就编辑吗?
可以,而且这是更快的路径。指令式编辑只改你点名的那个元素,已经满意的灯光、构图和表演都会保持不变。它能替换或移除主体、去掉物体、更换背景、把场景从白天改成夜晚、加特效,也能替换一句台词,一条指令里还能同时列出多处修改。
MiniMax H3支持哪些画幅比例和分辨率?
共六种画幅比例:21:9、16:9、4:3、1:1、3:4与9:16,参考图主导构图时还有自动模式可选。输出为1440p(官方称为2K)、24帧,1440指的是短边。更宽的画幅接近370万像素,21:9时约为2976×1248。官方已宣布即将推出768p模式,其输出可以升频到1440p。
怎样让角色在MiniMax H3的多个镜头里保持一致?
每次生成都提供同一张身份参考图,并在提示词里写清楚要保留的特征,比如发型、服装和表情,而不是只靠图片本身。若要保持表演一致,再加一段视频参考定动作、一段音频参考定声音,让脸、动作和声音都出自固定的来源。