八月以来刷屏的那个模型到底是什么
每隔几个月,总会有一个视频模型变成创作者圈子里人人都在测试的东西。从八月开始,这个模型就是 MiniMax H3——它的另一个名字是 Hailuo 3.0。看过样片就知道为什么:声音精准踩在动作上,因为它是和画面一起生成的;角色在 15 秒的多镜头长镜头里始终保持设计不跑偏;2K 的输出全屏看也扛得住。
在这些样片背后,H3 的设计思路确实不一样:这是一个把图片、视频片段、音频都当成同一场对话来处理的全模态模型,再加上开源权重,让它成了这一季被研究得最多的视频模型。而且从八月底开始,它已经变成了两个版本——原版 H3,以及 H3 Max,一个近乎实时的速度档位,彻底改变了迭代的手感。
这篇是大白话入门:H3 是什么、每个档位分别能干什么、能拿它做什么、以及怎么用才不浪费你的额度。
H3 的底层设计是怎么回事
H3 是一个围绕一个核心理念打造的视频生成模型:一切都可以是参考。 大多数模型只接受一段提示词、顶多一张图,H3 却能接受一整套素材——
- 最多 9 张参考图,用来定角色、服装和风格
- 最多 3 段参考视频,用来定动作和节奏
- 最多 3 段音频,用来引导声音和节奏(每段音频都挂在一个画面上)
——在提示词里按顺序引用它们,就像拿一张情绪板给动画师做说明一样。模型会生成一段 4 到 15 秒的片段,动作跟着你参考的走,角色保持你锁定的样子,并返回和画面一起生成的原生 32kHz 立体声音频。环境音、拟音,甚至对口型的台词都在同一次生成里完成,而且天然对齐——不需要另外排期或付费做配音。
分辨率分两个阶段:基础模型渲染在 768p,再经过一个云端的重生成阶段把最终结果提升到 2K(2560×1440)。这个拆分背后有个很实际的原因:MiniMax 开源了基础权重,研究者和工具开发者可以在 H3 上做二次开发——但 2K 的精修阶段只在云端提供。自建部署是可行的,但上限就是 768p。
在核心生成能力之外,这个模型家族还覆盖了精确视频编辑和音画续写——也就是把画面和声音一起延长一段已有片段——这也是它能用来做连续镜头、而不只是单个循环片段的原因。
H3 Max:反超源模型的速度档位
8 月 27 日,第二个档位登场:H3 Max,由 fal 和 MiniMax 合作,在 H3 的开源权重上做后训练得到,针对提示词还原度、画面美感和吞吐量做了专门调优。
最大的亮点是速度,快到能改变你的工作节奏:官方数据是5 秒片段不到 3 秒就出;日常使用中,一段 10 秒的片段回来的时间差不多就是它的播放时长。定价大约是480p 每秒 $0.05,768p 每秒 $0.08,而且发布几天后这个档位就补上了和基础模型一样的混合参考生成能力——图片、视频、音频都能用,按量计费下前几张参考图还是免费的。
让人意外的是,这个快速档位并不是"将就"的版本。在公开的图生视频排行榜上,H3 Max 目前排名第一——比它脱胎而来的基础版 H3 还要高。它唯一真正的上限是分辨率:2K 阶段没法从开源权重里继承过来,所以 Max 在架构上就封顶在 768p。
记住这个家族的最简单方式:
| MiniMax H3 | H3 Max | |
|---|---|---|
| 擅长 | 成片镜头 | 迭代速度 |
| 分辨率 | 云端最高 2K | 480p / 768p |
| 参考输入 | 9 张图 / 3 段视频 / 3 段音频 | 一样,发布几天后补上 |
| 原生音频 | 支持 | 支持 |
| 节奏 | 排队等,再来审片 | 更接近重新生成一张图 |
关于怎么在两个档位之间拆分草稿和成片的完整工作流逻辑,可以看 H3 Max 工作流指南。
创作者实际都在用它做什么
样片集中出现在几类 H3 设计上天然擅长的场景里:
动画 PV 和音乐驱动的片头。 和画面一起生成的原生音频意味着卡点剪辑不需要再交给剪辑师——描述好音轨的能量,引用一段音频,鼓点就会自然落在动作上。这也是 H3 最先在动画创作者圈子里火起来的用法。
多镜头角色叙事。 一次 15 秒的生成就能在不同场景之间切换,同时让角色的脸、服装、比例都保持一致——这向来是动画叙事里最难的问题,只要参考给得好,一次请求就能搞定。
对白片段。 一次生成就能拿到对口型的台词、带房间空间感和环境音的效果,还能支持多种语言。以前需要三个工具才能做出来的短角色瞬间,现在一条提示词就够。
风格锁定的连续镜头。 给它一种视觉语言——一套配色、一种线条、一种年代质感——它就能在整段片子的每个镜头里保持这个风格,这也是为什么 H3 的样片里风格化和复古向作品占比这么高。
怎么用 H3 不白费一次生成
H3 已经作为一个生成模型接入 ArcLoop——模型页面有各个模式和参数的说明——样片效果和让人抓狂的效果之间,差别几乎总是出在参考素材管理得够不够规范,而不是提示词写得好不好。
三个习惯决定了大部分效果:
给它稳定的参考。 九个图片槽位是通向一致性的机会,但如果这九张图对"你的角色是谁"意见不一,它也会是个陷阱。把角色做成一个角色资产,让它的标准参考图绑定在上面,每次生成都从这一个来源去取。在镜头描述里用 @ 引用角色资产,比每次重新描述一遍角色靠谱得多——这也意味着你第十条 H3 片段和第一条用的是同一个身份。
每个片段只讲一个清楚的动作。 H3 的 15 秒更适合一段有开头、有节拍、有结尾的镜头简报——而不是五个想法互相抢同一批画面。按顺序写清楚运镜、动作,还有你想要的声音。
从 Storyboard 生成,而不是在提示词框里单打独斗。 在 ArcLoop 里,打开你的 Episode,点 Generate Shots 把它拆成一张张 shot card,再把角色资产挂上去,逐张生成——或者在 AI Chat Panel 里用一句大白话批量处理,比如"给 Shot 1、2、3 生成视频"。每条 H3 片段都会自动挂在它所属的 shot card 上,这样比较不同版本、重新拼剪辑的时候就不会散落在下载文件夹里。
便宜地反复迭代,只精修一次。 用 Max 档位或较低设置去摸清节奏和走位,再把 2K 的精修额度花在已经确定要进最终剪辑的镜头上——这和适用于所有分档模型家族的成本控制逻辑是同一套思路。如果你在拿 H3 和同级别的另一个成片级模型做比较,H3 对比 Seedance 2.0把这个选择讲得很清楚。
常见问题
MiniMax H3 和 Hailuo 3.0 是同一个东西吗?
是的——H3 是这条产品线的国际化名字,之前叫 Hailuo。有些排行榜上 Max 档位还会用一个内部名字出现,叫 MiniMax H3 Turbo。
MiniMax H3 免费吗?
基础模型的权重是开源的,云端调用则是按量付费。Max 档位目前在其托管方的工具页面上每天提供少量免费生成次数。在 ArcLoop 里做项目,H3 会消耗你的 ArcLoop 额度,具体多少取决于所选的生成模式。
H3 和 H3 Max 有什么区别?
Max 是一个后训练出来的速度档位:最高 768p 下近乎实时生成,目前在图生视频排行榜上排名第一,参考模式和原生音频都和基础版一样。基础版 H3 则保留了云端的 2K 输出阶段。多数工作流最后都会落到"用 Max 出草稿、用 H3 出成片"这个分工上。
H3 是真的能和视频一起生成音频吗?
是的——音频是和画面一起预测出来的,而不是事后加上去的,这也是为什么音效能精准踩在打击点上、台词不用额外剪辑就能对上口型。你可以在描述镜头的同一条提示词里,直接把声音场景也写进去。
H3 生成的视频能有多长?
单次生成 4 到 15 秒,另外可以用音画续写来延长一段已有片段。更长的作品需要一个镜头一个镜头地搭出来——这正是配合 Storyboard 和持久化角色资产工作的优势所在,比一条一条单独写提示词生成靠谱得多。
模型是新的,自律不是
H3 这波关注是实打实赚来的:混合参考、原生音频、开源权重,现在又加上一个快到能跟上你思路的 Max 档位。但这份列表上的每一项能力,回报都取决于你给它的输入有多稳定——而这部分是工作流的事,不是模型的事。把角色做成角色资产,像导演一样去写镜头简报,在便宜的档位上反复迭代,把 2K 花在观众真正会盯着看的地方。打开一个项目,先把你的第一个角色锁定下来,让 H3 有一个值得认出来的对象。




