从这里开始
整个八月,MiniMax H3 都在把动画创作者往自己这边拉:这是一个全模态视频模型,能生成最长 15 秒、带原生立体声音频的片段,云端版本能到 2K,而且——对角色向创作来说最关键的一点——它支持混合参考,一个片段可以同时由图片、素材片段和音频共同引导。8 月 27 日,它旁边多了一个新名字:MiniMax H3 Max,一个和 fal.ai 合作、在 H3 基础上做速度调优后训练出来的档位。搜索热度立刻飙升,随之而来的还有一堆"我到底该用哪个"的困惑。
长话短说:H3 Max 不是一个"更强大"的 H3。它是一个快得多、便宜得多的 H3,上限封在 768p——但在这个上限之内,它完全不是降级版:在公开的图生视频排行榜上,它目前排名第一,超过了它脱胎而来的基础模型。你唯一舍弃的东西只有一样——2K 精修。这篇指南具体讲清楚,这对动画和 OC(原创角色)创作意味着什么。
H3 Max 不是更大的 H3
H3 Max 是 H3 的一个后训练变体,针对生成速度和成本做了优化:
| MiniMax H3 | MiniMax H3 Max | |
|---|---|---|
| 分辨率 | 开源权重 768p;云端最高 2K | 480p / 768p |
| 模式 | 文生视频、图生视频、混合图片/视频/音频的参考生成 | 文生视频、图生视频,以及——发布几天后补上的——同样的混合参考生成(图片、视频、音频) |
| 音频 | 原生立体声,与画面一起生成 | 原生立体声,与画面一起生成 |
| 速度 | 长片段需要几分钟量级 | 近乎实时:官方数据是 5 秒片段不到 3 秒;早期用户反馈 10 秒片段大约 10 秒就能生成 |
| 调优方向 | 能力覆盖面 | 提示词还原度、画面美感和吞吐量 |
| 云端定价 | 单秒价格更高 | 480p 约 $0.05/秒,768p 约 $0.08/秒;参考输入按 token 计费,前几张图免费 |
还有一个事实会改变你对这次发布的理解:这不是一个"快但差"的档位。H3 Max 目前在公开图生视频排行榜上排名第一——Design Arena 给它的评分高于它脱胎而来的基础版 H3——因为这次后训练在追求速度之前,先瞄准的是提示词还原度和画面美感。在 768p 范围内,Max 可以说是更好的那个模型。
分辨率上限是架构层面的,不是一个等着被打开的开关。H3 本身渲染在 768p,靠一个独立的重生成阶段才能到 2K;而开源出来的只有基础模型的权重,所以在这些权重上后训练出来的模型,自然也没有 2K 阶段可以继承。H3 Max 停在 768p 不是"2K 以后会加上",这就是它的设计本身。
两个档位共有的,是当初让 H3 变得有意思的那个特性:音频是和视频一起被预测出来的,而不是事后配上去的。环境音、打击音效、音乐重音都能精准踩在动作上,因为它们本来就是和动作一起生成出来的。
近实时+低价格真正解锁了什么
近乎实时、便宜、768p 的片段彻底改变了制作流程里的一个环节:迭代。走位分镜、测试一个动作看不看得懂、给同一个节拍试四种不同的时间点——一秒才几分钱,片段还没等你重新读完自己的提示词就回来了,你完全可以放心大胆地一直试错。这是一种不同的创作模式,不只是更便宜:当一次尝试只要几秒钟成本时,你会去探索,而不是急着敲定。
而且因为参考生成在发布几天后就补给了 Max,迭代也不再意味着要放弃身份一致性。你可以用参考图锁定你的 OC——按量计费下前几张还是免费的——并且做到不跑设定的草稿,用视频片段和音频引导,方式和完整版模型一样。
Max 依然做不到的是精修分辨率:2K 阶段在架构上就只属于正式版 H3。所以老实的分工方式是:
- 在 Max 上迭代——动作测试、时间点变体、构图草稿、带参考锁定的身份检查,全部用 768p 的速度来做。
- 在完整版模型上出成片——把定稿的剪辑,用同一套参考重新渲染到 2K,配上你真正要发布的原生音频。
如果你是想拿 H3 跟其他成片级模型做对比,那是另一个问题——H3 对比 Seedance 2有专门的正面对比。
怎么在 ArcLoop 里跑草稿-精修分工
一个模型档位只有放进一个能在你来回切换快速档和成片档时、依然保持角色和剪辑稳定的工作流里,才真正有用。在 ArcLoop 里,这个结构就是项目本身:
在任何生成之前先锁定身份。 先把角色建成角色资产,绑定它们的参考图。草稿阶段正是身份最容易跑偏的时候——一条便宜的快速片段如果把你 OC 的脸都改了样,那对这个镜头本身没有任何参考价值。在每条镜头描述里都用 @ 引用角色,能让哪怕是随手扔掉的草稿也不跑设定,因为引用角色资产比每次从头描述角色要靠谱得多。
在 Storyboard 里出草稿,而不是在提示词框里单打独斗。 从你 Episode 的 Storyboard 生成 Shot,这样每条快速草稿都会挂在它所属的 shot card 上。Shot 7 的四个时间点变体,就一直待在 Shot 7 底下——方便比较、方便替换,不会散落在下载文件夹里找不着。
直接"晋级",不用重做。 当某个草稿版本胜出时,它所在的 shot card 上已经有了描述、角色资产引用和它在剪辑里的位置。直接在 MiniMax H3 上用完整设置重跑同一个 Shot 出成片——同一个镜头,同一套参考,只是档位更高——而不是凭记忆重新拼一遍提示词。
先用草稿剪,再用成片替换。 在镜头还是 768p 草稿的阶段就先把 Episode 的时间线拼起来;节奏问题在任何分辨率下都看得出来,趁早发现比花了精修额度之后被剪辑砍掉要划算得多。等定稿了,再逐个镜头把成片换进去。这和适用于所有分档模型家族的成本控制逻辑是一回事:把钱花在观众会看的地方,还没定下来的地方就先省着。
浪费速度优势的方法
- 用速度档位出成片。 一个 768p 的 PV 事后放大,是没法跟这一季原生 2K 的作品比的。Max 是用来出草稿的,就让它专心干这件事。
- 不锁身份就直接出草稿。 角色没锁定的快速迭代,得到的反馈是关于噪点的,而不是关于你这个镜头的。先建角色资产,再出草稿。
- 按上周的参数表来做规划。 Max 刚发布时参考生成还是"即将上线",几天后就正式支持了;网上大部分对比文章至今还写着它没有这个功能。这个模型家族每周都在变,决定用不用之前,先去接口本身确认一下能力清单,别只信旧文章。
- 只比较每秒单价。 一个用 $0.08/秒 重新生成八次的草稿,花费可能比在完整版模型上认真出一次还贵。要算的是整个循环的成本,不是单条片段的成本。
- 让一个当红模型打乱一套已经跑顺的流程。 每个模型家族都在不断推出新档位。只要你的项目结构本身就把"出草稿"和"出成片"分开了,任何新发布的模型都能在一个下午之内被塞进这两个角色里的一个——这才是能一直管用的能力,而不是记住某一个模型的参数表。
常见问题
MiniMax H3 Max 比 H3 好吗?
在 768p 范围内,很多时候是的——它在图生视频排行榜上排名超过了自己的基础版,现在也补齐了 H3 的模式列表,包括混合参考生成。H3 独占的只有 2K 输出阶段。"更好"取决于这一遍生成是为了迭代,还是为了发布。
它到底有多快?
官方给出的数据是 5 秒片段不到 3 秒;早期用户反馈 10 秒片段大约 10 秒就能拿到。不管哪个数字,这都是一种不同的工作节奏——更接近重新生成一张图,而不是排队等一段视频。
我能在 ArcLoop 里用 MiniMax H3 吗?
可以——H3 已经作为一个生成模型接入 ArcLoop,具体设置取决于你选择的生成模式。可以看 MiniMax H3 模型页面,了解它在动画创作里最擅长的场景:PV、片头,以及那些靠原生音频撑起整个片段的音乐驱动镜头。 H3 Max 现在也作为独立模型进了 ArcLoop:可以挂图片、视频、音频参考,5 秒 480p 大约 3 秒出片,见 MiniMax H3 Max 模型页。
H3 Max 也能生成音频吗?
能。音画同生这个特性来自它们共用的基础模型,所以速度档位出的草稿,声音依然能精准踩在动作上——这对你在正式出片前先测试一个卡点想法成不成立很有用。
我需要角色在不同镜头之间保持一致,该用哪个档位?
两个档位现在都支持参考图,草稿和成片阶段都能锁定身份。真正决定一致性的规矩其实在更上游:把角色的标准参考图绑定在一个角色资产上,不管是快速档还是成片档,每次生成都从这同一个来源去取,而不是随手抓一张顺手的图。
档位是战术,不是战略
H3 Max 的发布确实是个好消息:你迭代流程里"出草稿"的那一半,一下子变得更快也更便宜了。但速度档位只会奖励那些项目结构本来就搭好去利用它的创作者——角色锁定成资产、镜头活在 Storyboard 的 shot card 上、剪辑流程能接受草稿又能替换成片。把这套结构搭好一次,以后每个发布出来的快速新模型,都会变成你迭代速度上的一次升级,而不是对你一致性的威胁。打开你的项目,锁定你的角色,让便宜的档位安心便宜下去。





