同天发布的模型,不同的活
MiniMax H3 和 Seedance 2.5 在七月底的同一天发布,从那以后对比文章就没停过。大多数文章都想分出个胜负。但对真正在做动画或短剧的人来说,这是个问错的问题,因为这两个模型本来就是为不同的活儿设计的——而且在 ArcLoop 里,你根本不需要为整个项目只选一个。每个镜头都能单独选自己的模型。
所以这不是一张成绩单,而是一份地图:哪些镜头 H3 处理得最好,哪些 Seedance 2.5 处理得最好,以及怎么让两个模型都用同一套角色资产,还不让演员的脸在切换模型之间变样。如果你想看跟上一代 Seedance 的正面对比,H3 对比 Seedance 2.0讲了这部分。
参数表背后的逻辑差异
| MiniMax H3 | Seedance 2.5 | |
|---|---|---|
| 单次生成 | 4–15 秒 | 最长 30 秒;长视频模式可以到几分钟 |
| 最高分辨率 | 2K(云端) | 最高 4K |
| 每次生成的参考数量 | 9 张图片、3 段片段、3 段音频 | 最多 50 个多模态参考(图片、视频、音频、脚本) |
| 原生音频 | 支持,32kHz 立体声,和画面一起生成 | 支持 |
| 编辑 | 精确视频编辑、音画续写 | 基于时间戳的编辑、给已有视频做延长 |
| 开源权重 | 基础模型开源(768p);2K 阶段云端专属 | 闭源 |
| 调优方向 | 参考还原度、音乐与节奏、全模态引导 | 长镜头连贯性、大规模参考集、单次生成里的多镜头叙事 |
把这张表读成两种设计哲学。H3 把生成时长收得很短,换来的是精细的控制力——九张按顺序引用的参考图、和动作精准贴合的音频、一个社区可以在上面二次开发的开源底座。Seedance 2.5 把生成拉得又长又宽——一次三十秒、五十个参考、一次请求里的多镜头序列。
MiniMax H3 的优势场景
音乐驱动的节拍。 动画 PV、片头、副歌高潮——任何声音必须精准踩在动作上的场景。H3 会把音频和画面一起生成,一段音频参考配上一张画面就能直接引导节奏。动画音乐视频指南基本上就是一份 H3 使用手册。
需要精确还原参考的镜头。 当一个镜头必须匹配一张具体的插画——OC 的脸、服装的某个细节——H3 按顺序引用参考图的机制,能精确控制哪张图管哪个部分。参考数量少,但每一张的话语权更重。
快速迭代。 用 H3 Max 档位,草稿能以接近实时的速度在 768p 下回来。节奏测试、走位变体、"这个剪辑点行不行"——H3 是你用来试错的地方。
风格化的 2D 画风。 钉住一张风格参考图之后,H3 在整条片段里都能稳住平涂上色和线条;动画提示词指南讲了具体怎么配置。
Seedance 2.5 的优势场景
长镜头一镜到底。 三十秒的边走边说、缓慢的靠近、一段连贯的舞蹈——任何一剪就会打断表演的场景。H3 需要两条片段拼接才能做到,Seedance 2.5 一次就够。
一条提示词生成多镜头序列。 Seedance 家族从 1.0 开始就把多镜头叙事当成原生能力。描述三个节拍,一次生成就能拿到三个保持连贯性的镜头。对短剧快速出草稿来说,这是实打实省时间。
大规模参考集。 一个有四个角色、两个场景、一套固定道具的场景,很容易超过 H3 九张图的上限。Seedance 五十个参考的额度,能一次装下整个班底。
4K 交付。 如果规格要求是 4K,Seedance 2.5 能直接渲染到位。H3 最高只到 2K。
镜头类型对照表
| 镜头类型 | 选谁 | 为什么 |
|---|---|---|
| 卡点音乐的片头 / PV 节拍 | H3 | 音频和动作一起生成,能引导节奏 |
| 必须匹配插画的角色特写 | H3 | 每张参考图的引导权重更精确 |
| 20–30 秒的连续表演 | Seedance 2.5 | 单镜头超过 15 秒 |
| 一次出三个节拍的场景草稿 | Seedance 2.5 | 原生支持多镜头 |
| 群像或多人物场景,资产多 | Seedance 2.5 | 参考数量额度大 |
| 节奏 / 走位草稿 | H3(Max 档位) | 接近实时的迭代速度 |
| 最终 4K 成片 | Seedance 2.5 | 分辨率上限更高 |
| 需要精确还原脸部的 2K 关键镜头成片 | H3 | 2K 阶段加上精确的参考还原 |
ArcLoop 里两个模型怎么配合用
这份对照表只有在切换模型不会牺牲一致性的前提下才成立。在 ArcLoop 里确实不会,因为身份是活在项目里的,不是活在模型里的:
- 在我的资产里把班底建一次就够。 绑定每个角色的 Main image 和 Reference image。当一个镜头用
@引用角色时,两个模型读的是同一套参考。 - 按 shot card 逐个选模型。 在 Storyboard 上,每张 shot card 都带着自己的描述、时长和生成模型。同一个 episode 里,可以把副歌高潮交给 H3,把长镜头的靠近交给 Seedance 2.5。
- 让镜头描述跟具体模型无关。 运镜、动作、光线、声音——一条片段一个动作。让参考图去承载身份信息,这样切换模型也不会改变脸。
- 在还原度重要的镜头上先生成静帧, 再生成视频。模型切换带来的问题会先在静帧上显现出来,在那里就能发现。
- 在 Edit 时间线上剪辑。 两个模型出的片段都会落在同一条时间线上;如果 Seedance 的镜头和 H3 的镜头在光线上对不上,剪辑阶段就能先发现,不用等观众来发现。
有一条来自产品文档的硬性前提要注意:要用 Seedance 2.0 系列生成视频,对应的元素必须先存在为一个资产——这正好就是上面这套配置方法。
最容易搞错的事
- 整个项目只选一个模型。 你会白白放弃长镜头或者音乐节拍其中一项能力,没必要。
- 给每个模型分别重新上传参考图。 把它们绑定到资产上一次就够,两个模型都会读取。
- 拿 H3 去跑 30 秒的活,或者拿 Seedance 去卡 5 秒的音乐点。 每个模型在不是为它设计的场景里,都会输掉这场比较。
- 只靠参数表来比较。 真正决定性的测试是在你自己的班底上看连贯性;拿同样三个镜头在两个模型上都跑一遍,盯着脸看。
常见问题
MiniMax H3 比 Seedance 2.5 更好吗?
对短的、音乐驱动的、需要精确还原参考的镜头,通常是的。对长镜头一镜到底、多人物场景、4K 交付来说,Seedance 2.5 是更强的选择。两个模型在 ArcLoop 里都能用。
我能在同一个视频里同时用两个模型吗?
可以。ArcLoop 里每张 shot card 都能单独选生成模型,两边出的片段最后都落在同一条 Edit 时间线上。
哪个模型能让我的角色更一致?
一致性主要来自绑定好的资产和 @ 引用,而不是模型本身。用同一套参考图,两个模型都能保持身份稳定;H3 对每张图的控制更精细,Seedance 能接受的图片数量更多。
哪个更便宜?
要看具体镜头:H3 Max 出的草稿每秒非常便宜,而一条 30 秒的 Seedance 镜头能顶替两次 H3 生成加一次拼接。要算的是整个迭代循环的成本,不是单条片段的成本。
先给镜头分类,再选模型
同一天发布容易招来"谁更强"的对立叙事;但一个真正在推进的项目,会把它们当成同一张工作台上的两件工具。把班底建成资产,描述镜头时不写角色长相,让镜头类型自己决定用哪个模型。打开你的项目,拿同样三个镜头在两个模型上都试一遍——脸会告诉你参数表说不出来的一切。





