引言
"MiniMax H3 anime" 是围绕这个模型增长最快的搜索词之一,而大家晒出来的结果分成明显两派。一派做出的是干净的 2D 效果——平涂式赛璐璐上色、稳定的线条粗细、动画式的运动节奏。另一派做出来的更像是套了动画滤镜的 3D 渲染:柔和的体积光、带景深的摄影质感,脸还会一条片段比一条片段更走样一点。
差别几乎从来不在模型本身,而在提示词和参考图是怎么配置的。H3 是一个全模态模型——它会把图片、片段、音频和你的文字放在一起读——所以动画效果是你锚定出来的,不是靠一个形容词求来的。这篇文章讲清楚动画向提示词该怎么搭结构、为什么对大多数创作者来说参考图比 LoRA 更划算,以及怎么用 ArcLoop 的配置让角色从第一条片段到最后一条都是同一个人。
光写 "anime style" 为什么锁不住风格
单独写"anime style"是个很弱的信号。这个模型见过各种流派的动画,也见过各种 3D-动画混血风格,一个光秃秃的形容词等于把选择权交给它自己挑。真正能锁定画风的是这三件事:
一张已经是你想要效果的参考图。 H3 每次生成最多能接受九张参考图。一张风格精准的干净 2D 角色插画——线条粗细、上色方式、配色——比任何一段风格描述文字都管用。这是最重要的输入,没有之一。
说清楚"怎么画",而不是"什么类型"的风格词汇。 "Flat cel shading, two-tone shadows, clean dark linework, no photographic depth of field, limited animation timing" 描述的是怎么画出来的。"Anime style, high quality, beautiful" 这种话,模型根本没法拿去执行。2D 动画提示词词汇表在 H3 上完全适用,不用改。
一份你真心想排除的负面清单。 H3 对简短的"要避免什么"清单反应很好:真实感皮肤质感、3D 渲染光照、镜头虚化。列出三四个上次毁了你效果的东西就够了。
怎么写一条动画镜头提示词
一条好用的 H3 动画提示词,应该是一份镜头简报,而不是角色描述。角色活在参考图里,提示词只描述一个镜头:
@Rin in the school rooftop scene, 2D anime, flat cel shading with two-tone
shadows and clean dark linework. Medium shot. She leans on the railing, wind
lifts her hair once, she turns her head toward the camera and smiles. Late
afternoon sun, long soft shadows, no lens blur. Sound: distant traffic, a
single gust, her small laugh at the end.
注意这里没有写的东西:发色、眼型、校服细节。这些都属于参考图,每次提示词里都重新描述一遍,正是身份跑偏的根源——文字和图片会开始互相打架。也注意这里只有一个动作:靠、吹、转、笑。H3 处理一条片段里一个清楚节拍的效果,远好于同时塞一堆事情,而且动画式的节奏本来就更适合落在一个持续的动作上。
要做对白镜头,就在同一条提示词里把声音也描述进去。H3 会把音频和画面一起生成,所以对好口型的台词加环境音,一次生成就能拿到:
@Rin, close-up, 2D anime, flat shading. She says quietly: "You came back."
Small pause, eyes drop, then meet the camera again. Sound: evening cicadas,
her line clear and close, no music.
对大多数创作者来说,参考图比 LoRA 划算
因为 H3 的基础权重是开源的,"minimax h3 anime lora" 确实是个有搜索量的词——有人在用它训练风格适配器。这条路是存在的,而且对需要在成千上万条片段里统一一种风格、又有硬件跑自定义模型的工作室来说是说得通的。
但对个人创作者或小团队来说,这是条慢路。LoRA 锁死一种风格,风格一变就得重新跑一次训练;参考图是按次生成来锁定风格的,不花钱,你的画风一变它也跟着变。九个图片槽位加三段视频参考,足够在一次请求里钉住角色、服装、配色和运动风格。先从这里开始。如果你发现自己连续一个月每条提示词都在塞同样那九张参考图,那才是 LoRA 开始划算的时候——在这之前都不是。
在 ArcLoop 里让角色不跑设定
在 ArcLoop 里,MiniMax H3 是可选的生成模型之一,而动画工作流的核心,基本就是在你写任何提示词之前,先把该放的东西放到该放的位置:
- 把 Story Brief 设成 Anime。 项目的风格设置会影响下游的每一次生成,这样你就不用在每条提示词里跟默认风格较劲。
- 在我的资产里把角色做成一个资产。 把你最干净的一张 2D 插画绑定为 Main image,再加一张转身图和一两张表情图作为 Reference image。你在提示词里引用角色时,H3 读的就是这些——身份锚点在这里,不在你的提示词里。
- 为风格加一张 Visual reference。 一张专门展示具体画法——上色、线条、配色——和角色分开的图,这样即使某个镜头里角色很小或者根本不在画面里,画风也能保持一致。
- 从 Episode 的 Storyboard 里 Generate Shots。 每张 shot card 的描述用
@引用角色,只描述这个镜头的动作、运镜、光线和声音。用资产引用比每个镜头都从头描述角色靠谱得多——这是产品本身的建议,对动画来说更是加倍成立,因为哪怕眼型差一点点,一眼就能看出来。 - 先生成图片,再生成视频。 先在静帧上检查风格——平涂上色有没有稳住、线条干不干净、脸对不对得上设定——再花一次视频生成的额度。一张看起来像 3D 的静帧,动起来也不会变成 2D。
- 画风定了之后再批量生成。 在 AI Chat Panel 里说一句"给 Shot 1、2、3 生成视频",就能让整批生成用同一套资产和风格。
常见踩坑
- 每条提示词都重新描述角色。 文字和参考图会互相打架,脸一条片段一个样。引用资产,只描述镜头。
- 只写风格词,没配风格参考图。 "Anime style" 这种词单独用,等于让模型自己挑一种混血风格。用一张图把它钉住。
- 一条片段塞三个动作。 动画式节奏需要一个持续的节拍。一次生成只放一个动作、一个运镜、一次情绪转折。
- 在 2D 场景里用电影感的光线描述。 "体积光god rays、浅景深" 这种话会把 H3 拉向它的 3D 那一面。像 2D 画师一样去描述光:"暖色侧光、硬边阴影。"
- 用视频而不是静帧来判断风格。 静帧更便宜,风格看得也更清楚。风格问题在静帧阶段就解决掉。
常见问题
MiniMax H3 能把动画做好吗?
能,前提是用参考图锚定风格、提示词描述的是画法而不是类型。没有参考图的话,结果会往 3D-动画混血风格上飘。
在 H3 上做动画需要 LoRA 吗?
对大多数创作者来说不需要。参考图能按次免费锁定风格。LoRA 更适合需要在自有硬件上大规模统一一种风格的工作室。
H3 做动画片段能给到多高的分辨率、多长的时长?
云端模型最高 2K,单条片段 4 到 15 秒;分辨率与时长限制指南把每个档位都讲了一遍,包括 H3 Max。
怎么让角色在很多条片段里都保持一致?
把角色的参考图绑定到一个资产上,每个镜头都用 @ 引用它。让脸在多个镜头间保持稳定的那套方法,原样适用于 H3。
先锚定,再写提示词
H3 把动画创作者一直想要的东西都给了——原生音频、混合参考、真正的 2K——但它只把这些给那些锚定了画风、只描述一个镜头的提示词。把 Story Brief 设成 Anime,绑定你的角色,加一张风格参考图,再写镜头。打开一个项目,在生成任何一秒视频之前,先把第一张静帧锁定下来。





