开始使用

MiniMax H3 片段拼接:怎么做出超过 15 秒的视频

续写、context-loop 拼接,还是剪辑——你的序列到底需要哪一种。

开始创作
MiniMax H3 片段拼接:怎么做出超过 15 秒的视频

舞い落ちる花びらには誰も手を伸ばさない悲しみが混ざったような 冷たい笑顔のままゆらり 舞い落ちた心の たどり着く先は快切很多的排版,按照音乐来制作纯文字PV动画,@[H3.png] 人物参考,运镜动态感强,文字要有拆字的动画,笔画像花瓣一样被一片片剥开、飘散、悬停、再被重力砸回去重组,线条组合,坠落的力量感和飘零的失重感同时要有,日系拼贴,单帧闪烁,花瓣和墨迹一起飞溅,要有歌词,每一个词卡准歌词和鼓点,卡点准确,做到曲线有力,合成精细,排版紧凑,动画敏捷,所有的分镜都非常精致,能和pv大师同台竞技的程度。情绪要贴这四句:没人伸手去接的飘落花瓣、混着悲伤的冰冷笑容、ゆらり摇曳着往下坠、一颗心飘落最终去往的地方,整体冷调黑白,只在「花」的最后一笔、「悲」「冷」的关键笔画和重拍单帧里渗一点点冷绯红

模型
MiniMax H3
时长
15 秒
画面比例
16:9
分辨率
2K
制作同款

15 秒上限到底意味着什么

MiniMax H3 单次生成最长 15 秒,一旦有人想做更长的东西,几乎都会撞上"minimax h3 loop"这个搜索词。它指向一个真实存在的技巧:context-loop 片段拼接,一种社区做法——被打包成图形化工具里的节点——把上一条 H3 片段的结尾喂给下一条的开头,让动作和音频真正在接缝处延续下去。

这个方法确实有效,也是绕过上限的三条路之一。另外两条,一条是模型自带的音画续写模式,另一条是动画行业最古老的技巧:剪辑。你该选哪条,取决于你要做的到底是什么样的序列。这篇文章把三条路都摊开讲,并附上动画创作角度该怎么选的理由。

方法一:音画续写(模型自带)

H3 的云端 API 能延长一条已有片段,把画面和声音一起续下去。你把片段和接下来要发生的事的描述交给它;它会生成接下来那几秒,主体、光线和背景音都延续同一套。

最适合: 一段不能被打断的持续表演——一句唱二十秒的乐句、缓慢推近一张脸的推轨镜头、跨过 15 秒线的一段舞蹈动作。

要注意: 跑偏会累积。每一次续写都是基于上一条生成的新一次生成;到第三次延长的时候,脸或配色上的细微变化就已经叠加起来了。对身份至关重要的镜头,实际上限是两次延长,而且每次延长请求都带上角色的参考图,能帮你守住这条线。

方法二:Context-loop 拼接(社区做法)

"loop"这类搜索词背后的拼接技巧,比续写走得更远。它不是重新描述交接点,而是把模型的内部状态——上一条片段末尾的 latent 和音频——直接带进下一次生成,所以接缝不是"重新构造"出来的。更好的实现方式会直接从 latent 里切出锚定帧,而不是解码成像素再重新编码,这正是早期尝试里那种明显接缝被消除的原因。

最适合: 自己跑开源权重、需要长连续镜头的技术向用户——氛围循环、持续的镜头漂移、场景背景动效。

要注意: 这是一套自托管、图形化的工作流,分辨率停在 768p(开源权重没有 2K 阶段),而且需要硬件。对只想要片段、不想搭工作流的创作者来说,这条路是拿来读一读的,不是拿来真的走的。而且它也继承了续写的跑偏问题,而且是在很多个链接上累加——序列本身会很流畅,但角色可能已经不是原来那个人了。

方法三:像动画一样去剪(Storyboard 方法)

大多数"怎么做得更长"的搜索都会忽略这件事:动画本来就不是靠长连续镜头做出来的。一个典型的场景大概每两到八秒就切一次——特写、反应、远景、插入镜头。15 秒这个窗口对一个动画场景来说根本不是一堵墙;它比场景里几乎任何一个单独镜头都要大。

所以,最能做出动画感的方法,恰好也是彻底绕开这个上限的方法:把场景拆成一个个镜头,每个镜头单独生成一条片段,再拼起来。

最适合: 叙事场景、对白、动作戏,任何有不止一个节拍的内容——也就是几乎所有场景。

为什么这个方法在角色向创作上比拼接更好: 每个镜头都是从同一套角色参考图重新开始的,而不是从上一条片段的跑偏状态延续下去。十个镜头能和一个镜头一样不跑设定。而且每一次剪辑点都是一次改变运镜、景别、节奏的机会,这正是让一段序列有"导演感"而不是"生成感"的关键。

要注意: 镜头之间的连贯性现在得你自己来把关——光线方向、服装状态、视线方向、角色站位。Storyboard 连贯性指南讲了具体该检查哪些东西。

在 ArcLoop 里,Storyboard 方法具体怎么做

  1. 把场景写成一串节拍,而不是一整段描述。 "她走进来。她看到那封信。她读信。她抬起头。"四个节拍,四个镜头。
  2. 打开 Episode,点 Generate Shots。 Storyboard 会把场景拆成一张张 shot card。给每张卡调整时长——反应镜头 4 秒,读信镜头 8 秒。
  3. 每张卡都用 @ 引用班底。 每个镜头都写 @Yui,意味着每个镜头读的都是同一份绑定好的 Main image 和 Reference image。身份不依赖上一条片段。
  4. 每个镜头只描述会变的部分。 运镜、动作、光线。保持光线方向和时间感在各张卡之间一致——如果模型需要提醒,就在每张卡里写一句"same afternoon light"。
  5. 先把整个序列的静帧全部生成出来。 十张静帧的成本比一条失败的视频还低,而且能在 Storyboard 上并排看出连贯性问题——挪了位置的台灯、换了样子的外套。
  6. 生成视频,在 AI Chat Panel 里批量处理——"给 Shot 1 到 4 生成视频"——再把它们拉到 Edit 时间线上。剪裁、调整顺序、替换掉没达标的那个镜头。序列的总长度由时间线说了算,而且没有任何一次拼接会超过 15 秒的上限。
  7. 只在剪辑会破坏效果的地方才用续写。 那一句唱段、那一次缓慢推近——只延长那一个镜头。

三种方法怎么选

序列类型方法
20–25 秒的单段表演(唱歌、台词、舞蹈)续写,延长一到两次,并带上角色参考图
氛围或循环背景,自托管Context-loop 拼接
有多个节拍的叙事场景Storyboard 方法:拆成镜头
两个角色之间的对白Storyboard 方法:正反打交替
音乐视频Storyboard 卡点剪辑;只在需要撑住一段唱腔时才用续写
需要脸在一分钟内保持完全一致的任何内容Storyboard 方法——每个镜头都从参考图重新开始

最常见的翻车点

  • 给叙事场景用拼接。 一个本该剪辑的场景如果做成无缝衔接,看起来像屏保,不像故事。
  • 角色镜头延长超过两次。 跑偏会累积;第三次延长往往就是脸开始走样的地方。
  • 做长序列之前跳过静帧。 连贯性问题在 Storyboard 上发现很便宜,在十条渲染好的片段里发现就很贵了。
  • 忘了处理接缝处的声音。 H3 是按片段生成音频的;在时间线上,让环境音稍微重叠一点,或者加一条底噪,这样剪辑点就不会有"咔"的一声。

常见问题

"minimax h3 loop" 是什么意思?

指的是 context-loop 片段拼接——一种社区技巧,把 H3 的内部状态从一条片段带到下一条,让动作和音频在接缝处延续下去。这是一套自托管的工作流,和模型自带的续写模式是两回事。

MiniMax H3 能做出一分钟的视频吗?

单次生成做不到,上限是 15 秒。一分钟的动画序列通常是 8 到 15 个镜头分别生成再拼起来的——就是上面说的 Storyboard 方法。

续写能保持角色一致吗?

延长一到两次的话,基本可以。超过这个数,跑偏就会累积。对身份至关重要的创作来说,每个镜头都从绑定好的参考图重新开始更靠谱。

有不用自托管就能做到的办法吗?

有——Storyboard 方法不需要搭任何工作流。在 ArcLoop 里,镜头是在云端 H3(带 2K 阶段)上生成的,再到 Edit 时间线上拼起来。

先剪辑,拼接放最后

15 秒的上限,对单次生成来说是真实存在的限制,但对一个场景来说几乎从来都不是限制。把场景规划成一个个镜头,让班底始终锚定在资产里,先出静帧再出视频,只在剪辑会破坏表演的地方才用续写。打开你的项目,写下节拍,让 Storyboard 把这个上限变成一种剪辑节奏。

用镜头搭出加长版

在 ArcLoop 里,一个 episode 就是一整块由 shot card 组成的 Storyboard——每张卡都用 MiniMax H3 生成,用 @ 引用保持班底一致,再到 Edit 时间线上拼出完整序列。

立即创作

发现更多

怎么让人看完这集就想看下一集

怎么让人看完这集就想看下一集

怎么把一个画风写成能反复用的配方

怎么把一个画风写成能反复用的配方

怎么让一整季的画面看起来是同一部片

怎么让一整季的画面看起来是同一部片

GPT Image 2 怎么做短剧角色图、分镜和封面

GPT Image 2 怎么做短剧角色图、分镜和封面