開始使用

MiniMax H3 片段拼接:怎麼做出超過 15 秒的影片

續寫、context-loop 拼接,還是剪輯——你的序列到底需要哪一種。

開始創作
MiniMax H3 片段拼接:怎麼做出超過 15 秒的影片

舞い落ちる花びらには誰も手を伸ばさない悲しみが混ざったような 冷たい笑顔のままゆらり 舞い落ちた心の たどり着く先は快切很多的排版,按照音乐来制作纯文字PV动画,@[H3.png] 人物参考,运镜动态感强,文字要有拆字的动画,笔画像花瓣一样被一片片剥开、飘散、悬停、再被重力砸回去重组,线条组合,坠落的力量感和飘零的失重感同时要有,日系拼贴,单帧闪烁,花瓣和墨迹一起飞溅,要有歌词,每一个词卡准歌词和鼓点,卡点准确,做到曲线有力,合成精细,排版紧凑,动画敏捷,所有的分镜都非常精致,能和pv大师同台竞技的程度。情绪要贴这四句:没人伸手去接的飘落花瓣、混着悲伤的冰冷笑容、ゆらり摇曳着往下坠、一颗心飘落最终去往的地方,整体冷调黑白,只在「花」的最后一笔、「悲」「冷」的关键笔画和重拍单帧里渗一点点冷绯红

模型
MiniMax H3
時長
15 秒
畫面比例
16:9
解析度
2K
製作同款

15 秒上限到底意味著什麼

MiniMax H3 單次生成最長 15 秒,一旦有人想做更長的東西,幾乎都會撞上"minimax h3 loop"這個搜尋詞。它指向一個真實存在的技巧:context-loop 片段拼接,一種社群做法——被打包成圖形化工具裡的節點——把上一條 H3 片段的結尾餵給下一條的開頭,讓動作和音訊真正在接縫處延續下去。

這個方法確實有效,也是繞過上限的三條路之一。另外兩條,一條是模型自帶的音畫續寫模式,另一條是動畫行業最古老的技巧:剪輯。你該選哪條,取決於你要做的到底是什麼樣的序列。這篇文章把三條路都攤開講,並附上動畫創作角度該怎麼選的理由。

方法一:音畫續寫(模型自帶)

H3 的雲端 API 能延長一條已有片段,把畫面和聲音一起續下去。你把片段和接下來要發生的事的描述交給它;它會生成接下來那幾秒,主體、光線和背景音都延續同一套。

最適合: 一段不能被打斷的持續表演——一句唱二十秒的樂句、緩慢推近一張臉的推軌鏡頭、跨過 15 秒線的一段舞蹈動作。

要注意: 跑偏會累積。每一次續寫都是基於上一條生成的新一次生成;到第三次延長的時候,臉或配色上的細微變化就已經疊加起來了。對身份至關重要的鏡頭,實際上限是兩次延長,而且每次延長請求都帶上角色的參考圖,能幫你守住這條線。

方法二:Context-loop 拼接(社群做法)

"loop"這類搜尋詞背後的拼接技巧,比續寫走得更遠。它不是重新描述交接點,而是把模型的內部狀態——上一條片段末尾的 latent 和音訊——直接帶進下一次生成,所以接縫不是"重新構造"出來的。更好的實現方式會直接從 latent 裡切出錨定幀,而不是解碼成畫素再重新編碼,這正是早期嘗試裡那種明顯接縫被消除的原因。

最適合: 自己跑開源權重、需要長連續鏡頭的技術向使用者——氛圍迴圈、持續的鏡頭漂移、場景背景動效。

要注意: 這是一套自託管、圖形化的工作流,解析度停在 768p(開源權重沒有 2K 階段),而且需要硬體。對只想要片段、不想搭工作流的創作者來說,這條路是拿來讀一讀的,不是拿來真的走的。而且它也繼承了續寫的跑偏問題,而且是在很多個連結上累加——序列本身會很流暢,但角色可能已經不是原來那個人了。

方法三:像動畫一樣去剪(Storyboard 方法)

大多數"怎麼做得更長"的搜尋都會忽略這件事:動畫本來就不是靠長連續鏡頭做出來的。一個典型的場景大概每兩到八秒就切一次——特寫、反應、遠景、插入鏡頭。15 秒這個視窗對一個動畫場景來說根本不是一堵牆;它比場景裡幾乎任何一個單獨鏡頭都要大。

所以,最能做出動畫感的方法,恰好也是徹底繞開這個上限的方法:把場景拆成一個個鏡頭,每個鏡頭單獨生成一條片段,再拼起來。

最適合: 敘事場景、對白、動作戲,任何有不止一個節拍的內容——也就是幾乎所有場景。

為什麼這個方法在角色向創作上比拼接更好: 每個鏡頭都是從同一套角色參考圖重新開始的,而不是從上一條片段的跑偏狀態延續下去。十個鏡頭能和一個鏡頭一樣不跑設定。而且每一次剪輯點都是一次改變運鏡、景別、節奏的機會,這正是讓一段序列有"導演感"而不是"生成感"的關鍵。

要注意: 鏡頭之間的連貫性現在得你自己來把關——光線方向、服裝狀態、視線方向、角色站位。Storyboard 連貫性指南講了具體該檢查哪些東西。

在 ArcLoop 裡,Storyboard 方法具體怎麼做

  1. 把場景寫成一串節拍,而不是一整段描述。 "她走進來。她看到那封信。她讀信。她抬起頭。"四個節拍,四個鏡頭。
  2. 開啟 Episode,點 Generate Shots。 Storyboard 會把場景拆成一張張 shot card。給每張卡調整時長——反應鏡頭 4 秒,讀信鏡頭 8 秒。
  3. 每張卡都用 @ 引用班底。 每個鏡頭都寫 @Yui,意味著每個鏡頭讀的都是同一份繫結好的 Main image 和 Reference image。身份不依賴上一條片段。
  4. 每個鏡頭只描述會變的部分。 運鏡、動作、光線。保持光線方向和時間感在各張卡之間一致——如果模型需要提醒,就在每張卡里寫一句"same afternoon light"。
  5. 先把整個序列的靜幀全部生成出來。 十張靜幀的成本比一條失敗的影片還低,而且能在 Storyboard 上並排看出連貫性問題——挪了位置的檯燈、換了樣子的外套。
  6. 生成影片,在 AI Chat Panel 裡批次處理——"給 Shot 1 到 4 生成影片"——再把它們拉到 Edit 時間線上。剪裁、調整順序、替換掉沒達標的那個鏡頭。序列的總長度由時間線說了算,而且沒有任何一次拼接會超過 15 秒的上限。
  7. 只在剪輯會破壞效果的地方才用續寫。 那一句唱段、那一次緩慢推近——只延長那一個鏡頭。

三種方法怎麼選

序列型別方法
20–25 秒的單段表演(唱歌、臺詞、舞蹈)續寫,延長一到兩次,並帶上角色參考圖
氛圍或迴圈背景,自託管Context-loop 拼接
有多個節拍的敘事場景Storyboard 方法:拆成鏡頭
兩個角色之間的對白Storyboard 方法:正反打交替
音樂影片Storyboard 卡點剪輯;只在需要撐住一段唱腔時才用續寫
需要臉在一分鐘內保持完全一致的任何內容Storyboard 方法——每個鏡頭都從參考圖重新開始

最常見的翻車點

  • 給敘事場景用拼接。 一個本該剪輯的場景如果做成無縫銜接,看起來像屏保,不像故事。
  • 角色鏡頭延長超過兩次。 跑偏會累積;第三次延長往往就是臉開始走樣的地方。
  • 做長序列之前跳過靜幀。 連貫性問題在 Storyboard 上發現很便宜,在十條渲染好的片段裡發現就很貴了。
  • 忘了處理接縫處的聲音。 H3 是按片段生成音訊的;在時間線上,讓環境音稍微重疊一點,或者加一條底噪,這樣剪輯點就不會有"咔"的一聲。

常見問題

"minimax h3 loop" 是什麼意思?

指的是 context-loop 片段拼接——一種社群技巧,把 H3 的內部狀態從一條片段帶到下一條,讓動作和音訊在接縫處延續下去。這是一套自託管的工作流,和模型自帶的續寫模式是兩回事。

MiniMax H3 能做出一分鐘的影片嗎?

單次生成做不到,上限是 15 秒。一分鐘的動畫序列通常是 8 到 15 個鏡頭分別生成再拼起來的——就是上面說的 Storyboard 方法。

續寫能保持角色一致嗎?

延長一到兩次的話,基本可以。超過這個數,跑偏就會累積。對身份至關重要的創作來說,每個鏡頭都從繫結好的參考圖重新開始更靠譜。

有不用自託管就能做到的辦法嗎?

有——Storyboard 方法不需要搭任何工作流。在 ArcLoop 裡,鏡頭是在雲端 H3(帶 2K 階段)上生成的,再到 Edit 時間線上拼起來。

先剪輯,拼接放最後

15 秒的上限,對單次生成來說是真實存在的限制,但對一個場景來說幾乎從來都不是限制。把場景規劃成一個個鏡頭,讓班底始終錨定在資產裡,先出靜幀再出影片,只在剪輯會破壞表演的地方才用續寫。開啟你的專案,寫下節拍,讓 Storyboard 把這個上限變成一種剪輯節奏。

用鏡頭搭出加長版

在 ArcLoop 裡,一個 episode 就是一整塊由 shot card 組成的 Storyboard——每張卡都用 MiniMax H3 生成,用 @ 引用保持班底一致,再到 Edit 時間線上拼出完整序列。

立即創作

探索更多

Live2D 和 VTuber 要的設定表長怎樣

Live2D 和 VTuber 要的設定表長怎樣

怎麼做角色立繪

怎麼做角色立繪

直式微短劇製作指南

直式微短劇製作指南

動作太整齊反而像木偶

動作太整齊反而像木偶