八月以來刷屏的那個模型到底是什麼
每隔幾個月,總會有一個影片模型變成創作者圈子裡人人都在測試的東西。從八月開始,這個模型就是 MiniMax H3——它的另一個名字是 Hailuo 3.0。看過樣片就知道為什麼:聲音精準踩在動作上,因為它是和畫面一起生成的;角色在 15 秒的多鏡頭長鏡頭裡始終保持設計不跑偏;2K 的輸出全屏看也扛得住。
在這些樣片背後,H3 的設計思路確實不一樣:這是一個把圖片、影片片段、音訊都當成同一場對話來處理的全模態模型,再加上開源權重,讓它成了這一季被研究得最多的影片模型。而且從八月底開始,它已經變成了兩個版本——原版 H3,以及 H3 Max,一個近乎實時的速度檔位,徹底改變了迭代的手感。
這篇是大白話入門:H3 是什麼、每個檔位分別能幹什麼、能拿它做什麼、以及怎麼用才不浪費你的額度。
H3 的底層設計是怎麼回事
H3 是一個圍繞一個核心理念打造的影片生成模型:一切都可以是參考。 大多數模型只接受一段提示詞、頂多一張圖,H3 卻能接受一整套素材——
- 最多 9 張參考圖,用來定角色、服裝和風格
- 最多 3 段參考影片,用來定動作和節奏
- 最多 3 段音訊,用來引導聲音和節奏(每段音訊都掛在一個畫面上)
——在提示詞裡按順序引用它們,就像拿一張情緒板給動畫師做說明一樣。模型會生成一段 4 到 15 秒的片段,動作跟著你參考的走,角色保持你鎖定的樣子,並返回和畫面一起生成的原生 32kHz 立體聲音訊。環境音、擬音,甚至對口型的臺詞都在同一次生成裡完成,而且天然對齊——不需要另外排期或付費做配音。
解析度分兩個階段:基礎模型渲染在 768p,再經過一個雲端的重生成階段把最終結果提升到 2K(2560×1440)。這個拆分背後有個很實際的原因:MiniMax 開源了基礎權重,研究者和工具開發者可以在 H3 上做二次開發——但 2K 的精修階段只在雲端提供。自建部署是可行的,但上限就是 768p。
在核心生成能力之外,這個模型家族還覆蓋了精確影片編輯和音畫續寫——也就是把畫面和聲音一起延長一段已有片段——這也是它能用來做連續鏡頭、而不只是單個迴圈片段的原因。
H3 Max:反超源模型的速度檔位
8 月 27 日,第二個檔位登場:H3 Max,由 fal 和 MiniMax 合作,在 H3 的開源權重上做後訓練得到,針對提示詞還原度、畫面美感和吞吐量做了專門調優。
最大的亮點是速度,快到能改變你的工作節奏:官方資料是5 秒片段不到 3 秒就出;日常使用中,一段 10 秒的片段回來的時間差不多就是它的播放時長。定價大約是480p 每秒 $0.05,768p 每秒 $0.08,而且發布幾天後這個檔位就補上了和基礎模型一樣的混合參考生成能力——圖片、影片、音訊都能用,按量計費下前幾張參考圖還是免費的。
讓人意外的是,這個快速檔位並不是"將就"的版本。在公開的圖生影片排行榜上,H3 Max 目前排名第一——比它脫胎而來的基礎版 H3 還要高。它唯一真正的上限是解析度:2K 階段沒法從開源權重裡繼承過來,所以 Max 在架構上就封頂在 768p。
記住這個家族的最簡單方式:
| MiniMax H3 | H3 Max | |
|---|---|---|
| 擅長 | 成片鏡頭 | 迭代速度 |
| 解析度 | 雲端最高 2K | 480p / 768p |
| 參考輸入 | 9 張圖 / 3 段影片 / 3 段音訊 | 一樣,發布幾天後補上 |
| 原生音訊 | 支援 | 支援 |
| 節奏 | 排隊等,再來審片 | 更接近重新生成一張圖 |
關於怎麼在兩個檔位之間拆分草稿和成片的完整工作流邏輯,可以看 H3 Max 工作流指南。
創作者實際都在用它做什麼
樣片集中出現在幾類 H3 設計上天然擅長的場景裡:
動畫 PV 和音樂驅動的片頭。 和畫面一起生成的原生音訊意味著卡點剪輯不需要再交給剪輯師——描述好音軌的能量,引用一段音訊,鼓點就會自然落在動作上。這也是 H3 最先在動畫創作者圈子裡火起來的用法。
多鏡頭角色敘事。 一次 15 秒的生成就能在不同場景之間切換,同時讓角色的臉、服裝、比例都保持一致——這向來是動畫敘事裡最難的問題,只要參考給得好,一次請求就能搞定。
對白片段。 一次生成就能拿到對口型的臺詞、帶房間空間感和環境音的效果,還能支援多種語言。以前需要三個工具才能做出來的短角色瞬間,現在一條提示詞就夠。
風格鎖定的連續鏡頭。 給它一種視覺語言——一套配色、一種線條、一種年代質感——它就能在整段片子的每個鏡頭裡保持這個風格,這也是為什麼 H3 的樣片裡風格化和復古向作品佔比這麼高。
怎麼用 H3 不白費一次生成
H3 已經作為一個生成模型接入 ArcLoop——模型頁面有各個模式和引數的說明——樣片效果和讓人抓狂的效果之間,差別幾乎總是出在參考素材管理得夠不夠規範,而不是提示詞寫得好不好。
三個習慣決定了大部分效果:
給它穩定的參考。 九個圖片槽位是通向一致性的機會,但如果這九張圖對"你的角色是誰"意見不一,它也會是個陷阱。把角色做成一個角色資產,讓它的標準參考圖繫結在上面,每次生成都從這一個來源去取。在鏡頭描述裡用 @ 引用角色資產,比每次重新描述一遍角色靠譜得多——這也意味著你第十條 H3 片段和第一條用的是同一個身份。
每個片段只講一個清楚的動作。 H3 的 15 秒更適合一段有開頭、有節拍、有結尾的鏡頭簡報——而不是五個想法互相搶同一批畫面。按順序寫清楚運鏡、動作,還有你想要的聲音。
從 Storyboard 生成,而不是在提示詞框裡單打獨鬥。 在 ArcLoop 裡,開啟你的 Episode,點 Generate Shots 把它拆成一張張 shot card,再把角色資產掛上去,逐張生成——或者在 AI Chat Panel 裡用一句大白話批次處理,比如"給 Shot 1、2、3 生成影片"。每條 H3 片段都會自動掛在它所屬的 shot card 上,這樣比較不同版本、重新拼剪輯的時候就不會散落在下載資料夾裡。
便宜地反覆迭代,只精修一次。 用 Max 檔位或較低設定去摸清節奏和走位,再把 2K 的精修額度花在已經確定要進最終剪輯的鏡頭上——這和適用於所有分檔模型家族的成本控制邏輯是同一套思路。如果你在拿 H3 和同級別的另一個成片級模型做比較,H3 對比 Seedance 2.0把這個選擇講得很清楚。
常見問題
MiniMax H3 和 Hailuo 3.0 是同一個東西嗎?
是的——H3 是這條產品線的國際化名字,之前叫 Hailuo。有些排行榜上 Max 檔位還會用一個內部名字出現,叫 MiniMax H3 Turbo。
MiniMax H3 免費嗎?
基礎模型的權重是開源的,雲端呼叫則是按量付費。Max 檔位目前在其託管方的工具頁面上每天提供少量免費生成次數。在 ArcLoop 裡做專案,H3 會消耗你的 ArcLoop 額度,具體多少取決於所選的生成模式。
H3 和 H3 Max 有什麼區別?
Max 是一個後訓練出來的速度檔位:最高 768p 下近乎實時生成,目前在圖生影片排行榜上排名第一,參考模式和原生音訊都和基礎版一樣。基礎版 H3 則保留了雲端的 2K 輸出階段。多數工作流最後都會落到"用 Max 出草稿、用 H3 出成片"這個分工上。
H3 是真的能和影片一起生成音訊嗎?
是的——音訊是和畫面一起預測出來的,而不是事後加上去的,這也是為什麼音效能精準踩在打擊點上、臺詞不用額外剪輯就能對上口型。你可以在描述鏡頭的同一條提示詞裡,直接把聲音場景也寫進去。
H3 生成的影片能有多長?
單次生成 4 到 15 秒,另外可以用音畫續寫來延長一段已有片段。更長的作品需要一個鏡頭一個鏡頭地搭出來——這正是配合 Storyboard 和持久化角色資產工作的優勢所在,比一條一條單獨寫提示詞生成靠譜得多。
模型是新的,自律不是
H3 這波關注是實打實賺來的:混合參考、原生音訊、開源權重,現在又加上一個快到能跟上你思路的 Max 檔位。但這份列表上的每一項能力,回報都取決於你給它的輸入有多穩定——而這部分是工作流的事,不是模型的事。把角色做成角色資產,像導演一樣去寫鏡頭簡報,在便宜的檔位上反覆迭代,把 2K 花在觀眾真正會盯著看的地方。開啟一個專案,先把你的第一個角色鎖定下來,讓 H3 有一個值得認出來的物件。





