引言
你想要一個很具體的姿勢:重心落在後腳,右臂橫過胸前,下巴壓低,眼睛朝上看。你一字不差地寫出來,生成結果給你一個正常站立、一隻手微微抬起的角色。你又加了幾句話。現在手的位置對了,重心又不對了。肢體語言牽涉的關節太多,一句話根本鎖定不了,每加一句就給模型多一個發揮空間。
靜幀不會被解讀,只會被複制。任何包含你想要的姿勢的片段——舞蹈影片、打鬥場景、走路迴圈、訪談裡某人聳肩——只要截出合適的幀,都能變成姿勢參考來源。這篇指南說的就是怎麼在 AI 動畫影片裡使用姿勢參考:截哪些幀、怎麼繫結才能只提供姿勢、怎麼寫 shot card 讓角色資產提供其餘的一切。
從片段裡能遷移什麼,不能遷移什麼
從片段裡截一張靜幀綁到 shot 上,模型能從中獲取:
- 姿勢本身。 各關節角度、重心分佈、手的位置。
- 構圖空間。 身體在畫面裡的位置,周圍留了多少餘地。
- 時間節奏,如果你取了多張靜幀的話。 起始姿勢、頂點姿勢、結束姿勢告訴模型動作的弧線。
- 鏡頭高度和距離。 從地面拍的靜幀會帶來低角度視點。
它會嘗試獲取、而你必須阻斷的:
- 風格。 一張照片會把生成結果拉向寫實;灰色人臺會把它拉向灰色。保持風格參考在位。
- 身份。 片段裡的人不是你的角色。用
@引用你的角色,永遠不要在文字裡描述他們的臉。 - 服裝。 靜幀裡的衣服會滲入。把服裝綁到角色資產上。
規則是一個參考只做一件事:靜幀提供姿勢,資產提供身份,風格參考提供外觀。參考選擇指南覆蓋了所有參考型別的通用原則。
挑選姿勢靜幀的規則
- 取極值幀,不取過渡幀。 踢腿的最高點、出拳的全伸展、鞠躬的最深處。過渡幀模糊、歧義多。
- 一幀,一個姿勢。 如果一幀裡同時有兩件事——轉身加伸手——就取兩幀。
- 身體完整入畫。 被裁掉的肢體會被模型自行發明。
- 鏡頭角度和 shot 保持一致。 側面的姿勢靜幀對正面鏡頭沒什麼用。用你實際要用的角度去找,或者換一個包含這個角度的片段。
- 優先選中性來源。 無貼圖的 3D 人臺片段是理想選擇,因為它除了姿勢什麼也不帶;人臺舞蹈指南有一個完整演示。
分步:怎麼建立並使用姿勢參考集
- 找到包含這個動作的片段。 任何身體完整入畫、鏡頭穩定的來源都行。
- 拖到極值幀,匯出靜幀。 每個動作三張通常夠用:之前、頂點、之後。按動作命名:「shrug-01、shrug-02、shrug-03」。
- 把靜幀上傳到內容庫,繫結為 Visual reference 資產,按動作或場景命名。之後 Agent 就可以重複使用這套參考集了。
- 確認角色是一個資產,帶有 Main image,如果動作涉及服裝,也要有服裝參考。身份絕對不寫進 shot 文字裡。
- 寫 shot card:鏡頭、
@角色、姿勢靜幀、以及變化的部分。 「Match pose still shrug-02;她保持這個姿勢一拍,然後放下肩膀。」 - 生成圖片,和靜幀對比。 逐個關節看:重心、手、頭部。如果姿勢不對,是靜幀本身有歧義——換一張更清晰的幀,不要加文字描述。
- 只從匹配成功的靜幀出發生成影片。 對於有三張靜幀的動作,shot description 按順序點名:「從 shrug-01 經過 shrug-02 到 shrug-03,持續兩秒。」
- 複用這套參考集。 同一個聳肩動作適用於所有角色;只需要換
@。
示例 1:單個定格姿勢
Medium shot, camera at chest height, static, plain rehearsal room. @Yuki stands at center matching pose still guard-02: weight on the back foot, left arm across the chest, right hand open at hip height, chin down, eyes up at camera. She holds the pose for the whole shot, breathing visibly, hair settling. Soft overhead light. No camera move, no added movement.
示例 2:跨三張靜幀的動作
Medium-wide shot, camera at chest height, static, same rehearsal room. @Yuki moves from pose still shrug-01 (arms at her sides, shoulders neutral) through shrug-02 (shoulders up, palms turned out) to shrug-03 (shoulders dropped, small exhale) over about two seconds. Face stays toward camera the whole time. One clean motion, no repeat, no bounce at the end, hands relaxed. Same light and framing as Shot 1.
示例 3:不同角色做同一個姿勢
Medium shot, camera at chest height, static, on the bridge of @Riverside Market. @Hana matches pose still guard-02 exactly: weight back, left arm across the chest, right hand open at hip height, chin down, eyes up. Same pose as Yuki's Shot 1, different character, different place. Outfit from Hana's asset. She holds for the shot; a breeze moves her hair. Late afternoon light from the left.
姿勢參考最常見的失效方式
- 照片風格滲入。 生成結果變寫實,因為靜幀是照片。加強或補充風格參考;靜幀只用來提供姿勢。
- 片段裡的人出現了。 來源素材裡的臉或髮型出現在結果裡。原因是角色用文字描述了而不是用
@引用。修正引用方式。 - 角度不對。 側面靜幀用在正面 shot 上,模型折中處理了。換成正確角度的幀。
- 用了過渡幀。 姿勢出來很模糊,因為靜幀截在動作中途。取極值幀。
- 一個 shot 堆了太多靜幀。 六個參考讓模型取了平均值。每個動作最多三張。
常見問題
我可以用自己生成的影片裡的靜幀作為姿勢參考嗎? 可以,而且這是最乾淨的來源:風格相同,角色相同。匯出幀,繫結,重複使用。
姿勢靜幀對手部有效嗎? 對手的位置有效。對手指細節效果差一些;手部靜幀能幫助整體姿勢,但如果手指出了問題,手部與姿勢指南裡有專門的處理方法。
姿勢參考和角色資產上的 Reference image 有什麼區別? 資產上的 Reference image 說的是角色從另一個角度或另一套服裝看是什麼樣子。姿勢靜幀說的是身體在某個 shot 裡在做什麼。把它們分開,姿勢就不會變成角色身份的一部分。
片段本身呢? 把它留在內容庫裡,用於回看和選幀。Shot 裡用的是靜幀。
下一步
找一個你一直描述不出來的動作。找一個包含它的片段,匯出頂點幀,把它繫結為 Visual reference,寫一個 shot:用 @ 引用角色,點名靜幀,身體部分只寫「match the still」。在 ArcLoop 裡開啟專案,生成圖片,逐個關節對比之後再生成影片。





