開始使用

多人對話先畫站位,再生成鏡頭

用場景站位示意圖鎖定人物位置、機位方向、視線和對口型關係。

立即創作
多人對話先畫站位,再生成鏡頭

三個人一同框,鏡頭就崩了

單人近景都還挺像,一到多人對話就翻車。上一鏡頭林知夏站在桌子右前方,下一鏡頭她突然跑到左邊;周衡明明在沉默,嘴卻一直動;陳總站在門口壓著兩個人,一切到反打,他又變成坐在桌邊的陌生人。更麻煩的是桌上的合約、錄音筆和手機也跟著亂跑,剪輯時根本接不上。

這種問題不是靠一句「保持一致」就能救的。AI 短劇多人同框需要先鎖空間,再鎖角色,再鎖說話人。站位、視線、台詞、口型、字幕安全區和剪輯保底方案,都要在生成前進入同一條生產路徑。否則你只能不停抽卡,碰到一條像的就硬剪,後面越剪越穿幫。

在 ArcLoop 裡,做法更直接:用 AI 短劇指南 拆多人鏡頭結構,用 角色資產庫 給每個人建角色資產——臉、服裝、聲線(character voice)分別鎖定,鏡頭描述裡用 @角色名 逐個引用;再到 創作空間 打開專案,把這些鏡頭依次編進 Storyboard 的 shot 卡,站位、視線這類每鏡都不同的資訊寫在鏡頭描述裡,不用重新描述長相。多人對話不是每秒都要多人同框,只要空間和視線連續,單人反應、證據特寫和雙人關係鏡頭也能讓觀眾相信他們在同一場戲裡。

這篇講的是可落地的做法:先畫場景站位圖,再拆 15 秒和 30 秒鏡頭表,再做對口型與剪輯審核,最後用最小重做動作修翻車鏡頭。

空間、身分、聲音:穩住多人對話的三條線

第一條線是空間。多人對話裡,人物位置、家具位置、道具位置、機位方向和視線關係,決定觀眾能不能看懂關係。女主在右前景,表示她正在逼問;男主坐左後景,表示他被壓住;反派站門口,表示他堵住退路。位置一跳,戲的壓力就散了。

第二條線是身分。多人同框時最容易錯臉、借臉、換演員。只寫「女主、男主、反派」不夠,要用角色編號接角色資產庫。比如 ZH-001 林知夏,短黑髮、米白西裝、銀耳釘;ZH-002 周衡,深灰襯衫、細框眼鏡、左手戒痕;ZH-003 陳總,黑色大衣、方臉、金色袖扣。每個人都要有能在同一畫面裡分得出來的錨點。

第三條線是聲音。對口型不是最後貼音訊的事,而是在分鏡階段就要決定哪一句由誰說、誰聽、誰打斷、誰沉默。多人鏡頭最好一個鏡頭一個主要說話人,其他人做聽者反應。兩個角色同時長台詞,基本就是給口型找麻煩。

場景站位圖不需要畫得好看。它更像拍攝現場的俯視圖:門在哪、窗在哪、桌子朝向、誰在前景、誰在後景、關鍵道具放哪、機位 A/B/C/D 分別拍誰、哪條軸線不能跨。只要這張圖清楚,後面每個鏡頭都能引用它,不用每條提示詞都重寫一遍辦公室。

先畫站位圖,最直接的好處是防止左右關係亂。兩人對話裡,如果 A 看向左,B 也看向左,觀眾會覺得他們不是在互相說話。三人對話更明顯:誰壓迫誰、誰躲避誰、誰掌握證據,都靠空間關係成立。站位圖提前規定機位在桌子哪一側,反打鏡頭也不跨線。

它還能防止桌椅和道具跑偏。中文短劇常用合約、房卡、錄音筆、手機、藥瓶、親子鑑定做衝突證據。道具一旦從桌面中央跑到角落,或者在下一鏡頭消失,劇情就斷了。站位圖把道具當成場景資產保存,鏡頭表每次引用同一位置。

第三個好處是減少抽卡。沒有空間規格時,生成是在人物、家具、道具、機位之間碰運氣。你以為自己在最佳化提示詞,其實是在賭這一條剛好不崩。先畫站位圖看似多一步,實際上是把失敗從「隨機」變成「可審核」。

第四個好處是支援超時長拼接。15 秒以內的多人衝突可以靠三四個鏡頭撐住;30 秒以上就要不斷回到空間錨點,讓觀眾知道人還在同一間房裡。沒有站位圖,長段拼接很容易像素材合集。

場景站位圖怎麼畫

第一步,確定空間邊界。用一句話寫清楚場景:夜晚律所會議室,長桌橫在畫面中段,門在左後側,落地窗在右後側,冷白頂燈,桌面有合約和錄音筆。空間要簡單,別一上來就寫豪宅、樓梯、陽台、多人走位全都有。

第二步,固定家具。桌子、椅子、門、窗、沙發、螢幕、櫃子這些大物件先定死。家具是空間骨架,也是機位切換的參照。不要每個鏡頭都重新生成一套房間。

第三步,固定關鍵道具。合約在桌面靠女主一側,錄音筆在桌面中央,手機在男主右手邊,水杯在反派進門路線外側。道具位置要服務劇情,不是隨手鋪滿桌子。

第四步,放人物。每個角色用編號和資產庫引用,不只寫關係詞。ZH-001 林知夏站右前景,ZH-002 周衡坐左後景,ZH-003 陳總站門口中景。標清前中後、左中右、朝向和視線。

第五步,放機位。機位 A 拍女主近景,機位 B 拍男主反應,機位 C 拍三人關係,機位 D 拍桌面證據。每個機位都要寫拍攝方向和不能跨過的線。越軸會讓左右關係反掉,是多人對話最常見的穿幫之一。

第六步,寫說話責任。每個鏡頭只指定一個主要說話人,其他人是聽、低頭、握拳、避開視線、拿道具或沉默。口型責任寫清楚,比後期硬對音訊穩得多。

第七步,接入鏡頭表。後續提示詞不要反覆重寫整間會議室,只寫「沿用場景站位圖 S-01,使用機位 A,ZH-001 說話,ZH-002 聽者反應,合約位置不變」。這樣更短,也更穩。

15 秒與 30 秒怎麼分鏡頭,出錯了怎麼最小改動

在 ArcLoop 裡,同一個專案下能看到角色資產庫、Storyboard 的 shot 卡和 Edit 時間線。角色資產管的是臉、服裝、聲線這些不變的身份,站位、機位這些每鏡都不同的東西寫在 shot 描述裡。這樣某條鏡頭崩了,你改的是機位、口型或道具位置這一個 shot,不是把整段多人對話推倒重來。

15 秒以內,建議三到四個鏡頭:關係鏡頭交代站位,說話人近景推進衝突,聽者反應承接壓力,證據特寫或反問做小鉤子。不要在一個 15 秒鏡頭裡讓三個人輪流說長台詞,口型大概率會崩。

30 秒左右,可以拆成兩個 15 秒模組。第一輪丟證據,第二輪逼問或反轉。每個模組至少回到一次空間錨點,比如三人關係鏡頭、桌面證據、門口壓迫位或固定機位。這樣拼接時不會像換了房間。

多人同框要克制使用。兩人同框相對穩,三人同框需要明確前中後和左中右,四人以上建議只做遠景氣氛或拆成反應鏡頭。商業化短劇裡,多人同框適合衝突高光、封面候選和反轉切片;普通資訊交代拆成單人近景更省成本。

對口型不穩時,不要硬撐正臉長台詞。可以切聽者反應、證據特寫、手部動作、背影、門口腳步,或者讓關鍵句只露最後幾個字的口型。提前準備保底剪法:雙人同框失敗就切說話人單人近景,三人站位亂就拆成前景壓迫、證據特寫、聽者反應。

字幕也要提前讓位。直式短劇的下三分之一經常放字幕,不要把嘴、手機螢幕、合約簽名、錄音筆紅點放在字幕區。站位圖和鏡頭表都要標字幕安全區。

下面是在 ArcLoop 裡逐步執行的方法。

開啟 IP Project,進入 My Assets,給場景裡每個人建一個 Character——林知夏、周衡、陳總各一個。把參考圖上傳到 Library,再把最清晰的那張 Bind 為該角色的 Main image。如果角色在不同劇集裡換造型,把其他造型圖 Bind 為同一角色資產的 Reference image,他們仍然是同一個人。

資產準備好之後,進入 Episode,點 Generate Shots。ArcLoop 會把這一集拆成 shot card。開啟每張卡,輸入 @ 引用角色名——只寫這個鏡頭新增的資訊:機位、角色動作、道具位置、說話人。臉和服裝已經在資產裡,不用重新描述。

對口型方面,每張 shot card 只指定一個主要說話人。如果這個鏡頭需要的是聽者反應而不是臺詞,在描述裡寫清楚,這樣生成的動作就不會多餘地張嘴。

需要批次生成時,開啟 AI Chat Panel,輸入:Generate videos for Shots 1, 2, and 3. 對照站點陣圖稽核結果,再進入下一個模組。某條鏡頭崩了,只改那一張 shot card——調整機位說明或道具位置——單獨重生成。

確認透過的鏡頭進入 Edit 時間線排列,確認每個 15 秒模組至少有一次空間錨點鏡頭,再匯出。

範例 1:多人對話站位圖

Wide shot of the law firm conference room at night. @Lin Zhixia stands front-right, leaning forward with both hands on the table. @Zhou Heng sits back-left, eyes down, gripping the edge of his chair. @Chen stands mid-ground in the doorway, arms crossed. The contract lies on the table closer to Lin Zhixia; the voice recorder sits center-table. Cool white overhead light. Camera holds at a three-quarter angle from the right side — do not cross the axis. No character changes position. Subtitle-safe zone: bottom quarter of frame is clear.

這個規格的重點不是寫得華麗,而是讓每個人、每個道具、每個機位都有固定位置。

範例 2:站位圖轉 30 秒鏡頭表

Break this scene into a 30-second shot list using the established staging: @Lin Zhixia front-right, @Zhou Heng back-left, @Chen mid-ground at the doorway. Contract and voice recorder positions unchanged. Camera stays on the right side of the axis throughout. Two 15-second blocks: Block 1 — Lin Zhixia slides the contract across the table, Zhou Heng looks down without touching it; Block 2 — Chen steps one pace into the room, Lin Zhixia straightens up. For each shot: duration, camera position (A/B/C/D), shot size, speaker, listener reaction, prop positions, lip-sync note, edit point, fallback cut if the shot fails.

鏡頭表要能直接指導生成和剪輯。每個鏡頭一個主要任務,失敗後也能單獨重做。

範例 3:成片站位和對口型審核

Review this finished scene against the staging spec. Characters: @Lin Zhixia, @Zhou Heng, @Chen. Check: (1) Does each character hold their established left-right position across cuts? (2) Does the camera stay on the correct side of the axis? (3) Do the contract and voice recorder stay in place — or drift? (4) Does the speaker's mouth move on their lines and stay closed when listening? (5) Do subtitles clear the mouth area and the contract signature? (6) Does the scene return to a spatial anchor between the two 15-second blocks? Flag each issue as: pass, fixable in editing, or needs a redo, with the smallest fix described.

審核不是挑刺,是省錢。能靠剪輯修的別重做,站位和身分已經崩的別硬救。

常見翻車與修復

第一種翻車是只寫「辦公室多人對話」。修復方式是先畫俯視站位圖,再寫鏡頭表。空間先穩,人物才穩。

第二種翻車是兩個角色長得太像。修復方式是回到角色資產庫,核對臉型、髮型輪廓、服裝剪裁、配色和道具錨點,必要時補人物資產圖,讓兩個人放在同一頁也能分清楚。

第三種翻車是桌椅每個鏡頭都變。修復方式是把家具當成場景資產,不要在每條提示詞裡重新生成。

第四種翻車是關鍵道具跑偏。修復方式是給道具編號和固定位置,鏡頭表每次引用同一位置。合約、錄音筆、手機這類證據道具尤其要管住。

第五種翻車是機位越軸。修復方式是規定機位區域,反打鏡頭也不要跨到讓左右關係反轉的位置。已經越軸的鏡頭,輕微可用反應鏡頭緩衝,嚴重就重做。

第六種翻車是多人同時說話。修復方式是一個鏡頭一個主要說話人,其他人做聽者反應。長台詞拆短,不要讓兩張嘴同時扛關鍵資訊。

第七種翻車是口型錯位。修復方式是縮短台詞,切證據特寫、手部動作或聽者沉默。關鍵句盡量給說話人近景,非關鍵句可以做畫外音。

第八種翻車是把同場誤認為必須同框。同一場戲不需要每秒都三個人在畫面裡。只要站位、視線、道具和聲音連續,單人反應和道具特寫也能維持同場感,還更適合批量出片。

先判斷說話人錯在哪,再替換鏡頭

生成失敗後,先按這張表排查。聲音分錯、聽的人亂動嘴、剪輯時間不對,需要分別處理。

看到或聽到的問題先檢查優先做的小修復
角色沒錯,聲音錯了臺詞歸屬和選用的聲音改聲音分配;畫面表演仍然合適時才保留
別人說話時,聽的人也在動嘴生成畫面裡的表演替換這一條畫面,或有意切到反應鏡頭、道具特寫
說話人正確,但趕詞或漏字臺詞長度和可用時長縮短臺詞,或留出更多時間
先回答,後提問剪輯中的鏡頭順序和音訊位置先修順序,再決定是否需要重新生成
鏡頭之間換了張臉角色參考和選中的資產單獨修身份一致性,不要和對白時間一起改

先靜音看一遍,檢查嘴部動作;再不看畫面聽一遍,檢查臺詞順序和停頓。靜音不會讓亂動的嘴停下來,替換聲音也不會自動對齊口型。提示詞只指定一個說話人,並不保證輸出一定服從。能用的反應鏡頭保留,只重做真正失敗的說話表演。

常見問題

場景站位圖一定要畫成圖片嗎?

不一定。文字俯視圖、表格、簡單 ASCII 方位都可以。重點是人物、家具、道具、機位、視線和字幕安全區要清楚。

兩人對話也需要站位圖嗎?

需要,尤其是有桌椅、道具、反打鏡頭和口型要求時。兩人對話最容易出現左右跳、視線錯位和聽者亂張嘴。

AI 短劇多人同框最多放幾個人穩?

預設兩人最穩,三人需要明確前中後、左中右和說話責任。四人以上建議拆分鏡頭,除非只是遠景氣氛或短暫封面畫面。

對口型一定要完全精準嗎?

關鍵台詞要盡量準,尤其是正臉近景和反轉句。非關鍵句可以用反應鏡頭、手部動作、背影、證據特寫和畫外音降低口型壓力。

已經生成好的多人鏡頭還能補救嗎?

先按站位圖審核。輕微口型錯、短暫道具偏移、字幕擋到一點邊緣,可以透過剪輯、反應鏡頭或特寫補救。人物左右關係反了、桌椅完全重排、角色互換,通常需要重做。

站位圖會不會限制表演?

不會。站位圖鎖的是關係、位置和口型責任,不是鎖死表情。表情、停頓、手部小動作、聽者反應和節奏仍然可以變化。

把多人站位做成可復用模板

先確認站位圖和角色資產,再拆 15 秒節奏和對口型鏡頭。

查看範本

探索更多

MiniMax H3 片段拼接:怎麼做出超過 15 秒的影片

MiniMax H3 片段拼接:怎麼做出超過 15 秒的影片

怎麼做一場打戲

怎麼做一場打戲

怎麼做一集完整短片

怎麼做一集完整短片

AI 短劇成本控制與預算拆解

AI 短劇成本控制與預算拆解