三个人一同框,镜头就崩了
单人近景都还挺像,一到多人对话就翻车。上一镜头林知夏站在桌子右前方,下一镜头她突然跑到左边;周衡明明在沉默,嘴却一直动;陈总站在门口压迫两个人,反打镜头一切,他变成坐在桌边的陌生人。更麻烦的是桌上的合同、录音笔和手机也跟着乱跑,剪辑时根本接不上。
这种问题不是靠一句“保持一致”能救的。AI 短剧多人同框需要先锁空间,再锁角色,再锁说话人。站位、视线、台词、口型、字幕安全区和剪辑保底方案,都要在生成前进入同一条生产路径。否则你只能不停抽卡,碰到一条像的就硬剪,后面越剪越穿帮。
在 ArcLoop 里,做法更直接:用 AI 短剧指南 拆多人镜头结构,用 My Assets 给每个人建角色资产——脸、服装、声线(character voice)分别锁定,镜头描述里用 @角色名 逐个引用;再到 创作空间 打开项目,把这些镜头依次编进 Storyboard 的 shot 卡,站位、视线这类每镜都不同的信息写在镜头描述里,不用重新描述长相。多人对话不是每秒都要多人同框,只要空间和视线连续,单人反应、证据特写和双人关系镜头也能让观众相信他们在同一场戏里。
这篇讲的是可落地的做法:先画场景站位图,再拆 15 秒和 30 秒镜头表,再做对口型与剪辑审核,最后用最小重做动作修翻车镜头。
空间、身份、声音:稳住多人对话的三条线
第一条线是空间。多人对话里,人物位置、家具位置、道具位置、机位方向和视线关系决定观众能不能看懂关系。女主在右前景,说明她正在逼问;男主坐左后景,说明他被压住;反派站门口,说明他堵住退路。位置一跳,戏的压力就散了。
第二条线是身份。多人同框时最容易错脸、借脸、换演员。只写“女主、男主、反派”不够,要用角色编号接My Assets。比如 ZH-001 林知夏,短黑发、米白西装、银耳钉;ZH-002 周衡,深灰衬衫、细框眼镜、左手戒痕;ZH-003 陈总,黑色大衣、方脸、金色袖扣。每个人都要有能在同一画面里区分开的锚点。
第三条线是声音。对口型不是最后贴音频的事,而是在分镜阶段就要决定哪一句由谁说、谁听、谁打断、谁沉默。多人镜头最好一个镜头一个主要说话人,其他人做听者反应。两个角色同时长台词,基本就是给口型找麻烦。
场景站位图不需要画得好看。它更像拍摄现场的俯视图:门在哪,窗在哪,桌子朝向,谁在前景,谁在后景,关键道具放哪,机位 A/B/C/D 分别拍谁,哪条轴线不能跨。只要这张图清楚,后面每个镜头都能引用它,不用每条提示词重新描述办公室。
先画站位图,最直接的好处是防止左右关系乱。两人对话里,如果 A 看向左,B 也看向左,观众会觉得他们不是在互相说话。三人对话更明显:谁压迫谁、谁躲避谁、谁掌握证据,都靠空间关系成立。站位图提前规定机位在桌子哪一侧,反打镜头也不跨线。
它还能防止桌椅和道具跑偏。中文短剧常用合同、房卡、录音笔、手机、药瓶、亲子鉴定做冲突证据。道具一旦从桌面中央跑到角落,或者在下一镜头消失,剧情就断了。站位图把道具作为场景资产保存,镜头表每次引用同一位置。
第三个好处是减少抽卡。没有空间规格时,生成是在人物、家具、道具、机位之间碰运气。你以为自己在优化提示词,其实是在赌这一条刚好不崩。先画站位图看似多一步,实际上是把失败从“随机”变成“可审核”。
第四个好处是支持超时长拼接。15 秒以内的多人冲突可以靠三四个镜头撑住;30 秒以上就要不断回到空间锚点,让观众知道人还在同一间房里。没有站位图,长段拼接很容易像素材合集。
场景站位图怎么画
第一步,确定空间边界。用一句话写清楚场景:夜晚律所会议室,长桌横在画面中段,门在左后侧,落地窗在右后侧,冷白顶灯,桌面有合同和录音笔。空间要简单,别一上来写豪宅、楼梯、阳台、多人走位全都有。
第二步,固定家具。桌子、椅子、门、窗、沙发、屏幕、柜子这些大物件先定死。家具是空间骨架,也是机位切换的参照。不要每个镜头重新生成一套房间。
第三步,固定关键道具。合同在桌面靠女主一侧,录音笔在桌面中央,手机在男主右手边,水杯在反派进门路线外侧。道具位置要服务剧情,不是随手铺满桌子。
第四步,放人物。每个角色用编号和资产库引用,不只写关系词。ZH-001 林知夏站右前景,ZH-002 周衡坐左后景,ZH-003 陈总站门口中景。标清前中后、左中右、朝向和视线。
第五步,放机位。机位 A 拍女主近景,机位 B 拍男主反应,机位 C 拍三人关系,机位 D 拍桌面证据。每个机位都写拍摄方向和不能越过的线。越轴会让左右关系反掉,是多人对话最常见的穿帮之一。
第六步,写说话责任。每个镜头只指定一个主要说话人,其他人是听、低头、握拳、避开视线、拿道具或沉默。口型责任写清楚,比后期硬对音频稳定得多。
第七步,接入镜头表。后续提示词不要反复重写整间会议室,只写“沿用场景站位图 S-01,使用机位 A,ZH-001 说话,ZH-002 听者反应,合同位置不变”。这样更短,也更稳。
15 秒与 30 秒怎么分镜头,出错了怎么最小改动
在 ArcLoop 里,同一个项目下能看到My Assets、Storyboard 的 shot 卡和 Edit 时间线。角色资产管的是脸、服装、声线这些不变的身份,站位、机位这些每镜都不同的东西写在 shot 描述里。这样某条镜头崩了,你改的是机位、口型或道具位置这一个 shot,不是把整段多人对话推倒重来。
15 秒以内,建议三到四个镜头:关系镜头交代站位,说话人近景推进冲突,听者反应承接压力,证据特写或反问做小钩子。不要在一个 15 秒镜头里让三个人轮流说长台词,口型大概率崩。
30 秒左右,可以拆成两个 15 秒模块。第一轮抛证据,第二轮逼问或反转。每个模块至少回到一次空间锚点,比如三人关系镜头、桌面证据、门口压迫位或固定机位。这样拼接时不会像换了房间。
多人同框要克制使用。两人同框相对稳,三人同框需要明确前中后和左中右,四人以上建议只做远景气氛或拆成反应镜头。商业化短剧里,多人同框适合冲突高光、封面候选和反转切片;普通信息交代拆成单人近景更省成本。
对口型不稳时,不要硬撑正脸长台词。可以切听者反应、证据特写、手部动作、背影、门口脚步,或者让关键句只露最后几个字的口型。提前准备保底剪法:双人同框失败就切说话人单人近景,三人站位乱就拆成前景压迫、证据特写、听者反应。
字幕也要提前让位。竖屏短剧的下三分之一经常放字幕,不要把嘴、手机屏幕、合同签名、录音笔红点放在字幕区。站位图和镜头表都要标字幕安全区。
下面是在 ArcLoop 里逐步执行的方法。
打开 IP Project,进入 My Assets,给场景里每个人建一个 Character——林知夏、周衡、陈总各一个。把参考图上传到 Library,再把最清晰的那张 Bind 为该角色的 Main image。如果角色在不同剧集里换造型,把其他造型图 Bind 为同一角色资产的 Reference image,他们仍然是同一个人。
资产准备好之后,进入 Episode,点 Generate Shots。ArcLoop 会把这一集拆成 shot card。打开每张卡,输入 @ 引用角色名——只写这个镜头新增的信息:机位、角色动作、道具位置、说话人。脸和服装已经在资产里,不用重新描述。
对口型方面,每张 shot card 只指定一个主要说话人。如果这个镜头需要的是听者反应而不是台词,在描述里写清楚,这样生成的动作就不会多余地张嘴。
需要批量生成时,打开 AI Chat Panel,输入:Generate videos for Shots 1, 2, and 3. 对照站位图审核结果,再进入下一个模块。某条镜头崩了,只改那一张 shot card——调整机位说明或道具位置——单独重生成。
确认通过的镜头进入 Edit 时间线排列,确认每个 15 秒模块至少有一次空间锚点镜头,再导出。
示例 1:多人对话站位图
Wide shot of the law firm conference room at night. @Lin Zhixia stands front-right, leaning forward with both hands on the table. @Zhou Heng sits back-left, eyes down, gripping the edge of his chair. @Chen stands mid-ground in the doorway, arms crossed. The contract lies on the table closer to Lin Zhixia; the voice recorder sits center-table. Cool white overhead light. Camera holds at a three-quarter angle from the right side — do not cross the axis. No character changes position. Subtitle-safe zone: bottom quarter of frame is clear.
这个规格的重点不是写得华丽,而是让每个人、每个道具、每个机位都有固定位置。
示例 2:站位图转 30 秒镜头表
Break this scene into a 30-second shot list using the established staging: @Lin Zhixia front-right, @Zhou Heng back-left, @Chen mid-ground at the doorway. Contract and voice recorder positions unchanged. Camera stays on the right side of the axis throughout. Two 15-second blocks: Block 1 — Lin Zhixia slides the contract across the table, Zhou Heng looks down without touching it; Block 2 — Chen steps one pace into the room, Lin Zhixia straightens up. For each shot: duration, camera position (A/B/C/D), shot size, speaker, listener reaction, prop positions, lip-sync note, edit point, fallback cut if the shot fails.
镜头表要能直接指导生成和剪辑。每个镜头一个主要任务,失败后也能单独重做。
示例 3:成片站位和对口型审核
Review this finished scene against the staging spec. Characters: @Lin Zhixia, @Zhou Heng, @Chen. Check: (1) Does each character hold their established left-right position across cuts? (2) Does the camera stay on the correct side of the axis? (3) Do the contract and voice recorder stay in place — or drift? (4) Does the speaker's mouth move on their lines and stay closed when listening? (5) Do subtitles clear the mouth area and the contract signature? (6) Does the scene return to a spatial anchor between the two 15-second blocks? Flag each issue as: pass, fixable in editing, or needs a redo, with the smallest fix described.
审核不是挑刺,是省钱。能剪辑修的别重做,站位和身份已经崩的别硬救。
常见翻车与修复
第一种翻车是只写“办公室多人对话”。修复方式是先画俯视站位图,再写镜头表。空间先稳定,人物才稳定。
第二种翻车是两个角色长得太像。修复方式是回到My Assets,核对脸型、发型轮廓、服装剪裁、配色和道具锚点,必要时补人物资产图,让两个人放同一页也能分清。
第三种翻车是桌椅每镜头变化。修复方式是把家具作为场景资产,不在每条提示词里重新生成。
第四种翻车是关键道具跑偏。修复方式是给道具编号和固定位置,镜头表每次引用同一位置。合同、录音笔、手机这类证据道具尤其要管住。
第五种翻车是机位越轴。修复方式是规定机位区域,反打镜头也不要跨到让左右关系反转的位置。已经越轴的镜头,轻微可用反应镜头缓冲,严重就重做。
第六种翻车是多人同时说话。修复方式是一个镜头一个主要说话人,其他人做听者反应。长台词拆短,不要让两张嘴同时承担关键信息。
第七种翻车是口型错位。修复方式是缩短台词,切证据特写、手部动作或听者沉默。关键句尽量给说话人近景,非关键句可以做画外音。
第八种翻车是把同场误认为必须同框。同一场戏不需要每秒都三个人在画面里。只要站位、视线、道具和声音连续,单人反应和道具特写也能维持同场感,还更适合批量出片。
先判断说话人错在哪,再替换镜头
生成失败后,先按这张表排查。声音分错、听的人乱动嘴、剪辑时间不对,需要分别处理。
| 看到或听到的问题 | 先检查 | 优先做的小修复 |
|---|---|---|
| 角色没错,声音错了 | 台词归属和选用的声音 | 改声音分配;画面表演仍然合适时才保留 |
| 别人说话时,听的人也在动嘴 | 生成画面里的表演 | 替换这一条画面,或有意切到反应镜头、道具特写 |
| 说话人正确,但赶词或漏字 | 台词长度和可用时长 | 缩短台词,或留出更多时间 |
| 先回答,后提问 | 剪辑中的镜头顺序和音频位置 | 先修顺序,再决定是否需要重新生成 |
| 镜头之间换了张脸 | 角色参考和选中的资产 | 单独修身份一致性,不要和对白时间一起改 |
先静音看一遍,检查嘴部动作;再不看画面听一遍,检查台词顺序和停顿。静音不会让乱动的嘴停下来,替换声音也不会自动对齐口型。提示词只指定一个说话人,并不保证输出一定服从。能用的反应镜头保留,只重做真正失败的说话表演。
常见问题
场景站位图必须画成图片吗?
不必须。文字俯视图、表格、简单 ASCII 方位都可以。关键是人物、家具、道具、机位、视线和字幕安全区清楚。
两人对话也需要站位图吗?
需要,尤其是有桌椅、道具、反打镜头和口型要求时。两人对话最容易出现左右跳、视线错位和听者乱张嘴。
AI 短剧多人同框最多放几个人稳?
默认两人最稳,三人需要明确前中后、左中右和说话责任。四人以上建议拆分镜头,除非只是远景气氛或短暂封面画面。
对口型必须完全精准吗?
关键台词要尽量准,尤其是正脸近景和反转句。非关键句可以用反应镜头、手部动作、背影、证据特写和画外音降低口型压力。
已经生成好的多人镜头还能补救吗?
先按站位图审核。轻微口型错、短暂道具偏移、字幕挡一点边缘,可以通过剪辑、反应镜头或特写补救。人物左右关系反了、桌椅完全重排、角色互换,通常需要重做。
站位图会不会限制表演?
不会。站位图锁的是关系、位置和口型责任,不是锁死表情。表情、停顿、手部小动作、听者反应和节奏仍然可以变化。





