簡介
你生成了告白場景,聲音完美:低沉、猶豫,最後一個字都快要崩了。下一個場景生成出來,她聽起來像個電臺播音員。同一個角色,同一個生成器,換了一天。觀眾聽到的不是「模型有波動」,而是「這是另一個人」,整部劇最核心的東西就斷了——那個讓角色成為角色的東西。
AI角色配音生成器能產出一個聲音。讓它成為角色的聲音,是個工作流問題:聲音要定義一次、繫結到角色上、每次用同樣的方式為每句臺詞做導演。這篇指南講的就是怎麼在ArcLoop裡做到這一點——從在資產上定義聲音,到用狀態和場景為臺詞做導演,到為任務選對模型,再到在Edit時間軸上把聲音和麵孔放在一起審。
聲音住在哪裡
在ArcLoop裡,一個character asset不只存著臉。把角色聲音和Main image、參考圖一起Bind到資產上,每個引用@Mira的shot就會拉取同一個聲音,就像拉取同一張臉一樣。聲音成了身份的一部分,而不是每個clip單獨設定的引數。
這有一個實際影響:在需要用到之前就定義好聲音。一個在第四集才確定聲音的角色,聽起來是後裝上去的,因為前三集都是靠猜。在搭建資產的時候就選好聲音,和做人設三檢視是同一個環節。
如果你想快速從庫裡選一個聲音,AI角色配音生成器工具頁面會帶你選聲音、貼上臺詞、為表演做導演;這篇文章是用在系列作品裡的版本。
讓聲音穩下來的幾條規則
- 每個角色一份聲音檔案,寫下來。 感知年齡、音高、語速、音色、聲音在哪裡會裂開。寫在資產的描述裡;聲音提示詞指南涵蓋了各個欄位。
- 為狀態做導演,不要用形容詞。 「悲傷」是個平均值。「試圖保持安靜,憤怒在最後幾個字裡崩開」才是一場表演。
- 每句臺詞都帶上它的場景。 她在哪裡、在和誰說話、她在隱瞞什麼。模型會表演這個語境。
- 同一個角色在整季裡用同一個模型。 中途換引擎是最快讓聲音變成另一個人的辦法。
- 把聲音和臉放在一起審,不要單獨聽。 單獨聽起來沒問題的臺詞,放在它對應的表情上可能是錯的。
怎麼一步步搭建和使用角色聲音
- 在我的資產裡,在character asset上寫聲音檔案:年齡、音色、語速、質感、情緒範圍、一個標誌性習慣(「撒謊時會把詞尾咬掉」)。
- 把角色聲音Bind到資產上。 從庫裡選或者自己塑造一個;它現在是
@Mira的一部分了。 - 根據任務選引擎。 Seed Audio 1.0適合表演場景,情緒需要在臺詞內部流動;ElevenLabs適合穩定、可複用的表達,支援
[whispers]或[crying]這樣的標籤。配音對比有詳細拆分。每個角色選一次,定下來。 - 在shot card上為每句臺詞寫好狀態和場景:她在和誰說話、她想要什麼、聲音在哪裡會裂開。
- 先生成shot的影片,讓面孔和時間節奏先存在。
- 在Edit裡執行Generate Voiceover。 臺詞會按對應的shot放在時間軸上。
- 帶著畫面審。 把shot和聲音一起看;如果表達和表情打架,改臺詞的導演說明,而不是聲音檔案。
- 跨劇集複用。 資產帶著聲音;新劇集只需要新臺詞。多角色場景可以參考多角色配音一致性指南,裡面講怎麼把不同聲音區分開。
示例1:資產上的聲音檔案
@Mira voice profile: female, reads 26–28, low-medium pitch, slightly dry texture, unhurried pace with short pauses before the words that cost her something. Emotional range: controlled to breaking; never shouts, gets quieter when angry. Signature: clips the ends of words when she is lying, and laughs only on an exhale. Engine: Seed Audio 1.0 for the whole season; do not switch engines for one-off lines.
示例2:對抗場景的臺詞導演說明
Line for @Mira, Shot 9, kitchen, facing @Daniel across the counter, she has already seen the boarding pass. State: calm on the surface, anger under it, trying not to give him the satisfaction. Pace: slower than normal; a full pause before the last word. Line: "How was Osaka." Delivery note: not a question — flat, the period audible, no rise at the end, and no breath before she says it.
示例3:同一個角色,不同場景,同一個聲音
Line for @Mira, Shot 3 of EP4, hospital corridor, alone, on the phone to @Sora. State: exhausted, relieved, close to laughing at herself. Pace: quicker, breath audible, the dry texture stays. Line: "I know. I know. I'm coming home." Delivery note: the third phrase is almost a whisper; keep the pitch where it was in EP1 — same person, worse night.
角色聲音最常見的崩壞方式
- 每個clip單獨選聲音。 每次生成聲音都不一樣。把聲音Bind到資產上。
- 用形容詞做導演。 「情緒化」會產出一個隨機情緒。寫出狀態和場景。
- 中途換引擎。 第五集角色換了一副嗓子。每個角色一個引擎。
- 臺詞是寫給紙面看的。 長句子聲音來不及,只能趕著念。剪到字幕條能裝下的量。
- 沒帶著面孔審。 聽起來沒問題,但配在錯誤的表情上了。在時間軸上審。
常見問題
兩個角色可以共用一個生成的聲音嗎? 不應該。就算導演說明不同,觀眾也會記住音色。給每個反覆出現的角色一份獨立的檔案和庫裡的選擇。
如果我想要聲音支援多種語言呢? 保留檔案和導演說明;用同一個引擎為每種語言生成臺詞,這樣角色在不同語種裡聽起來都是同一個人。
導演說明寫多少算過頭? 如果註釋比臺詞還長,就把註釋剪短。狀態、場景、語速、一個表達細節,夠了。
聲音也適合旁白嗎? 適合,但旁白是另一個角色。給它獨立的檔案,這樣旁白永遠不會聽起來像主角。
下一步
在ArcLoop裡開啟你主角的資產,用一段話寫下聲音檔案:年齡、音高、語速、質感、在哪裡會裂開、一個習慣。Bind聲音,選好引擎,為一句臺詞寫上狀態和場景。生成出來,配著shot播放,調整導演說明,直到聲音和麵孔是同一個人。





