介紹
你搜「seed audio」,是因為聽到的某個片段聽起來像真人在演戲——聲音卡在某個字上,突然沉下去,然後帶著怒氣回來——而你試過的每個配音工具都只會把同一句臺詞念得清晰、平穩、略帶倦意。你想知道 Seed Audio 1.0 是什麼、它是不是那段聲音聽起來有生命感的原因,以及你要寫什麼才能得到同樣的效果。
Seed Audio 1.0 是一個以表演為核心構建的聲音生成模型:它把情緒狀態、場景和節奏當作真正的指令,而不是可有可無的修飾。這篇指南解釋這意味著什麼、一條 Seed Audio prompt 必須包含什麼、什麼時候穩定音色模型 ElevenLabs 才是更好的選擇,以及如何在 ArcLoop 裡使用 Seed Audio 1.0,讓這段表演屬於一個角色,而不只是一個孤立的片段。
Seed Audio 1.0 是什麼
Seed Audio 1.0 是 ArcLoop 裡可用於角色配音的聲音模型之一,與 ElevenLabs 和 Doubao 並列。大多數聲音模型的目標是用選定的音色把臺詞說清楚,而 Seed Audio 1.0 的目標是演出臺詞:它讀取說話者是誰、感受是什麼、身處何處、情緒在句子裡如何變化,然後用音高、節奏、氣息和停頓來匹配這些資訊。
實際效果是:
- 情緒在一句話裡移動——開頭平靜,在最後一個字崩掉——而不是把一種情緒均勻地鋪滿整句。
- 場景感知的表達方式——走廊裡的低語、在噪音中提高的嗓門、哽咽著說出的臺詞。
- 聲音質感和口音作為角色的一部分,而不是事後加上的濾鏡。
- 整段能撐住壓力,適合獨白和對峙場景。
它不是什麼:固定的音色庫。如果你需要的是同一個辨識度高的聲音在幾百條臺詞裡以最小差異重複出現,那是另一種需求,下面會講到。
Seed Audio 1.0 vs ElevenLabs:哪個適合這個任務
區別在於任務型別,不是品質高低。配音對比詳解按場景逐一分析,簡短版本如下:
- Seed Audio 1.0:場景需要被演出來的時候——對峙、哭泣、壓著慌亂、一段說到一半就變調的告白。prompt 描述表演,模型交付表演。
- ElevenLabs:音色需要穩定、可以在大量臺詞和多語言裡反覆使用,並且你習慣用
[whispers]、[angry]這類標籤在臺詞級別排程的時候。
在系列作裡,很多製作兩者都用:主角的重場戲用 Seed Audio 1.0,配角和大量日常對話用 ElevenLabs。按角色選,不要按片段選,這樣同一個角色就不會在不同集數里換嗓子。
Seed Audio 1.0 的 prompt 規則
- 在臺詞前面先寫狀態。 是誰、他們的感受、他們在掩蓋什麼,然後才是臺詞本身。
- 描述運動,不要只貼標籤。 「努力保持冷靜,憤怒在最後幾個字爆出來」比「憤怒」好用得多。
- 用一個短句交代場景。 走廊、電話裡、隔著櫃檯——場景會改變聲音的質感。
- 說出節奏。 比平時慢、最後一個字前停頓、急促然後驟停。
- 臺詞要短。 字幕長度的臺詞給表演留空間;一大段文字只會被讀出來。
- 音色檔案固定在資產上。 每條臺詞的排程可以變,聲音本身不變。
在 ArcLoop 裡使用 Seed Audio 1.0 的完整流程
- 在我的資產裡給角色寫聲音檔案:年齡、音高、節奏、質感、情緒幅度、一個習慣性細節。這是不變的基準;聲音生成器指南講怎麼建。
- 把角色聲音繫結到資產上,把這一季的引擎選為 Seed Audio 1.0。
- 在每個 shot card 上寫臺詞及其狀態和場景——表演排程跟著 shot 走,不放在另一份文件裡。
- 先生成這個 shot 的影片,讓時機和表情先存在,再用聲音去配合。
- 在 Edit 裡執行 Generate Voiceover。 臺詞會落在時間線上各自對應的 shot 處。
- 對著畫面聽。 如果表演和表情打架,就調整這條臺詞的排程——狀態、節奏、在哪裡斷——然後只重新生成這一條。
- 最後加 BGM,放在表演下面,這樣混音不會蓋掉你調出來的那些停頓和氣口。
示例 1:一條對峙臺詞
Voice: @Mira (profile on asset, Seed Audio 1.0). Scene: kitchen, across the counter from @Daniel, she has already seen the boarding pass. State: controlled on the surface, anger underneath, refusing to give him a reaction. Pace: slower than her normal; a full pause before the last word. Line: "How was Osaka." Note: flat, the period audible, no rise at the end.
示例 2:說到一半就變調的臺詞
Voice: @Kaito (profile on asset, Seed Audio 1.0). Scene: shrine steps at dawn, alone, reading the letter aloud to himself. State: starts steady, almost amused; the second sentence lands and the voice thins out. Pace: even, then a catch before "stay." Line: "You said you'd wait at the gate. You didn't say you'd stay." Note: the last word barely voiced.
示例 3:走廊裡的低語臺詞
Voice: @Liora (profile on asset, Seed Audio 1.0). Scene: hotel corridor at night, on the phone to @Rowan, staff could hear her. State: frightened, keeping it down, trying to sound like she is in control. Pace: quick, breath audible between phrases. Line: "It's my brother's initials. On a staff card. Don't come up." Note: whisper throughout; the last three words firmer.
Seed Audio prompt 最常見的失敗方式
- 只有臺詞。 沒有狀態、沒有場景,模型就只能給出一個平均值。加上是誰、在什麼狀態。
- 貼標籤而不是描述運動。 「悲傷」給出的是均勻的悲傷。說清楚它在哪裡發生變化。
- 把一大段當臺詞。 長文字會被讀出來,不會被演。剪到一句話。
- 每個片段重新選音色。 每次都是不同的人。把它繫結到資產上。
- 不對著畫面聽。 最好的那條也可能跟 shot 不匹配。在時間線上聽。
常見問題
Seed Audio 1.0 在 ArcLoop 裡可以用嗎? 可以。它是角色聲音引擎之一;在角色資產上繫結它,然後在 Edit 裡執行 Generate Voiceover。
它會克隆真人聲音嗎? 這裡講的不是這個用法,它對系列作的價值也不在這裡。在資產上建一個原創的聲音檔案,然後去排程它。
支援哪些語言? 排程內容用英文寫,臺詞用故事本身的語言;各語言版本保持同一個檔案,這樣角色在哪裡聽起來都是同一個人。
什麼時候該換成 ElevenLabs? 當一個角色有幾百條日常臺詞、需要每條聽起來都一模一樣,或者你需要在臺詞級別用音訊標籤精細控制而不是排程整場表演的時候。
下一步
挑一個聲音要做最多事情的場景——告白、指控、哽咽著說出的臺詞。在 shot card 上的臺詞前面寫上狀態、場景和節奏,在 ArcLoop 的角色上繫結 Seed Audio 1.0,然後在時間線上生成配音。先對著畫面完整聽一遍,再動任何東西。





