一次生成完整的聲音場景
對白、環境音、配樂和音效在同一次生成裡寫出來,彼此已經配平。音樂會自己壓到人聲下面。拿回來的是一條成品軌,不是四條等著調電平的分軌。
一次點擊,生成最長兩分鐘的對白、環境音、音效與整場場景音訊。角色的表演、時間點和氛圍,都用同一段提示詞來指揮。
點擊播放試聽
對白、環境音、配樂和音效在同一次生成裡寫出來,彼此已經配平。音樂會自己壓到人聲下面。拿回來的是一條成品軌,不是四條等著調電平的分軌。
按敘事順序寫,音訊就按那個順序出來,精度到 100 毫秒。寫在第三句的台詞就出現在第三句,兩句台詞之間開的那扇門就開在中間。正是這個順序性,讓音訊可以反過來帶著畫面走,而不是追著畫面配。
足夠裝下一整場戲或一段完整旁白,從第一個字到最後一個字都是同一個聲音。戲更長時,可以從上次停下的地方接著往下生成。
中文、英語、日語、韓語、西班牙語、德語、法語、泰語、越南語等,一部系列可以在多個語種上線,不用重新找配音。
選擇一個角色聲音,或上傳一段你有權使用的參考音訊,讓它貼合這場戲。
輸入對白,並描述你想聽到的情緒、節奏、時間點、環境音和音效。
生成這場戲,試聽結果,再調整提示詞,直到聲音和氣氛貼合你想要的那一刻。
Seed Audio 讀提示詞的方式,很像場記讀劇本頁:誰在說、聽起來怎樣、台詞之間發生了什麼。每個角色第一次出場時定下來,然後按這場戲播放的順序往下寫。
安保機器人(AI 機器人,單調低沉的嗓音,語速緩慢):「工作階段已過期。」 菲伊(少女,清亮的嗓音,語速急促)說:「不,求求你——這很緊急,我必須把這條訊息送到。」 安保機器人說:「無法驗證身分。你將被押送至羈押區。」 一扇厚重的金屬門打開,一個男人朝菲伊走過來。 傑特(中年男性,低沉暗啞的嗓音,語速平穩)說:「菲伊,抱歉給你添了麻煩。跟我來。」
把年紀、音色質感和語速寫進括號裡。之後寫「角色名說:」就夠了,聲音會延續下去。
把台詞之間發生的事按順序寫出來。模型不會從「與此同時」推斷出重疊,所以如果某個音效應該落在一句話中間,就把這句話拆成兩半,音效放中間。
寫「配樂:」再描述它,並說明要持續多久。只寫一句氣氛描述,往往會得到一段兩秒的音效,而不是一段配樂。
光靠文字描述就能定下一個聲音。當某個角色需要在整部系列裡聽起來是同一個人時,上傳最多 3 段、每段 30 秒的參考音訊,之後他每次開口都複用這一條。
Seed Audio 1.0 是字節跳動 Seed 團隊的 AI 音訊生成模型。它能基於文字和音訊參考,生成對白、角色聲音、環境音、音效等場景音訊,很適合短劇、動畫和敘事類內容。
傳統的文字轉語音主要是把文字變成人聲。Seed Audio 1.0 能基於同一段場景脈絡,生成包含多個角色、情緒、節奏、環境音和音效的完整聲音場景。
Seed Audio 1.0 單次最長可生成兩分鐘音訊。這讓它足以承載較長的對白場景、旁白、動畫段落和短劇單集,不必把每一句都拆成單獨的片段。
T2A 是把文字提示詞變成新的音訊,包括人聲、對白、環境音和音效。A2A 則是用既有音訊作為參考,基於它的音色或聲學特徵生成新的音訊。
Seed Audio 1.0 支援 20 多種語言,包括英語、中文、日語、韓語、法語、德語、西班牙語和泰語。這讓它適合多語言角色、在地化動畫和面向國際的劇集製作。
AI 音訊生成並非完全確定性的,同一段提示詞可能產出不同的表演、節奏、音色或聲音細節。想要更穩定的結果,就把角色、情緒、時間點、環境和聲音提示寫得盡可能清楚。
當對白、角色表演、環境音和音效需要配合成一個整體時,Seed Audio 1.0 更合適。如果你的首要需求是專門的人聲生成、旁白或音色複製,ElevenLabs 往往是更強的選擇。判斷標準是:你要做的是一整場戲,還是主要在生成語音。