ワンパスで完全なオーディオシーンを生成
会話、環境音、劇伴、効果音が同じ生成の中で書かれ、すでに互いのバランスが取れています。音楽はセリフの下へ自分で引きます。返ってくるのは仕上がったトラックであって、レベル調整待ちの4本のステムではありません。
ワンクリックで最長2分の会話、環境音、効果音、シーン音声を生成。キャラクターの芝居、タイミング、空気感を一つのプロンプトで演出できます。
再生して試聴できます
会話、環境音、劇伴、効果音が同じ生成の中で書かれ、すでに互いのバランスが取れています。音楽はセリフの下へ自分で引きます。返ってくるのは仕上がったトラックであって、レベル調整待ちの4本のステムではありません。
物語の順に書けば、その順に音が出ます。精度は100ミリ秒。3番目に書いたセリフは3番目に届き、2つのセリフの間で開くドアはその間で開きます。この順序性があるから、音声が映像を追いかけるのではなく、映像を引っぱれます。
シーン一つ、あるいはナレーション一本が収まる長さで、最初の一語から最後まで同じ声のままです。シーンがもっと長いときは、止めたところから続けて生成できます。
中国語、英語、日本語、韓国語、スペイン語、ドイツ語、フランス語、タイ語、ベトナム語など。シリーズを複数言語で出すのに、キャストし直す必要がありません。
キャラクターボイスを選ぶか、シーンに合う、権利のある参考音声を追加します。
会話を入力し、聴かせたい感情、間合い、タイミング、環境音、効果音を書きます。
シーンを生成して結果を試聴し、声と音が狙った瞬間に合うまでプロンプトを調整します。
Seed Audioは、スクリプターが台本のページを読むようにプロンプトを読みます。誰が話し、どんな声で、セリフの間に何が起きるか。キャラクターは最初に一度だけ決めて、あとはシーンが流れる順に書いていきます。
警備ロボット(AIロボット、抑揚のない低い声、ゆっくりした話速):「セッションの有効期限が切れました。」 フェイ(少女、澄んだ明るい声、切迫した話速)が言う:「待って、お願い——急ぎなの、このメッセージを届けないといけないの。」 警備ロボットが言う:「身元を確認できません。拘留区へ移送します。」 重い金属の扉が開き、男がフェイのほうへ歩いてくる。 ジェット(年配の男性、暗く低い声、一定の話速)が言う:「フェイ、手間をかけてすまない。こっちだ。」
年齢、声質、話速を括弧に入れます。それ以降は「名前が言う:」だけで十分で、声はそのまま引き継がれます。
セリフの間に起きることを、起きる順に書きます。モデルは「その間に」から重なりを推測しないので、効果音がセリフの途中に入るなら、そのセリフを二つに割って間に置きます。
「劇伴:」と書いて内容を説明し、どれくらい続くかも書きます。雰囲気を一行書いただけだと、劇伴ではなく2秒の効果音として返ってくることがよくあります。
文章の説明だけでも声は決まります。エピソードをまたいで同じ声である必要があるキャラクターには、30秒までのクリップを最大3本アップロードし、そのテイクを毎回使い回してください。
Seed Audio 1.0はByteDance SeedのAIオーディオ生成モデルです。テキストと参考音声から、会話、キャラクターボイス、環境音、効果音などのシーン音声を生成でき、ショートドラマ、アニメ、ナラティブ作品に向いています。
従来のテキスト読み上げは、主に文章を音声に変換します。Seed Audio 1.0は同じシーンの文脈から、複数のキャラクター、感情、間合い、環境音、効果音を含む完全なオーディオシーンを生成できます。
Seed Audio 1.0は最長2分の音声を生成できます。長めの会話シーン、ナレーション、アニメのシーケンス、ショートドラマの一話分を、一行ずつ別のクリップに分けずに扱えます。
T2Aはテキストプロンプトから、声、会話、環境音、効果音を含む新しい音声を生成します。A2Aは既存の音声を参考として使い、その声質や音響的な特徴をもとに新しい音声を生成します。
Seed Audio 1.0は英語、中国語、日本語、韓国語、フランス語、ドイツ語、スペイン語、タイ語を含む20以上の言語に対応しています。多言語キャラクター、ローカライズしたアニメ、国際向けのドラマ制作に活用できます。
AIによる音声生成は完全に決定的ではないため、同じプロンプトでも芝居、間合い、声、音のディテールが変わることがあります。結果を安定させたい場合は、キャラクター、感情、タイミング、環境、音のきっかけをできるだけ具体的に書いてください。
会話、キャラクターの芝居、環境音、効果音が一体で機能する必要があるシーン単位の音声には、Seed Audio 1.0が向いています。音声生成そのもの、ナレーション、ボイスクローンが主目的なら、ElevenLabsのほうが強い選択になることが多いです。シーン全体を作るのか、主に発話を生成するのかで選んでください。