Seedance 2.5 リリース|期間限定で最大 +100% クレジット
はじめる

ショートドラマとアニメ向けSeed Audio 1.0 AIオーディオ生成モデル

ワンクリックで最長2分の会話、環境音、効果音、シーン音声を生成。キャラクターの芝居、タイミング、空気感を一つのプロンプトで演出できます。

声を選ぶ

再生して試聴できます

人生応援おじさんボイス音声テンプレート Prompt to audio
英語女性ミッドナイトラジオ寄り添い音声テンプレート Prompt to audio
おかえり癒やしボイス音声テンプレート Prompt to audio
韓国語の元恋人復縁電話音声テンプレート Prompt to audio
雨夜の女性おやすみASMR音声テンプレート Prompt to audio
夜行電車の少女癒やし音声テンプレート Prompt to audio
温泉旅館の女将おやすみ音声テンプレート Prompt to audio
壊れた元いじめっ子の懺悔 Prompt to audio
モデル Seed Audio 1.0

セリフを入力

Seed Audio 1.0がシーン音声に向いている理由

ワンパスで完全なオーディオシーンを生成

ワンパスで完全なオーディオシーンを生成

会話、環境音、劇伴、効果音が同じ生成の中で書かれ、すでに互いのバランスが取れています。音楽はセリフの下へ自分で引きます。返ってくるのは仕上がったトラックであって、レベル調整待ちの4本のステムではありません。

ワンクリックで完全なオーディオシーンを生成

ワンクリックで完全なオーディオシーンを生成

物語の順に書けば、その順に音が出ます。精度は100ミリ秒。3番目に書いたセリフは3番目に届き、2つのセリフの間で開くドアはその間で開きます。この順序性があるから、音声が映像を追いかけるのではなく、映像を引っぱれます。

最長2分まで生成

最長2分まで生成

シーン一つ、あるいはナレーション一本が収まる長さで、最初の一語から最後まで同じ声のままです。シーンがもっと長いときは、止めたところから続けて生成できます。

20以上の言語でキャラクター音声を制作

20以上の言語でキャラクター音声を制作

中国語、英語、日本語、韓国語、スペイン語、ドイツ語、フランス語、タイ語、ベトナム語など。シリーズを複数言語で出すのに、キャストし直す必要がありません。

Seed Audio 1.0のプロンプトの書き方

Seed Audioは、スクリプターが台本のページを読むようにプロンプトを読みます。誰が話し、どんな声で、セリフの間に何が起きるか。キャラクターは最初に一度だけ決めて、あとはシーンが流れる順に書いていきます。

プロンプト例
警備ロボット(AIロボット、抑揚のない低い声、ゆっくりした話速):「セッションの有効期限が切れました。」

フェイ(少女、澄んだ明るい声、切迫した話速)が言う:「待って、お願い——急ぎなの、このメッセージを届けないといけないの。」

警備ロボットが言う:「身元を確認できません。拘留区へ移送します。」

重い金属の扉が開き、男がフェイのほうへ歩いてくる。

ジェット(年配の男性、暗く低い声、一定の話速)が言う:「フェイ、手間をかけてすまない。こっちだ。」
  1. キャラクターは最初に話すときに決める。

    年齢、声質、話速を括弧に入れます。それ以降は「名前が言う:」だけで十分で、声はそのまま引き継がれます。

  2. 音と動きは独立した行に。

    セリフの間に起きることを、起きる順に書きます。モデルは「その間に」から重なりを推測しないので、効果音がセリフの途中に入るなら、そのセリフを二つに割って間に置きます。

  3. 音楽は劇伴として明示する。

    「劇伴:」と書いて内容を説明し、どれくらい続くかも書きます。雰囲気を一行書いただけだと、劇伴ではなく2秒の効果音として返ってくることがよくあります。

  4. 声を固定したいときは参考音声を足す。

    文章の説明だけでも声は決まります。エピソードをまたいで同じ声である必要があるキャラクターには、30秒までのクリップを最大3本アップロードし、そのテイクを毎回使い回してください。

専門家の知見を読む

ボイスデザイン、プロンプトの書き方、ArcLoopでの音声制作の実践ガイド。

続きを読む

Seed Audio 1.0に関するよくある質問

1. Seed Audio 1.0とは何ですか?

Seed Audio 1.0はByteDance SeedのAIオーディオ生成モデルです。テキストと参考音声から、会話、キャラクターボイス、環境音、効果音などのシーン音声を生成でき、ショートドラマ、アニメ、ナラティブ作品に向いています。

2. Seed Audio 1.0はテキスト読み上げと何が違いますか?

従来のテキスト読み上げは、主に文章を音声に変換します。Seed Audio 1.0は同じシーンの文脈から、複数のキャラクター、感情、間合い、環境音、効果音を含む完全なオーディオシーンを生成できます。

3. Seed Audio 1.0はどれくらいの長さを生成できますか?

Seed Audio 1.0は最長2分の音声を生成できます。長めの会話シーン、ナレーション、アニメのシーケンス、ショートドラマの一話分を、一行ずつ別のクリップに分けずに扱えます。

4. T2AとA2Aの違いは何ですか?

T2Aはテキストプロンプトから、声、会話、環境音、効果音を含む新しい音声を生成します。A2Aは既存の音声を参考として使い、その声質や音響的な特徴をもとに新しい音声を生成します。

5. Seed Audio 1.0はどの言語に対応していますか?

Seed Audio 1.0は英語、中国語、日本語、韓国語、フランス語、ドイツ語、スペイン語、タイ語を含む20以上の言語に対応しています。多言語キャラクター、ローカライズしたアニメ、国際向けのドラマ制作に活用できます。

6. 同じプロンプトなのに2回の生成で音が違うのはなぜですか?

AIによる音声生成は完全に決定的ではないため、同じプロンプトでも芝居、間合い、声、音のディテールが変わることがあります。結果を安定させたい場合は、キャラクター、感情、タイミング、環境、音のきっかけをできるだけ具体的に書いてください。

7. Seed Audio 1.0とElevenLabs、自分のプロジェクトにはどちらが向いていますか?

会話、キャラクターの芝居、環境音、効果音が一体で機能する必要があるシーン単位の音声には、Seed Audio 1.0が向いています。音声生成そのもの、ナレーション、ボイスクローンが主目的なら、ElevenLabsのほうが強い選択になることが多いです。シーン全体を作るのか、主に発話を生成するのかで選んでください。