Seedance 2.5 已上线|限时最高可获 +100% 积分
开始使用

适用于短剧和动画的 Seed Audio 1.0 AI 音频生成模型

一次点击,生成最长两分钟的对白、环境音、音效与整场场景音频。角色的表演、时间点和氛围,都用同一段提示词来指挥。

挑一个声音

点击播放试听

日语中年男性人生鼓励音频模板 Prompt to audio
英文女性午夜电台陪伴音频模板 Prompt to audio
日语欢迎回家安慰音频模板 Prompt to audio
韩语旧爱复合电话音频模板 Prompt to audio
雨夜女性晚安 ASMR 音频模板 Prompt to audio
日语夜行电车少女安慰音频模板 Prompt to audio
日语温泉旅馆老板娘晚安音频模板 Prompt to audio
霸凌者忏悔AI语音提示词 Prompt to audio
模型 Seed Audio 1.0

写下台词

为什么 Seed Audio 1.0 适合做场景音频

一次生成完整的声音场景

一次生成完整的声音场景

对白、环境音、配乐和音效在同一次生成里写出来,彼此已经配平。音乐会自己压到人声下面。拿回来的是一条成品轨,不是四条等着调电平的分轨。

一次点击生成完整的声音场景

一次点击生成完整的声音场景

按叙事顺序写,音频就按那个顺序出来,精度到 100 毫秒。写在第三句的台词就出现在第三句,两句台词之间开的那扇门就开在中间。正是这个顺序性,让音频可以反过来带着画面走,而不是追着画面配。

单次最长生成 2 分钟

单次最长生成 2 分钟

足够装下一整场戏或一段完整旁白,从第一个字到最后一个字都是同一个声音。戏更长时,可以从上次停下的地方接着往下生成。

用 20+ 种语言创作角色音频

用 20+ 种语言创作角色音频

中文、英语、日语、韩语、西班牙语、德语、法语、泰语、越南语等,一部系列可以在多个语种上线,不用重新找配音。

怎么写 Seed Audio 1.0 的提示词

Seed Audio 读提示词的方式,很像场记读剧本页:谁在说、听起来怎样、台词之间发生了什么。每个角色第一次出场时定下来,然后按这场戏播放的顺序往下写。

示例提示词
安保机器人(AI 机器人,单调低沉的嗓音,语速缓慢):“会话已过期。”

菲伊(少女,清亮的嗓音,语速急促)说:“不,求你了——这很紧急,我必须把这条消息送到。”

安保机器人说:“无法验证身份。你将被押送至羁押区。”

一扇厚重的金属门打开,一个男人朝菲伊走过来。

杰特(中年男性,低沉暗哑的嗓音,语速平稳)说:“菲伊,抱歉给你添了麻烦。跟我来。”
  1. 角色第一次开口时定下来。

    把年纪、音色质感和语速写进括号里。之后写「角色名说:」就够了,声音会延续下去。

  2. 声音和动作单独成行。

    把台词之间发生的事按顺序写出来。模型不会从「与此同时」推断出重叠,所以如果某个音效应该落在一句话中间,就把这句话拆成两半,音效放中间。

  3. 音乐要明确标成配乐。

    写「配乐:」再描述它,并说明要持续多久。只写一句气氛描述,往往会得到一段两秒的音效,而不是一段配乐。

  4. 声音必须固定时,加参考音频。

    光靠文字描述就能定下一个声音。当某个角色需要在整部系列里听起来是同一个人时,上传最多 3 段、每段 30 秒的参考音频,之后他每次开口都复用这一条。

来自专家的实践洞察

了解声音设计、提示词写法和 ArcLoop 音频制作的实用指南。

阅读更多

关于 Seed Audio 1.0 的常见问题

1. Seed Audio 1.0 是什么?

Seed Audio 1.0 是字节跳动 Seed 团队的 AI 音频生成模型。它能基于文本和音频参考,生成对白、角色声音、环境音、音效等场景音频,很适合短剧、动画和叙事类内容。

2. Seed Audio 1.0 和文本转语音有什么不同?

传统的文本转语音主要是把文字变成人声。Seed Audio 1.0 能基于同一段场景上下文,生成包含多个角色、情绪、节奏、环境音和音效的完整声音场景。

3. Seed Audio 1.0 单次能生成多长?

Seed Audio 1.0 单次最长可生成两分钟音频。这让它足以承载较长的对白场景、旁白、动画段落和短剧单集,不必把每一句都拆成单独的片段。

4. T2A 和 A2A 有什么区别?

T2A 是把文字提示词变成新的音频,包括人声、对白、环境音和音效。A2A 则是用已有音频作为参考,基于它的音色或声学特征生成新的音频。

5. Seed Audio 1.0 支持哪些语言?

Seed Audio 1.0 支持 20 多种语言,包括英语、中文、日语、韩语、法语、德语、西班牙语和泰语。这让它适合多语言角色、本地化动画和面向国际的剧集制作。

6. 同一段提示词,两次生成为什么听起来不一样?

AI 音频生成并非完全确定性的,同一段提示词可能产出不同的表演、节奏、音色或声音细节。想要更稳定的结果,就把角色、情绪、时间点、环境和声音提示写得尽可能清楚。

7. Seed Audio 1.0 和 ElevenLabs,我的项目该选哪个?

当对白、角色表演、环境音和音效需要配合成一个整体时,Seed Audio 1.0 更合适。如果你的首要需求是专门的人声生成、旁白或音色克隆,ElevenLabs 往往是更强的选择。判断标准是:你要做的是一整场戏,还是主要在生成语音。