一次生成完整的声音场景
对白、环境音、配乐和音效在同一次生成里写出来,彼此已经配平。音乐会自己压到人声下面。拿回来的是一条成品轨,不是四条等着调电平的分轨。
一次点击,生成最长两分钟的对白、环境音、音效与整场场景音频。角色的表演、时间点和氛围,都用同一段提示词来指挥。
点击播放试听
对白、环境音、配乐和音效在同一次生成里写出来,彼此已经配平。音乐会自己压到人声下面。拿回来的是一条成品轨,不是四条等着调电平的分轨。
按叙事顺序写,音频就按那个顺序出来,精度到 100 毫秒。写在第三句的台词就出现在第三句,两句台词之间开的那扇门就开在中间。正是这个顺序性,让音频可以反过来带着画面走,而不是追着画面配。
足够装下一整场戏或一段完整旁白,从第一个字到最后一个字都是同一个声音。戏更长时,可以从上次停下的地方接着往下生成。
中文、英语、日语、韩语、西班牙语、德语、法语、泰语、越南语等,一部系列可以在多个语种上线,不用重新找配音。
选择一个角色声音,或上传一段你有权使用的参考音频,让它贴合这场戏。
输入对白,并描述你想听到的情绪、节奏、时间点、环境音和音效。
生成这场戏,试听结果,再调整提示词,直到声音和气氛贴合你想要的那一刻。
Seed Audio 读提示词的方式,很像场记读剧本页:谁在说、听起来怎样、台词之间发生了什么。每个角色第一次出场时定下来,然后按这场戏播放的顺序往下写。
安保机器人(AI 机器人,单调低沉的嗓音,语速缓慢):“会话已过期。” 菲伊(少女,清亮的嗓音,语速急促)说:“不,求你了——这很紧急,我必须把这条消息送到。” 安保机器人说:“无法验证身份。你将被押送至羁押区。” 一扇厚重的金属门打开,一个男人朝菲伊走过来。 杰特(中年男性,低沉暗哑的嗓音,语速平稳)说:“菲伊,抱歉给你添了麻烦。跟我来。”
把年纪、音色质感和语速写进括号里。之后写「角色名说:」就够了,声音会延续下去。
把台词之间发生的事按顺序写出来。模型不会从「与此同时」推断出重叠,所以如果某个音效应该落在一句话中间,就把这句话拆成两半,音效放中间。
写「配乐:」再描述它,并说明要持续多久。只写一句气氛描述,往往会得到一段两秒的音效,而不是一段配乐。
光靠文字描述就能定下一个声音。当某个角色需要在整部系列里听起来是同一个人时,上传最多 3 段、每段 30 秒的参考音频,之后他每次开口都复用这一条。
Seed Audio 1.0 是字节跳动 Seed 团队的 AI 音频生成模型。它能基于文本和音频参考,生成对白、角色声音、环境音、音效等场景音频,很适合短剧、动画和叙事类内容。
传统的文本转语音主要是把文字变成人声。Seed Audio 1.0 能基于同一段场景上下文,生成包含多个角色、情绪、节奏、环境音和音效的完整声音场景。
Seed Audio 1.0 单次最长可生成两分钟音频。这让它足以承载较长的对白场景、旁白、动画段落和短剧单集,不必把每一句都拆成单独的片段。
T2A 是把文字提示词变成新的音频,包括人声、对白、环境音和音效。A2A 则是用已有音频作为参考,基于它的音色或声学特征生成新的音频。
Seed Audio 1.0 支持 20 多种语言,包括英语、中文、日语、韩语、法语、德语、西班牙语和泰语。这让它适合多语言角色、本地化动画和面向国际的剧集制作。
AI 音频生成并非完全确定性的,同一段提示词可能产出不同的表演、节奏、音色或声音细节。想要更稳定的结果,就把角色、情绪、时间点、环境和声音提示写得尽可能清楚。
当对白、角色表演、环境音和音效需要配合成一个整体时,Seed Audio 1.0 更合适。如果你的首要需求是专门的人声生成、旁白或音色克隆,ElevenLabs 往往是更强的选择。判断标准是:你要做的是一整场戏,还是主要在生成语音。