音频生成
Seed Audio 1.0
由 ByteDance 提供
字节跳动的一体化 TTS 模型。
一次生成人声、音乐和音效。

核心功能
聆听声音的广度
纪录片旁白语音
温暖、沉稳的纪录片旁白。
0:00
0:12
惊悚片旁白语音
压低、紧张的台词朗读,贴近而私密。
0:00
0:12
香料市场环境音音效
层次丰富的露天市场声音垫底。
0:00
0:12
雷暴音效
翻滚的风暴逐渐酝酿出远处的一声惊雷。
0:00
0:12
管弦乐段音乐
一段为弦乐和铜管而作的短促上扬乐句。
0:00
0:12
Lo-fi 节拍音乐
轻松的节拍,配上柔和琴键和黑胶噪点。
0:00
0:12
技术规格
ByteDance
由字节跳动 Seed 研究团队开发。
20
英语、中文、日语、韩语、西班牙语、法语、德语等。
最长 2 分钟
每次生成最多两分钟音频。
3000 字符
足够写下含台词的完整场景说明。
最多 3 段
最多三段参考音频,每段不超过 30 秒。
非流式
输出完整音轨,而非实时音频流。
应用场景
有声书
整本书的音频都不用进棚。字节跳动称成本约为录音棚的十分之一。
视频配音
描述声音或上传角色图片,再用时间码把每句台词放到画面需要的位置。
游戏音频
角色台词、有表演的场景和环境音效,直接从剧本生成沉浸的瞬间。
一次生成视频音频
旁白、声音设计和音乐一次生成,之后不再需要单独的混音步骤。
广告与宣传片
一句台词、音效和音乐合成一条即用音轨,为短内容而做。
对白与广播剧
多个角色各有声音和表演,在同一场戏里配上相称的环境音与节奏。
提示词示例
简单定价
今天就免费开始,随时可以升级或取消。
Basic
$9/ 月
账单金额为 $0 每年900 每月 信用
1 个用户
所有模型
工作流
Standard
$24/ 月
账单金额为 $0 每年3200 每月 信用
1 个用户
所有模型
工作流
Pro
$45/ 月
账单金额为 $0 每年6200 共享 每月 信用
1 用户
+ 最多 4 人额外付费可增加
所有模型
工作流
Pro Max
$170/ 月
账单金额为 $0 每年24000 共享 每月 信用
1 用户
+ 最多 9 人额外付费可增加
所有模型
工作流
Enterprise
更高的限制
自定义
定价和账单条款
大容量信用
自定义席位限制
所有模型
工作流

Free
供随意体验
$0
永久免费
最多 20 积分
仅1个用户
部分模型
工作流
常见问题
Seed Audio 1.0 是什么?
Seed Audio 1.0 是字节跳动的一体化语音合成模型。一条文本提示词就能同时产出人声、器乐配乐和音效,直接得到混好的成品音轨。它有两种主要模式:文本到音频(T2A),一切都来自你的描述;以及文本加音频到音频(TA2A),加入参考音频来指定具体的声音。
Seed Audio 1.0 支持哪些语言?
Seed Audio 1.0 支持 20 种语言:英语、中文、日语、韩语、墨西哥西班牙语、卡斯蒂利亚西班牙语、印尼语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语和瑞典语。想要最好的效果,请用与台词相同的语言写提示词。
Seed Audio 1.0 的参考音频怎么用?
在 TA2A 模式下,你可以提供最多三段、每段不超过 30 秒的参考音频,并在提示词里做好绑定,让每个角色对应一段录音。模型会取走参考音频的音色和情绪,并在整段生成中保持一致。你也可以用文字描述或角色图片来定义声音,而不必提供录音。
Seed Audio 1.0 能克隆声音吗?
可以。除了 T2A 和 TA2A,还有一个声音克隆模式:上传一段音频,克隆出来的声音就能用于普通的语音合成。字节跳动把它记录为从单段音频完成的克隆。如果这个声音要和音乐、音效以及其他角色一起出现在一整场戏里,请改用可带三段参考音频的 TA2A。
Seed Audio 1.0 能控制每句台词的时长吗?
可以。Seed Audio 1.0 支持精确时间控制:在台词开头写上 [5.5s:8.0s] 这样的时间码,模型就会把这句话严格放进这个区间。正是这一点让它能用于配音,因为对白必须与画面对齐。
Seed Audio 1.0 能一次生成多个说话人吗?
可以。写一场有多个角色的戏,并在正文里描述每个人的声音。Seed Audio 1.0 会在一次生成中给每位说话人不同的声音、情绪和节奏,同时把周围的环境音和音效一并做出来。
Seed Audio 1.0 一次能生成多长?
Seed Audio 1.0 单次生成最长两分钟音频,提示词最多 3000 字符。更长的作品按场景逐段制作。
Seed Audio 1.0 和普通语音合成有什么不同?
普通语音合成是挑一个声音把文字读出来。Seed Audio 1.0 则从文本到语音走向参考到音频:一条提示词描述环境、音乐、音效和每个角色的声音,模型把整场戏混好之后返回。差别在于范围,得到的是一份成品音频作品,而不只是人声。