音频生成

Seed Audio 1.0

由 ByteDance 提供

字节跳动的一体化 TTS 模型。
一次生成人声、音乐和音效。

Seed Audio 1.0

核心功能

聆听声音的广度

纪录片旁白语音

温暖、沉稳的纪录片旁白。

0:00
0:12
惊悚片旁白语音

压低、紧张的台词朗读,贴近而私密。

0:00
0:12
香料市场环境音音效

层次丰富的露天市场声音垫底。

0:00
0:12
雷暴音效

翻滚的风暴逐渐酝酿出远处的一声惊雷。

0:00
0:12
管弦乐段音乐

一段为弦乐和铜管而作的短促上扬乐句。

0:00
0:12
Lo-fi 节拍音乐

轻松的节拍,配上柔和琴键和黑胶噪点。

0:00
0:12

技术规格

ByteDance

由字节跳动 Seed 研究团队开发。

20

英语、中文、日语、韩语、西班牙语、法语、德语等。

最长 2 分钟

每次生成最多两分钟音频。

3000 字符

足够写下含台词的完整场景说明。

最多 3 段

最多三段参考音频,每段不超过 30 秒。

非流式

输出完整音轨,而非实时音频流。

应用场景

有声书

整本书的音频都不用进棚。字节跳动称成本约为录音棚的十分之一。

视频配音

描述声音或上传角色图片,再用时间码把每句台词放到画面需要的位置。

游戏音频

角色台词、有表演的场景和环境音效,直接从剧本生成沉浸的瞬间。

一次生成视频音频

旁白、声音设计和音乐一次生成,之后不再需要单独的混音步骤。

广告与宣传片

一句台词、音效和音乐合成一条即用音轨,为短内容而做。

对白与广播剧

多个角色各有声音和表演,在同一场戏里配上相称的环境音与节奏。

提示词示例

讲解旁白

沉稳旁白,轻微厨房环境音:“把面粉和黄油拌匀。”

Edit prompt

时间控制

瑞恩(气喘):“[5.5s:8.0s] 玛雅!你今晚真的走?”

Edit prompt

有声书片段

雨打窗棂。旁白低沉从容:“她读了两遍。”

Edit prompt

体育解说

满场看台,山呼海啸。解说激动高喊:“球进啦!”

Edit prompt

广播剧

警探绷紧声音:“别动。”脚步停住,一扇门吱呀作响。

Edit prompt

游戏瞬间

低沉英雄般的嗓音:“上古封印已破。”石块摩擦声。

Edit prompt

简单定价

今天就免费开始,随时可以升级或取消。

Basic

$9/
账单金额为 $0 每年

900 每月 信用

1 个用户

所有模型

工作流

Standard

$24/
账单金额为 $0 每年

3200 每月 信用

1 个用户

所有模型

工作流

Pro

$45/
账单金额为 $0 每年

6200 共享 每月 信用

1 用户

+ 最多 4 人额外付费可增加

所有模型

工作流

Pro Max

$170/
账单金额为 $0 每年

24000 共享 每月 信用

1 用户

+ 最多 9 人额外付费可增加

所有模型

工作流

Enterprise

更高的限制

自定义

定价和账单条款

大容量信用
自定义席位限制
所有模型
工作流
Pricing Gradient

Free

供随意体验

$0

永久免费

最多 20 积分
仅1个用户
部分模型
工作流

常见问题

Seed Audio 1.0 是什么?
Seed Audio 1.0 是字节跳动的一体化语音合成模型。一条文本提示词就能同时产出人声、器乐配乐和音效,直接得到混好的成品音轨。它有两种主要模式:文本到音频(T2A),一切都来自你的描述;以及文本加音频到音频(TA2A),加入参考音频来指定具体的声音。
Seed Audio 1.0 支持哪些语言?
Seed Audio 1.0 支持 20 种语言:英语、中文、日语、韩语、墨西哥西班牙语、卡斯蒂利亚西班牙语、印尼语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语和瑞典语。想要最好的效果,请用与台词相同的语言写提示词。
Seed Audio 1.0 的参考音频怎么用?
在 TA2A 模式下,你可以提供最多三段、每段不超过 30 秒的参考音频,并在提示词里做好绑定,让每个角色对应一段录音。模型会取走参考音频的音色和情绪,并在整段生成中保持一致。你也可以用文字描述或角色图片来定义声音,而不必提供录音。
Seed Audio 1.0 能克隆声音吗?
可以。除了 T2A 和 TA2A,还有一个声音克隆模式:上传一段音频,克隆出来的声音就能用于普通的语音合成。字节跳动把它记录为从单段音频完成的克隆。如果这个声音要和音乐、音效以及其他角色一起出现在一整场戏里,请改用可带三段参考音频的 TA2A。
Seed Audio 1.0 能控制每句台词的时长吗?
可以。Seed Audio 1.0 支持精确时间控制:在台词开头写上 [5.5s:8.0s] 这样的时间码,模型就会把这句话严格放进这个区间。正是这一点让它能用于配音,因为对白必须与画面对齐。
Seed Audio 1.0 能一次生成多个说话人吗?
可以。写一场有多个角色的戏,并在正文里描述每个人的声音。Seed Audio 1.0 会在一次生成中给每位说话人不同的声音、情绪和节奏,同时把周围的环境音和音效一并做出来。
Seed Audio 1.0 一次能生成多长?
Seed Audio 1.0 单次生成最长两分钟音频,提示词最多 3000 字符。更长的作品按场景逐段制作。
Seed Audio 1.0 和普通语音合成有什么不同?
普通语音合成是挑一个声音把文字读出来。Seed Audio 1.0 则从文本到语音走向参考到音频:一条提示词描述环境、音乐、音效和每个角色的声音,模型把整场戏混好之后返回。差别在于范围,得到的是一份成品音频作品,而不只是人声。