Seed Audio 1.0
由 ByteDance 提供
字节跳动的一体化 TTS 模型。
一次生成人声、音乐和音效。

核心功能
聆听声音的广度
温暖、沉稳的纪录片旁白。
压低、紧张的台词朗读,贴近而私密。
层次丰富的露天市场声音垫底。
翻滚的风暴逐渐酝酿出远处的一声惊雷。
一段为弦乐和铜管而作的短促上扬乐句。
轻松的节拍,配上柔和琴键和黑胶噪点。
技术规格
ByteDance
由字节跳动 Seed 研究团队开发。
20
英语、中文、日语、韩语、西班牙语、法语、德语等。
最长 2 分钟
每次生成最多两分钟音频。
3000 字符
足够写下含台词的完整场景说明。
最多 3 段
最多三段参考音频,每段不超过 30 秒。
非流式
输出完整音轨,而非实时音频流。
应用场景
有声书
整本书的音频都不用进棚。字节跳动称成本约为录音棚的十分之一。
视频配音
描述声音或上传角色图片,再用时间码把每句台词放到画面需要的位置。
游戏音频
角色台词、有表演的场景和环境音效,直接从剧本生成沉浸的瞬间。
一次生成视频音频
旁白、声音设计和音乐一次生成,之后不再需要单独的混音步骤。
广告与宣传片
一句台词、音效和音乐合成一条即用音轨,为短内容而做。
对白与广播剧
多个角色各有声音和表演,在同一场戏里配上相称的环境音与节奏。
提示词示例
概览
Seed Audio 1.0 是字节跳动的一体化音频模型,定位是语音合成的下一步,而不是与它的决裂。传统音频流程用不同工具分别做人声、音乐和音效,各自生成后再混音。Seed Audio 1.0 从一条文本提示词同时产出这三层,输出的是一条完整、可直接使用的音轨。
从文本到语音,走向参考到音频
传统 TTS 拿到的是一个声音和一段文字。Seed Audio 1.0 拿到的是一场戏:天气和空间、垫在底下的音乐、动作周围的音效、每个角色的样貌与声音,以及他们说的台词。凡是你能描述的,都会成为同一次生成的一部分,这也是提示词可以写到 3000 字符而不显得注水的原因。
模型理解场景语境。写咖啡馆对话的提示词,得到的是背景人声和合适的声学空间,而不是一段泛泛的房间底噪。动作场面得到的是干脆的音效和有推进感的配乐,而不是贴在寂静之上的背景音乐。三层不是把各自导出的文件拼在一起,而是按这场戏的比例混好后一起出来。
四种模式
最简单的是语音合成:挑一个声音,输入文字,模型读出来。声音克隆在此之上多一步:上传一段音频,克隆出来的声音就能用于同样的语音合成。另外两种模式,才是这个模型和普通 TTS 拉开距离的地方。
在**文本到音频(T2A)**中,每个声音都来自你的描述。写清角色的年龄、口音、情绪、音色和语速,模型就会为其选声。
在**文本加音频到音频(TA2A)**中,你上传最多三段、每段不超过 30 秒的参考音频,并在提示词里把每段绑到一个角色上。此时生成的声音跟随的是录音,而不是描述。参考音频可以只为当次任务上传,也可以放在素材库里,在整个系列中反复使用。
二十种语言
Seed Audio 1.0 可生成英语、中文、日语、韩语、墨西哥西班牙语、卡斯蒂利亚西班牙语、印尼语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语和瑞典语。提示词的语言应与剧本语言一致:用角色所说的语言来写这份说明。
可以精确到秒的时间
Seed Audio 1.0 支持在任意一句台词上写时间码,在行内写成 [5.5s:8.0s],模型就会把这句的表演严格放进这个区间。在配音里,这是“大致对得上”和“正好落在剪辑点上”的区别。生成是非流式的:模型一次渲染出最长两分钟的成品音轨。
简单定价
今天就免费开始,随时可以升级或取消。
Basic
1100 每月 信用
1 个用户
所有模型
工作流
Standard
3625 每月 信用
1 个用户
所有模型
工作流
Pro
6350 共享 每月 信用
1 用户
所有模型
工作流
Pro Max
24650 共享 每月 信用
1 用户
所有模型
工作流
Enterprise
更高的限制
自定义
定价和账单条款

Free
供随意体验
$0
永久免费