Gemini 3.1 Flash TTS
由 Google DeepMind 提供
Google 最具表现力的文本转语音,支持音频标签和多人对话。

核心功能
技术规格
多语言
在多种语言中控制风格、节奏与口音
最多 2 位
一次多人生成中两种不同的声音
音频标签
平实话语指示加上内嵌的方括号提示
SynthID
输出上不可察觉的 AI 来源水印
应用场景
视频旁白与配音
为 AI 或实拍视频添加自然旁白,用平实的话设定语气与节奏。
角色对话
为短片、游戏和讲解视频配两位说话人的场景,每个角色都有独特的声音。
本地化配音
用多种语言朗读同一脚本,保持母语般的节奏与口音。
有声书与长篇内容
在长段旁白中保持自然、一致的朗读。
讲解与教程
为产品演示、课程和操作指南提供清晰、可调度的旁白。
广告口播与宣传
以你所调度的能量与强调,呈现富有表现力且契合品牌的口播。
提示词示例
概览
Gemini 3.1 Flash TTS 是 Google 的文本转语音模型,于 2026 年 4 月 15 日发布,并作为语音用的音频模型集成到 Morphic 中。它将文本转化为可用平实话语指示和内嵌音频标签调度的、富有表现力的自然旁白,让多人对话发声,并为每段片段添加 SynthID 水印。
Gemini 3.1 Flash TTS 的独特之处
大多数文本转语音只是以固定的语气把你的文字读回来。Gemini 3.1 Flash TTS 会接受调度。在句子前用平实的话写下指示来设定语气、节奏或口音,并在你想要的位置放入方括号提示,例如 [laughs] 或 [whispering]。模型会表演调度而非把它读出来,因此同一份脚本可以从轻声的独白转为充满能量的朗读。
Morphic 上的 Gemini 3.1 Flash TTS
在 Morphic 中,Gemini 3.1 Flash TTS 位于 Speech 的音频模型选择器中,与 ElevenLabs 并列。将提示栏切换到 Audio,选择 Speech,选取 Gemini 3.1 Flash TTS,然后写下带有调度或标签的脚本,选择声音与语言并生成。音频会直接放到 Canvas 的视频片段旁边。
简单定价
今天就免费开始,随时可以升级或取消。
Basic
1100 每月 信用
1 个用户
所有模型
工作流
Standard
3625 每月 信用
1 个用户
所有模型
工作流
Pro
6350 共享 每月 信用
1 用户
所有模型
工作流
Pro Max
24650 共享 每月 信用
1 用户
所有模型
工作流
Enterprise
更高的限制
自定义
定价和账单条款

Free
供随意体验
$0
永久免费