谷歌在 9 月 23 日推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,一个主打声音设计,一个主打批量出音。最抓人的参数是用 30 秒音频样本就能复刻一个声音,两款模型支持超过 100 种语言和方言,并内置 2000 多种现成声音。
两款模型分工不同
Gemini 3.8 Flash TTS 面向声音和角色设计。它支持用自然语言描述来创建定制化声音,比如直接说要什么样质感的声音,并能逐句精确控制语气、语速和口音。30 秒样本的声音复刻也在这款上。
Gemini 3.8 Flash-Lite TTS 则专注大规模音频生成和高效配音场景,定位上更像是给需要批量出音频的业务准备的,比如长内容配音、批量广告语音。
多语言方面官方给出的数字是支持超过 100 种语言和方言,开箱即用提供 2000 多种现成声音。这两个数字意味着开发者不必从零训声音,直接用现成库也能起步。
放在近期的语音模型竞争里看
语音合成这一块最近很挤。就在前一天,千问发布了 Qwen-Audio-3.1 五款语音模型,TTS 价格降约 70%,支持同音色跨语言迁移;StepAudio 3 系列也是五款模型一次性推齐。开源侧,小红书 FireRedTTS3 做到 24 语种 21 种中文方言零样本克隆,B 站 IndexTTS-2.5 用 0.8B 参数把推理提速 2.28 倍。
谷歌这次的差异点在于控制粒度。自然语言描述加逐句控语气语速口音,把原本需要调参数的工作变成说话,这个方向对非技术用户更友好。代价是这类云端 API 的长期成本,和一次性部署的开源小模型不是一回事。
| 能力 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| 定位 | 声音与角色设计 | 大规模音频生成与高效配音 |
| 声音创建 | 自然语言描述定制 | 未单独说明 |
| 声音复刻 | 30 秒样本 | 未单独说明 |
| 逐句控制 | 语气、语速、口音 | 未单独说明 |
| 语言覆盖 | 100+ 语言与方言 | 100+ 语言与方言 |
| 现成声音 | 2000 多种 | 2000 多种 |
和 Gemini 3.8 Live 是什么关系
两回事。Gemini 3.8 Live 是实时语音交互模型,处理的是边对话边推理的双向场景;这次的 Flash TTS 是单向的文本转语音,负责把文字变成音频。真要做语音助手,通常是实时模型负责理解和回复,TTS 负责最终发声,两者可以串起来用。
常见问题
30 秒复刻的声音质量如何
官方只公布了 30 秒样本可完成复刻这一能力指标,没有给出相似度或主观评分的量化数据。实际效果建议用自己的样本试一遍,尤其是中文和多方言场景。
2000 多种现成声音能商用吗
官方表述是开箱即用,具体商用授权条款要查谷歌的 API 服务协议,这次公布的信息里没有涉及授权范围。
和 Gemini 3.8 Flash 主模型是一回事吗
不是。名字相近但用途不同,Gemini 3.8 Flash TTS 专注于文本转语音,Flash-Lite TTS 面向批量生成,两者都属于语音输出方向的专用模型。
小结
谷歌这次补的是语音输出这块拼图,30 秒复刻和自然语言定制声音这两个点足够实用,尤其对做角色配音和有声内容的团队。真正的悬念在价格,官方这次没公布计费细节,而同一周内千问刚把 TTS 价格砍了 70%,这种时候定价表往往比参数更能决定开发者的选择。
相关阅读
- Qwen-Audio-3.1 五款语音模型齐发
- 小红书 FireRedTTS3 开源解析
- B 站开源 IndexTTS-2.5
- Gemini 3.8 Live 实时语音模型
- StepAudio 3 系列五款语音模型
延伸阅读
- Google Gemini 3.8 Flash 发布:距上次不到三周,编程能力成重点3 周前
- DeepSeek明确调休日计费规则:中秋国庆十天”半价窗口”,V4.1-Flash空闲价低至0.02元/百万Token4 天前
- AI 恶意软件 ClosedQuorum 现身 Win11:入侵后自主决策60 分前
- 豆包专业版上线:接入豆包 2.1 Pro 办公任务模式,68/200/500 元三档定价3 天前
