Gemini 3.8 Flash TTS 发布:30 秒复刻声音,支持 100 种语言

谷歌在 9 月 23 日推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,一个主打声音设计,一个主打批量出音。最抓人的参数是用 30 秒音频样本就能复刻一个声音,两款模型支持超过 100 种语言和方言,并内置 2000 多种现成声音。

两款模型分工不同

Gemini 3.8 Flash TTS 面向声音和角色设计。它支持用自然语言描述来创建定制化声音,比如直接说要什么样质感的声音,并能逐句精确控制语气、语速和口音。30 秒样本的声音复刻也在这款上。

Gemini 3.8 Flash-Lite TTS 则专注大规模音频生成和高效配音场景,定位上更像是给需要批量出音频的业务准备的,比如长内容配音、批量广告语音。

多语言方面官方给出的数字是支持超过 100 种语言和方言,开箱即用提供 2000 多种现成声音。这两个数字意味着开发者不必从零训声音,直接用现成库也能起步。

放在近期的语音模型竞争里看

语音合成这一块最近很挤。就在前一天,千问发布了 Qwen-Audio-3.1 五款语音模型,TTS 价格降约 70%,支持同音色跨语言迁移;StepAudio 3 系列也是五款模型一次性推齐。开源侧,小红书 FireRedTTS3 做到 24 语种 21 种中文方言零样本克隆,B 站 IndexTTS-2.5 用 0.8B 参数把推理提速 2.28 倍。

谷歌这次的差异点在于控制粒度。自然语言描述加逐句控语气语速口音,把原本需要调参数的工作变成说话,这个方向对非技术用户更友好。代价是这类云端 API 的长期成本,和一次性部署的开源小模型不是一回事。

能力 Gemini 3.8 Flash TTS Gemini 3.8 Flash-Lite TTS
定位 声音与角色设计 大规模音频生成与高效配音
声音创建 自然语言描述定制 未单独说明
声音复刻 30 秒样本 未单独说明
逐句控制 语气、语速、口音 未单独说明
语言覆盖 100+ 语言与方言 100+ 语言与方言
现成声音 2000 多种 2000 多种

和 Gemini 3.8 Live 是什么关系

两回事。Gemini 3.8 Live 是实时语音交互模型,处理的是边对话边推理的双向场景;这次的 Flash TTS 是单向的文本转语音,负责把文字变成音频。真要做语音助手,通常是实时模型负责理解和回复,TTS 负责最终发声,两者可以串起来用。

常见问题

30 秒复刻的声音质量如何

官方只公布了 30 秒样本可完成复刻这一能力指标,没有给出相似度或主观评分的量化数据。实际效果建议用自己的样本试一遍,尤其是中文和多方言场景。

2000 多种现成声音能商用吗

官方表述是开箱即用,具体商用授权条款要查谷歌的 API 服务协议,这次公布的信息里没有涉及授权范围。

和 Gemini 3.8 Flash 主模型是一回事吗

不是。名字相近但用途不同,Gemini 3.8 Flash TTS 专注于文本转语音,Flash-Lite TTS 面向批量生成,两者都属于语音输出方向的专用模型。

小结

谷歌这次补的是语音输出这块拼图,30 秒复刻和自然语言定制声音这两个点足够实用,尤其对做角色配音和有声内容的团队。真正的悬念在价格,官方这次没公布计费细节,而同一周内千问刚把 TTS 价格砍了 70%,这种时候定价表往往比参数更能决定开发者的选择。


相关阅读