2026 年 9 月 16 日,Google 正式发布新一代实时语音模型 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,两款模型均已进入 Gemini API 的 Stable 模型列表。与追求「更快回复」的传统语音模型不同,这一代的重点是让实时语音 AI 能够边对话边推理、边调用工具,向真正的语音 Agent 演进。
Gemini 3.8 Live 是什么
Gemini 3.8 Live 是 Google 面向低延迟、大规模实时语音应用的模型,核心能力包括:
- 多模态输入:支持文本、图像、音频和视频输入,可近实时理解视觉内容
- 97 种语言自动切换:一次对话中可自动识别并切换语言
- 工具调用:支持同步与异步工具调用,可在语音对话中连接搜索、业务 API 等外部服务
Extended Thinking:解决语音 Agent 的「长时间沉默」难题
传统语音 Agent 执行复杂任务时,往往陷入十几秒的沉默等待。这次同步推出的 Extended Thinking 版本面向需要复杂规划和多步骤推理的语音任务:模型可以先语音回应「正在查询」,随后在后台持续推理并异步调用多个工具,最终返回完整答案。
例如用户要求「查航班、订酒店并规划行程」,模型能同时推进多个工具调用、比较结果后再作答,全程保持对话的连续感。
开发者可为 Extended Thinking 设置 Low / Medium / High 三档推理深度,在响应速度与推理能力之间权衡。
官方跑分数据
| 评测基准 | 成绩 |
|---|---|
| Artificial Analysis Speech-to-Speech Quality Index | 82.6 分 |
| τ-Voice 智能体任务完成测试 | 68.6% |
| Big Bench Audio | 97.7% |
哪里能用上
- 开发者:Gemini API 与 Google AI Studio 已开放调用
- 消费者产品:Gemini 3.8 Live 正逐步应用于 Search Live;Extended Thinking 进入 Gemini Live、Docs Live、Gmail Live、Keep Live
- 企业:Gemini Enterprise 中处于 Private Preview 阶段
常见问题(FAQ)
Gemini 3.8 Live 和 Gemini 3.8 Flash 有什么区别?
两者面向不同场景:Flash 是通用文本/多模态模型,主打性价比与编程能力;Live 是专门的实时语音模型,主打低延迟语音交互,且支持边说话边执行任务。
Extended Thinking 会不会让响应变慢?
不会明显变慢。它的设计是先给出即时语音反馈,把复杂推理放到后台异步执行,用户感知上反而更流畅。
现在就能调用吗?
可以。两款模型均已进入 Gemini API Stable 列表,开发者可直接使用;企业版 Gemini Enterprise 目前为私有预览。
小结
Google 对实时语音模型的定位已从「和 AI 聊天」转向「能持续交流、理解环境并自主完成任务的语音 Agent」。Extended Thinking 将实时交互与后台推理结合,为客服、技术支持、教育、办公助手等场景提供了新的实现范式。
消息来源:aihub.cn 资讯、Google 官方。
相关阅读
这条线上还有几篇站内文章可以接着看:
延伸阅读
- ChatGPT Images 2.0 发布:gpt-image-2 攻克文字渲染与多语言,Thinking 一次出 8 张1 天前
- 美团CatPaw AI编程IDE发布:内置LongCat多模型混合调用,Tab/Agent/Browser/Codebase四大能力全解析1 天前
- OpenAI 正式发布 ChatGPT Images 2.5:图像保真度与编辑精度大幅提升2 周前
- Qwen-UI-Agent 发布:阿里通义 GUI 智能体基座模型,100+ 真机 150+ 应用训练超越 GPT、Claude、Gemini3 天前
