Google 发布 Gemini 3.8 Live:可边对话边推理的实时语音 AI 模型

2026 年 9 月 16 日,Google 正式发布新一代实时语音模型 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking,两款模型均已进入 Gemini API 的 Stable 模型列表。与追求「更快回复」的传统语音模型不同,这一代的重点是让实时语音 AI 能够边对话边推理、边调用工具,向真正的语音 Agent 演进。

Gemini 3.8 Live 是什么

Gemini 3.8 Live 是 Google 面向低延迟、大规模实时语音应用的模型,核心能力包括:

  • 多模态输入:支持文本、图像、音频和视频输入,可近实时理解视觉内容
  • 97 种语言自动切换:一次对话中可自动识别并切换语言
  • 工具调用:支持同步与异步工具调用,可在语音对话中连接搜索、业务 API 等外部服务

Extended Thinking:解决语音 Agent 的「长时间沉默」难题

传统语音 Agent 执行复杂任务时,往往陷入十几秒的沉默等待。这次同步推出的 Extended Thinking 版本面向需要复杂规划和多步骤推理的语音任务:模型可以先语音回应「正在查询」,随后在后台持续推理并异步调用多个工具,最终返回完整答案。

例如用户要求「查航班、订酒店并规划行程」,模型能同时推进多个工具调用、比较结果后再作答,全程保持对话的连续感。

开发者可为 Extended Thinking 设置 Low / Medium / High 三档推理深度,在响应速度与推理能力之间权衡。

官方跑分数据

评测基准 成绩
Artificial Analysis Speech-to-Speech Quality Index 82.6 分
τ-Voice 智能体任务完成测试 68.6%
Big Bench Audio 97.7%

哪里能用上

  • 开发者:Gemini API 与 Google AI Studio 已开放调用
  • 消费者产品:Gemini 3.8 Live 正逐步应用于 Search Live;Extended Thinking 进入 Gemini Live、Docs Live、Gmail Live、Keep Live
  • 企业:Gemini Enterprise 中处于 Private Preview 阶段

常见问题(FAQ)

Gemini 3.8 Live 和 Gemini 3.8 Flash 有什么区别?

两者面向不同场景:Flash 是通用文本/多模态模型,主打性价比与编程能力;Live 是专门的实时语音模型,主打低延迟语音交互,且支持边说话边执行任务。

Extended Thinking 会不会让响应变慢?

不会明显变慢。它的设计是先给出即时语音反馈,把复杂推理放到后台异步执行,用户感知上反而更流畅。

现在就能调用吗?

可以。两款模型均已进入 Gemini API Stable 列表,开发者可直接使用;企业版 Gemini Enterprise 目前为私有预览。

小结

Google 对实时语音模型的定位已从「和 AI 聊天」转向「能持续交流、理解环境并自主完成任务的语音 Agent」。Extended Thinking 将实时交互与后台推理结合,为客服、技术支持、教育、办公助手等场景提供了新的实现范式。

消息来源:aihub.cn 资讯、Google 官方。

相关阅读

这条线上还有几篇站内文章可以接着看: