OpenAI 给 ChatGPT 移动端加语音代理:4 档用户全覆盖,跨设备办公

OpenAI 本周三宣布,ChatGPT 的语音代理功能正式登陆移动端。用户可以直接用语音下达指令,让 AI 起草文档、撰写邮件、汇总 Slack 消息。桌面级的生产力能力开始向手机迁移。

4 档用户分别能用什么

Plus 与 Pro 订阅用户的权限最完整,可通过手机端的「工作」选项卡跨设备完成文档创建、邮件撰写与 Slack 消息汇总,还支持网站建设、演示文稿生成、云浏览器调用以及财务工具访问。Free 与 Go 版用户也能借此使用各类插件与关联应用。

这一方向和 OpenAI 此前的布局一脉相承,ChatGPT Agent 已经可以调用虚拟浏览器自主完成表格与调研任务,语音代理相当于把同一套能力换成了语音入口。

用户层级 移动端语音代理能力
Plus / Pro 跨设备文档创建、邮件撰写、Slack 汇总,附建站与演示文稿生成
Free / Go 可使用插件与关联应用

底座是 GPT-Live

这套移动端代理能力的底层支撑来自 OpenAI 今年 7 月发布的对话模型 GPT-Live。该模型此前已率先集成在桌面端,让用户在「工作」或「代码库」选项卡里通过语音构建应用并处理任务。移动端这次升级补齐了全场景产品生态的最后一块。

语音和文本的切换被抹平了

交互层面的变化同样值得注意。移动端的语音对话会输出更丰富的文本形态,用户能在语音与文本输入之间无缝切换,也可以先在手机上发起对话,再平滑流转到电脑端继续完成。任务不再绑定在某台设备上。

国内厂商在相近方向上也有动作,科大讯飞的 AStudio 把自己定位成全场景 AI 生产力工作台,路线与 OpenAI 的移动端代理接近。

和 Anthropic 走了两条路

产品形态上的分歧正在显现。Anthropic 近期选择合并协作办公与聊天界面,以减少多端切换成本。OpenAI 则坚持把常规聊天交互与专业工作区做物理隔离,用更明确的功能分区强化移动端语音代理的专业定位。两条路径背后是对企业级 AI 办公市场的不同判断。

语音作为交互入口的竞争同时在多条战线上展开。谷歌本周发布的 Gemini 3.8 Live 已经能做到边对话边推理,把实时性当作核心卖点。

常见问题

需要额外付费吗?不需要单独订阅,现有 Plus、Pro、Free、Go 各档用户都能使用,只是能力范围有差异。

和语音模式有什么区别?语音模式负责对话,语音代理负责执行。后者能调用工具、跨设备完成任务,不只是回答。

手机上能完成复杂任务吗?文档创建、邮件撰写、消息汇总这类任务可以完成,需要长时运行的复杂流程仍会绕回桌面端或云端。

语音入口的竞争进入工作流阶段

把语音代理搬上手机,实质是把随时可下达任务这件事变成默认能力。对企业用户来说,决定采用哪一家的关键会从模型能力转向工作流的串联程度。

相关阅读