OpenAI 本周三宣布,ChatGPT 的语音代理功能正式登陆移动端。用户可以直接用语音下达指令,让 AI 起草文档、撰写邮件、汇总 Slack 消息。桌面级的生产力能力开始向手机迁移。
4 档用户分别能用什么
Plus 与 Pro 订阅用户的权限最完整,可通过手机端的「工作」选项卡跨设备完成文档创建、邮件撰写与 Slack 消息汇总,还支持网站建设、演示文稿生成、云浏览器调用以及财务工具访问。Free 与 Go 版用户也能借此使用各类插件与关联应用。
这一方向和 OpenAI 此前的布局一脉相承,ChatGPT Agent 已经可以调用虚拟浏览器自主完成表格与调研任务,语音代理相当于把同一套能力换成了语音入口。
| 用户层级 | 移动端语音代理能力 |
|---|---|
| Plus / Pro | 跨设备文档创建、邮件撰写、Slack 汇总,附建站与演示文稿生成 |
| Free / Go | 可使用插件与关联应用 |
底座是 GPT-Live
这套移动端代理能力的底层支撑来自 OpenAI 今年 7 月发布的对话模型 GPT-Live。该模型此前已率先集成在桌面端,让用户在「工作」或「代码库」选项卡里通过语音构建应用并处理任务。移动端这次升级补齐了全场景产品生态的最后一块。
语音和文本的切换被抹平了
交互层面的变化同样值得注意。移动端的语音对话会输出更丰富的文本形态,用户能在语音与文本输入之间无缝切换,也可以先在手机上发起对话,再平滑流转到电脑端继续完成。任务不再绑定在某台设备上。
国内厂商在相近方向上也有动作,科大讯飞的 AStudio 把自己定位成全场景 AI 生产力工作台,路线与 OpenAI 的移动端代理接近。
和 Anthropic 走了两条路
产品形态上的分歧正在显现。Anthropic 近期选择合并协作办公与聊天界面,以减少多端切换成本。OpenAI 则坚持把常规聊天交互与专业工作区做物理隔离,用更明确的功能分区强化移动端语音代理的专业定位。两条路径背后是对企业级 AI 办公市场的不同判断。
语音作为交互入口的竞争同时在多条战线上展开。谷歌本周发布的 Gemini 3.8 Live 已经能做到边对话边推理,把实时性当作核心卖点。
常见问题
需要额外付费吗?不需要单独订阅,现有 Plus、Pro、Free、Go 各档用户都能使用,只是能力范围有差异。
和语音模式有什么区别?语音模式负责对话,语音代理负责执行。后者能调用工具、跨设备完成任务,不只是回答。
手机上能完成复杂任务吗?文档创建、邮件撰写、消息汇总这类任务可以完成,需要长时运行的复杂流程仍会绕回桌面端或云端。
语音入口的竞争进入工作流阶段
把语音代理搬上手机,实质是把随时可下达任务这件事变成默认能力。对企业用户来说,决定采用哪一家的关键会从模型能力转向工作流的串联程度。
相关阅读
- ChatGPT Agent 正式发布:虚拟浏览器自主完成表格与调研
- Google 发布 Gemini 3.8 Live:可边对话边推理的实时语音 AI
- 科大讯飞发布 AStudio:全场景 AI 生产力工作台
延伸阅读
- OpenAI发布GPT-5.6-Cyber:周五叫停Astra,周一上线拒绝更少的黑客模型1 月前
- Meta AI助手Muse被指偷看Mac通知:用户未授权却读出消息,官方否认”监视”4 天前
- 澳大利亚政府网站遭 OpenAI 智能体入侵:全球首例,6 月事发 9 月才证实1 小时前
- 美团小美AI助手App上线:搭载LongCat-Flash-Chat,一句话点外卖订座排队,本地生活Agent怎么用2 天前
