微软 UFO² 桌面 AgentOS 解析:自动化成功率 32.7%,超越 OpenAI Operator 且 MIT 开源

结论先行:微软在 2025 年 4 月发布的 UFO²(Desktop AgentOS),把桌面智能代理从”自动化脚本”升级为一套操作系统级方案。官方测试数据显示,在两组不同的自动化任务场景中,UFO² 的成功率分别为 30.5% 和 32.7%,而同期 OpenAI Operator 的成功率为 20.8% 和 14.3%。项目已在 GitHub 以 MIT 协议开源,可直接二次集成。

UFO² 是什么:从 AgentUFO 到 Desktop AgentOS

UFO² 是开源项目 AgentUFO 的大版本升级,官方给它一个新定义——Desktop AgentOS(桌面智能代理操作系统)。和上一代相比,它不再只是”调用几个接口的小助手”,而是深度整合 Windows 平台,支持用自然语言指令驱动多个应用程序协同完成一条完整任务链。

之所以称其为”操作系统”,是因为它承担的是调度职责:接收自然语言目标 → 拆解步骤 → 选择执行方式 → 跨应用落地。这与传统 RPA(机器人流程自动化)靠录制坐标脚本的方式有本质区别。

四项核心机制

深度系统 API 调用

UFO² 不只依赖屏幕像素识别,而是调用 Windows 深度系统 API 获取控件信息。好处是拿到的界面结构是语义化的(按钮、输入框、菜单项),而非一张需要再去猜的截图;这让它在界面元素识别和定位上的可靠性明显优于纯视觉方案。

混合控制执行:GUI 操作与 API 调用自适应

这是 UFO² 最关键的架构选择。纯 GUI 操作的优点是通用、无需适配,缺点是慢且脆弱——界面一改坐标就失效;纯 API 调用优点是快且稳,缺点是需要为每个应用写适配层。UFO² 的做法是混合执行:能用系统 API 的地方走 API,只有遇到没有接口的界面才降级为 GUI 模拟操作。这也是它在非标准界面上适应性更强的原因。

智能推测执行机制

代理执行多步骤任务时,往往因为逐步等待确认而拖慢整体速度。推测执行允许系统基于当前状态预判后续操作并提前准备,在判定条件满足后快速落地,减少空转等待。这本质上是把 CPU 流水线里的成熟思路搬到了 Agent 调度里。

知识增强检索系统

面对陌生应用或不常见的自定义控件,纯视觉识别容易失效。UFO² 引入知识增强检索,把外部或历史积累的应用知识引入决策环节,提升在陌生界面上的操作正确率——相当于给代理配了一本”软件使用手册”。

画中画桌面

官方预告的一项功能是画中画(Picture-in-Picture)桌面:代理任务在独立的虚拟桌面中运行,用户的真实桌面不受干扰。这解决了桌面 Agent 一个非常实际的痛点——代理执行时会抢占鼠标键盘,人就没法同时干活。独立桌面隔离让”人机并行”成为可能。

成功率对比

测试场景 UFO² OpenAI Operator
场景一 30.5% 20.8%
场景二 32.7% 14.3%

以上数据来自微软官方公布的测试结果。有一点必须说清楚:桌面自动化任务的成功率整体仍停留在三成左右的区间,说明这个方向距离”可靠托管”尚有距离。它更适合分担重复性操作,而不适合无人值守地跑关键业务流程。

为何成功率偏低仍是进步

桌面自动化之所以难,根源在于 GUI 环境的开放性——同一个目标在不同软件里有完全不同的路径,字体缩放、弹窗、动态加载、权限提示都会打断执行流水线。在这样的前提下,从两成提升到三成,意味着相当一部分原本必然失败的任务变得可用。判断这类产品价值时,更务实的指标是”在受控、固定的应用列表里成功率有多高”,而不是跨任意软件的泛化成功率。

开源与许可

UFO² 已在 GitHub 开源,采用 MIT 协议。MIT 属于相当宽松的许可,允许在保留版权声明的前提下做商业闭源二次集成,对希望把它嵌进内部工具链的团队非常友好——这也是它相比闭源 Operator 的一个结构性优势。

常见问题(FAQ)

Q1:UFO² 和 OpenAI Operator 的核心差异是什么?

主要在执行方式上。UFO² 采用 GUI 操作与系统 API 调用的混合自适应执行,并深度绑定 Windows;官方公布的两个测试场景中,其成功率分别为 30.5% 和 32.7%,高于 Operator 同场景的 20.8% 和 14.3%。此外 UFO² 以 MIT 协议开源。

Q2:普通非技术用户现在能用吗?

UFO² 目前更偏向开发者与自动化技术爱好者,需要在 GitHub 获取源码后自行部署运行,尚未形成开箱即用的消费级产品形态。

Q3:成功率只有三成,值得投入吗?

取决于任务性质。对于可随时重试、失败成本低的重复操作,三成成功率已经能省下人力;对一次失败就要付出高代价的流程,现阶段仍需人工复核。建议先在小范围固定任务上试跑。

小结

UFO² 的意义不在于把桌面 Agent 的成功率推得多高,而在于给出了一个可复用、可扩展、且完全开源的执行框架:混合控制执行解决了通用性与效率的矛盾,推测执行解决等待开销,知识增强检索解决陌生界面,画中画桌面解决人机争抢。对于想在 Windows 环境里落地自动化代理的团队,它提供了一个比从零造轮子靠谱得多的起点。