结论先行:阿里通义推出 GUI 智能体基座模型 Qwen-UI-Agent,覆盖手机、电脑、网页以及深度搜索四类场景。它的训练数据来自 100+ 台真机与 150+ 应用,在 MobileWorld、OSWorld、WebArena 等多项基准上超越 GPT、Claude、Gemini 等旗舰模型。更值得注意的是安全设计:模型具备严格的安全边界,能够拒绝违法请求,并在支付、删除等敏感操作之前主动向用户确认。
什么是 GUI 智能体基座模型
要理解 Qwen-UI-Agent 的定位,需要先区分两类「会操作电脑的 AI」。
第一类是外挂式方案:用一个通用多模态大模型,配合截图、无障碍树或 DOM 结构,再套一层操作脚本。这类方案灵活,但每一步都要靠提示词工程兜底,稳定性差。
第二类是基座模型方案:直接在模型训练阶段就让它学会「看界面—理解元素—决定动作」这件事。Qwen-UI-Agent 属于后者。所谓基座模型,意思是它不是一个开箱即用的成品应用,而是供上层智能体调用的能力底座——各家可以在它之上搭建自己的自动化助手、测试工具或运维机器人。
100+ 台真机与 150+ 应用,这个数据量意味着什么
GUI 智能体最大的难点从来不是「看得见按钮」,而是界面多样性。同一个「提交」操作,在不同 App 里可能是按钮、图标、长按菜单,甚至是手势;同一个应用在不同机型、不同系统版本、不同语言设置下的布局也可能完全不同。
官方披露的训练规模是 100+ 台真机、150+ 应用。这个数字的关键不在于绝对大小,而在于它说明了训练数据的来源是真实设备而非模拟器。真机采集能够覆盖到模拟器里很难复现的问题:系统弹窗、权限申请、网络异常提示、应用内广告遮挡、手势交互等。这些恰恰是 GUI 智能体在真实环境里最容易翻车的地方。
四类场景与三项基准
| 覆盖场景 | 对应基准 | 考察重点 |
|---|---|---|
| 手机 | MobileWorld | 触屏操作、手势、App 内多步任务 |
| 电脑 | OSWorld | 桌面系统操作、多窗口、文件系统 |
| 网页 | WebArena | 浏览器导航、表单填写、信息检索 |
| 深度搜索 | — | 跨页面信息整合与多轮检索 |
据官方披露,Qwen-UI-Agent 在上述多项基准上超越了 GPT、Claude、Gemini 等旗舰模型。这类横向对比需要谨慎解读——不同模型的接入方式、提示词模板和评测脚本都可能影响结果——但至少说明 GUI 操作已经不再是通用大模型的附带能力,而是需要专门训练的独立方向。
安全边界:比能力更难做的一件事
Qwen-UI-Agent 在安全上做了两项明确设计,这在实际落地中可能比榜单分数更重要。
拒绝违法请求
当被要求执行违法或违规操作时,模型应当拒绝。对 GUI 智能体来说这一点尤其敏感——因为它操作的是真实设备与真实账号,一次越界行为的后果远大于生成一段不当文字。
敏感操作前主动确认
在支付、删除这类不可逆操作之前,模型会主动向用户确认。这是一个非常务实的设计:它把「AI 全自动」改成了「AI 执行 + 人类把关关键节点」,既保留了自动化带来的效率,又避免了不可逆损失。对企业采购方而言,这类机制往往是能否上线的决定性因素。
典型落地场景
移动应用自动化测试
传统 UI 自动化测试需要为每条用例编写脚本,界面一改脚本就失效。基于 GUI 智能体的测试可以用自然语言描述任务,由模型自行找到路径完成操作,对界面改动的容忍度更高。
跨应用流程自动化
例如「从邮箱里找到发票附件,上传到报销系统并填写金额」这类横跨多个应用、需要理解界面语义的流程,正是 GUI 智能体的强项。
信息检索与比价
深度搜索场景要求模型在多个页面之间跳转、筛选、交叉验证。这类任务用固定爬虫难以覆盖,用 GUI 智能体则可以按人的方式去浏览和判断。
无障碍辅助
对行动不便的用户而言,用一句话让 AI 帮自己完成手机上复杂的多步操作,是 GUI 智能体最具社会价值的方向之一。
常见问题
Qwen-UI-Agent 和普通的 AI 助手有什么区别?
普通 AI 助手主要处理对话与文本生成,而 Qwen-UI-Agent 是专门为「操作图形界面」训练的基座模型,输出的是界面动作而非文字答复,覆盖手机、电脑、网页和深度搜索四类场景。
它会自己付款或删除文件吗?
不会在未确认的情况下执行。模型具备严格安全边界,在支付、删除等敏感操作前会主动向用户确认,同时能够拒绝违法请求。
在哪些基准上做了评测?
官方披露的评测涵盖 MobileWorld、OSWorld、WebArena 等多项基准,结果超越 GPT、Claude、Gemini 等旗舰模型。实际选型时建议在自己的业务界面上复测,通用基准与真实环境之间通常存在差距。
小结
Qwen-UI-Agent 的出现,标志着 GUI 智能体从「通用模型加外挂脚本」的临时方案,走向了「专门训练的基座模型」这条更正规的路线。100+ 真机与 150+ 应用的训练规模指向真实环境鲁棒性,而支付与删除前的主动确认则回应了落地时最现实的安全顾虑。接下来它要回答的问题是:在千差万别的企业内部系统里,这套能力能否保持同样的稳定度——那才是 GUI 智能体真正的主战场。
