阿里发布Qwen-UI-Agent图形界面智能体基座模型,多项基准测试超越业界旗舰

危险请求不执行,敏感操作不擅自决定,让模型既能执行,也懂得何时停手。

阿里巴巴8月20日正式推出Qwen-UI-Agent,一个以真实世界为中心的GUI智能体基座模型,覆盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。该模型在多项GUI任务基准测试中表现突出,在移动端、电脑端和浏览器端均实现对业界旗舰模型的全面对标乃至超越。

据千问大模型官方公众号发布的信息,Qwen-UI-Agent在移动端基准测试MobileWorld上取得82.1%的成绩,分别领先GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro达12.0、14.6、8.9个百分点。在真机基准MobileWorld-Real上,该模型以92.2%的成绩超越Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol和Seed 2.1 Pro。此外,其在AndroidDaily基准上达到97.5%,接近满分水平。

在电脑端,Qwen-UI-Agent于OSWorld-Verified基准取得79.5%的成绩,超越GPT-5.5、Gemini 3.1 Pro和Seed 2.1 Pro;在OSWorld-v2 Partial基准上获得40.0%的分数,相比基线节省58%的执行步数。在浏览器与DeepSearch场景中,该模型在WebArena基准上以73.6%位列所有对比模型第一,BrowseComp-ZH成绩为75.0%。在GUI Grounding方面,ScreenSpot-Pro得分81.5%,其余4个grounding评测基准也全部刷新SOTA(最优成绩)。

通用能力方面,Qwen-UI-Agent在通用和Agentic能力上全面保持或超越训练基座模型,并在两类任务上大幅领先GUI专用模型。据官方介绍,该模型能够从容应对真实世界的长尾需求,在多样化场景中保持稳定的任务执行能力。

为打通“从模拟到真实”的最后一公里,阿里搭建了覆盖100余台真实手机、150余个应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准,包含400余个任务和100余个应用。这一基础设施使模型能够在接近真实使用条件的场景中进行训练和验证。

Qwen-UI-Agent在安全机制上采取分层策略。面对违法或高风险请求,模型不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。官方将这一机制概括为“危险请求不执行,敏感操作不擅自决定”,强调模型既具备执行能力,也具备判断何时停止的能力。

除GUI操作外,该模型还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI动作占比近半,约40%的动作以batched actions形式输出,这一设计大幅缩短了执行轨迹、拓展了能力边界并提升了执行效率。例如,跨网站调研产品、核对价格、生成比价方案等任务均可通过该机制高效完成。

在训练层面,Qwen-UI-Agent支持在超过100步的超长轨迹上进行在线强化学习训练,约10000个并发环境可同时进行rollout,配合模型自适应课程学习,持续攻克长程任务。这一训练机制为模型在复杂多步任务中的稳定性提供了支撑。

Qwen-UI-Agent的发布标志着GUI智能体领域竞争进入新阶段。随着大模型在真实世界交互场景中的能力持续提升,以屏幕为界面的智能体有望在办公自动化、信息检索、跨应用协同等企业服务场景中发挥更大作用。阿里同步公开了技术报告、项目主页和GitHub代码仓库,为开发者提供了进一步研究和应用的入口。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
英伟达高管黄敏珊现身世界机器人大会,聚焦具身智能与物理AI合?
上一篇 3小时前
估值432亿的全球龙头,英伟达投了
下一篇 2025年6月3日 下午2:51

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部