ithome
科技
采集 2026-08-20T10:09:30+00:00
阿里发布 Qwen-UI-Agent
原始标题:阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕
来源
ithome
发布时间
2026-08-20T09:45:51
采集批次
2026-08-20-10
字数
755
URL 指纹
902631035c5811df
📌 AI 总结(143 字)
阿里巴巴推出面向真实操作场景的 GUI 智能体基座模型 Qwen-UI-Agent,覆盖手机、电脑、网页及深度搜索环境。该模型在多项 GUI 任务中取得领先成绩,并借助覆盖百余台设备和应用的真机环境提升执行能力。其还引入全流程安全判断、命令行操作和批量动作机制,并支持超长轨迹强化学习。
📄 正文(755 字)
阿里巴巴正式推出 Qwen-UI-Agent,这是一款以真实世界操作为中心的 GUI 智能体基座模型,适用场景涵盖移动端、电脑端、网页端和深度搜索环境。 在移动端任务中,Qwen-UI-Agent 在 MobileWorld 上取得 82.1% 的成绩,领先多款旗舰模型;真机基准 MobileWorld-Real 得分达到 92.2%,AndroidDaily 得分高达 97.5%。在电脑端,OSWorld-Verified 得分 79.5%,OSWorld-v2 Partial 得分 40.0%,同时比基线减少 58% 的执行步数。 在网页浏览和深度搜索方面,模型在 WebArena 上取得 73.6%,BrowseComp-ZH 得分达到 75.0%。GUI Grounding 评测中,ScreenSpot-Pro 得分 81.5%,并在多个相关基准上刷新最高成绩。模型的通用能力和 Agentic 能力也保持在训练基座模型水平,部分任务表现更强。 为提升真实设备上的操作能力,Qwen-UI-Agent 搭建了覆盖 100 多台真实手机、150 多个应用的真机移动环境,并建设包含 400 多项任务、100 多个应用的 MobileWorld-Real 基准,用于任务构建、轨迹采集、训练和评测。 安全机制贯穿任务执行全过程。遇到违法或高风险请求时,模型会拒绝操作并终止任务;涉及支付、数据删除、隐私授权等敏感操作时,会在关键步骤暂停并请求用户明确确认。 模型还支持命令行操作和单次批量输出多个动作。在电脑任务中,近半动作通过命令行完成,约 40% 的动作采用批量输出,从而缩短执行轨迹。训练方面,该模型支持超过 100 步的超长轨迹在线强化学习,并可同时运行约 10000 个环境。