三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

阿里:迈向真实世界的GUI智能体

阿里:迈向真实世界的GUI智能体

📖标题:Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
🌐来源:arXiv, 2607.28227v1

🛎️文章简介
🔸研究问题:如何缩小GUI智能体在模拟基准测试与真实世界设备应用之间的性能差距,实现跨平台、长程且主动的可靠执行?
🔸主要贡献:论文提出了Qwen-UI-Agent,一个以真实世界为中心的基础GUI智能体,通过混合动作空间、在线强化学习及主动服务层,在移动端和电脑端任务上达到最先进水平。

📝重点思路
🔸构建真实设备移动运行环境,包含百余台物理设备和健康感知调度器,解决模拟到现实的鸿沟,支持大规模并发训练与评估。
🔸设计统一的混合动作空间,将GUI操作、CLI命令及API调用结合,并支持批量动作生成,提升执行效率与任务覆盖范围。
🔸建立Agent驱动的数据飞轮,自动化完成任务合成、环境构建、失败诊断及迭代优化,减少人工干预并加速能力进化。
🔸采用分阶段训练策略,包括领域条件专家微调、针对局部错误的动作强化学习以及面向长程决策的大规模在线强化学习。
🔸引入Harness层实现跨平台工作流与主动服务,基于手机通知预判用户需求,并在手机与电脑间无缝保持上下文状态执行任务。

🔎分析总结
🔸在真实设备移动端基准MobileWorld-Real上取得92.2%的成功率,显著优于Gemini 3.1 Pro、Claude Opus 4.8等前沿闭源模型。
🔸在电脑使用任务OSWorld-Verified上获得79.5%的成绩,排名第二;在OSWorld-v2中部分进度得分达40.0%,且步骤更少,证明混合动作空间的高效性。
🔸在浏览器导航WebArena中达到73.6%的成功率,超越所有对比基线;在DeepSearch任务中展现出强大的多源信息检索与综合验证能力。
🔸行为分析显示,真实设备上的失败主要源于探索不足、弹窗干扰及UI误读,而Qwen-UI-Agent通过真实数据训练有效缓解了这些问题。
🔸消融实验表明,动作强化学习修正了重复错误和局部决策失误,在线强化学习则显著提升了长程任务中的规划与状态跟踪能力。

💡个人观点
论文摆脱了对纯模拟环境的依赖,构建了大规模真实设备集群进行训练与评估,提升了智能体的鲁棒性。

← 返回列表