首页/ 资讯/ Qwen-UI-Agent 阿里通义推出的 GUI 智能体基座模型

Qwen-UI-Agent 阿里通义推出的 GUI 智能体基座模型

灵犀编辑部 2026-08-21 2 阅读 AI资讯

Qwen-UI-Agent是什么

Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI 与命令行混合执行,可完成跨应用长程任务。内置安全机制,危险请求直接拒绝,支付、删除等敏感操作主动交还用户确认。在 MobileWorld、WebArena 等基准上全面超越 GPT-5.6 、Claude Opus 等旗舰模型,是当前真实世界可用性最强的 GUI Agent 之一。

Qwen-UI-Agent

Qwen-UI-Agent的主要功能

· 跨设备 GUI 操作 :在手机、电脑、浏览器上自动点击、输入、滑动,完成界面交互。

· 真机多应用工作流 :跨 150+ 真实 App 执行复杂长链任务,如查地图→找餐厅→订座→发日程。

· GUI + CLI 混合执行 :既能点界面,也能跑命令行,支持一次输出多个批量动作提速。

· 安全边界管控 :违法请求直接拒,支付、删文件、隐私授权等敏感操作主动弹窗交还用户确认。

· 长程任务处理 :稳定执行 100+ 步的调研、数据分析、报告生成等超长任务。

· 精准界面定位 :在 ScreenSpot-Pro 等 grounding 基准上刷新 SOTA,精准识别屏幕元素位置。

Qwen-UI-Agent的技术原理

· 真机训练环境 :搭建 100+ 台真实手机、150+ 应用的真机集群,直接采集真实轨迹并用于训练与评测,弥合模拟环境与真实设备之间的性能鸿沟。

· 混合动作空间 :模型同时掌握 GUI 操作(点击、滑动、输入)与 CLI 命令,引入 Batched Actions 机制,支持单次决策并行输出多个动作,使电脑任务中 CLI 占比近半,整体执行步数显著缩短。

· 长程在线强化学习 :支持在超过 100 步的超长轨迹上进行端到端在线 RL 训练,依托约 10,000 个并发环境并行 rollout,配合自适应课程学习,持续攻克高难度长程任务。

· 安全对齐机制 :将安全判断内嵌于任务执行全链路,通过前置分类识别违法或高风险请求并直接终止;对支付、数据删除、隐私授权等敏感场景,在关键节点触发 ask_user 接管,确保危险请求不执行、敏感操作不擅自决定。

· 多模态 Grounding 与通用能力保持 :在 GUI 专用训练的同时保留基座模型的通用推理与 agentic 能力,使其既能精准定位屏幕元素(刷新多项 grounding SOTA),能应对真实世界中的长尾知识与工具调用需求。

挖挖<a class=GitHub" loading="lazy" />

如何使用Qwen-UI-Agent

· 阅读技术报告 :访问 arXiv 论文了解模型架构、训练方法与 8 项基准的详细评测结果。

· 浏览项目主页 :打开 tongyi-mai.github.io/Qwen-UI-Agent 观看 5 个真实场景的真机演示与交互案例。

· 跟踪开源仓库 :关注 GitHub Tongyi-MAI/MAI-UI 获取后续可能发布的模型权重、代码与部署文档更新。

· 运行基准评测 :使用配套仓库 Tongyi-MAI/MobileWorld 的 Docker 环境,对模型进行可复现的移动端 GUI 能力测试。

Qwen-UI-Agent的核心优势

· 真机闭环 :基于 100+ 台真实手机、150+ 应用训练与评测,自建 MobileWorld-Real 真机基准,直接弥合模拟到真实的鸿沟。

· 全面 SOTA :在 MobileWorld、OSWorld、WebArena、ScreenSpot-Pro 等 8 项核心基准上全面超越或持平 GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro 等旗舰模型。

· 混合执行提速 :统一 GUI 点击与 CLI 命令,支持单次决策批量输出多个动作,电脑任务中约 40% 为批量动作,整体节省近 58% 执行步数。

· 长程在线强化学习 :支持 100+ 步超长轨迹的端到端在线 RL,依托约 10,000 并发环境并行 rollout,持续攻克复杂长程任务。

· 内置安全边界 :违法/危险请求直接拒绝终止;支付、删数据、隐私授权等敏感操作在关键节点主动停手,弹窗交还用户确认后再继续。

Qwen-UI-Agent的项目地址

· 项目官网 :https://tongyi-mai.github.io/Qwen-UI-Agent/

· GitHub仓库 :https://github.com/Tongyi-MAI/MAI-UI

· 技术论文 :https://tongyi-mai.github.io/Qwen-UI-Agent/Qwen-UI-Agent-Technical-Report.pdf

Qwen-UI-Agent的同类竞品对比

对比维度 | Qwen-UI-Agent | MAI-UI

产品定位 | 跨移动、电脑、浏览器、DeepSearch 的统一 GUI Agent 基座 | 移动端 GUI Agent 基座模型

MobileWorld | 82.1% | 41.7%

执行方式 | GUI + CLI 混合,支持批量动作(Batched Actions) | 以 GUI 点击为主

长程能力 | 100+ 步在线 RL,10,000 并发环境 rollout | 基础长程任务

跨平台 | 手机、电脑、浏览器、DeepSearch 统一模型 | 主要聚焦移动端

主动服务 | 能从航班取消等真实通知信号主动发起任务 | 被动响应用户指令

安全机制 | 分层安全:违法直接拒,敏感操作弹窗交还用户确认 | 基础安全对齐

数据飞轮 | AutoResearch 式数据飞轮:Agent 自建任务、诊断失败、规划迭代 | 人工驱动迭代

Qwen-UI-Agent的应用场景

· 本地生活探店 :自动跨高德、大众点评、小红书完成地址搜索、人气比对和口碑总结,一站式搞定约会探店。

· 行程会议联动 :查 12306 高铁班次、算地铁通勤时间,自动在钉钉创建带提醒的会议日程。

· 深度调研报告 :跨网站采集财报数据、运行分析脚本,自动生成 Excel、PPT 和 Word 交付物。

· 跨设备发票整理 :从手机相册提取发票照片,传到电脑分类归档,并生成结构化 Excel 报销单。

· 航班取消主动应急 :检测到航班取消通知后,自动搜索替代航班和高铁方案,推荐能赶上会议的最优选项并交还用户决策。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
🎯 输入关键词,AI 从 1000+ 工具中精准匹配推荐