Qwen-UI-Agent 阿里通义推出的 GUI 智能体基座模型
Qwen-UI-Agent是什么
Qwen-UI-Agent 是阿里巴巴通义团队推出的 GUI 智能体基座模型,能在手机、电脑和网页端像真人一样操作界面。模型基于 100+ 台真机、150+ 应用训练,支持 GUI 与命令行混合执行,可完成跨应用长程任务。内置安全机制,危险请求直接拒绝,支付、删除等敏感操作主动交还用户确认。在 MobileWorld、WebArena 等基准上全面超越 GPT-5.6 、Claude Opus 等旗舰模型,是当前真实世界可用性最强的 GUI Agent 之一。

Qwen-UI-Agent的主要功能
· 跨设备 GUI 操作 :在手机、电脑、浏览器上自动点击、输入、滑动,完成界面交互。
· 真机多应用工作流 :跨 150+ 真实 App 执行复杂长链任务,如查地图→找餐厅→订座→发日程。
· GUI + CLI 混合执行 :既能点界面,也能跑命令行,支持一次输出多个批量动作提速。
· 安全边界管控 :违法请求直接拒,支付、删文件、隐私授权等敏感操作主动弹窗交还用户确认。
· 长程任务处理 :稳定执行 100+ 步的调研、数据分析、报告生成等超长任务。
· 精准界面定位 :在 ScreenSpot-Pro 等 grounding 基准上刷新 SOTA,精准识别屏幕元素位置。
Qwen-UI-Agent的技术原理
· 真机训练环境 :搭建 100+ 台真实手机、150+ 应用的真机集群,直接采集真实轨迹并用于训练与评测,弥合模拟环境与真实设备之间的性能鸿沟。
· 混合动作空间 :模型同时掌握 GUI 操作(点击、滑动、输入)与 CLI 命令,引入 Batched Actions 机制,支持单次决策并行输出多个动作,使电脑任务中 CLI 占比近半,整体执行步数显著缩短。
· 长程在线强化学习 :支持在超过 100 步的超长轨迹上进行端到端在线 RL 训练,依托约 10,000 个并发环境并行 rollout,配合自适应课程学习,持续攻克高难度长程任务。
· 安全对齐机制 :将安全判断内嵌于任务执行全链路,通过前置分类识别违法或高风险请求并直接终止;对支付、数据删除、隐私授权等敏感场景,在关键节点触发 ask_user 接管,确保危险请求不执行、敏感操作不擅自决定。
· 多模态 Grounding 与通用能力保持 :在 GUI 专用训练的同时保留基座模型的通用推理与 agentic 能力,使其既能精准定位屏幕元素(刷新多项 grounding SOTA),能应对真实世界中的长尾知识与工具调用需求。
GitHub" loading="lazy" />如何使用Qwen-UI-Agent
· 阅读技术报告 :访问 arXiv 论文了解模型架构、训练方法与 8 项基准的详细评测结果。
· 浏览项目主页 :打开 tongyi-mai.github.io/Qwen-UI-Agent 观看 5 个真实场景的真机演示与交互案例。
· 跟踪开源仓库 :关注 GitHub Tongyi-MAI/MAI-UI 获取后续可能发布的模型权重、代码与部署文档更新。
· 运行基准评测 :使用配套仓库 Tongyi-MAI/MobileWorld 的 Docker 环境,对模型进行可复现的移动端 GUI 能力测试。
Qwen-UI-Agent的核心优势
· 真机闭环 :基于 100+ 台真实手机、150+ 应用训练与评测,自建 MobileWorld-Real 真机基准,直接弥合模拟到真实的鸿沟。
· 全面 SOTA :在 MobileWorld、OSWorld、WebArena、ScreenSpot-Pro 等 8 项核心基准上全面超越或持平 GPT-5.6、Claude Opus 4.8、Gemini 3.1 Pro 等旗舰模型。
· 混合执行提速 :统一 GUI 点击与 CLI 命令,支持单次决策批量输出多个动作,电脑任务中约 40% 为批量动作,整体节省近 58% 执行步数。
· 长程在线强化学习 :支持 100+ 步超长轨迹的端到端在线 RL,依托约 10,000 并发环境并行 rollout,持续攻克复杂长程任务。
· 内置安全边界 :违法/危险请求直接拒绝终止;支付、删数据、隐私授权等敏感操作在关键节点主动停手,弹窗交还用户确认后再继续。
Qwen-UI-Agent的项目地址
· 项目官网 :https://tongyi-mai.github.io/Qwen-UI-Agent/
· GitHub仓库 :https://github.com/Tongyi-MAI/MAI-UI
· 技术论文 :https://tongyi-mai.github.io/Qwen-UI-Agent/Qwen-UI-Agent-Technical-Report.pdf
Qwen-UI-Agent的同类竞品对比
对比维度 | Qwen-UI-Agent | MAI-UI
产品定位 | 跨移动、电脑、浏览器、DeepSearch 的统一 GUI Agent 基座 | 移动端 GUI Agent 基座模型
MobileWorld | 82.1% | 41.7%
执行方式 | GUI + CLI 混合,支持批量动作(Batched Actions) | 以 GUI 点击为主
长程能力 | 100+ 步在线 RL,10,000 并发环境 rollout | 基础长程任务
跨平台 | 手机、电脑、浏览器、DeepSearch 统一模型 | 主要聚焦移动端
主动服务 | 能从航班取消等真实通知信号主动发起任务 | 被动响应用户指令
安全机制 | 分层安全:违法直接拒,敏感操作弹窗交还用户确认 | 基础安全对齐
数据飞轮 | AutoResearch 式数据飞轮:Agent 自建任务、诊断失败、规划迭代 | 人工驱动迭代