Qwen-UI-Agent:混合GUI+CLI,真实手机环境成功率达97.5%
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
图形用户界面(GUI)是人类访问数字服务的主要入口。如果大模型能够理解界面、自主点击滑动,就能成为操控现有数字设备的通用执行器,免去为每个服务开发专用API的繁琐。然而,当前多数表现惊艳的 GUI Agent 其实都患有“温室病”。它们在纯模拟器和标准测试集上刷出了很高的分数,可一旦被放到真实的手机或电脑上执行真实任务,往往会因为弹窗干扰、复杂的应用嵌套、权限请求或网络波动而手足无措。
ArXiv URL:https://arxiv.org/abs/2607.28227
为了跨越从模拟基准到真实世界可用性之间的鸿沟,Qwen-UI-Agent 提出了面向真实世界的新一代基础 GUI Agent 架构。这项工作不满足于在沙箱里演示能力,而是从环境基础设施、动作空间定义到训练方法进行了彻底重构。该模型能够跨越移动端、PC端、Web端以及深度搜索环境,执行跨平台的长流程工作流;并且独创性地将 GUI 图形操作与 CLI 命令行执行混合在同一个动作空间中。
在实验验证中,Qwen-UI-Agent 展现了极强的真实环境适应力。在包含超过 100 款 App 的真实设备测试集 MobileWorld-Real 上,它达到了 92.2% 的成功率,在另一个真实设备基准 AndroidDaily 上更是取得了 97.5% 的惊人成绩。这些结果显著超越了诸如 Claude Opus 4.8、Gemini 3.1 Pro 以及 GPT-5.6 Sol 等闭源前沿模型。

从模拟沙箱走向真实的复杂世界
现阶段 GUI Agent 面临的最核心瓶颈在于 Sim-to-Real(从模拟到真实)的差距。许多模型在干净的模拟环境中运行良好,因为那里不会突然跳出软件更新提示,不会遇到严格的验证码,也不会因为设备卡顿导致操作丢失。但在真实的移动设备上,应用功能远比模拟器复杂,UI 布局随时变动,系统级中断也是家常便饭。
Qwen-UI-Agent 的破局思路是从源头解决数据与环境脱节的问题。研究团队并没有单纯依靠更庞大的沙箱数据,而是直接构建了一个包含 100 多台实体手机、支持 150 多款真实应用的大规模真实设备移动运行环境(Real-device mobile runtime)。这使得模型在数据收集、强化学习训练和最终评估阶段,始终面对的是带有真实应用状态和网络连接的复杂物理环境。
为了让这个包含上百台真实手机的集群能够稳定地支持大模型训练,研究者引入了一个“健康感知调度器”(Health-aware scheduler)。当一个任务进入队列时,调度器会实时评估每一台手机的健康状态、应用账号权限以及网络连通性。如果模型在执行过程中由于真实环境的不可控因素(如应用服务宕机、设备突然断网)导致失败,系统内部署的视觉语言模型裁判(VLM-based judge)会介入。它通过分析完整的回放轨迹,将“模型决策失误”与“环境故障”区分开来。确认的环境故障将被隔离并触发设备修复,而只有确认有效的交互轨迹才会流入训练集。这种设计有效剥离了真实世界的噪声,让模型能够在不稳定的物理载体上学到稳定的操作策略。

不仅限于手机端,Qwen-UI-Agent 被设计为一个能穿梭于异构数字环境的基础 Agent。以往的智能体大多局限于单一领域,做手机 Agent 的不管桌面,做 Web Agent 的不碰本地文件。但在实际工作流中,用户常常需要将任务在手机和电脑间接力。
为了支撑跨域执行,模型配备了一个轻量级的挂载层(Harness layer)。这个层充当了不同平台间的“状态总线”,使得任务上下文得以保留。例如,Agent 可以在桌面端接收到一个处理排班的任务,通过桌面环境的命令行与界面查找资料;遇到需要通过手机端接收验证码或特定 App 权限的操作时,工作流能够无缝转移到移动环境中继续进行。这种跨平台的一致性,将分散的多域能力整合成了一体化的真实任务执行力。

GUI与CLI混合的统一动作空间
决定 Agent 执行效率和能力天花板的,是它能向环境输出什么动作。传统的 GUI Agent 只能模拟人类的点击、滑动和键盘输入。对于结构化的任务(比如批量重命名文件、处理数据表格或是下载依赖包),纯界面交互显得极其低效。人类在面对这些任务时会自然地打开终端使用命令行,但先前的模型很难在纯界面操作和纯底层代码之间自如切换。
为了解决这个问题,Qwen-UI-Agent 将 GUI 操作和基于 Bash 的命令行操作(CLI)融合进了一个统一的动作空间。模型的每一步决策不仅可以输出屏幕点击坐标,还可以直接生成命令行指令,甚至是调用特定外部服务的 API。这种混合机制让 Agent 能够“对症下药”:当任务依赖于复杂的视觉界面和特定的 App 逻辑时,它调用 GUI 动作;当任务涉及文件操作或系统状态查询时,它直接抛出 CLI 指令。
更关键的是,该动作空间支持批处理动作(Batched actions)。在传统的马尔可夫决策过程中,Agent 每次只能执行一个动作,随后必须等待环境渲染出新的屏幕截图进行观察后,才能决定下一步。但对于一些确定的连贯操作,比如连续向下滚动页面三次,或者在输入框中填入文字后紧接着点击“确认”按钮,中间的观察步骤完全是多余的。
Qwen-UI-Agent 能够在单个模型推理轮次内,生成一个包含多个有序动作的批次序列。在这个批次中,GUI 点击和 CLI 命令可以交错执行。执行完毕后,所有命令行的输出会被汇总压缩,作为下一步的观察输入。在实际的计算机控制任务中,研究显示有超过 40% 的动作输出被模型打包成了批处理形式。这一机制大幅缩减了长任务的执行步数,降低了因过度频繁推理而导致的任务迷失概率。

支撑长程任务的在线强化学习与数据飞轮
一旦把任务放到真实世界并赋予更强大的混合动作,Agent 面临的任务视界(Horizon)就会急剧拉长。订购一张跨国机票或者整理一份跨越三个软件的数据报告,往往需要数十甚至上百步的连贯操作。在如此长的执行轨迹中,单纯依靠传统的监督微调(SFT)和人工收集的数据是无法让模型学会长期规划和纠错的。
为此,Qwen-UI-Agent 在训练阶段引入了针对超长轨迹的在线强化学习(Online RL)。对于动辄超过 100 步交互的复杂任务,模型必须学会如何跟踪状态进度,进行中间验证,以及在点击错误后如何利用返回按钮或撤销指令来恢复执行状态。为了满足在线 RL 对海量经验片段的需求,研究框架支持了大约 10,000 个沙箱环境并发运行以加速 rollout 轨迹采集。同时,系统还搭载了自适应的课程学习机制,动态筛选出成功率处于中间地带(既非轻易通过也非完全失败)的任务进行重点训练,确保强化学习的样本始终处于模型的“最近发展区”。
与在线 RL 相配合的,是一个高度自动化的 AutoResearch 风格数据飞轮。开发一个前沿的 GUI Agent 过去需要消耗巨大的人力资源去人工设定任务、编写评测脚本、分析模型到底死在哪一步。Qwen-UI-Agent 将大部分迭代工作交给了 Agent 自身。
在这个闭环中,高能力的视觉语言模型被用作任务生成器和校验器。它们分析当前策略在哪些领域的成功率低下,自动生成新的环境上下文和任务目标;随后通过拒绝采样(Rejection Sampling)收集高质量的成功轨迹并入训练集。人类工程师的职责从“逐条写标注”转变为“设定更高维度的演化目标”和进行少量关键节点的干预,极大地加速了模型能力获取的迭代周期。
主动式服务:从被动听令到场景感知
Qwen-UI-Agent 在系统设计上的另一大突破,是摆脱了传统 Agent 只能响应明确指令的“被动工具”定位。真实世界中的数字需求往往是由设备本身发出的信号触发的。
系统内置了一个基于移动端通知的主动服务挂载层。当用户的手机收到一条航班取消的短信或应用推送时,Qwen-UI-Agent 能够直接捕获这一数字信号。它不会干等用户发号施令,而是主动识别被影响的日程,通过 DeepSearch 环境调用 API 检索可替代的航班信息,对比用户日历后生成一份备选方案。随后,Agent 会通过屏幕弹窗或对话请求用户的最终确认。
只有在获取授权后,模型才会使用 GUI 动作完成重新订票,并利用 CLI 操作将更新后的日程推送到相关协作人的邮箱。这种“环境感知-主动提议-用户确认-跨端执行”的工作流,展示了 GUI Agent 走向真正个人助理的形态演变。
实验结果与行业标杆对比
在多维度的能力评估中,Qwen-UI-Agent 交出了一份极具说服力的答卷。
在移动设备控制领域,研究者不仅在标准模拟基准 MobileWorld 上测试,更在其扩展的真实物理设备基准 MobileWorld-Real 上进行了严苛评估。该基准包含超过 400 个横跨百余款 App 的复杂任务。Qwen-UI-Agent 取得了 92.2% 的高成功率,将 Claude Opus 4.8(84.7%)、GPT-5.6 Sol(85.4%)和 Gemini 3.1 Pro(86.2%)等顶尖闭源模型远远甩在身后,也以 3.5 个百分点的优势超越了 Seed 2.1 Pro。在另一项真实安卓任务测试 AndroidDaily 中,它更是逼近了 97.5% 的近乎完美表现。
在更强调桌面端混合操作的 OSWorld 体系中,Qwen-UI-Agent 同样展现了顶尖实力。在 OSWorld-Verified 测试中,它获得 79.5% 的成功率;而在难度陡增的 OSWorld-v2 评测中,尽管绝对成功率普遍较低,但 Qwen-UI-Agent 在反映任务推进程度的“部分进度得分(partial-progress score)”上达到了 40.0%,并大幅超越了 Qwen 3.7 Plus 和 MiniMax M3。更为核心的是,得益于 CLI与批处理动作的支持,其完成任务所需的平均步数比基线模型骤降了 58.4%,展现了极高的操作经济性。
在 WebArena(浏览器自动化)基准上,Qwen-UI-Agent 取得了 73.6% 的成绩,依旧以显著优势击败了 Opus 4.8 和 Gemini 3.1 Pro。同时,在信息获取任务环境 DeepSearch 中,它在 BrowseComp 基准上得分达到 64.1%,不仅证明了其控制界面的能力,也验证了其在海量网页中检索并整合信息的深度理解能力。
值得强调的是,如此拔尖的专用 Agent 能力并没有以牺牲模型的通用智力为代价。在包含 MMMU-Pro、MMLU-Pro 等通用推理任务的评估中,Qwen-UI-Agent 的表现在保持基础模型原有智商基线的同时,完全碾压了此前业界中只为 GUI 而特别微调的窄领域模型。
综合来看,Qwen-UI-Agent 代表了目前大模型向数字世界执行器演化的一条极其务实的路径。它没有沉迷于在越来越简化的模拟沙箱中刷分,而是直面物理设备的不可控性,用极其高效的动作空间和工程调度体系夯实了底盘。无论是超长序列强化学习的落地,还是主动式跨平台服务的尝试,都在向行业证明:真正有商业价值的 GUI Agent,必须且已经能够,在复杂的真实世界里干活了。