腾讯UI-Mate:多模态演示解锁GUI智能体,OSWorld达77.0%
UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

图形用户界面(GUI)智能体展现出了将自然语言意图转化为跨软件生态多步操作的巨大潜力。然而,从基准测试的进步到真实世界的可靠部署,GUI智能体一直被两大瓶颈死死卡住:一是训练层面的数据稀缺与分布偏差;二是交互层面的提示词歧义与执行不可靠。真实世界的工作流高度依赖用户个人的特定工具习惯和默契约定,用户通常只会给出简短的结果导向指令,而省略掉具体的过程细节。这种未言明的指令导致智能体在不同运行次序中产生随机的变化——一次成功的执行,完全可能在下一次同样的请求中遭遇失败。
ArXiv URL:https://arxiv.org/abs/2608.15930v1
为了彻底打通这一阻碍,腾讯主导的研究团队推出了UI-Mate,这是一个将环境基座训练栈(Environment-Grounded Training Stack)与上下文演示学习(In-Context Demonstration Learning)深度融合的开源基础GUI智能体。该方法不仅解决了模型“能学到什么”的训练瓶颈,更解决了模型“如何稳定发挥”的交互瓶颈。实验数据直接证明了该路线的统治力:UI-Mate-27B 在通用计算机使用基准测试上创下了开源权重的新SOTA,在 OSWorld-Verified 上得分达到 77.0%,在 WindowsAgentArena 上达到 66.2%。更关键的是,在全新提出的 OSWorkerBench 评测中,仅仅提供一次上下文演示,就能将严格成功率从 17.2% 翻倍提升至 35.4%,将长视野任务的可靠性推向了新的高度。
打破GUI智能体的“不可能三角”:训练与交互的双重困境
在当前的智能体研究中,GUI交互数据无法脱离其产生的环境独立存在。与静态的文本或图像语料库不同,一条GUI操作轨迹只有在满足三个条件时才具备学习价值:初始状态能够被实例化、动作可以被真实执行、结果能够被客观验证。虽然近期的研究通过大规模合成经验和跨平台轨迹收集来应对数据量的问题,但单纯的规模堆砌并不能保证能力覆盖的全面性。数据生产天然倾向于那些“容易实例化”的短周期、单应用任务。相反,跨应用的信息传递、长周期的工作流以及从执行错误中恢复的能力,在训练数据中极其稀缺。在这样倾斜的分布上训练,智能体极易养成狭隘且脆弱的执行模式。
除了训练瓶颈,即使是能力极强的智能体也面临着交互瓶颈。日常办公任务的形态往往由用户特定的文件夹组织、命名约定和输出格式模板所塑造,而不是一套放之四海而皆准的标准程序。如果要求用户在提示词中把每一个微观选择都写得清清楚楚,其工作量甚至会超过手动完成该任务。因此,用户给出的指令注定是高度浓缩的。这些被省略的过程细节,交由智能体在执行时“盲猜”,直接导致了平均成功率掩盖下的极度不稳定。对于终端用户而言,可靠性并不是能力的附属品,而是体验智能体能力的唯一途径。
UI-Mate 的核心破局点在于,它并没有试图用更庞大的静态数据集去暴力破解,而是构建了一个完整的动态闭环系统。在训练端,它通过一个环境基座数据管道,自动构建任务和可执行环境,收集并过滤轨迹,并通过一个层级化的能力树来诊断和重新平衡数据覆盖率。在交互端,它引入了 DemoCUA 机制,通过多模态演示将用户的过程意图传达给模型,从而避免了让模型在模棱两可的指令中盲目试错。
重新定义任务公式:从盲目预测到演示引导的自适应执行
在传统的通用计算机使用场景中,一个任务通常被定义为指令 $x$ 与环境 $\mathcal{E}$ 的组合,即 $\mathcal{T}=(x,\mathcal{E})$。智能体在每个时间步 $t$ 需要根据历史信息 $h_t$ 和当前屏幕观察 $o_t$ 生成动作 $a_t$,其策略可以表示为 $y_t=(r_t,a_t)\sim\pi_\theta!\left(\,\cdot\mid x,\,h_t,\,o_t\right)$。最终,一个可执行的验证器会检查环境的最终状态并返回一个二元结果 $R(\tau)\in{0,1}$。
UI-Mate 引入的演示引导机制彻底改变了这一策略条件。当提供了一个演示 $d$(例如用户之前完成类似任务的屏幕录像)时,UI-Mate 并不会像传统的宏录制器那样将其视为一串死板的动作序列直接重放。相反,它会将演示离线分割成一个有序的子任务集合:
\[d=(s_1,\ldots,s_N),\hskip 20.00003pts_n=\bigl(\ell_n,\,v_n,\,u_n\bigr)\]在这里,每个子任务包含目标描述 $\ell_n$、视觉状态 $v_n$ 和操作描述 $u_n$。在执行时,智能体获得的引导信号 $g_t$ 包含了当前需要关注的子任务以及整体进度清单。此时的策略更新为依赖于演示指导的条件概率:
\[y_t=(r_t,a_t)\sim\pi_\theta\!\left(\,\cdot\mid x,\,h_t,\,o_t,\,g_t\right)\]这一数学表达蕴含了两个极其重要的系统设计哲学。其一,$g_t$ 是一个“先验(prior)”,而不是“强制目标(target)”。这意味着演示中提供的底层操作 $u_{n_t}$ 可能缺少当前真实屏幕上所需的细微操作,或者引用的元素在当前状态下不可见。在任何时候,实时的视觉观察 $o_t$ 都对演示内容保留“一票否决权(veto power)”。只有当实时的屏幕状态与动作真正匹配时,智能体才会采纳演示;否则,它会根据实时观察重新规划。其二,这种设计并没有改变智能体的最终优化目标 $\mathbb{E}[R(\tau)]$。演示只是改变了策略的条件输入,因此,当没有任何有效演示(即 $g_t=\varnothing$)时,UI-Mate 依然退回为一个极其强大的通用计算机使用智能体。
环境基座的数据飞轮:告别“脆弱的合成数据”
为了支撑起这样强大的策略模型,UI-Mate 设计了一个精密的闭环数据飞轮系统,将指令策划、环境构建、任务生成和轨迹过滤无缝整合。

高质量的指令是数据飞轮的起点。为了避免指令过于单一,UI-Mate 整合了四种互补的数据源:来自真实用户活动的开源数据集确保了基础的日常覆盖度;从失败的智能体运行中分解出的原子子任务,专门用于攻克模型当前的软肋;从真实的文档、表格、PPT和静态网站中生成的指令,迫使模型去理解具体的实体关系而非合成的占位符;最后,基于应用程序规范构建的能力树,负责挖掘那些容易被日常工作流遗漏的细粒度操作。
有了指令之后,系统需要将其转化为可运行的环境。传统的做法往往使用大语言模型(LLM)去凭空生成一些简短、同质化的文档作为任务素材。这种合成材料往往存在大量“捷径”,严重扭曲了任务的真实难度。UI-Mate 采取了截然不同的物理资源挂载策略:它索引了大量真实的开源文档、演示文稿、音视频文件,在构建环境时,LLM会直接检索并复制这些真实文件。不仅如此,系统还会随机化操作系统的壁纸、桌面布局、应用设置和侧边栏位置。这种环境级别的随机化,强制模型去理解GUI的底层逻辑,而不是死记硬背某种特定的视觉排版。
在环境准备就绪后,UI-Mate 的内部云虚拟机集群开始进行大规模并发执行。为了保证喂给模型的数据是绝对干净可靠的,系统引入了多模态法官(Multimodal Judge)进行双重过滤。第一重校验环境的初始状态是否合法、任务是否自相矛盾;第二重则是严格的步级结果过滤。法官会从指令中提取独立可验证的交付物,并在整个GUI观察和动作序列中追踪证据。只有当每一个交付物都能找到明确的步骤支撑时,这条轨迹才会被保留。这种设计彻底杜绝了模型因为环境恰好崩溃而“蒙对”结果,或者模型输出幻觉掩饰失败的情况。
GUI能力树与在线强化学习的数据重平衡
在大规模自动化数据收集中,“廉价任务”不可避免地会占据压倒性的比例。为了防止模型的局部能力过度膨胀而长视野能力萎缩,UI-Mate 引入了一套动态生长的 GUI 能力树(GUI Capability Tree)。

这个能力树将所有可能的操作划分为应用层、粗粒度能力层和细粒度操作层。每一条收集到的任务轨迹都会被映射到这棵树的具体节点上。系统实时监控各节点的覆盖率、数据密度以及智能体的运行成功率。当发现某个细粒度操作(例如跨应用复制特定格式的表格)数据密度极低或运行失败率异常高时,这部分指标会立刻作为负反馈信号传导给数据生成引擎,在下一轮循环中定向增加该类型任务的生成预算。这种闭环诊断机制,使得数据飞轮具备了自我修复分布倾斜的能力。
与此同时,真实人类标注的数据也被纳入了这一体系。人类操作天然包含复杂的长尾行为,但也常常伴随录制瑕疵(例如光标提前悬停暴露了目标位置)。UI-Mate 设计了严格的观察修复协议:一旦发现操作前的截图发生了“目标泄漏(target leakage)”或者界面渲染不完整,系统会在时间窗口内向前或向后回溯,寻找干净的缓冲帧进行替换。在彻底清洗并由教师模型补齐推理过程后,这些宝贵的人类长尾经验被无损地注入到了模型的认知中。
更为硬核的是,UI-Mate 针对基于可验证奖励的强化学习(RLVR)设计了严苛的任务束(Task Bundles)。一个能够用于 RL 的任务,不仅需要有指令 $x$ 和环境 $\mathcal{E}$,还必须明确界定初始状态 $\mathcal{E}_0$ 和可以到达的参考完成状态 $\mathcal{E}^\star$。针对每个任务构建的独立可执行验证器 $R$,必须死死守住一个执行不变量:
\[R(\mathcal{E}_0)=0,\hskip 20.00003ptR(\mathcal{E}^\star)=1\]只有经过生成和双重压力测试、满足这一不变量的验证器,才能在数以万计的并发强化学习环境中,为模型提供绝对准确的奖励信号。
OSWorkerBench:为长周期复杂任务设立的新标尺
为了准确衡量这种架构带来的实际提升,评估体系不能仅仅停留在单指令的“真空环境”里。为此,研究团队构建了 OSWorkerBench 基准测试。这是一个高度贴近真实办公场景的深度评测集,包含了 100 个长视野办公任务,横跨 41 个常见应用程序和 10 个不同的职业工种。
这个基准测试有两个显著特点:第一是强调信息的跨时空流转。其中 67 个任务属于“长记忆(Long-Memory)”类型,要求模型在漫长的操作后依然能回忆起早期动态生成的信息;49 个任务属于“多应用(Multi-App)”类型,需要模型在至少三个独立的软件之间进行实质性的数据迁移和加工。
第二,它首创了双轨演示评估协议。在“自我演示(self-demo)”设置中,系统使用强模型在相同任务上成功运行的轨迹作为多模态引导;在“变体演示(variant-demo)”设置中,系统则提供人类录制的、语义相关但具体参数和环境并不完全相同的参考录像。通过在控制指令、初始环境、交互预算完全一致的前提下,对比模型有无演示指导的表现,OSWorkerBench 能够无比精准地剥离出“演示可用性”为模型带来的增益边界。
SOTA之上的质变:化解不确定性
在严苛的实验环境下,UI-Mate 展现出了断崖式的领先优势。作为一个 27B 参数规模的开源模型,它在 OSWorld-Verified 上斩获 77.0% 的惊人成绩,在 WindowsAgentArena 上拿下 66.2%,全面确立了开源权重在通用计算机使用领域的全新 SOTA 标准。
而在最能体现复杂工作流驾驭能力的 OSWorkerBench 评测中,UI-Mate-27B 在纯指令模式下实现了 41.0% 的严格成功率和 76.9% 的任务进度,这一成绩比其底座模型 Qwen3.6-27B 分别暴涨了 17.7 和 24.5 个百分点。
但最令人震撼的数据,发生在该框架引入一次上下文演示之后。在 OSWorkerBench 的 33 个自我演示子集上,当提供了一个多模态演示作为引导时,UI-Mate-27B 的严格任务成功率直接从 17.2% 飙升至 35.4%,任务进度也从 67.9% 跃升至 81.1%。这意味着,模型不再是盲目地在界面中试探,而是真正理解了人类操作背后的“意图图纸”。它知道何时该严格遵循录像中的步骤,何时该根据当前真实的弹窗或异构的界面进行自我修正。
UI-Mate 体系的出现,标志着大模型在接管计算机控制权这条道路上跨过了极其关键的一步。它用扎实的工程实践证明:要让智能体在真实桌面上成为可靠的帮手,我们需要的不仅仅是一个能看懂截图的视觉语言大模型,更需要一个能从根源上治愈训练分布失衡、并在执行端优雅接收人类非结构化指导的端到端操作系统。