UI-MOPD:多教师在线蒸馏!跨平台GUI智能体成功率达38.2%
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

随着多模态基础模型和智能体系统的快速演进,图形用户界面(GUI)智能体正经历从单平台任务执行向跨平台复杂交互的关键跨越。真实世界的数字工作流往往需要跨越桌面应用程序、移动端 App 和 Web 服务,这就要求智能体不仅能适应异构的 GUI 环境,还要准确保留各个平台独有的交互习惯。然而,现有的跨平台联合训练方法面临着严重的瓶颈:直接混合不同平台的数据往往会导致模型行为模式的混淆、特定平台能力的退化,甚至在持续学习中引发灾难性遗忘。
ArXiv URL:https://arxiv.org/abs/2607.04425v1
为了打破这一僵局,哈尔滨工业大学、清华大学、小米及浙江大学等机构的研究团队提出了一种全新的解决方案——UI-MOPD(Multi-Platform On-Policy Distillation)。这是首个将多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation)引入 GUI 智能体持续学习的方法。该方法通过为不同平台动态路由专属的教师模型,在强化学习过程中引入条件化、平台感知的行为约束,成功实现了在适应新平台的同时,完美保留已有平台的交互能力。
实验数据证实了这一机制的强大威力:在 OSWorld(桌面端)和 MobileWorld(移动端)基准测试中,UI-MOPD 分别取得了 38.2% 和 12.0% 的任务成功率,相较于基座模型实现了显著的相对提升。本文将深入拆解 UI-MOPD 的核心机制,探讨其如何通过数据基建、动态路由与在线蒸馏,优雅地解决跨平台 GUI 智能体面临的遗忘与混淆难题。
跨平台 GUI 交互的深层挑战与动机
构建跨平台 GUI 智能体的传统思路通常是“堆数据”或“直接融合”。开源社区已经提供了诸如 OpenCUA、OpenMobile 等数据集,研究者们也尝试通过混合监督微调(Mixed SFT)、混合强化学习或模型合并(Model Merging)来整合来自计算机、移动端或 Web 环境的监督信号。尽管这些方法在一定程度上拓宽了模型的平台覆盖面,但它们本质上是将跨平台学习视作异构信号的简单聚合。
这种简单聚合忽略了一个核心事实:不同平台的动作语义和可供性(Affordances)存在根本差异。
举个最直观的例子,当任务需要“返回上一个上下文”时,在桌面计算机上,智能体可能需要点击窗口的关闭按钮(X)或使用键盘快捷键;而在移动端,这一操作通常对应着点击底部的“返回”按键或执行侧滑手势。如果只是机械地将这两类数据混合进行联合训练,模型在优化过程中很容易将这两种截然不同的交互逻辑强行平均,最终产生一个“四不像”的策略。在持续学习的场景下,这种现象更为致命,新平台的训练信号会迅速覆盖旧平台的特征,导致灾难性遗忘。

如上图所示,UI-MOPD 的设计动机正是为了避免这种信号的粗暴混合。与简单的模型合并或混合监督微调不同,UI-MOPD 通过平台条件路由(Platform-Conditioned Routing)和多教师在线策略蒸馏,将特定平台的专业知识作为稳定的行为锚点(Behavioral Anchors),安全地注入到一个共享的 GUI 智能体策略中。
数据基石:Uni-GUI 数据集的构建
任何强大的智能体都离不开高质量的数据支撑。跨平台交互数据的一大痛点在于,现有数据集往往局限于单一平台,且存在无效动作、状态-动作对齐不准或任务粒度不一致等问题。
为了解决数据层面的瓶颈,研究团队首先构建了一个统一的跨平台数据收集框架。该框架能够以一致的动作接口和日志格式,从桌面和移动环境中持续采集交互数据。基于这一框架,团队收集了约 11 万步桌面环境和 5 万步移动环境的交互轨迹。
在经历了严格的清洗、过滤和质量控制后,最终形成了 Uni-GUI 数据集。该数据集包含近 1 万条高质量的跨平台交互轨迹。Uni-GUI 不仅为 UI-MOPD 提供了初始的监督微调(SFT)材料,更重要的是,它为后续多教师模型的训练奠定了坚实的基础。
UI-MOPD 的核心架构与运作机制
UI-MOPD 的整体训练流程被分为两个清晰的阶段,其核心思想是在线策略优化(Online Policy Optimization)与平台专属知识蒸馏的深度融合。

阶段一:平台专属教师的培育(Stage 1)
在这一阶段,研究人员利用 Uni-GUI 数据集中的高质量轨迹,对视觉-语言基础模型(如 Qwen3-VL-32B-Thinking)分别进行平台专属的监督微调。由此,孕育出两位“领域专家”:一位是精通桌面操作的桌面教师 $\pi_{\mathrm{ref}}^{d}$,另一位是深谙移动端交互的移动教师 $\pi_{\mathrm{ref}}^{m}$。
阶段二:多教师在线策略蒸馏(Stage 2)
这是 UI-MOPD 最为关键的技术创新。传统的知识蒸馏往往依赖于离线的静态轨迹,或者直接对多个专家模型的输出概率进行平均。UI-MOPD 则让统一的学生策略 $\pi_{\theta}$ 根据当前策略在线采样交互轨迹(Rollouts)。更为精妙的是,教师的监督信号并非无差别地施加于所有状态,而是仅仅针对学生模型真正访问到的状态,且严格遵循“对症下药”的平台条件路由。
平台条件路由(Platform-Conditioned Routing)
在强化学习的每次更新中,学生模型首先会基于混合平台的提示词(Prompts)采样出一批交互轨迹。随后,系统会根据轨迹所属的平台(桌面或移动端),将这一小批量数据进行划分。属于桌面端的轨迹被送往桌面教师 $\pi_{\mathrm{ref}}^{d}$ 处评估,而属于移动端的轨迹则交由移动教师 $\pi_{\mathrm{ref}}^{m}$ 评估。
这一机制彻底改变了 Kullback-Leibler (KL) 散度在传统 RLHF(基于人类反馈的强化学习)中的角色。在传统 RLHF 中,KL 惩罚项通常被用作一种保守的正则化手段,防止模型过度偏离初始策略。而在 UI-MOPD 中,KL 惩罚变成了一种精准定向的知识迁移工具。通过平台路由,强化学习在推动策略向着更高任务奖励方向优化的同时,路由教师施加的 KL 约束确保了特定平台的原生交互模式不会被其他平台的信号所覆盖。
高效的在线 KL 估计:K3 估算器
在实施在线蒸馏时,计算整个词表级别的全 KL 散度会带来极大的计算开销。为了实现高效训练,UI-MOPD 采用了 K3 估算器(K3 Estimator)。
K3 估算器仅仅依赖于学生模型和教师模型在实际采样出的 Token 上的对数概率。具体而言,对于第 $t$ 步采样的 Token,定义对数概率差为 $\delta_{t}^{(i)} = \log\pi_{\mathrm{ref}}^{(i)}(y_{t}\mid h_{t}^{(i)}) - \log\pi_{\theta}(y_{t}\mid h_{t}^{(i)})$,其指数形式为 $\rho_{t}^{(i)} = \exp(\delta_{t}^{(i)})$。K3 估算器给出的 Token 级别 KL 估计值为:
\[\hat{D}_{\mathrm{KL}}^{(t,i)} = \rho_{t}^{(i)} - \delta_{t}^{(i)} - 1\]在学生模型的采样分布下,该估算器不仅是非负的,而且是对真实 KL 散度的无偏估计。更重要的是,相比于直接的对数比值估计,K3 估算器在实践中展现出了更低的方差,确保了训练的稳定性。
自适应 KL 掩码(Adaptive KL Masking)
在强化学习的探索过程中,教师的约束力并非在任何时候都是绝对有益的。当某一组提示词对应的轨迹已经获得了足够高的基于规则的任务奖励时,如果继续施加严格的 KL 正则化,反而可能限制模型探索更优解的空间。
为此,UI-MOPD 引入了组级别的自适应 KL 掩码 $\mu^{(i)}$。当某个样本所在提示词组的平均奖励超过设定阈值时,掩码置为 0,从而移除教师惩罚;否则掩码为 1,保留教师指导。这一设计巧妙地平衡了任务探索与行为规范之间的关系,确保教师信号主要作用于任务反馈尚弱的薄弱环节。
结构化结果奖励设计
除了蒸馏机制,UI-MOPD 在强化学习的奖励函数设计上也针对 GUI 任务进行了定制。GUI 动作通常输出为包含动作类型、坐标、文本等维度的 JSON 格式。研究团队定义了一个匹配维度比例 $f_{a} \in [0,1]$。
如果动作完全正确($f_{a}=1$),奖励为 1.0;如果动作不可解析或完全无效,惩罚为 -1.0。关键在于,对于部分有效但并非全对的动作($0 \leq f_{a} < 1$),模型会给予 -0.5 的中等惩罚。这种中间态惩罚保留了有价值的奖励梯度,帮助策略在优势估计中区分“有瑕疵的动作”和“彻底的废动作”。
实验结论:破局跨平台能力评估
研究团队在 OSWorld 和 MobileWorld 这两个极具挑战性的交互式基准上,对 UI-MOPD 进行了详尽的评估。这两个基准不再局限于静态界面的理解,而是要求智能体执行长视距(Long-horizon)、依托于真实平台的复杂交互任务。
综合性能的全面领先
实验结果表明,在同等参数规模下,UI-MOPD 展现出了最为均衡且优异的跨平台能力。
-
在 OSWorld 上,UI-MOPD 取得了 38.2% 的任务成功率;
-
在 MobileWorld 上,其任务成功率达到了 12.0%。
相比之下,现有的基线模型往往存在严重的“偏科”现象。例如,专注于多平台的 GELab-Zero-4B 在移动端能拿到 10.9% 的分数,但在桌面端 OSWorld 上仅有 31.9%;而 GUI-Owl-7B 在 OSWorld 上能达到 34.9%,但在 MobileWorld 上却暴跌至 4.5%。
更值得注意的是,对比不同的集成策略,UI-MOPD 同样占据绝对优势。直接将桌面和移动数据混合进行微调(Mixed-SFT)并没有带来稳定的双端提升(移动端仅为 6.4%);而通过权重平均(Weight Averaging)或 TIES 合并(TIES Merging)进行的静态模型合并,在 MobileWorld 上的表现更是惨淡,TIES Merging 甚至降到了 0%。这些对比清晰地证明:面对跨平台 GUI 任务,基于物理环境信号的直接混合或参数合并是低效的,而 UI-MOPD 的平台条件化在线蒸馏能够更本质地传递专有平台的交互智慧。
静态 GUI 理解与基础定位能力的保持
跨平台强化学习的一大隐患是,模型在追求动态交互任务成功率的同时,可能会损失其底层的视觉定位(Grounding)和静态界面理解能力。
为了验证这一点,研究人员在 AndroidControl、ScreenSpot-Pro、ScreenSpotV2 以及 OSWorld-G 等静态基准上进行了评估。

结果显示,UI-MOPD 最大限度地保留了基座模型的底层定位能力。例如,在 ScreenSpotV2 上,UI-MOPD 的分数为 90.88%,几乎与基座模型的 91.27% 持平;在 OSWorld-G 上,甚至从 52.13% 小幅提升到了 52.84%。
形成鲜明对比的是,静态的模型合并方法(Model Merge)在这类底层能力测试中出现了灾难性的滑坡。例如在 ScreenSpot-Pro 上,模型合并方法的分数大幅跌至 37.13%(基座为 43.71%)。这从另一个侧面证实,UI-MOPD 的在线策略寻优过程,对模型底层通用视觉-语言表征的破坏性远小于直接的参数空间干预。
总结与技术展望
UI-MOPD 的提出,为解决通用 GUI 智能体在异构环境下面临的灾难性遗忘和行为模式混淆问题提供了一条极为优雅的路径。它不再迷信粗暴的数据混合与参数平均,而是将多教师在线策略蒸馏(MOPD)巧妙地与平台感知的环境路由相结合。
这项研究带来了几个关键的启示:
-
行为锚点比数据混合更重要:在差异巨大的操作平台上,赋予模型清晰的、受限于特定平台的动作规范(通过教师模型施加 KL 约束),是保证复杂动作连贯性和正确性的前提。
-
在线蒸馏的精准打击:仅仅在模型实际探索(Rollout)到的状态分布上施加监督,不仅提高了计算效率,也使得约束信号更贴合模型当前的策略瓶颈。
-
自适应掩码释放探索潜能:在强化学习后期,适时松绑教师约束,让任务本身的奖励信号主导优化,是突破 SFT 性能天花板的关键细节。
随着全场景、跨设备 AI 助手的加速落地,如何让单一模型在 PC、手机、车机甚至 XR 设备之间无缝切换且游刃有余,将是下一阶段大模型应用的核心命题。UI-MOPD 所展示的框架不仅在当前的测试集上拿到了亮眼的成绩,更为未来构建真正的全能型数字智能体奠定了坚实的范式基础。