不是盲猜而是看懂后果:GHD用下一张截图后视蒸馏突破手机Agent
The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

在让视觉语言模型(VLM)学会操作手机界面的过程中,研究者们长期面临一个颇具讽刺意味的因果困境:要让智能体在当前界面做出合理的决策,模型往往需要先写出一段解释自身动机的推理链条(Reasoning Trace),然而真正能够证明这个动作完全正确的物理依据,却只有在动作执行完毕、下一个屏幕界面加载出来之后才会出现。
ArXiv URL:https://arxiv.org/abs/2608.06065v1
比如,为了在某个代码编辑器或阅读器应用中开启“自动换行(Soft Wrap)”,人类或 Agent 应该点击顶部的“Edit”还是“View”?在菜单真正弹开之前,当前屏幕上的几个一级菜单项在视觉上都具备潜在可能性。标准的人类专家演示数据固然记录下了正确路径——点击“View”,但界面本身并没有给出“设置藏在这里”的先验线索。现有的离线模仿学习(Imitation Learning)和强化学习(RL)做法,是将完整的交互轨迹粗暴地切碎成单步的“历史前缀—当前动作”对(Prefix-Action Pairs),然后将动作发生后的后续观测全部丢弃。这就带来了一个无法回避的监督断层:模型被强行要求仅凭历史和当前屏幕,去“猜”出一个它在物理上根本无从观察到的推理过程。
来自电子科技大学(UESTC)的研究团队在论文《The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents》中直击了这一核心矛盾。他们提出的方案简单却极其犀利:既然离线成功轨迹里明明已经记录了动作发生后的下一张截图($o_{t+1}$),为什么不在训练阶段把它作为“特权信息”(Privileged Information)反哺给模型?
研究团队据此提出了门控后视蒸馏(Gated Hindsight Distillation, 简称 GHD)。该方法在训练时引入一个参数完全共享的“教师视角”,让它额外观察到下一帧真实截图,从而利用事后诸葛亮式的后验视角为推理与动作重新打分;同时设计了严格的门控机制,只有当普通的前缀学生模型出错、且特权教师模型能够精准复现标准动作时,才触发 Token 级别的后视蒸馏。该方法在移动端权威基准 AndroidWorld 和 AndroidLab 上,全面超越了强监督微调(SFT)和主流的组相对策略优化(GRPO),显著拉升了开源多模态模型在复杂移动界面下的任务完成率。

为什么标准训练会让 GUI 智能体“瞎猜”理由?
当前移动端 GUI Agent 的主流构建路线通常分为两步:首先在大量人类操作录像或合成轨迹上进行基于行为克隆(Behavior Cloning)的监督微调(SFT),随后采用类似 DeepSeek-R1 风格的强化学习算法(如 GRPO)在离线或模拟环境中进行自探索对齐。这种流程在许多任务上行之有效,但在遇到依赖特定应用深层知识(App World Knowledge)的场景时,瓶颈就会迅速暴露。
这一瓶颈的本质可以归结为两个关键条件的缺失:训练目标没有显式监督推理动机,而模型输入又缺乏构建该动机所必需的视觉证据。
在传统的单步前缀训练设定下,目标函数只关心模型是否输出了与专家标注一致的坐标或动作类型。只要模型碰巧命中了正确的坐标,无论是通过蒙猜、隐式记忆还是盲目联想,损失函数都会给予正面反馈。这导致多模态模型虽然能生成一段看似流畅、有理有据的思考链(Rationale),但这些思考很多时候并没有真正扎根于界面当前的视觉元素上,属于“事后编造的借口”。
更致命的是证据的滞后性。正如前面提到的二级菜单案例,正确的决策依据 $p(z \mid s)$ 在当前状态 $s$ 下本身就存在巨大的信息熵。对于模型而言,预测“我现在应该做什么”是一个极具不确定性的难题;但如果反过来问模型“我刚才究竟做了什么才导致了这个新界面的出现”,也就是从后验分布 $p(z \mid s, s^{\prime})$ 出发进行推断,问题瞬间退化成了一个信息完备的因果回溯任务。
在标准离线训练中,算法在处理第 $t$ 步时,将已经记录在案的第 $t+1$ 步截图 $o_{t+1}$ 彻底遗弃。这种做法表面上是为了严格保证训练与部署时的因果输入一致(部署时智能体显然无法预知未来截图),但在客观上,它恰恰剥夺了模型理解“动作如何改变环境”的最关键线索。
GHD 架构:参数共享与特权后视
为了弥合这一监督鸿沟,GHD 的设计哲学是:在训练时充分压榨未来的特权信息,在推理时彻底丢掉未来与教师模型,回归纯粹因果前缀。

如上图所示,在一次离线成功轨迹中,环境交互的前缀上下文表示为 $x_t = (q, h_t)$,其中 $q$ 是用户自然语言指令,$h_t = (o_1, a_1^\star, \dots, o_{t-1}, a_{t-1}^\star, o_t)$ 代表截止到当前步的截图和历史专家动作。
在训练阶段,算法构建了两个逻辑角色:
-
学生模型(Student):仅接收部署时可见的标准因果前缀 $x_t$,通过自回归采样生成一组包含思考过程和工具调用的候选响应 $y^{(n)} = (r^{(n)}, a^{(n)})$。
-
教师模型(Teacher):与学生模型完全共享模型参数 $\theta$,但在输入端额外获得了特权后视信息 $\tilde{x}t = (x_t, o{t+1})$。这里的 $o_{t+1}$ 正是专家轨迹中执行了正确动作后真实产生的下一帧截图。
在具体的蒸馏计算上,研究团队并没有让特权教师独立生成一段全新的序列,而是采用强制教学(Teacher Forcing)的方式,让教师模型在学生采样的具体路径上逐 Token 进行重评估。在学生生成的第 $j$ 个 Token 位置,学生分布与带有截断梯度的教师分布分别定义为:
\[\pi_S^j = \pi_\theta(\cdot \mid x_t, y_{<j}), \qquad \pi_T^j = \operatorname{sg}\left[\pi_\theta(\cdot \mid \tilde{x}_t, y_{<j})\right]\]为了稳定在大型词表和连续视觉特征下的分布对齐,GHD 采用了对称的 $\alpha$-散度(Symmetric $\alpha$-divergence,实验中取 $\alpha = 0.5$):
\[D^{(\alpha)}(\pi_T \parallel \pi_S) = (1 - \alpha) D_{\mathrm{KL}}(\pi_S \parallel m_\alpha) + \alpha D_{\mathrm{KL}}(\pi_T \parallel m_\alpha)\]其中 $m_\alpha = (1 - \alpha)\pi_S + \alpha \pi_T$。蒸馏损失覆盖了包括思考链与工具调用参数在内的每一个 Token,梯度仅回传至学生模型视角下的参数。通过这种方式,特权教师利用未来观测所推导出的确定性因果关系,被高密度地压缩并注入到仅观察当前界面的学生表征中。
门控机制与动态采样:剔除虚假与平庸的信号
将特权信息引入自回归模型往往伴随着一个隐蔽的风险:未来信息是一把双刃剑,如果教师模型本身推理能力不足,它可能会利用下一张截图推导出错误的归因逻辑;或者在某些简单的界面跳转中,额外引入未来截图反而可能导致过度解释。
为此,GHD 设计了严密的后视修正门控(Hindsight-Correction Gating) $M(y) \in {0, 1}$。门控开关打开、允许该样本参与蒸馏更新,必须严格同时满足两个硬性条件:
-
学生必须犯错:学生模型独立生成的响应在环境奖励验证器下的得分必须低于阈值,即 $R(y) < \tau_{\mathrm{succ}}$。如果学生自身的前缀策略已经能够正确解决该步操作,后视蒸馏便不介入,避免破坏模型原有的正确分布。
-
后视教师必须能修复动作:在固定学生历史前缀 $y_{<j}$ 的前提下,教师模型在每一步贪婪选词得到的响应序列,其最终解析出的工具调用动作 $\hat{a}_T$,必须与专家示范动作 $a_t^\star$ 精准吻合:
这里的匹配逻辑极为严苛:动作类型必须完全一致;对于点击、长按、滑动等连续坐标操作,预测坐标与专家坐标在归一化网格上的欧式距离必须在极小的容差 $\delta = 20$ 之内;对于文本输入,必须满足严格的编辑距离或精确匹配;任何格式解析失败或字段缺失均直接视为不匹配。
由于在训练后期,同时满足“学生失手”且“教师成功纠错”的高价值过渡样本在单个 Batch 内的命中率可能会下降,论文进一步引入了动态采样(Dynamic Sampling, DS)机制。针对同一个 Prompt 组,算法允许最多进行三次 Rollout 尝试。一旦某次尝试中检测到了被门控机制接纳的有效监督样本,立即终止采样并进行模型更新;若三次尝试均未触发有效门控,则保留最后一次尝试的标准 RL 信号。这种机制在几乎不额外增加系统墙钟耗时(Wall-clock Time)的前提下,极大地提升了高质量后视蒸馏信号的密度。
整个系统的联合优化目标将后视蒸馏与标准的组相对策略优化有机结合:
\[\mathcal{L} = \mathcal{L}_{\mathrm{GRPO}} + \lambda \mathcal{L}_{\mathrm{GHD}}\]其中平衡权重 $\lambda$ 设为 0.1。GRPO 负责在全局策略空间中通过正负反馈维持探索广度,而 GHD 则专注于在关键的“信息不对称”节点上提供精细到底层 Token 分布的高确定性语义矫正。
实验评测:复杂任务下的显著跃升
为了客观衡量 GHD 的有效性,研究团队在 Android 智能体领域公认最难的两个基准测试——AndroidWorld 和 AndroidLab 上展开了系统评估。实验选取了当前多模态领域极具代表性的两个基座模型:Qwen2.5-VL-7B 与 Qwen3-VL-8B。
在数据处理层面,研究团队遵循严谨的控制变量原则:所有模型均基于开源项目 OpenMobile 的配方训练 SFT 起点,统一采用 $420 \times 896$ 的图像分辨率以兼顾训练吞吐与显存开销。
在整体评测(Pass@1 与 Pass@3)中,配备 GHD 的模型展现出了极具说服力的性能超越。
在 AndroidWorld 评测中,基于 Qwen2.5-VL-7B 的基线模型经 SFT 训练后的 Pass@1 为 47.13%,引入标准的强化学习 GRPO 微调后微幅提升至 49.56%。而在叠加上 GHD 后,模型的 Pass@1 直接跃升至 52.73%,实现了超过 3.17 个百分点的实质性净增长。在参数量更大的 Qwen3-VL-8B 上,这种增益同样明显:GRPO 的 Pass@1 均值为 61.35%,而完整版 GHD 将其推高至 66.47%(三次独立实验标准差仅 $\pm 0.68$),在 AndroidLab 上的 Pass@1 同样从 37.43% 大幅拉升到了 54.11%。
在与此前文献中公开的各类强基线系统的横向对比中,GHD 在 7B 和 8B 两个量级上,均打破了此前完全依赖开源数据训练的智能体性能天花板。
为了更透彻地解析这种提升到底来源于何处,消融实验对算法中的各个模块进行了严密的拆解:
-
如果仅仅在 GRPO 基础上加入门控蒸馏机制,但教师模型不提供特权后视信息(即无后视的普通自蒸馏),AndroidWorld 上的得分仅从 49.56% 缓慢爬升至 50.27%(增益 0.71 点);
-
在此基础上进一步开启允许更多生成机会的动态采样(DS),得分上升到 51.99%(增益 1.72 点);
-
最终,当把特权未来截图 $o_{t+1}$ 正式灌入教师模型时,系统迎来了最大幅度的跃升,直接跨入 52.73% 的区间。
这一层层剥离的对照有力地证实:算法性能的核心驱动力绝非单纯来自更多的采样预算或形式上的自对齐技巧,而是扎扎实实来源于下一帧截图所承载的未来视觉因果。
细分到 AndroidLab 的九款具体真实 App 来看,GHD 在其中七款应用上均显著领先于传统的 GRPO。特别是在业务逻辑繁琐、深层嵌套设置众多的个人记账软件 Bluecoins 和通讯录软件 Contacts 中,GHD 展现出了断层式的优势。原因显而易见:这类应用拥有密集的层级导航结构,若不理解每个点击动作背后的页面流转逻辑,单凭当前界面的有限元素,Agent 极易陷入盲目试错或无效死循环。
深度解构:未来信息该如何高效利用?
利用“未来”信息来辅助智能体决策并不是一个全新的设想。在世界模型(World Models)与逆向动力学(Inverse Dynamics)领域,已有诸如 GUI-Shift 等工作尝试建立页面转换网络。那么,GHD 的后视蒸馏机制与其他方案相比,核心差异与优势究竟在哪里?
首先是特权信息形式的取舍。如果特权教师不看下一张截图,而是直接被投喂专家标注的思维链与动作(CoT + Action),或者在当前截图中通过高亮标出标准答案的点击热区(Highlight GT),效果会如何?
实验给出了耐人寻味的结论:直接提供专家动作与思维链,模型在 AndroidWorld 上的 Pass@1 从 59.05% 微调提升到了 60.34%,增益非常微弱。进一步分析发现,当特权信号直接是文本答案时,强参数容量的教师模型往往倾向于走捷径——它会退化成一个“抄答案”的复读机,而没有真正建立从视觉界面到意图因果的深度连接;单纯高亮目标热区虽然提供了精准的定位偏置,却无法从根本上向模型解释“为什么这个未知的按钮是通向最终目标的正确跳板”。唯有真实的下一帧截图 $o_{t+1}$,由于完整呈现了动作引发的界面状态转移事实,能够迫使教师输出真正扎根于界面因果转移的监督信号。
其次是知识迁移机制的对比。在将教师的特权知识传递给学生时,业内存在两种典型范式:一种是以 STaR(Self-Taught Reasoner)为代表的重生成路线,即让特权教师独立生成一条修正后的完整轨迹,并将其作为非策略(Off-policy)的最大似然目标喂给学生;另一种则是 GHD 采用的分布级(Distribution-level)逐 Token 蒸馏路线。
评测显示,在相同的特权信号输入下,Token 级蒸馏的准确率全线压倒了 STaR 范式。STaR 依赖于教师自主采样的单条文本序列,这种离散序列一旦在中间某个推理词上发生轻微漂移,就会在后续 Token 上累积误差;而 GHD 的强制教学蒸馏让教师直接贴合在学生自己采样的轨迹分布上,在学生产生犹豫或偏差的每一个具体决策点上精确注入概率校准,所提供的监督粒度显然要细致得多。
最后,在与基于逆向动力学的代表方案(GUI-Shift 风格)的同台竞技中,GHD 再次展现了降维优势。在 GUI-Shift 设定下,模型被赋予一项辅助自监督任务:给定当前图 $S_t$ 和未来的某张图 $S_{t+k}$,反推引发这次跳转的动作 $a_t$。在统一以 7B 模型为底座的对比中,引入 GUI-Shift 辅助任务仅取得了 49.33% 的 Pass@1,而 GHD 达到了 52.73%。
这一差异的根源在于:基于逆向动力学的辅助任务是在强制模型去学习所有界面之间细碎的物理位移关系,但这些位移在很多时候与高阶的用户任务意图是脱节的;而 GHD 始终将未来截图牢牢绑定在“用户指令驱动的成功任务流”中,它教给模型的不是单纯的屏幕像素位移,而是“为了完成用户的指令,这一步操作在业务逻辑上为什么是必须的”。
启示与延伸
Gated Hindsight Distillation 为长期困扰 GUI 智能体训练的因果倒错问题提供了一种非常优雅且工程代价极小的解法。它既不需要像传统世界模型那样在推理阶段耗费巨额算力去在线幻觉、预演下一帧画面的像素分布,也没有在最终部署的智能体架构中塞入任何冗余的校验器模块。它对未来的利用是克制且纯粹的——所有的后视红利全部被沉淀在离线训练阶段的参数梯度之中。
这项研究对未来多模态具身智能(Embodied AI)和复杂工具调用系统的训练同样具有启发意义。在机器人操作、软件 API 编排等诸多领域,决策的正确性依据同样往往滞后于动作本身。习惯性地将轨迹切分成孤立的前缀-动作对,实际上是人为丢弃了大量已经真实发生的世界因果反馈。善用这部分触手可及的“事后诸葛亮”信息,让模型在复盘中读懂后果,或许是缩小离线策略与现实世界动态缝隙的关键一步。