不卷任务轨迹!NUS等提出STP:靠视觉状态转移预训练,GUI智能体最高提升6.2%
Scaling GUI Agents with Visual State Transitions

利用多模态大模型开发图形用户界面(GUI)智能体,正在成为自动化数字工作流的核心方向。无论是帮用户跨软件整理报表,还是在手机端完成复杂的多步打车、订餐任务,智能体都需要具备观察屏幕截图并预测下一步精准交互操作的能力。然而,目前构建高性能 GUI 智能体的主流方法往往面临严重的扩展瓶颈:依赖人工标注的多步任务轨迹微调(Trajectory Fine-tuning)成本高昂且数据稀缺,而直接在这些轨迹上进行端到端监督训练,又把底层视觉定位、界面环境动力学建模与高层任务规划死死纠缠在一起,导致模型优化极其困难。
ArXiv URL:https://arxiv.org/abs/2607.24112v1
来自新加坡国立大学(NUS)、Sea AI Lab 等机构的研究团队提出了名为 STP(State Transition Pretraining,状态转移预训练) 的全新扩展范式。该方法巧妙地绕开了对端到端任务指令的依赖,将现存轨迹拆解为最底层的单步视觉状态转移三元组 $(s_t, a_t, s_{t+1})$。借助统一多模态模型(UMM),团队在预训练阶段联合优化逆向动力学(根据前后两帧截图推断执行了什么动作)与正向动力学(根据当前截图和动作预测下一帧界面变化)。这种联合设计既赋予了模型精细的动作级视觉对齐能力,又让其在内部建立起 GUI 环境演化的“世界模型”。
实验结果表明,在 AgentNetBench、AndroidControl 和 GUIOdyssey 等桌面与移动端基准上,经过 STP 预训练的模型在下游指令微调中展现出显著优势。在桌面端基准 AgentNetBench 上,任务平均成功率最高提升了 6.2%,坐标预测成功率提升达 6.8%;在移动端基准上也全面优于仅进行轨迹微调的基线。更关键的是,研究揭示出一条全新的 Scaling 路径:下游智能体的任务表现能够随着底层无指令状态转移数据量的增加而稳步提升,为摆脱人工轨迹标注瓶颈开辟了极具工程可行性的新方向。
GUI 智能体训练困境:当高层规划与底层交互混在一起
现阶段训练 GUI 智能体主要有两条路线:基于环境交互的强化学习(RL)和基于专家演示的监督微调(SFT)。强化学习虽然潜力巨大,但将其扩展到复杂多样的桌面及移动软件生态中,需要搭建稳定、可回滚、高并发的虚拟交互沙盒,其工程开销令多数团队望而却步。因此,收集人类操作轨迹并进行监督微调,依然是绝大多数团队的首选。
然而,传统的轨迹微调存在两个难以回避的核心缺陷。其一是数据扩展成本极高。一条完整的跨应用任务轨迹往往包含十几甚至几十个交互步骤,从任务意图生成、每一步的点击拖拽,到跨步骤的逻辑连贯性,几乎都需要高精度的人工核验与标注,很难像预训练纯语言模型那样通过海量网络文本实现低成本扩展。
其二是优化目标的过度耦合。在典型的自回归轨迹微调损失 $\mathcal{L}_{\text{SFT}}$ 中,模型必须在给定自然语言任务指令 $u$、历史动作交互 $h_t$ 以及当前界面截图 $s_t$ 的前提下,直接预测出可执行动作 $a_t$:
\[\mathcal{L}_{\text{SFT}} = -\sum_{t} \log p_{\theta}(a_t \mid u, s_t, h_t)\]这个公式看似简洁,实则要求模型在同一步骤中同时解决三类认知难度迥异的问题:第一,它必须精准识别界面微小控件的位置与语义(视觉定位);第二,它必须理解特定点击或输入会引发什么样的界面变化(环境动力学);第三,它还要理解用户的终极任务并推理拆解子目标(长程规划)。把这些目标一股脑抛给模型进行从头微调,极易引发梯度冲突与优化不稳定,模型甚至往往还没学明白界面的基本响应逻辑,就被迫去死记长程操作序列。
STP 的破局点正在于“解耦”。人类在熟悉一个新软件时,往往不需要带着复杂目标去盲目试错,而是会先随便点点看、划划看,观察按钮按下去会弹窗还是变色。一旦掌握了软件的底层响应机制,再去完成具体任务就会游刃有余。STP 正是把这种“掌握界面物理法则”的过程前置到了独立的预训练阶段。
数据解构:摒弃任务指令,释放原子转移的潜力
为了打破对任务标注的依赖,STP 将所有交互数据抽象为原子状态转移元组 $(s_t, a_t, s_{t+1})$。其中 $s_t$ 与 $s_{t+1}$ 代表操作发生前后两个连续的界面截图,而 $a_t$ 则是促成该转变的执行动作。

从上图可以看出,研究团队涵盖了桌面端与移动端的异构数据源,包括桌面操作系统交互数据集 AgentNet,以及移动设备操作数据集 AndroidControl 和 GUIOdyssey。在这些数据源中,每个元组都忠实记录了一次单步操作及其环境反馈:例如在桌面端点击某款软件的“导出”菜单,下一帧立刻显示保存路径对话框;在移动端滑动应用列表,下一帧呈现新的卡片流。
这种数据形式带来两个颠覆性的优势。一方面是标注抗噪性。在以往的轨迹微调中,如果人类标注者的长程规划并不最优,或者指令表述含糊不清,整条轨迹的数据质量都会受损;而在单步转移中,高层任务指令被彻底剥离,只要动作 $a_t$ 真实导致了 $s_t$ 到 $s_{t+1}$ 的视觉变化,该元组就是绝对真实有效的监督信号。另一方面是极强的可扩展性。尽管本研究中多数元组是从现有轨迹中拆解而来的,但实验已经证明,这些单步转移即使脱离连续上下文、以纯离散单步形式采样,其预训练价值也完全不打折扣。这意味着未来可以通过程序化脚本在交互环境中进行随机点击与自动探索,以接近零的人工成本生产数以千万计的转移数据。
双向动力学联合预训练:世界模型与视觉定位的协同
仅有转移数据还不够,如何设计监督机制才能最大限度激发多模态模型的潜能?过去的研究往往走极端:要么仅做逆向动力学(根据屏幕变化反推动作),要么仅在文本空间预测状态差异。STP 则首次在全视觉空间将逆向动力学(Inverse Dynamics)与正向动力学(Forward Dynamics)统一在单个模型内。

为了同时支撑视觉图像与文本代码的输入与输出,研究团队选用了统一多模态模型(Unified Multimodal Model, UMM)作为骨干网络,具体采用的是基于 Mixture-of-Transformers(MoT)架构的 BAGEL 模型。该架构将多模态理解与多模态生成专家分离在不同的前馈网络中,但共享底层的自注意力层,并通过流匹配(Flow Matching)实现图像生成。STP 巧妙地将两个截然相反的动力学目标对应到 UMM 的原生输入输出格式中:
-
逆向动力学(Inverse Dynamics): 任务形式为“图像+图像 $\to$ 文本”。模型同时接收操作前截图 $s_t$ 和操作后截图 $s_{t+1}$,目标是预测出中间发生的文本化结构动作 $a_t$(包括自然语言描述与可执行的 GUI 坐标脚本):
\[\mathcal{L}_{\text{inv}} = -\log p_{\theta}(a_t \mid s_t, s_{t+1})\]这一过程迫使模型的核心注意力机制对比两帧图像的细微差异,自动识别出光标位置、高亮区域、输入框内容增减等细粒度变化,从而建立起极强的动作级视觉特征表征能力。
-
正向动力学(Forward Dynamics): 任务形式为“图像+文本 $\to$ 图像”。模型输入当前界面 $s_t$ 和待执行动作 $a_t$,目标是直接生成下一步的界面截图 $s_{t+1}$,通过流匹配生成损失进行约束:
\[\mathcal{L}_{\text{fwd}} = \mathcal{L}_{\text{gen}}(s_{t+1};\, s_t, a_t, \theta)\]这一目标要求模型必须预测出动作对界面产生的影响,诸如弹窗的出现位置、下拉菜单的展开样式或滚动界面的位移幅度。这实质上是在模型的潜空间内构建了一个隐式的 GUI 动力学“世界模型”。
联合预训练的总损失函数定义为两者的加权和:
\[\mathcal{L}_{\text{pre}} = \mathcal{L}_{\text{fwd}} + \lambda \mathcal{L}_{\text{inv}}\]在工程实现中,团队将 $\lambda$ 设定在 0.25 到 0.5 之间。在完成这一阶段的一轮(Epoch)联合预训练后,模型再加载任务指令并进入标准的轨迹微调阶段。由于模型已经在无指令预训练中熟知了操作意图与界面变化的因果关系,轨迹微调就不再需要承受从头学习界面逻辑的重负,而是专注于学习如何根据用户的自然语言意图规划动作序列。
实验评测:全场景性能跃升与更平稳的收敛曲线
为了验证 STP 的实际效能,研究团队在桌面端(跨 Windows 与 macOS 的 AgentNetBench)以及移动端(AndroidControl 与 GUIOdyssey)进行了全面的对比测试。所有基线均在相同模型底座、相同微调超参数以及相同硬件环境下运行,唯一的变量就是模型是否经过了状态转移预训练。
在桌面端评测中,研究设置了不同规模和领域的微调切分。在基于 32 万条 AgentNet 状态转移进行 STP 预训练后,下游任务的微调效果获得了全方位的提升。在 2K 轨迹的微调设定下,经过 STP 初始化的模型在 AgentNetBench 上的平均任务成功率实现了显著提升,增幅在 2.3% 至 6.2% 不等,其中在最能体现动作精准度的屏幕坐标成功率上,提升幅度更是高达 1.6% 至 6.8%。
这种性能增益在移动端同样得到了复现。在以操作密集著称的 AndroidControl 基准上,STP 使得单步成功率提升了 0.9%,坐标预测精度提升了 1.3%;而在多轮长程交互的 GUIOdyssey 上,单步成功率和坐标精度也分别提升了 0.6% 与 1.6%。移动端与桌面端的不同幅度差异也反映了任务特性的不同:移动端界面的布局标准化程度较高、任务路径相对直观,因此模型收敛更快、基线分值相对饱和;而桌面端软件布局极度复杂自由、上下文交互更长,STP 带来的界面动力学先验因而能发挥出更大的填补效应。
除了最终指标的提升,STP 带来的另一个核心优势体现在微调过程的优化效率上。对比纯微调模型与 STP 模型的训练曲线可以清晰发现,STP 初始化后的模型在轨迹微调刚开始的几个步数内,交叉熵损失(Cross-Entropy Loss)就迅速降至远低于基线的水平,且在整个微调过程中始终保持着更低的训练损失。这表明模型不再需要从离散的轨迹中去磕磕绊绊地拟合动作语法和界面关联,微调过程变得更为平滑且高效。
为什么必须“双管齐下”?消融实验背后的机理拆解
STP 的成功究竟来自于逆向动力学,还是正向动力学?抑或是单纯增加了一些图像自监督任务?研究团队通过多组严格的消融实验揭示了背后的深层逻辑:
-
正向与逆向动力学缺一不可: 当团队分别测试纯逆向动力学(Inverse-only)和纯正向动力学(Forward-only)预训练时,下游表现均明显弱于二者联合优化的方案。纯逆向动力学虽然能很好地强化动作识别,但模型缺乏对界面未来响应的推演能力;纯正向动力学虽然建立了世界模型,但对于具体参数(如精确点击坐标)的反向推导约束不足。唯有两者在共享自注意力层中互相提供反馈,模型才能兼具定位精准度与状态演化直觉。
-
单纯的视觉重建无法替代环境动力学: 团队还设计了“逆向动力学 + 图像掩码重建(Reconstruction)”的对照组。结果表明,将正向动力学替换为传统的无动作条件图像自编码重建后,性能提升大幅缩水。这明确证实了:GUI 智能体需要的不是泛化的图像压缩与去噪能力,而是强绑定于动作因果条件(Action-conditioned)的环境状态预测能力。
-
模型语言模块必须参与联合更新: 另一个具有实践指导意义的发现涉及参数更新策略。在预训练阶段,如果冻结大语言模型的骨干网络、仅更新视觉编码器(ViT)或投射层,下游微调的收益将微乎其微。这是因为 GUI 交互中的动作不仅包含连续的屏幕坐标,还包含离散的控件语义、键盘打字内容和 Python 自动化代码。只有语言模型与视觉专家同步感知状态转移,才能真正建立跨模态的动作空间对齐。
-
单步采集与整条轨迹采样具备等价性: 在对比实验中,团队固定了 19.2 万条转移元组的总预算,一组从连续轨迹中顺序截取,另一组则从海量池中完全随机打乱采样单步转移。两者的微调收敛轨迹与最终任务成功率几乎完全重合。这一结果彻底打破了“状态转移学习必须依赖完整任务上下文”的思维定势,在理论上为未来构建纯自动化、随机探索式的数据采集流水线奠定了坚实证据。
扩展性特征:一条更具性价比的 Scaling 新路径
在多模态智能体领域,评价一种训练范式是否具备长期生命力,核心在于其是否具备良好的扩展性(Scalability)。STP 在两个维度上均展现出了持续增益的特性。
一方面是预训练转移数据规模的扩展。在固定下游 2K 轨迹微调数据的条件下,研究团队持续增加 STP 阶段的状态转移数据量。实验表明,下游基准的成功率呈现出随转移数据量增加而单调上升的稳定趋势,并没有出现浅层过拟合或收益快速饱和的现象。
另一方面是对下游微调规模扩展的稳健增益。当固定 STP 预训练阶段的配置,将下游用于微调的专家轨迹规模从 2K 逐步扩展到 1.8 万条时,STP 模型的表现依然系统性地压制纯微调基线。这一发现非常关键,它强有力地反驳了一种质疑——“STP 的收益是否只是因为微调数据不够用时带来的暂时补充?”事实证明,即当下游高质量微调轨迹成倍增加时,预训练阶段获得的界面动力学与高敏视觉表征,仍然能作为基础能力持续赋能长程规划,两者在训练机制上构成了纯粹的互补关系。
从算力与标注成本的角度权衡,STP 同样极具工业落地价值。以最大的 32 万条 AgentNet 转移为例,STP 仅仅在标准微调流水线之前增加了一轮联合预训练开销,并未引入任何额外的人工文本标注。更为重要的是,这个预训练底座是一次性投资,产出的检查点可以复用在后续各种不同任务、不同提示词模板的下游微调中,被众多业务线反复摊薄。在所有实验中,纯微调基线的训练损失均已彻底收敛走平,这说明基线能力的不足根本无法通过简单延长微调步数来弥补,STP 带来的表征重构具有不可替代性。
局限性与未来应用图景
尽管 STP 展现出令人信服的扩展潜力和性能收益,研究团队也在论文中坦诚指出了当前的现实约束。首先,目前实验中所使用的绝大多数状态转移元组,依然是从现有的离散轨迹数据集中解构而来。虽然理论与小规模消融已经证明离散单步与连续轨迹等效,但真正跳出现存数据集、在真实交互系统里依靠智能体自动漫游抓取数百万级转移数据的全自动流水线,其背后的系统工程挑战(如环境保活、反作弊策略规避、有效交互过滤等)仍有待进一步攻克。
其次,正向动力学由于涉及图像生成与流匹配扩散计算,其对显存和算力的开销显著高于纯文本回归任务。对于那些计算资源极为有限、或者底层骨干网络完全不具备图像生成能力的研究团队而言,全量部署 STP 会面临一定门槛。如何在保持动力学建模优势的同时,进一步轻量化视觉生成目标,是值得社区跟进的优化方向。
从更广阔的技术演进视角来看,STP 实际上为 GUI 智能体乃至具身智能体(Embodied Agents)指出了一条极其清晰的分层演化路径。以往我们总是试图让一个模型“出生即懂全局规划”,在复杂的任务轨迹中疲于奔命;而 STP 证明,把交互物理世界的因果规律(Forward & Inverse Dynamics)沉淀为模型的基础本能,远比强行硬灌长程任务更为高效。 随着未来自动化沙盒采集技术的成熟,基于海量视觉状态转移的持续预训练,极有可能成为下一代通用计算机操作智能体(Computer-Use Agents)的标准前置基石。