AppDeltaWorld:基于增量代码机制的GUI世界模型,评测达73.5分

AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents

移动端 GUI(图形用户界面)智能体正处于一个关键的演进节点。多模态基础模型的出现,使得智能体可以直接通过屏幕像素感知和触摸动作来操作智能手机。这种通用的交互范式使其能够跨越繁杂的应用边界,直接执行复杂长程任务。然而,这一前景正面临一道几乎无法逾越的数据壁垒:对于涉及用户隐私的敏感应用,以及诸如支付、账号修改等关键操作,真实的交互轨迹数据极难获取,更遑论规模化收集。

ArXiv URL:https://arxiv.org/abs/2608.05891v1

为了打破这种数据封锁,研究社区此前提出了两条主要路线:一是手工构建基于底层代码的模拟器环境,二是训练能够预测和渲染下一步状态的 GUI 世界模型(GUI World Models)。前者的致命弱点在于扩展和维护成本高昂,难以跟上移动应用快速迭代的步伐;后者的潜力巨大,但在实际应用中却频繁碰壁——现有的世界模型依然饱受生成不稳定、模态覆盖不全(难以同时兼顾精准文本与视觉特征)以及交互逻辑自相矛盾的困扰。当你让智能体在现有的世界模型中尝试一次错误的点击时,模型往往不是抛出一个无反应的页面,而是陷入幻觉,凭空捏造出一个现实世界中根本不存在的奇异界面。

为了从根本上解决这些局限,来自南洋理工大学、中国人民大学等机构的研究团队提出了 AppDeltaWorld。这是一个基于状态转换约束的增量代码世界模型(transition-grounded delta code world model)。它的核心逻辑非常明确:不再像以往的模型那样无约束地生成一张新图片或一段文本描述,而是将“预测下一个 GUI 状态”严格转化为“一次可达的代码更新过程”。通过引入分层的 HTML 生成机制、图文代码混合渲染架构以及基于真实动作路径的检索约束,AppDeltaWorld 在 CMGUIBench-500 基准测试中斩获了 73.51 的最高保真度评分,全面超越了 GPT-Image-2 和 Gemini-3.1-Pro-Image 等闭源巨头模型。更关键的是,基于该世界模型合成的数据成功训练出了 AppDeltaAgent,在 AndroidLens、MobileGym 等多个端到端智能体评测中达到了当前的最优水平。

GUI 世界模型的核心困境:幻觉、模态断层与逻辑断裂

要理解 AppDeltaWorld 的设计动机,必须先直面现有 GUI 世界模型在闭环环境训练中暴露出的三大顽疾。

GUI世界模型的典型失败案例分析

首先是保真度(Fidelity)的崩塌。在长程轨迹的收集过程中,智能体需要连续执行多次复杂的触摸或滑动动作。理想的世界模型应当稳定地输出与真实设备高度一致的渲染页面。但实际上,由于缺乏结构化约束,许多模型在经历了三四步操作后,页面结构就开始发生严重的“漂移”,按钮错位、文本重叠成了家常便饭。

其次是模态融合的困境。纯文本的世界模型(输出页面元素的语义描述)显然无法直接为视觉语言模型(VLM)提供像素级的训练数据。而另一端的极端——纯图像的世界模型(例如基于 Diffusion 的方法),虽然在整体色彩和宏观布局上看起来像模像样,但对于界面中密集的细小文本和极其细微的图标结构,往往表现得力不从心,生成的文字经常模糊不清甚至扭曲变形,彻底丧失了作为交互环境的价值。

最后,也是最影响智能体决策的一点:状态转换逻辑的不一致。在一个真实的 App 中,有些点击是无效的,有些滑动是不可达的。一个合格的“世界”必须遵守客观物理(或软件逻辑)规律,当智能体执行了不支持的动作时,它应该拒绝响应,或者停留在原界面。然而,现有的自回归或生成式世界模型缺乏这种底层索引约束,只要输入了一个动作,它们总倾向于“顺势”生成一个花里胡哨的新状态,这就把错误的反馈信号传递给了智能体。

AppDeltaWorld 的破局之道:分层检索与混合渲染

为了根治上述问题,AppDeltaWorld 在架构设计上进行了一次彻底的解耦,将任务拆解为结构检索、多模态渲染和动作-转换验证三个独立且相互约束的模块。

AppDeltaWorld 架构全景:分层检索、混合渲染与闭环SFT生成

第一个核心设计是引入了 Level-1 与 Level-2 层次化 HTML 机制,以此来锚定界面的稳定性。AppDeltaWorld 并不是在每次动作后从零开始生成下一个界面的全部代码,而是将界面的 HTML 代码一分为二。Level-1 HTML 负责捕获那些高度可复用的页面宏观结构和骨架布局,而 Level-2 HTML 则负责填充具体的下一步内容细节。

在具体执行流中,AppDeltaWorld 首先会把当前的屏幕截图“定位”到某个特定的应用源簇(source cluster)。紧接着,它会查询一个专门构建的、针对当前 App 的转换记忆库,找出该动作所能触达的目标页面簇,并从中检索出最匹配的 Level-1 HTML 代码作为参考底座。随后,语言模型才在这个 Level-1 骨架的约束下,结合当前屏幕、执行的动作以及预测的后续文本,生成出完整的、可执行的 Level-2 HTML。这种将复杂生成转化为“基于检索的增量补全(Delta Code Completion)”的策略,从根源上扼杀了结构漂移的可能,确保了智能体在反复访问相似页面时,所见即所得。

第二个核心设计是巧妙的 文本-代码-扩散模型混合渲染架构(Hybridization Modality)。既然代码擅长精准的文本排版和规则的几何布局,而图像生成模型擅长复杂的视觉呈现,那么为何不各取所长?AppDeltaWorld 让生成的 Level-2 HTML 保留了所有密集的 UI 文本和精准的坐标结构,但对于那些纯代码难以描绘的复杂视觉区域(如商品主图、视频封面),模型则会在代码中留出一个带有文本描述的“图像占位符(Image Slots)”。在最终送入浏览器引擎渲染之前,一个专门的文本到图像模型(Diffusion 模型)会根据占位符的描述生成高保真的视觉资产,并完美嵌入到 HTML 的对应位置中。这不仅保留了代码体系的严谨性,还拥有了图像生成模型的视觉丰富度。

第三个关键设计是基于动作-状态转换(Action-Transition)的强约束逻辑。这是对付世界模型幻觉的一剂猛药。AppDeltaWorld 为每一个 App 预先建立了一个状态转换索引图。在为下一步寻找 Level-1 参考代码时,检索过程被严格限制在“当前状态节点”且“当前动作可达”的候选池中。如果智能体在当前页面发出了一个不合理的动作指令,由于检索系统无法在索引图中找到对应的可达状态,模型便会将其视为无效或低置信度的转换,从而避免生成不受约束的幻觉页面。

将世界模型转化为数据引擎:生成闭环 SFT 数据

AppDeltaWorld 的终极野心不仅仅是做个好用的预测器,而是要成为移动端 GUI 智能体无穷无尽的“虚拟训练场”。

动作模型应用分布与训练数据规模概览

以往的工作很少去深究 GUI 世界模型能否真正作为真实环境的替代品来为策略模型提供具有学习价值的经验。AppDeltaWorld 通过一套称为“World-Model-in-the-Loop SFT Data Construction”的流程给出了肯定的答案。

具体而言,研究人员利用开源的 GUI-Owl 和 OpenMobile 中的任务指令作为种子,在一个完全由 AppDeltaWorld 驱动的虚拟沙盒中让策略模型(Action Policy Model)进行长程探索。在这个过程中,策略模型不断预测动作,AppDeltaWorld 则负责预测并渲染下一步的界面。由于生成数据的质量直接决定了智能体训练的上限,系统引入了严格的过滤和验证机制。

根据论文披露的数据统计视角来看,由于世界模型合成环境和真实环境之间仍存在一定差距,在尝试构建的大量闭环轨迹中,最终只有约十分之一的数据成功通过了质量验证并被纳入 SFT 训练集。淘汰轨迹的主要原因包括:任务进度迷失(智能体在模拟环境中陷入死循环)、长步数操作后模拟保真度严重下降,以及未能用指定步数完成任务等。最终,经过大浪淘沙筛选出的 33,133 条高质量 SFT 轨迹,成为了后续训练 AppDeltaAgent 最核心的养料。这种将数据构建过程闭环化的做法,极大降低了人工标注成本,同时填补了隐私应用数据的空白。

从静态评估到端到端任务:全面领跑的实验数据

为了严谨地验证这一整套范式,论文展开了详尽且多维度的实验评估。

在保真度(Fidelity)方面,基于 CMGUIBench-500 和 Code2World 评估框架,AppDeltaWorld 以 73.51 的综合得分登顶。相比于 Qwen3-8B 基座模型的 50.53 分,实现了高达 45.5% 的相对提升。更加引人注目的是,它击败了专门针对图像生成的专有大模型 GPT-Image-2 和 Gemini-3.1-Pro-Image。

分析具体子项指标可以发现非常有意思的结论:以 GPT-Image-2 为代表的纯图像生成模型在 SigLIP 和 DINOv2 等衡量全局构图和色彩保真度的指标上表现极佳,但在局部元素($S_{ele}$)和精细布局($S_{lay}$)上却一塌糊涂——其 $S_{ele}/S_{lay}$ 分别仅有 44.00 和 41.70。而采用代码驱动混合渲染的 AppDeltaWorld 则在这两项指标上达到了惊人的 56.26 和 57.43。尽管纯视觉模型偶尔在局部元素的绝对坐标对齐上显得更平滑,但 AppDeltaWorld 在“功能逻辑合理性”与“细粒度文本/结构还原”之间找到了最佳的平衡点。

在智能体策略端到端评估中,融合了 AppDeltaWorld 合成数据的 AppDeltaAgent 展现出了断崖式的领先优势。在最具代表性的 AndroidLens 基准测试中,AppDeltaAgent-8B 在所有语言环境和指令粒度切分下均获得了最高动作匹配度(AMS)。其中,最具挑战性的高级抽象指令(High-level instructions)下,模型的平均任务进度(Total-HL ATP)从基座 Qwen3-VL-8B 的 23.30 大幅跃升至 33.05,相对提升高达 41.8%。这充分证明了世界模型生成的闭环轨迹,不仅提升了模型针对当前界面的“静态动作打点”能力,更实质性地增强了其面对抽象任务时的主动规划和长程推进能力。

在动态执行环境 MobileGym(基于模拟器)中,AppDeltaAgent 将端到端成功率从 10.2% 提升到了 14.1%;而在更加复杂的真实环境 MobileWorld 中,GUI-only 模式下的成功率更是从 9.4% 暴涨至 14.9%。

Test-Time RL:在测试时的脱机进化

这篇论文最具有前瞻性的探索之一,是将 AppDeltaWorld 运用于测试时强化学习(Test-Time Reinforcement Learning)。

既然世界模型可以预测未来的状态,那么策略模型在真实设备上采取行动前,完全可以在大脑(世界模型)中预演一遍。本文设计了一种无需人工奖励介入的自我打分强化学习机制(Self-score RL):针对当前屏幕和指令,策略模型先设想出 8 种可能的操作动作,由 AppDeltaWorld 逐一预测出对应的下一步渲染界面。然后,策略模型再回过头来审视这 8 个未来状态,评估哪条路径对完成任务最有利,以此作为 Reward 信号反向更新自身的策略。

Test-Time RL 在不同应用上的共识分析与收益表现

实验结果极其振奋人心。在针对淘宝、京东、美团和飞猪等特定应用的微调中,无需真机交互,仅仅经过几十步的世界模型预演迭代,策略模型就实现了稳步的自我进化。数据表明,经过 48 步的 Test-Time RL 后,策略在这四个应用上的动作匹配得分(AMS)分别提升了 5.06、3.02、3.25 和 1.51。前 60 次更新中,整体奖励得分从 68 分稳步攀升至 76 分。这项实验彻底证明了 AppDeltaWorld 作为“口袋里的数字孪生宇宙”的潜力:智能体完全可以利用它在后台默默“脑补”演练,待实操时便已是熟练工。

更深层次的数据缩放规律分析

进一步的消融实验(SFT Data Scaling)揭示了合成数据背后的规模法则。当只使用公开的公共 SFT 数据时,基座模型的提升相当有限(ATP 指标提升约 5-6 分)。而一旦加入 AppDeltaWorld 的 Rollout 数据,泛化性能立刻出现质的飞跃。

不过,研究者也十分坦诚地指出,仅仅依赖 AppDeltaWorld 生成的数据是不够的。如果完全抛弃真实公开数据,只用合成数据训练(ADW-only),由于世界模型自身依然带有对底层交互模式的少许偏差(Biases),最终策略性能反而会轻微下降(ATP 下降约 1 分)。更重要的是,合成数据带来的收益存在明显的边际递减效应。随着引入的 AppDeltaWorld 数据量从 0K 逐渐增加,模型性能稳定提升;但当数据量达到 12K 时,就已经锁定了约 75% 的最终增益,而在超过 20K 之后,各项指标开始趋于饱和。这说明通过单一指令增强或者纯环境模拟来扩充数据的上限依然受制于世界模型当前“知识库”和“检索空间”的丰富程度。

总结

AppDeltaWorld 的出现,为陷入数据瓶颈的移动端 GUI Agent 指出了一条极具操作性的突围之路。它证明了:通过状态约束检索、层级 HTML 补全以及图文混合渲染构建的增量代码世界模型,完全有能力在保真度和逻辑一致性上成为真实手机环境的高阶“平替”。利用它批量生产的合成监督数据,不仅能直接将 8B 级别的端到端模型推向当前最佳性能,更为未来通过测试时大规模强化学习(Test-Time RL)实现 GUI 智能体的自主进化铺平了道路。对于那些苦于无法获取海量私有应用交互数据的研究者和开发者来说,AppDeltaWorld 提供了一个极具启发性的工程架构蓝本。