CoAdapt-GUI:双通道测试时自适应,让手机Agent跨App成功率升至52.9%
CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications
移动端图形用户界面(GUI)智能体正在经历从“死记硬背”到“自主适应”的关键转折。过去一年中,多模态大模型在屏幕理解和单步指令定位上取得了长足进步,但当部署到实际移动设备时,开发者往往会遇到一个尴尬的断崖式瓶颈:智能体在训练见过的常用软件里表现游刃有余,一旦换到一款功能相似却从未在训练集中出现过的新应用,任务成功率便会剧烈下跌。
ArXiv URL:https://arxiv.org/abs/2608.11588v1
以基准测试 AndroidWorld-Generalization 为例,源应用上的在线强化学习可以让 7B 模型的同界面泛化提升 26.1 个百分点,但当场景切换到完全未见过的应用时,这一收益立刻暴跌到仅剩 8.3 个百分点。导致这种脆性的根本原因在于,跨应用迁移同时放大了两种维度的缺陷:界面感知的陌生,以及高阶流程理解的错位。智能体可能清楚总目标,却找不到新界面的特定入口;或者它能准确点击某些控件,却在关键步骤遗漏了验证流程或卡在未知的失败分支上。
来自康考迪亚大学、麦克马斯特大学、Mila 魁北克人工智能研究所和多伦多大学的研究团队提出了一种全新的破局思路:CoAdapt-GUI。这项工作不再指望源域训练能“一劳永逸”地搞定所有新软件,而是聚焦于测试时自适应(Test-Time Adaptation, TTA)。面对全新的目标应用,在没有任何人工示范、仅有极少交互预算的前提下,智能体仅依靠自己在新应用中的探索轨迹和环境返回的任务奖励,同时协调演化两个相互补充的状态——外置的结构化工作流上下文与轻量级策略参数。
实验证明,这种软硬解耦的双通道自适应架构取得了显著效果。在 AndroidWorld-Generalization 未见应用测试中,CoAdapt-GUI 达到了 45.0% 的成功率,比原有的纯策略更新基线高出 7.5 个百分点;而在更严苛的全新任务类型基准 AndroidWorld Plus 上,它将基础模型的成功率直接从 38.6% 推升至 52.9%。这一结果清晰地证明:跨应用迁移不是靠单纯调大模型参数,而是要把“通用的流程认知”与“底层的操作反射”分开自适应。
为什么单纯微调策略或生搬旧经验会失效?
想要理解 CoAdapt-GUI 的精妙之处,必须先看清传统方案在跨应用落地时的死穴。过去让 Agent 适应新 App 的做法通常可以归为两类:要么只做策略微调(Policy-Only),要么依赖静态记忆检索(Memory/Context Retrieval)。
纯策略微调依赖强化学习或强化自监督。当智能体在新应用中乱撞时,因为缺乏对应用工作流的基本预期,很多复杂任务(如在线退款、跨标签比对)从一开始就无法完成,整个探索过程只能收集到全零的稀疏奖励。缺乏正向信号的梯度反向传播不仅难以学到正确的动作序列,反而在极度有限的步数内极易导致模型参数偏移,甚至破坏原有的通用感知能力。
静态经验迁移则走向了另一个极端。类似 UI-Mem 这类工作,试图将训练集应用中积累的操作经验提取成外置记忆,在新 App 中直接检索复用。但移动应用的界面细节极度异构,按键的文字标签、排版布局、资源 ID 往往大相径庭。如果在上下文提示词中直接塞入源应用的屏幕状态或特定坐标,智能体会产生极其严重的负迁移(Negative Transfer),误以为新软件也存在相同的界面结构,进而陷入无休止的死循环或盲目乱按。
这就带来了一个本质矛盾:智能体需要借用老经验中的抽象流程(例如“修改密码前通常需要先验证旧密码或点击右上角个人中心”),但坚决不能继承老经验的具体界面依赖;同时,在新应用中摸索出的具体操作模式,必须以最高效的方式固化为当前 App 专属的操作能力。

状态解耦:约束工作流与轻量化策略
CoAdapt-GUI 解决上述矛盾的核心基石,是将智能体的适应状态明确拆解为外置显式的“工作流状态”(Workflow Context, $M_t$)与内置隐式的“参数化策略”(Parametric Policy, $\theta_t$)。
外置工作流上下文 $M_t$ 并不存储像素或控件级别的信息,它被高度抽象为一个结构化元组:触发前提 $c$、核心操作流程 $P$、典型失败模式及恢复策略 $F$,以及任务完成校验规则 $V$。在初始化阶段,系统从源应用中提炼出这些可迁移的流程库 $\mathcal{L}_{\mathrm{src}}$,并设置严格的清洗规则:彻底剔除特定屏幕截图、绝对坐标、资源 ID 以及绑定特定 App 路径的专有名词。
在进入目标应用后,源应用库完全冻结,只作为只读先验,系统另外开辟一个属于该目标应用的独立状态 $M_t^{\mathrm{tgt}}$。当向视觉语言模型(VLM)渲染提示词上下文时,程序动态组合这两种上下文。这种严格的来源隔离(Provenance Tracking),从物理层面断绝了目标应用探索污染通用流程库的风险,同时也确保了即便目标应用探索受挫,也不会擦除基础通用的高层推理框架。
底层策略参数 $\theta_t$ 则采用了轻量级方案。考虑到全参数微调在大模型上的算力消耗与稳定性风险,CoAdapt-GUI 将底层视觉语言模型(基于 UI-TARS-7B)的骨干网络彻底冻结,仅在其注意力层外挂可训练的 LoRA 适配器。这种双层架构为后续的协同演化创造了极佳的操作空间:高层工作流决定“做什么步骤、怎么检验”,底层 LoRA 决定“看到当前新屏幕时如何精准定位和点击”。
协同自适应:同一个轨迹流的双频演化
当智能体部署到目标应用后,通常只被允许执行极少的探索轮数(例如 20 轮,每轮仅有少数几次 Rollout)。在这般苛刻的预算下,如何同时驱动两种完全不同的状态更新?CoAdapt-GUI 设计了一套精巧的轨迹共享机制,两套通道使用同一次交互采集的数据,但在更新频率与数学处理上保持异步。
首先是基于奖励驱动的工作流演化。系统维护了一个通过 TrueSkill 评分算法排名的工作流变体种群。在每一轮探索中,控制器挑出候选的上下文变体,针对目标任务进行成对环境重置和采样交互,获取任务执行结果与真实环境返回的稀疏奖励。一个固定的反思器大模型(Reflector)负责对比同一批次中的成功轨迹与失败轨迹。如果发现某个变体在某个步骤频频卡顿,反思器就会提出针对性的修正(如增加一道防误触校验,或修正某个过渡状态的判断依据),生成新的子代工作流。
为了防止“越改越烂”,所有的候选子代必须通过极其严格的代码规范检查(Schema & Lint Checks)以及来源一致性检查。最关键的是,新生成的候选变体不会立刻生效,必须在后续轮次匹配相同的随机种子进行实测评估;只有在实打实拿到更高胜率和评分后,它才会取代父代,成为最高排名的引导上下文。
紧接着是策略维度的更新难题。在强化学习中,如果在探索过程中上下文提示词(Context)本身一直在动态变化,传统的策略梯度算法就会崩溃,因为策略输入分布发生了剧烈漂移,模型无法判断“一次操作成功”究竟是因为当前的 LoRA 权重学得好,还是因为提示词里的工作流变体写得好。
CoAdapt-GUI 由此提出了任务-上下文匹配的分组相对优化(Task-Context-Matched Group-Relative Optimization)。其核心数学直觉非常纯粹:既然不能跨上下文比对,那就坚决不跨。算法把同一个批次中采集的所有探索轨迹按“任务指令 $q$ + 对应的工作流变体 $\kappa$”严格划分成细分组:
\[G(q,\kappa)=\left\{j\;\middle\vert{}\;q_{j}=q,\;\kappa_{j}=\kappa\right\}\]优势函数(Advantage)只在这个细分的小组内部计算。也就是说,只有当几条轨迹面对完全相同的任务要求、注入完全相同的外部工作流提示词时,它们的奖励差异才被用来计算相对优势:
\[A_{j}=\frac{r_{j}-\bar{r}_{G}}{s_{G}}\]其中 $\bar{r}{G}$ 和 $s{G}$ 分别是该组内奖励的均值和标准差。如果一个小组内的所有尝试全部失败(奖励均为 0)或者全部成功,该组就会被直接丢弃,不产生任何梯度更新,杜绝无意义的伪信用分配。随后,这些优势值被用于计算策略损失:
\[\mathcal{L}_{\mathrm{policy}}=-\frac{1}{\lvert \mathcal{B}_{\mathrm{act}} \rvert}\sum_{j\in\mathcal{B}_{\mathrm{act}}}A_{j}\ell_{j}(\theta)+\beta\mathcal{R}\left(\theta;\pi_{\mathrm{anchor}}\right)\]公式后半部分引入了针对初始策略锚点的正则化约束,牢牢限制 LoRA 权重的漂移范围。通过这种精细切片,外置上下文的演化与内置策略的梯度学习完成了完美的正交解耦:上下文演化拓宽了探索视野,使得原本为 0 的任务有可能第一次爆出微弱的正向奖励;而分组优化则抓住这宝贵的正向信号,精准调校当前屏幕的视觉动素映射。
在 Chrome 应用的一次真实自适应过程中,可以直观观察到这种协同效应的威力:在最初的 11 轮探索中,由于引导流程不适配,智能体尝试的所有轨迹得分全部为 0,策略网络根本无从学起;直到第 12 轮,工作流演化通道生成了一个经过纠错的新变体,成功将 4 次尝试的平均奖励拉到了 0.25,而原始上下文依然为 0。正是这关键的上下文突破,瞬间为底层的 LoRA 优化注入了第一批真实、可靠的梯度信号。
严苛评测:不仅跨 App,更要跨任务类型
为了验证该框架的真实泛化能力,研究团队在基准设定上设立了极其严格的防泄漏防线。一旦自适应预算用完,选出的最佳工作流状态与 LoRA 适配器立即完全冻结,在后续所有测试集中不接收任何反馈、不做任何参数变动。
测试分为两个维度展开:
-
AndroidWorld-Generalization:遵循已有公开基准,源域包含 12 个应用、62 个任务模板,目标域包含 5 个从未见过的独立应用。在此设置下,自适应阶段与测试阶段的应用相同,任务模板相同,但使用完全不重叠的随机种子实例化不同参数,核心测试模型在见过的任务类型上的实例泛化。
-
AndroidWorld Plus:为了杜绝智能体“背诵”任务模式,团队进一步构建了这一高难度环境。在未见目标应用内部,自适应阶段与测试阶段的任务模板被彻底切断为互斥集合(60 个适配模板 vs 35 个测试模板)。这要求智能体在应用 A 里自适应了“查找好友”等操作后,测试时必须去完成“导出聊天记录”等全新类型的任务,真正考察其是否理解了该应用的全局底层逻辑。
在 AndroidWorld-Generalization 测试中,未做任何自适应的 7B 基础模型成功率为 27.10%,直接注入静态源工作流甚至可能带来负迁移导致不稳定(28.75%)。已有基线中的纯策略自适应(Policy-Only TTA)可将成绩提升至 37.50%,而纯工作流演化(Context-Only TTA)为 35.00%。CoAdapt-GUI 凭借双通道协同,一举达到了 45.00%(±1.86),在相同的交互轨迹预算下,比纯策略方案高出 7.5 个百分点,展现出了断层式的优势。
而在完全由全新任务构成的 AndroidWorld Plus 场景下,结果更加耐人寻味。基础策略的初始表现为 38.6%。如果只做上下文自适应(Context-Only TTA),成功率大幅跃升至 48.1%;当开启 CoAdapt-GUI 联合更新时,最终成绩直接定格在 52.9%,相比基线绝对提升了 14.3 个百分点。
实验中还有一个极具工程参考价值的对比维度:应用类别重叠度。当目标 App 属于源域包含的类别(Category-Shared)时,智能体可以检索到高质量的高层通用流程;而当目标 App 是完全冷门的品类(Category-Novel)时,系统开局只能依赖空工作流。数据表明,即使在完全无法利用源域流程库的极端冷启动场景下,CoAdapt-GUI 依然能靠目标域的自主试错在几轮内构建起有效的工作流骨架,并同步带动策略优化,其表现依然大幅碾压所有的单通道自适应变体。
移动 Agent 进化的新范式
回顾整个研究,CoAdapt-GUI 在算力开销与工程可行性上展现出了极高的实用价值。在单张具备 141 GB 显存的 NVIDIA H200 GPU 上,一个完整的 20 轮自适应运行平均仅需 9 到 10 个 GPU 小时。这表明,它完全可以在沙盒模拟器中作为轻量级的“部署前预热程序”运行:当用户的手机安装了一款新软件,后台调度器利用极短的空闲时间进行数十次无害的模拟自适应探索,就能在端侧沉淀出一个针对该软件的高效工作流缓存和一个小巧的 LoRA 权重补丁。
这项工作给整个大模型 Agent 领域带来了深刻的范式启示:智能体的环境泛化不应该被简化为一个单一的参数拟合问题。 面对物理世界或数字界面无穷无尽的长尾变化,单纯指望预训练底座去“包打天下”在经济和泛化边界上都是不切实际的。
将系统拆分为显式的认知流程(工作流上下文)和隐式的操作本能(轻量级策略),并利用任务与上下文严格锚定的数学约束,实现低频高阶反思与高频梯度优化的有机共生,或许正是通向真正稳健、不脆断的通用 GUI 智能体的必由之路。