FocusMem:不是无脑压缩轨迹!三大解耦机制让GUI Agent任务成功率最高提升18分

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在网页、桌面以及移动端自动化交互中,图形用户界面代理(GUI Agent)面临一个根本性的结构矛盾:它既需要情景记忆(Episodic Memory)来借鉴以往类似任务的成功路径,又需要工作记忆(Working Memory)来追踪当前任务已经执行了哪些操作、遇到了哪些界面约束。

ArXiv URL:https://arxiv.org/abs/2608.04530v1

如果直接将历史交互过程以完整的“截图 + 动作序列”重放给底层多模态大模型,庞大的视觉与文本 Token 会迅速撑爆上下文窗口,且带来成倍飙升的推理开销;而若单纯将交互记录转化为纯文本摘要,又极易丢失按钮坐标、动态弹窗样式、局部视觉状态等无法被精确文字化的关键细节。

隐式记忆(Latent Memory)正是为了调和这一矛盾而生。它借助小型神经网络将复杂的多模态轨迹压缩为极少量的连续向量(Token 块)。然而,以往主流方案大多采用“一镜到底”的暴力压缩思路:无论任务走到哪一步,同一条轨迹都被映射成完全静态的单一向量块,并且仅仅依靠最终动作的自回归损失进行反向传播。

来自中国科学院、北京大学和清华大学等机构的研究团队指出,这种“黑盒式单次压缩”忽略了记忆系统的本质规律,直接导致了三大致命缺陷:

  1. 压缩失真:仅靠下游动作监督,轨迹中的大量细节在瓶颈层被直接抹杀;

  2. 视角固化:一条长达十几步的轨迹往往涵盖了搜索、筛选、对比、表单填写等多个阶段,但在所有决策步骤中,模型看到的隐式向量块都毫无二致,无法按需呈现当前最需要的切面;

  3. 盲目信任:检索模块召回的经验可能与当前场景并不匹配,但固化的隐式向量仍会被强行注入决策流,严重干扰主策略判断。

为了彻底解决这一困境,研究团队提出了 FocusMem。它不再试图打造一个容量更大的黑盒压缩器,而是将隐式记忆的职责明确解耦为三个维度:存什么(内容基底)、怎么看(状态自适应读取)以及信不信(置信度门控)。在五个具有代表性的真实 GUI 基准测试中,FocusMem 在完全冻结主策略模型的前提下,相较于同等预算的固定隐式记忆基准取得了大幅度的性能跃升,最高在 DeepShop 任务上实现了 18.0 个百分点的成功率提升。

图1:购物轨迹中隐式记忆的三种典型失败模式

隐式记忆的症结:一条轨迹,三种盲区

图 1 清晰呈现了传统固定隐式记忆在实际电商交互中遭遇的典型困境。

假设 Agent 正在处理一个在电商平台采购特定规格商品的任务:

显式文本记忆可以通过文本重写、分段过滤或直接删除记录来应对上述挑战,但在信息高度密集的连续隐式空间中,必须设计专门的表征分解与路由机制。

图2:FocusMem的整体架构与双阶段优化流程

FocusMem的解耦之道:基底、读取与信任门控

如图 2 所示,FocusMem 将整个隐式记忆流水线分解为两个层级与三个核心组件。整个交互历史被拆分为两部分:当前最近的几步事件保持原始多模态形式输入给主策略,而超出可见窗口的更早步骤则被切片为工作记忆项;与此同时,外部经验库中检索出的历史成功轨迹作为情景记忆项。所有的多模态证据项首先通过共享的编码器提取特征 $H_i$。

1. 角色感知的内容基底:规范“存什么”

在以往的方法中,工作记忆与情景记忆往往共享完全相同的可学习 Query 向量,仅靠在最外层拼接一个来源类别 Embedding。这种做法无法显式约束不同角色到底应该保留何种层面的知识。

FocusMem 为不同角色设计了差异化的先验基底 Query $Q_0^{\mathrm{epi}}$ 与 $Q_0^{\mathrm{work}}$。为了使压缩后的隐式向量块 $Z_i^{\mathrm{fixed}}$ 具备扎实的内容承载能力,研究团队引入了双重监督机制:

通过这种联合监督,内容基底被训练为一个信息高度富集、角色特化明确的稳定“静态记忆池”。

2. 状态条件读取:掌控“怎么看”

拥有了高质量的静态基底并不意味着要直接把它扔给大模型。FocusMem 引入了状态自适应读取网络 $A_\eta$。

在具体的交互步骤 $t$,主决策状态(包括任务指令、当前屏幕观测及近期动作)被聚合成状态向量 $u_t$。读取网络以此为依据,结合被索引项的特征池化表征以及角色标识,生成一个动态偏移量:

\[\Delta Q_{t,i}=A_{\eta}\!\left(u_t,\operatorname{Pool}(H_i),e^{r_i}\right)\]

该偏移量叠加到静态基底 Query 上,得到全新的动态查询向量 $Q_{t,i} = Q_0^{r_i} + \Delta Q_{t,i}$。通过在共享的交叉注意力压缩器中再次提取特征,便能为当前决策生成高度定制化的动态记忆切片 $Z_{t,i}^{\mathrm{dynamic}}$。值得一提的是,$A_\eta$ 的输出层在训练之初进行了零初始化,保证了模型在优化初期平滑继承 Stage A 已经学成的高质量固定基底。

3. 证据信任门控:裁决“信不信”

在切片送入最终的主决策策略之前,FocusMem 设置了最后一道防线——轻量级块级信任模块 $T_\xi$。

许多检索召回的多模态证据在语义层面可能与当前任务相关,但在操作层面毫无参考价值,甚至是南辕北辙的干扰项。信任门控输入当前决策状态 $u_t$ 与动态记忆块的池化表征,输出一个置信度标量 $g_{t,i}$。只有当该标量经过 Sigmoid 激活后越过预设阈值 $\gamma$ 时,对应的记忆块才会被允许与主策略的输入 Token 拼接。在训练过程中,研究团队专门构建了无关的负样本轨迹,通过二元交叉熵损失约束门控在面对不可信线索时主动输出极低分数。

在最终推理阶段,所有通过门控验证的动态隐式 Token 会与当前步骤的原始上下文向量无缝拼合,直接输入给保持参数完全冻结的 GUI 策略模型,完成动作预测。

核心实验:全线超越强基线,最大涨幅18分

为了验证这种解耦机制的有效性,研究团队在统一严格的 15 步交互上限设置下,跨越五个主流 GUI 基准展开了详尽评测。这五个数据集包括了百科问答 MMInA-Wikipedia、复杂电商操作 MMInA-Shopping、真实高难度购物场景 DeepShop、多领域网页导航 WebVoyager 以及跨站表单操作 Online-Mind2Web。

主策略模型统一采用冻结参数的 Qwen3-VL-8B,底层视觉定位则配合 UGround-V1-7B,所有任务完成度均由 Gemini-3.1-Pro 按照统一打分提示词给出盲审判决。

评估基准 No Memory Retrieved Full Trajectory CoMEM-style HyMEM-style Mem-W-style Action-only Fixed (对照组) FocusMem (本文方法)
MMInA-Wiki 41.2 45.1 48.4 49.7 53.9 50.3 61.1 (+10.8)
MMInA-Shop 40.5 42.0 46.5 48.0 51.5 45.0 58.5 (+13.5)
DeepShop 16.0 20.0 24.7 26.0 29.3 24.0 42.0 (+18.0)
WebVoyager 44.1 48.5 52.8 54.7 60.0 56.5 73.5 (+17.0)
Online-Mind2Web 42.1 44.7 49.2 50.4 54.1 49.6 63.5 (+13.9)
Overall (平均) 36.8 40.1 44.3 45.8 49.8 45.1 59.7 (+14.6)

从上方核心指标对比中可以提炼出几个极具冲击力的技术结论:

  1. 全面超越原生多模态上下文重放:简单粗暴地将检索到的历史多模态长轨迹(Retrieved Full Trajectory)直接塞进上下文,平均成功率仅为 40.1%,甚至落后于多种专用的隐式记忆基准。而 FocusMem 在每个记忆项仅耗费 8 个隐式 Token(单次推理总记忆开销上限仅 48 个 Token)的极致紧凑预算下,平均成功率达到了惊人的 59.7%,高出完整轨迹重放近 20 个百分点。这强有力地说明:长文本上下文窗口的扩大并不能自动解决长程决策的注意力分散问题,信息的结构化重构远比未经提炼的原始信息堆叠更有效。

  2. 大幅碾压强对照基线:最为公平严苛的对照项是 Action-only Fixed——它与 FocusMem 享有完全一致的主干模型、检索候选集、训练数据分布以及 Token 预算,唯一区别在于它沿用了以往“端到端单次动作反传优化固定记忆块”的做法。实验表明,FocusMem 在五个数据集上展现出压倒性优势,涨幅分别达到 +10.8、+13.5、+18.0、+17.0 以及 +13.9 点。

  3. 高动态决策场景获益尤为显著:在步骤繁琐、页面状态多变的 DeepShop 和 WebVoyager 上,提升幅度双双逼近或达到 17-18 个点。这一现象在机制上完美契合了预期:越是长程复杂且分阶段清晰的交互,就越需要“状态条件读取”在不同环节提供不同切面的操作指引。

在执行效率方面,消融实验数据显示,随着内容基底、动态读取和信任门控的逐步加入,Agent 完成单任务的平均执行步数从 9.4 步平滑缩减至 8.4 步,因为步数超限判负的比例(Hit-Max)从 31.0% 大幅下降至 24.0%。尽管单步推理时间因动态 Query 生成和门控评分而增加了 1.70 倍,但得益于盲目试错步数的显著减少,最终每任务端到端总耗时仅微增 1.51 倍,完全在工程落地的可接受范围之内。

图3:动态读取的因果归因与抗干扰门控机制诊断

深度剖析:动态读取真起作用了吗?噪声注入见分晓

为了彻底验证增益究竟来自何处,作者团队进行了两组极其精巧的诊断性实验(如图 3 所示):

动态读取的因果依赖测试

在图 3(a) 针对 WebVoyager 的百步单步决策测试中,研究人员将模型内部的 Query、Key、Value 对应关系进行了受控破坏:

恶劣污染环境下的门控防御

现实部署中,检索算法不可能百分之百精准。在图 3(b) 与 3(c) 中,研究团队在测试阶段人为在每个步骤的 Top-3 候选池中强行掺入 1 到 3 条来自完全无关任务的高置信度干扰轨迹。

结果呈现出极其鲜明的对比:

这一对照生动表明,轻量级的二元置信门控在检测到记忆与当前决策上下文格格不入时,能够极其果断地“拉下电闸”,阻止有毒诱导信息污染主策略的注意力机制。

总结与展望

FocusMem 的成功给大模型 Agent 记忆系统的演进带来了深刻的技术启示。长期以来,社区在探索 Agent 长期记忆时往往陷入两个极端:要么寄希望于无限扩充多模态上下文,任由原始轨迹的大量冗余冲淡主干模型的推理精力;要么指望一个简单的 Q-Former 结构能在端到端损失下创造奇迹,把几十个截图压缩成十几个静态向量并包治百病。

FocusMem 清晰地证明了职责分解(Factorization)的价值所在。将记忆系统拆解为底层内容的可恢复沉淀、决策时刻的多重视角切片以及入口处的严格准入验证,不仅符合认知层面的记忆调用规律,更在计算开销极其有限的前提下最大化释放了隐式表征的潜力。

当然,该方案目前主要在固定的 8B 规模主策略模型与网页类基准上完成了验证,未来在更多通用操作系统、跨端多应用协同以及更长生命周期的自治 Agent 中,这种解耦机制如何与动态参数微调(如 LoRA)深度融合,依然是极为值得关注的演进方向。