VerMem:双验证器统一Agent长短记忆,省下20%计算预算刷爆五大基准

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

VerMem:双验证器统一Agent长短记忆,省下20%计算预算刷爆五大基准 论文图示

在大模型驱动的智能体(LLM Agent)向复杂长流程任务迈进的过程中,记忆机制早已被证明是决定上限的关键底座。如果智能体无法妥善管理历史交互、工具调用产物和阶段性结论,面对需要数十乃至上百步的长程决策时,上下文窗口便会迅速被无关噪音淹没,进而引发灾难性的幻觉与推理断崖。

ArXiv URL:https://arxiv.org/abs/2608.03137v1

然而,现存的记忆机制普遍面临两难困境。一方面,社区在工程上习惯将“长期记忆”(LTM,负责跨轮次持久化检索)与“短期记忆”(STM,负责维持当前上下文的精炼与可用)割裂开来,二者缺乏统一的调度决策;另一方面,少数尝试联合学习记忆操作的方案,往往严重依赖最终轨迹的成败作为强化学习的反馈信号。这类端到端奖励过于稀疏,根本无法穿透漫长的调用链去精确判定:到底是哪一次记忆写入带来了关键信息,还是哪一次错误的上下文过滤导致了十步之后的彻底溃败?

针对这一痛点,来自南洋理工大学、中山大学与腾讯的研究团队提出了统一记忆管理框架 VerMem(Verifiable Memory)。该工作打破了长短期记忆的割裂设计,通过一个统一的策略网络调度 7 种原子级记忆操作,并创造性地引入了“局部验证器”(Local Verifier)与“全局验证器”(Global Verifier)构成的分层信用分配机制。更值得一提的是,验证器仅在强化学习训练阶段提供细粒度语义监督,在推理阶段则完全移除,做到了不增加任何在线推理开销。

实验表明,仅在多跳问答数据集 HotpotQA 上完成训练的 VerMem,展现出了极强的零样本跨任务迁移能力,在涵盖交互环境交互、具身规划与复杂推理的五大基准测试中,全面超越了 LangMem、Mem0、AgeMem 等强基线;在同等在线 Token 预算约束下,达成目标成功率所需的计算消耗缩减了整整 20%。

VerMem 架构概览

长程决策中,智能体记忆究竟为何难以协同?

长程智能体所面临的记忆困境,本质上并非单纯的“容量不够”,而是异构状态的调度失序与信用归因的迟滞。深入剖析现有的记忆范式,通常存在三个难以调和的技术瓶颈。

首先是异质记忆尺度的协同冲突。长期记忆关心的是外部知识库或历史经验的增删改查,动作发生在大时间尺度上;而短期活跃上下文则直接决定了模型当前生成时能“看到”什么,受到严格的上下文窗口约束。如果仅优化长期持久化,外部检索回来的碎片极易与当前推理目标产生语义偏移;如果仅做当前上下文压缩,早期丢弃的某些中间工具输出或关键状态,在后续子任务切换时又会彻底丢失。

这就引出了第二个核心难点:情景历史的再激活与恢复。在以往的短期记忆管理方案中,过滤(Filter)与摘要(Summarize)是主流操作,但一旦信息被移出活跃上下文,智能体便很难在数十步后精准捞回特定的历史切片。常规检索工具倾向于返回全局最相似的知识,而非特定阶段的瞬态执行过程,导致智能体面对环境回溯需求时束手无策。

最后则是训练维度的多粒度信用分配困境。强化学习固然是训练记忆策略的理想工具,但记忆操作的价值具有严重的延迟性与协同依赖性。一次正确的记忆写入,可能要等到很多步之后的某次精准召回才会显现收益;一次看似无伤大雅的激进摘要,却可能在五步后让关键变量凭空蒸发。仅用最终的任务成功与否来评估整个轨迹,会为每一次原子记忆决策赋予极其模糊甚至误导的更新方向。

解构 VerMem:三态解耦与七大原子操作

为了在保留功能边界的同时实现全局掌控,VerMem 在概念层面上将智能体的状态明确解耦为三个维度:持久化长期记忆 $M_t$、受预算约束的短期活跃上下文 $C_t$,以及按时间序列完整归档的同任务情景历史 $H_t$。

在这三类状态之上,VerMem 构建了一个统一的记忆操作策略 $\pi_\theta$。智能体在每个决策时间步不仅要决定执行何种下游任务动作,还需要先根据当前全局状态的序列化表示,调用相应的原子记忆工具来重构上下文。研究团队将这些操作提炼为涵盖 LTM 与 STM 的 7 种原子指令:

在长期记忆层面,提供 Add(新增事实条目)、Update(修正已有记忆条目)与 Delete(对过时或错误事实进行软删除)。这使得长期记忆不再是一个只增不减的杂乱向量库,而是具备持续演化与纠错能力的结构化状态。

在短期记忆与历史恢复层面,提供 Retrieve(将长期记忆中匹配的信息注入活跃上下文)、Filter(剔除当前上下文中与子目标无关的冗余信息)、Summarize(将冗长的推理痕迹压缩为高密度摘要),以及至关重要的 SelectEpisode(从沉睡的情景历史 $H_t$ 中精准恢复早期的关键片段至活跃上下文)。

引入 SelectEpisode 是 VerMem 与传统记忆架构的关键分水岭。它将“从历史中捞回瞬态观测”明确建模为一种第一类的短期记忆决策,既避免了把庞杂的历史轨迹无休止地塞在活跃上下文里,又赋予了智能体在子任务切换时回溯早期线索的确定性能力。

双重验证器驱动的分层强化学习

为了让这 7 种原子操作在协同中保持严谨性,VerMem 摒弃了纯粹依赖端到端稀疏奖励的传统做法,设计了局部与全局双重验证机制,并配合三阶段强化学习课程(Curriculum Learning)来驱动策略更新。

首先,模型在高质量标注数据集上进行监督微调(SFT)热身,学会合规输出 7 种工具调用及空操作(Identity Decision);随后,策略进入强化学习阶段,先后经历长期记忆操作训练、短期记忆操作训练,最终进入长短期协同训练。

在强化学习采样轨迹时,VerMem 针对每一个记忆决策计算两路解耦的优势函数:

局部验证器(Local Verifier)在单步转移发生时即时介入。它专注于评估可执行记忆操作的局部语义质量,其核心打分维度包括任务相关性、证据支撑度、局部推理推进效果以及信息保真度。如果模型选择不执行任何记忆变更的空决策,局部验证器会通过专属标准判定当前上下文是否确实无需变动;若模型输出了非法的结构或超出预算的操作,则直接被执行引擎拦截并赋予固定的硬性约束惩罚,不送入局部验证器,从而防止语义打分与结构错误相互污染。

全局验证器(Global Verifier)则在整条任务轨迹执行完毕后进行复盘。它的综合反馈由四个维度复合而成:程序化判定的最终任务达成情况、证据支撑与全局连贯性、终态长期记忆的一致性,以及在任务成功前提下的 Token 消耗效率。全局验证器从宏观视角约束智能体,确保局部看起来合理的记忆操作不会在宏观层面上破坏全局推理链。

在策略梯度的计算中,VerMem 采用了类似 GRPO(Group Relative Policy Optimization)的机制。对于针对同一任务采样的候选轨迹组,局部打分按照操作工具类型在组内分别进行标准化计算出局部优势 $A_{t,k}^{\mathrm{local}}$,全局综合打分则按轨迹级别标准化为全局优势 $A_k^{\mathrm{global}}$。二者与显式的硬约束代价 $c_{t,k}$ 线性结合,形成最终的分层优势函数:

\[A_{t,k}^{\mathrm{hier}}=\lambda_{\mathrm{local}}A_{t,k}^{\mathrm{local}}+\lambda_{\mathrm{global}}A_k^{\mathrm{global}}-\lambda_{\mathrm{constraint}}c_{t,k}\]

通过这种机制,原子操作的具体执行质量与整条轨迹的成败终局在数学上形成了闭环。梯度更新仅仅施加在生成记忆命令的序列 Token 上,环境反馈、任务求解器自身的推理过程以及输入的状态提示均被严格屏蔽,确保策略梯度的更新纯粹聚焦在记忆调度的决策能力上。

实验评测:跨领域迁移与显著的效率优势

评估记忆框架有效性的终极试金石在于其泛化能力。在实际训练中,VerMem 仅在多跳事实问答数据集 HotpotQA 的训练集上完成了 SFT 与强化学习对齐,随后的所有评测均是在完全没有接触过任务环境的零样本状态下,直接迁移到包括交互式家用具身环境 ALFWorld、复杂科学探索环境 SciWorld、符号化规划基准 PDDL、指令导航基准 BabyAI 以及 HotpotQA 自身这五大极具挑战的基准上。

底层模型分别选用了 Qwen2.5-7B-Instruct 与更轻量的 Qwen3-4B-Instruct,对比基线囊括了无显式记忆的 Base 方案、持久化记忆系统 LangMem 与 Mem0、动态索引演化框架 A-Mem,以及此前代表长短记忆联合调控前沿水平的 AgeMem。

实验数据显示,VerMem 在全部五项基准和两种基座模型上,几乎刷新了所有评估指标的最优表现。以 Qwen2.5-7B-Instruct 为例,在考察复杂长程交互的 ALFWorld 和 SciWorld 中,VerMem 的成功率分别达到 78.43% 与 52.88%,不仅大幅超越了 Base 模型,相比于同样具备统管思想的 AgeMem 也取得了显著提升;在符号推理难度极高的 PDDL 规划任务中,进度指标同样稳固位居首位。在规模更小的 Qwen3-4B-Instruct 上,这种优势依然保持稳定,证明该机制对模型底层容量具有良好的适应性与鲁棒性。

更为关键的突破体现在性能-效率前沿曲线上。在智能体落地过程中,上下文过长所带来的延迟激增与 Token 费用是最大的落地阻碍。研究团队在严格限制在线 Token 预算的环境下对模型进行了压力测试。结果表明,VerMem 展现出了极为陡峭的效能提升曲线:在多项交互基准的宏观平均成功率达到 40% 的预设门槛时,VerMem 仅需消耗约 2080 个在线 Token,较此前最佳方案 AgeMem 降低了 20.0% 的计算量;而在 2500 Token 的固定预算约束下,VerMem 取得的宏观成功率更是比 AgeMem 高出 5.30 个百分点。

消融实验进一步验证了双重验证机制与全生命周期记忆管理的不可替代性。如果仅引入长短期记忆工具但剥离强化学习中的局部与全局语义验证器(即 VerMem-noVerify 对照组),模型的表现会出现明显下滑,尤其在推理链路极长的科学与规划任务中,缺乏精细信度分配的策略极易退化为盲目、频繁的记忆调用。

在奖励函数的细致对比中,由局部质量、连贯性与 Token 节约奖励共同构成的复合打分体系,让智能体在训练过程中展现出更早的收敛稳定性和更低的晚期方差。智能体并没有通过“干脆不调用任何记忆工具”这种取巧方式来骗取 Token 节约奖励,相反,其记忆工具的调用质量和上下文的信息纯度均显著上升,这说明模型真正学会了在恰当的时间做出恰到好处的记忆决策。

从割裂到自主:智能体记忆范式的演进思考

回顾 LLM 智能体的演化路径,早期系统往往将记忆视为外挂的检索插件,后来的研究者则试图通过精巧的 Prompt 工程在有限窗口内缝缝补补。VerMem 的核心贡献,在于证明了长短期记忆不仅能够在形式上被统一表征为一个包含 7 种原子操作的决策空间,更能够在数学上通过细粒度的分层验证信号,将其训练为一个具备高度自我反思与调度能力的策略网络。

这种设计思路对智能体工程有着深刻的启发意义:

  1. 训练与推理的成本解耦:利用能力更强但开销巨大的教师模型或特定验证器,在离线训练阶段作为局部与全局裁判,将高阶的记忆反思能力通过强化学习“内化”到小参数规模的记忆策略中,在部署时直接剥离验证器,做到了零附加推理成本的高效运转。

  2. 瞬态历史与持久知识的边界明确:将情景历史的回溯(SelectEpisode)与持久化状态的检索(Retrieve)解耦,为智能体提供了针对“曾经发生过什么”与“掌握了何种事实”两种完全不同记忆维度的独立提取通路,有效抑制了跨阶段记忆幻觉。

当然,正如论文在局限性中所指出的,VerMem 目前的评测范式集中于单任务会话内的情景持久与跨基准迁移,尚未完整覆盖超长周期下的跨用户隐私隔离与多会话长期沉淀;同时离线依赖的强力验证器本身也可能引入特定的评估偏置。但无论如何,VerMem 成功展示了一种极具说服力的技术路径:大模型智能体不需要无限扩张的上下文窗口,通过可验证的原子化记忆调度,即使在有限的计算预算内,同样能够稳健驭使长程复杂的智能推理任务。