检索越多反而错得越多?11种Agent记忆底座横评揭示注意力分流机制
Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents
在大模型逐步走向长周期、自主执行复杂任务的今天,为智能体构建持久记忆几乎成为了行业共识。无论是跨会话理解用户习惯的个人助理,还是在数百次代码提交中积累项目规范的编程助手,开发者通常的第一反应是:引入外部存储,把历史交互全部存下来,执行任务时再检索(RAG)出来拼进 Prompt。但很少有人停下来追问:这些记忆究竟应该存在怎样的介质(Substrate)里?向量数据库、关系图谱、层级树状摘要、模型权重微调,还是显式的上下文缓存?
ArXiv URL:https://arxiv.org/abs/2608.15008v1
来自麦吉尔大学、MBZUAI、UCLA、UIC 与华盛顿大学的联合研究团队在论文《Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents》中,对这一关键基础设施进行了系统性的严格受控评测。他们得出了一个令许多系统工程师意外的结论:在智能体记忆领域,不仅不存在所谓的一招鲜基质,甚至连“多检索几条相关经验”这种在问答任务中百试不灵的黄金法则,在自主决策任务中也会直接变成让智能体性能暴跌的致命毒药。

被遮蔽的记忆评估陷阱
在很长一段时间内,智能体记忆系统的研究都陷入了一种片面的评价惯性中。研究团队在系统梳理了 2023 至 2026 年间 52 个代表性记忆增强智能体系统后,指出了当前评测的三大结构性缺陷。
超过六成的评测指标被完全集中在 LoCoMo 和 LongMemEval 等纯对话问答基准上,而真正考察工具调用、环境交互与顺序决策的智能体任务却长期缺席。绝大多数论文只汇报最终答案的准确率,仅有 21% 的工作会提及延迟,关于写入成本、内存膨胀率以及多轮压缩开销的量化数据几乎处于空白状态。超过八成的系统仅仅绑定 GPT 系列单一模型运行,导致底座本身的存储特性与特定闭源模型的指令遵循偏好混淆在了一起。
这种评测维度的缺失,使得许多在对话榜单上表现优异的记忆方案,一旦被直接移植到具身规划或代码补全等闭环决策场景中,就会遭遇严重的性能滑铁卢。为了拆解这层黑盒,该工作构建了一个严格的控制变量测试系统(Harness),将底座(Substrate)本身作为唯一的自变量,锁定了底层的基座模型、提示词模板以及辅助处理模型。
研究覆盖了当前所有主流的 7 大记忆底座家族共 11 种具体方法:
-
平坦索引(Flat Index):包括免训练无额外调用的稠密向量检索(M1 Dense Vector)与稀疏向量检索(M2 Sparse Vector,如 BM25)。
-
文本记录(Text Record):带写入端精简与读取端分页筛选机制的 Gist 索引(M3 Gist Index)。
-
结构化存储(Structural):能够自动触发节点重写与关联更新的演化笔记(M4 Evolving Notes),以及抽取多层实体关系的双层图(M5 Dual-Level Graph)。
-
层级存储(Hierarchical):对经验进行递归聚类和层级摘要的树状索引(M6 Hierarchical Tree)。
-
精炼记忆(Refinement):对轨迹结果进行反思归纳的蒸馏策略库(M7 Distilled Strategies),以及将历史动作聚合成可复用组件的技能包(M8 Skill Bundles)。
-
参数化更新(Weight):通过 LoRA 或适配器微调将经验注入模型权重的 Adapter 方案(M9 Adapter Tuning)。
-
激活层机制(Activation):包含硬吃长上下文的暴力填充(M10 Full Context),以及按多轮交互聚类后仅在读取时对匹配片段重算预填充的机制(M11 Episode-Clustered Re-prefill)。
所有底座在统一调度下,运行于 Qwen3-8B、Qwen3-32B-AWQ 和基于混合专家的 Gemma-4-26B-A4B-IT 三大主流模型之上,并接入 26 项涵盖任务效果、延迟、存储、Token 消耗及管理成本的多维指标。
任务范式反转:问答的良药,决策的毒药
实验横跨了两类完全不同的业务环境:以事实抽取为主的用户对话问答(LoCoMo、MemoryAgentBench),以及需要多步连续动作执行的智能体决策基准(ALFWorld 具身规划、BigCodeBench-Hard 代码补全)。
在用户问答场景下,记忆底座的核心矛盾在于“从数万乃至数十万海量 Token 历史中定位微小的事实依据”。实验显示,构建了精细实体与关系链接的结构化双层图(M5 Dual-Level Graph)全面压制其他方案。在面对跨多轮对话的时间冲突、实体属性更新时,图结构的显式更新机制展现了极其出色的纠错与精确定位能力。尽管 M5 的维护延迟居高不下,但在检索要求苛刻的事实问答中,这种机器开销换来了实打实的准确率收益。
但当同样的底座被部署到智能体决策环境(ALFWorld)中时,天平彻底倾斜。
在连续决策任务中,图结构(M5)与演化笔记(M4)带来的复杂上下文并没有转化为更好的行动指南,其最终表现甚至被最简单的平坦向量检索帕累托支配。此时表现最好的底座,是彻底换了逻辑的精炼型记忆(M7 Distilled Strategies)与片段重计算预填充(M11 Re-prefill)。M7 在 Qwen3-32B-AWQ 模型上跑出了全表最高的 32.1% 任务成功率(TSR),几乎让无记忆基线(22.4%)提升了近 10 个百分点;M11 则在 Qwen3-8B 上将成功率直接翻倍。
这一反差揭示了智能体执行环境的本质差异:在具身规划中,模型面临的不是“大海捞针”式的事实回溯,而是在“当前环境观测(Observation)”与“可行候选动作列表(Admissible Actions)”之间做精准映射。原始的历史交互轨迹充斥着大量无效尝试和环境噪声,如果直接将一长串相似的历史上下文推给模型,反而会严重扰乱策略生成。M7 之所以胜出,是因为它在写入记忆时引入了反思机制,把过去冗长的执行过程蒸馏成简练的规则与抽象模式;M11 则是通过时间片段聚类,精准抑制了无关历史步数对当前注意力层的干扰。
检索深度的诅咒:为什么越“博学”越容易迷航?
工程师在调优 RAG 系统时,往往有一个直觉:如果召回效果不好,把 Top-$k$ 放大一些即可,模型哪怕读到了无关内容也可以自行忽略。这项研究通过严谨的检索深度扫描,打破了这一侥幸心理。

在对话问答基准 LoCoMo 上,将检索数量 $k$ 从 1 逐步提高到 20,各底座的评估分数($P_4$)展现出近乎单调的平稳上升。原因非常符合直觉:问答场景下只要金色标签(Gold Evidence)被包含在召回的片段里,上下文窗口里的冗余信息对最终提取答案并无太大干扰,大模型展现出了强大的“提取式阅读”容忍度。
但在智能体决策任务 ALFWorld 上,曲线呈现出令人警醒的断崖式反转。随着检索深度 $k$ 从 1 逐渐增加到 5,所有记忆底座的任务成功率集体跳水。即便是表现最优异的 M7,其成功率也从 $k=1$ 时的 32.1% 一路阴跌至 $k=5$ 时的约 25%;而基础向量检索(M1、M2)在 $k$ 放大后,其表现甚至全面跌破了完全不挂载任何记忆模块的纯粹基线(NoMem, 22.4%)。
与此同时,任务达成所消耗的平均步数却在不断向系统的上限逼近。这表明,被灌入大量历史记忆的智能体并没有变得果断,相反,它们在环境中陷入了漫无目的的“游荡”(Wandering)。过多的相关案例不但没能提供指引,反而让智能体在当前动作选择上举棋不定,最终步数超限走向失败。
探针揭秘:注意力是如何被检索片段吞噬的
为了在物理机理上解释这种反向缩放现象,研究团队采用注意力探针(Attention Probing)技术,对推理阶段最后一个 Prompt Token 在多头注意力高层网络中的权重分布进行了空间切片。

他们将输入内容划分为四个主要区域:系统指令(System)、检索出的记忆块(Retrieved)、任务即时上下文(Context,包含当前状态轨迹、环境实时观测与当前合规动作空间)以及决策线索(Cue,即具体的用户提问或下一步行动驱动符)。
热力学探测清晰地展示了注意力的流动过程:无论是在问答任务还是在决策任务中,只要增加检索条数 $k$,模型的注意力分布就会不可阻挡地发生同一种结构性迁移——大量注意力权重被强行从 Context 区域抽离,灌入到庞大的 Retrieved 记忆块中。
然而,这两类任务的死穴所在完全不同:
-
在问答场景(LoCoMo)中:回答问题的证据链原本就躺在检索出来的片段里(Retrieved 区域),注意力向该区域的高度倾斜正是模型完成事实抽取的正确路径,Context 区域权重的缩减无伤大雅,因此任务表现节节攀升。
-
在智能体决策(ALFWorld)中:决定下一步生死的核心信息恰恰是实时环境观测与那几条稍纵即逝的可用动作候选(Context 区域)。当外部检索内容塞满注意力机制时,模型对实时状态的感知被系统性稀释;更危险的是,驱动当前决策的 Cue 区域也在 $k$ 增大时被剥夺了约 4% 的注意力份额。这微小的关键权重流失,足以让模型选出无效甚至荒谬的动作。
这一发现为智能体架构师敲响了警钟:外部检索并不是免费的午餐。模型的单次注意力预算是恒定的,从长程记忆里多拖拽出一份历史记录,本质上就是在对模型当前的现场感知做一次无情的注意力降权。
长上下文扩展下的工程真实账本
在上下文长度从 6K 暴增到 32K 乃至 262K 的压力测试下,不同底座的工程开销曲线彻底分化。
直接堆砌原始上下文的方案(Full Context)不仅在长序列下的推理延迟呈现指数级膨胀,且极度依赖基座模型自身的“大海捞针”精度;而复杂图数据库虽然保留了精细的逻辑网络,但在数十万 Token 规模下,其维护开销和构建多跳索引所需的辅助 LLM 调用成本呈现重尾分布,在许多工程场景中甚至变得无法在经济意义上交付。
相对而言,基于显式提炼与聚类的结构(如 M7 与 M11)在规模膨胀时表现出了卓越的扩展弹性。因为它们把计算开销前置到了“写入期”,使得推理阶段推给骨干模型的上下文永远保持在信息密度极高、Token 量极窄的安全带之内,从而在长程跨度中守护住了动作策略的注意力焦点。
走向自适应复合记忆路由
这项研究所呈现的跨维度评测,最终沉淀出一条清晰的智能体底层架构演化逻辑:以写时深度,换读取宽度(Trade read breadth for write depth)。
在设计记忆模块时,开发者应当极力克制在推理阶段盲目增大 Top-$k$ 召回广度的冲动,转而将算力资源下沉到写入端。在事件沉淀进存储介质的那一刻,就应借助辅助模型完成清洗、因果提炼与噪声剔除,压减出高度紧凑的高信噪比表征。
更重要的是,研究从数据层面彻底终结了“通用单一记忆底座”的技术幻想。既然结构图天然适配多跳事实关联,而精炼策略天然适配时序闭环决策,那么下一代 Agent 记忆系统的核心主干,必然不再是一个孤立的存储插件,而必须是一个具备底座路由能力(Substrate Routing)的复合架构:
-
当智能体接收到长跨度的事实溯源与参数冲突校验时,调度网关将请求无缝导向图结构或层级索引;
-
当智能体步入外部环境执行工具调用与环境探索时,系统应自动切断原始交互片段的直接外挂,转而激活轻量化抽象策略库与精确的时间片段缓存。
让不同的记忆介质在各自适配的工况下发挥效能,而不是寄希望于单一大模型去强行消化芜杂的上下文,这才是从工程玩具走向工业级长程自主智能体的真正必由之路。