Zero-Mem:智能体记忆无需LLM!零Token操作让耗时降低57.6%

Zero-Mem: Zero-Token Memory Operations for LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在赋予大模型智能体(LLM Agent)长期记忆的方案中,业界似乎逐渐形成了一种技术惯性:只要遇到复杂的交互历史,就调用大模型去总结、反思、提取实体三元组,或者在检索时让小模型反复进行意图重构与语义合成。这种“用大模型管理大模型记忆”的思路,固然能将冗长的历史压缩为看似整洁的抽象摘要,却也埋下了两个长期难以忽视的隐患——高昂的显存与 API Token 账单,以及在多轮生成与重写中不可避免发生的事实丢失、时序混乱与幻觉蔓延。

ArXiv URL:https://arxiv.org/abs/2607.29377

如果智能体对记忆的组织、管理与检索,根本不需要任何一次 LLM 生成调用呢?

最新提出的 Zero-Mem 正面挑战了这种主流的生成式记忆范式。这项工作提出了零 Token 记忆操作(Zero-Token Memory Operations)的新标准:除了在最终根据检索证据回答用户问题的 Reader 阶段调用一次 LLM,整个系统在记忆的构建、层级编排、条件路由、图游走、上下文闭包以及结果校准的全部环节中,不发起任何一次 LLM 调用,不消耗任何一个生成 Token。

记忆机制对比

实验表明,这种彻底剥离生成环节的确定性证据选择策略,不仅没有牺牲问答表现,反而在多轮会话记忆基准 LoCoMo 与超长上下文基准 HotpotQA 上全面超越了此前最强的大模型记忆基线。在保持相同最终 Reader 和上下文预算的前提下,Zero-Mem 将记忆操作的耗时相比最快基线降低了 57.6%,彻底证明了结构化记忆完全不必依赖中间生成的伪叙事。

为什么生成式记忆容易“越帮越忙”?

要理解 Zero-Mem 的突破,首先需要认清当前智能体记忆方案所面临的系统困境。面对海量交互历史,已有的设计通常在两个极端之间摇摆。

其中一个极端是彻底的生成式记忆抽象。例如 Mem0、A-Mem、Zep 等系统,它们利用大模型在线或者异步地提取记忆片段、更新状态或生成知识图谱。这类方案将原始交互转化成了高层次的摘要,虽然降低了单次检索的上下文长度,却在记忆生命周期里引入了频繁的生成开销。更致命的是,生成过程是不可逆的信息压缩过程。一旦大模型在合并几轮会话时忽略了某个特定的时间戳,或者将两个相似实体的偏好张冠李戴,底层的真实证据(Grounding Evidence)就被彻底破坏了,后续的检索再也无法追溯回真实的交互现场。

另一个极端则是无状态的扁平检索。系统完整保存原始上下文切块,在提问时通过稠密向量(Dense Retriever)或 BM25 进行 Top-K 召回。这种方式完全保真,不消耗生成 Token,但在多轮对话场景下极其脆弱。向量匹配对具体的实体关系、会话所属的 Session 边界以及时间跨度毫不敏感,极易被多轮聊天中字面相似但时间早已失效的陈旧事实所干扰;而遇到横跨多个 Session 的多跳推理时,孤立的文本块检索往往无法拼接出完整的证据链。

近期的 LightMem 和 SimpleMem 尝试通过轻量级小模型或更紧凑的语义压缩来缓解这些成本,但依然没有摆脱生成式流程。Zero-Mem 的核心判断是:记忆管理系统的本质,应当是在带有完整溯源信息的原始交互踪迹上,执行结构化的高精度证据选择,而不是去凭空创造一套中间记忆表示。

双视图组织:不消耗 Token 的关系图与时序层级

为了在零 LLM 参与的前提下实现深度的结构化检索,Zero-Mem 将原始交互历史完好保留,并在其上并行构建了两套互补且完全可溯源的结构视图。

Zero-Mem 架构图

第一套视图是实体-上下文图(Entity-Context Graph)。与那些动辄要求 LLM 提取复杂三元组的方案不同,Zero-Mem 采用非生成式的轻量级命名实体识别(NER)工具(如 spaCy)扫描文本单元,直接基于真实观察到的实体共现与上下文邻接关系建立网络节点与边。实体与上下文片段之间的边权重完全由共现频次决定,相邻的上下文单元自动建立连接。这里不存在任何大模型脑补的主观推理,整张图忠实记录了哪些实体在哪些对话片段中同时出现过。

第二套视图是多粒度的时序层级结构(Temporal Hierarchy)。图结构擅长跨越文档与时间关联实体,却天然丢失了对话的先后时序和会话局部性。Zero-Mem 将交互踪迹划分为四层渐进单元:

所有这些层级单元不仅包含原始对话文本,还显式绑定了时间戳、会话 ID、说话人元数据与边界标识符。这两套视图完全映射回同一批底层的不可变踪迹,为后续的双路召回奠定了确定性基础。此外,系统通过 BGE-M3 提取稠密语义向量,配合传统的 BM25 词法统计建立索引,这些向量仅用于几何距离计算与语义锚定,同样不涉及任何自回归生成。

路由、闭包与确定性校准:全链条零生成

有了双视图基座后,Zero-Mem 在处理具体查询时,依赖一套精密的确定性算法完成证据提取。

当收到用户问题 $q$ 时,系统首先执行轻量级 Profile 解析,无须大模型参与,直接通过规则提取出查询的主体实体、关键词、预期的答案类型以及时间线索。基于查询的结构特征,系统将问题路由偏好分为“关系优先”与“局部优先”。两套视图在实际检索中均会运行,路由的主要作用是为最终的双视图融合动态分配权重 $\rho$。

在实体-上下文图上,Zero-Mem 采用个性化 PageRank 算法进行证据传播。首先将查询中识别出的实体映射到图中的锚点节点,赋予初始激活能量,能量随后沿着共现与邻接边在图谱中扩散,得到关于上下文节点的平稳状态得分向量 $\boldsymbol{\pi}_{q}$。这种在传统图算法中极为成熟的阻尼随机游走,能够极高效率地挖掘出那些与目标实体高度互联但字面可能完全不相关的“桥接证据”。

在时序层级结构上,系统则遵循自顶向下的粗到细检索路线:先在 Episode 层面基于语义与边界线索做大范围定位,随后逐步下钻至 Window 与具体的 Turn。

在双视图各自产生打分后,系统使用极值归一化将两套分值平齐并加权融合,选出主候选集。为了防止单一匹配切块导致上下文语境断裂,系统接下来执行“双视图证据闭包”(Dual-View Evidence Closure):利用实体图拉取与候选切块存在强关联的关系邻居,同时利用时序层级拉取候选切块前后的原始轮次,从而拼装出一个兼具多跳关联与局部语境的紧凑证据集合。

在将证据交给最终的 Reader 前,Zero-Mem 引入了关键的“确定性证据校准”。它像一道坚固的代码防火墙,强制过滤掉与当前问题时序约束冲突、实体主体错配或超出目标会话边界的无效片段,并基于答案类型兼容性对候选内容重排。

直到这一刻,筛选完毕的高质量紧凑上下文才会被送入唯一的 LLM 调用环节——最终的问答 Reader。令人惊叹的是,在模型输出答案之后,系统还会执行一次基于规则的答案校准,检查输出是否严格被检索证据所支撑、格式是否符合要求。整个记忆闭环严丝合缝,除了读证据答题的那一步,没有任何参数矩阵在做自回归解码。

真实较量:性能反超与 57.6% 的延迟削减

零 Token 记忆听起来优雅,但它能否抗衡调用了更丰富算力的生成式基线?论文在 LoCoMo 和 HotpotQA 两个代表性基准上给出了极具说服力的回答。

LoCoMo 是评估多会话长程对话记忆的代表性基准,涵盖单跳、多跳、时序推理及开放域四类任务。实验对比了包括长期记忆前沿方案 GAM、SimpleMem、LightMem、A-Mem、Mem0 在内的代表性方法,并分别使用 GPT-4o-mini 和 Qwen2.5-14B-Instruct 作为最终 Reader。

实验表明,Zero-Mem 在两个 Reader 设定下均斩获了全场最高的平均 F1 与 BLEU-1 得分。以 GPT-4o-mini 为例,面对此前综合性能最强的基线 GAM,Zero-Mem 将平均 F1 和 BLEU-1 分别提升了 5.40 和 5.45 个点;在开源的 Qwen2.5-14B 上,更是全包揽了全部四类任务与评估指标的第一名。相较于单纯基于滑动窗口的 LONG-LLM 与常规语义分块检索的 RAG,Zero-Mem 在对状态、边界高度敏感的时序推理和开放域任务上建立了断层式优势。这证实了:只要结构化图扩散与层级上下文搭配得当,完全无需大模型预先“总结”会话,就能更精准地定位正确状态。

在长上下文多跳问答基准 HotpotQA(包含 56K、224K、448K 三档干扰文档长度)上,Zero-Mem 同样展现了极强的抗噪鲁棒性。随着上下文长度和干扰片段急剧增加,Zero-Mem 在所有长度设置和不同底座下均保持了最高的 F1 分数,平均领先最强基线 5.52 个点。

更具实用价值的是系统开销对比。论文在相同并发与硬件配置下统计了各方案在记忆操作环节(剔除最终共用的 Reader 阶段)的消耗:

拆解结构:双视图为何缺一不可?

为了探究系统各个模块的实际贡献,论文在 HotpotQA(56K 上下文)上进行了剥离分析。

消融数据显示,完整的双视图模型取得了 72.07 的 F1 分数;当剥离时序层级仅保留图视图时,F1 下跌至 62.50;而如果彻底去除图结构仅保留时序层级,F1 则暴跌至 54.88。

这种显著的性能阶梯揭示了深层机制:在多跳推理主导的任务中,实体图提供了穿透冗长无关上下文、发现跨文档连接的关键桥梁;然而单有图结构是不够的,被抽离出的孤立实体节点如果脱离了层级视图提供的局部对话上下文与完整表述,最终给 Reader 的线索就会支离破碎。两套视图在空间上形成了完美的互补。

此外,去除“证据闭包”模块会导致 F1 下滑至 67.90,而去掉“确定性校准”则会使 F1 跌至 70.13。这印证了闭包操作在补充关系跳转证据时的重要性,也表明了基于规则与约束过滤幻觉证据对最终答案精度的直接增益。而在检索预算(Top-K)的测试中,系统表现出极佳的稳定性,在保留 5 到 10 个候选切块时即达到性能饱和,进一步限制了送入最终 Reader 的 Token 长度。

重新思考智能体系统的设计哲学

Zero-Mem 的价值并不仅限于刷榜,它为智能体系统的工程落地提供了一种清晰的解题新思路。

过去一年多,大模型架构设计中存在明显的“LLM 泛用化”倾向:只要系统某个环节需要处理文本语义,工程师和研究者就会下意识地套用一个小模型做路由,套用一个大模型做记忆总结。这种堆叠不仅带来了巨大的调用延迟和高额成本,更为全链路排错带来了灾难——因为你永远不知道最终答案的偏差,究竟是原始证据有误,还是中间某一步生成式摘要产生的幻觉误导。

Zero-Mem 证明了经典的计算机科学机制与现代嵌入模型的结合依然极其强大。确定性的实体图、确定性的 PageRank 游走、带有时序语义的数据分层,配合零生成的强规则校验,完全可以在保持低时延与零中间 Token 消耗的同时,提供比大模型反复重写更加可信的证据链。

当不可逆的信息压缩被放弃,所有的决策都回退到了可精确溯源的原始轨迹上。这项工作给大模型应用开发带来的启示是明确的:不要轻易让大模型去代替索引。把记忆管理与证据路由交给确定性算法,把宝贵而昂贵的自回归生成只留给最终那一下真正的推理与表达,或许才是构建兼具高可用性与商业可行性智能体系统的最优解。