告别被动检索!NapMem多粒度记忆金字塔让大模型学会主动导航

From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space

当你和一个AI助手交流了数月甚至数年,你期望它能建立起对你的深度理解。然而,当前大多数基于大型语言模型Large Language Model, LLM)的长期记忆系统,依然依赖于被动的检索接口——即系统在后台悄悄检索几段文本,然后塞进模型的上下文中。这种“喂饭式”的被动投喂,不仅限制了模型在证据不足时主动探查的能力,也让固定格式的记忆难以应对千变万化的用户需求。

ArXiv URL:http://arxiv.org/abs/2607.05794v1

难道我们就不能让大模型像查阅档案的侦探一样,主动在记忆的迷宫中穿梭寻宝吗?

来自阿里巴巴、新加坡国立大学、北京大学等机构的研究人员给出了肯定的答案。他们提出了一种名为NapMemNavigate over Pyramid Memory)的全新框架,彻底打破了被动检索的桎梏。该框架将长期用户记忆重塑为一个结构化的动作空间,并通过强化学习训练智能体主动调用记忆工具进行导航。这不仅让模型在多项复杂记忆任务中表现优异,还在不损失通用推理能力的前提下,有效降低了存储和推理成本。

今天,我们就来深入拆解这篇极具启发性的工作,看看大模型是如何学会“主动记忆导航”的。

Refer to caption 图1:主动记忆导航的动机示例。被动检索只能提供部分证据,而NapMem允许智能体在回答前主动搜索足够的证据。

核心机制:搭建多粒度的记忆金字塔

如果把用户的长期记忆比作一座庞大的“个人档案馆”,NapMem的精妙之处在于它没有把所有信息胡乱堆砌,而是构建了一个自下而上的多层记忆金字塔。在这个档案馆里,信息被分为四个递进的层级,层层之间通过数据溯源关系相互连接:

  1. 原始对话层Raw conversations):这是档案馆最底层的“原始笔录”。它以只追加的形式存储了用户与智能体交互的每一条原始消息(包含内容、角色、时间戳和唯一标识符)。这一层保留了最高保真度的证据,允许智能体在需要时随时下探核实最细微的细节。
  2. 记忆记录层Memory records):这是档案馆里的“卡片索引”。系统将原始对话提炼为紧凑的语义单元,涵盖事实、事件、指令和偏好四类。当新的对话产生后,系统会增量式地提取新记录,并通过混合检索与旧记录进行对齐、去重或合并。每条记录都会保留其来源消息的标识符,充当着连接抽象信息与底层原始对话的桥梁。
  3. 主题轨迹层Topic tracks):这是档案馆里的“主题案卷”。单一的记忆记录是碎片化的,而用户的某些特征往往在多个会话中跨期发展。主题轨迹将相关的记忆记录组织起来,由智能体驱动更新,决定是更新现有轨迹、合并还是新建。它以文件的形式存在,包含摘要和描述,并明确链接到支持它的记忆记录标识符。
  4. 用户画像层User profile):这是金字塔顶端的“人物特写”。它是一个全局文件,在设定的长度预算内,总结了用户稳定的属性、长期偏好和交互模式。它为智能体提供了最凝练的全局用户视角。

Refer to caption 图2:NapMem框架概览。智能体通过记忆工具在多粒度长期记忆金字塔中主动导航,根据中间证据选择合适的抽象层级并完善动作。

通过这种精巧的设计,在这个“档案馆”中,大模型既可以直接阅读顶层的总结报告,也能通过引用链接顺藤摸瓜,一路深挖到底层的原始对话。

工具武装与强化学习:如何训练“主动导航”?

拥有了档案馆,接下来需要给大模型配备一套顺手的“查阅工具”,并教它如何使用。

NapMem为智能体暴露了5个专门针对不同记忆粒度的工具:get_conversationssearch_conversationsget_recordssearch_recordsread_files。搜索工具(search)通过混合搜索返回候选片段,获取工具(get)通过精确ID定位,而阅读文件工具则用于查看高层的主题轨迹和用户画像。

为了让模型真正掌握在这座记忆金字塔中导航的策略,研究团队采用了组相对策略优化Group Relative Policy Optimization, GRPO)算法进行强化学习训练。

在训练阶段,智能体需要在有工具调用预算的限制下,回答高度依赖记忆的复杂问题。NapMem的设计极其优雅,它仅仅为整个交互轨迹 $\tau$ 分配一个基于规则的终端奖励 $r(\tau)$。这个奖励由三个二元标准决定:格式有效性 $F$、答案正确性 $C$ 以及记忆工具使用情况 $U$。其数学定义如下:

\[r(\tau)=\left\{\begin{array}[]{ll}-1,&F=0,\\ \phantom{-}1,&F=1,\ C=1,\ U=1,\\ \phantom{-}0,&F=1,\ C=1,\ U=0,\\ -0.5,&F=1,\ C=0,\ U=1,\\ -1,&F=1,\ C=0,\ U=0.\end{array}\right.\]

这意味着,只有当模型既遵循了格式,又通过使用记忆工具最终得出了正确答案(即 $F=1, C=1, U=1$)时,才能获得最高奖励 $+1$;而违背格式($F=0$)或未能给出正确答案都会受到相应的惩罚。

对于每一次查询,假设生成了一组轨迹 $\mathcal{G}$,GRPO通过计算组内相对优势 $A_i$ 来更新策略:

\[A_i=r_i-\frac{1}{|\mathcal{G}|}\sum_{j\in\mathcal{G}}r_j\]

通过这种将轨迹级优势均匀分配给所有输出Token(包括调用工具的Token)的训练方式,模型学会了不仅仅是“生成正确答案”,更学会了“如何通过最高效的记忆搜索路径找到正确答案”。它知道何时从全局画像开始宏观把握,何时直奔底层记录去求证细节,以及最重要的——何时收集到了足够的证据并应该停止搜索。

实验结果与硬核分析:性能全面超越被动检索

研究团队在包含记忆密集型任务(如PersonaMem-v2、LongMemEval、LoCoMo)和非记忆通用任务(如GPQA-D、BFCL-v3、V*Bench)的6个基准上对NapMem进行了全面评估。对比基线包括了Mem0、Zep、MemOS等前沿记忆系统。

1. 记忆任务上的卓越表现

在使用Qwen3.5-9B作为基座模型进行强化学习训练后,NapMem-9B w/ RL 在三大记忆基准上取得了惊人的成绩,其平均得分不仅远超同样基于9B模型的其他基准系统,甚至逼近了未经强化学习训练的397B超大模型变体(NapMem-397B)。这有力地证明了,将结构化存储与主动学习导航策略相耦合,能释放出远超“大力出奇迹”的效果。它在长距离事实召回、跨会话推理以及隐式偏好理解上,都展现出了统治级的表现。

2. 通用能力不退反进,杜绝“滥用记忆”

很多时候,针对特定工具微调模型会导致模型产生“工具依赖症”,在不需要工具的场景下也盲目调用。令人惊喜的是,在无记忆需求的GPQA-Diamond推理等任务中,强化学习后的NapMem-9B不仅没有掉分,反而将“不必要的记忆调用率”从34.51%骤降至6.90%。而在BFCL-v3等纯工具调用任务中,不必要调用率保持在完美的0%。这说明RL训练极大地校准了模型的工具调用时机,让它变得极其克制且聪明。

3. 极佳的推理与存储效率

得益于多层抽象机制,NapMem的存储占用远小于保存大量冗余上下文的传统系统。而在推理效率上,实验抛出了一个非常关键的工程洞察:主动导航实际上比被动检索更省时间

Refer to caption 图3:在100个PersonaMem-v2样本的成功运行中,延迟和完成Token数的统计。

如上图散点图所示,由于NapMem的模型能够精准执行目标导航,并在证据足够时主动叫停(而不是像被动检索那样被塞入成堆的无关文档并被迫阅读),其生成的补全Token数大幅减少,从而带来了显著更低的系统响应延迟。

深度剖析:模型规模如何影响“搜索习惯”?

该论文在消融实验和行为分析部分还揭示了一个极为有趣的现象:不同大小的模型,有着截然不同的“档案查阅习惯”

在面对复杂的记忆查询时:

此外,消融实验证明,去掉任何一个金字塔层级(仅限记录、无高层抽象),或者退回到被动检索模式,都会导致性能的显著下滑。RL训练的加入,使得模型的多级导航成功率不仅没有降低,证据命中率反而大幅提升,真正实现了“有的放矢”。

总结与启示

NapMem的提出,为大模型长期记忆技术的发展指明了一条极其优雅的新路径:记忆不应该是被动填充的上下文,而应当是一个可供探索的结构化动作空间

对于致力于打造Personal AI Agent的开发者而言,这篇论文提供了几个极其宝贵的工程启示:

  1. 构建分层索引是值得的:不要只依赖单一的Vector DB去存所有聊天记录。引入从“原始对话”到“事实记录”再到“主题摘要”的树状溯源结构,能极大地提升模型复杂推理的准确性。
  2. 赋予Agent决定权:用RL教导Agent如何调用获取、搜索和阅读工具,远比用复杂的外部Reranker去强行拼凑Prompt更加Native,也更符合大模型的自然推理逻辑。
  3. 精准带来效率:主动导航看似增加了工具调用的轮数,但由于去除了冗余信息的干扰,最终生成的Token数量反而更少,推理成本不升反降。

告别被动投喂,让AI学会在记忆的金字塔中主动攀登,这或许正是通向真正具备“人情味”和连贯认知智能体的重要一步。