SodaMem:北大提出时序图记忆,以1分钱成本冲上92.8%准确率

SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

当大语言模型(LLM)驱动的 Agent 开始承担起长期伴随用户的个人助理角色时,一个根本性的工程瓶颈迅速浮现:在跨越数天、数周乃至数月的真实交互中,用户的状态与偏好是动态流变的。扁平的追加式聊天日志(Append-only logs)、Markdown 记事本或者简单的向量检索(RAG),往往能很好地解决“大海捞针”(Needle in a haystack)式的静态事实检索,却极易在“哪个状态在当下仍然有效”这一关键问题上彻底失效。当用户在上个月说“我极其喜欢吃辣”,两周前又表示“我最近胃不舒服开始戒辣”,朴素的检索系统极有可能因语义相似度更高而挑出前者,导致 Agent 给出南辕北辙的建议。

ArXiv URL:https://arxiv.org/abs/2608.08055v1

针对这一长期记忆难题,来自北京大学的研究团队提出了 SodaMem。该工作将 Agent 的长期记忆重新定义为一种强证据溯源的时序知识图谱(Evidence-Grounded Temporal Graph Memory)。它通过提取带强类型约束的事件事实、维护显式的时序闭合与状态覆盖关系,并采用“规划者-阅读者”(Planner-Reader)双循环架构,系统性地攻克了记忆时效、时序推断、来源审计与多跳关联等核心失效模式。

在极具挑战性的长期记忆基准 LongMemEval-S 上,采用 deepseek-v4-flash 作为骨干模型的 SodaMem 达到了 92.8% 的高准确率,而平均单次问答的 API 成本仅需 0.00161 美元(约合人民币 1 分钱出头)。在成本与准确率的综合权衡中,SodaMem 不仅在百亿级低成本模型区间逼近了准确率前沿,更严格支配了一批调用高成本顶尖模型但表现欠佳的已有方案。

SodaMem 系统总览

长期记忆落地的四大核心失效模式

在多会话个人记忆场景中,学术界与工业界已经从早期单纯比拼长文本上下文窗口,转向了对记忆可维护性与使用合理性的精细评估。过往基于纯文本日记或朴素向量数据库的方案,在真实的人机长期交互中通常会撞上四类系统性缺陷。

首先是时效性与事实冲突(Currency / Conflict)。用户的生活状态和主观偏好并非恒定不变。在追加式日志中,不同时间点相互矛盾的陈述会同时存在。如果单纯依靠检索阶段将未排序的文本块无差别送给大模型去自由推断,模型极易产生幻觉或抓取过时的陈述。确定性的状态新鲜度管理,往往比大模型的自由发挥更为稳健。

其次是时序结构的缺失(Temporal Structure)。用户在提问时经常包含“最近一次”、“上周”、“在某事发生之前”等相对时间表述。如果系统在写入记忆时没有将这些相对短语锚定在绝对时间轴上,模型面对交错的会话就无法建立有序的时间线。

第三是溯源与可审计性不足(Provenance)。现代 Agent 极度依赖可信审计,用户需要知道 Agent 做出某个推断究竟是依据哪一天、哪一轮会话的原话。许多记忆系统采用多轮迭代压缩摘要或黑盒向量召回,事实来源模糊不清,一旦出现事实扭曲便无从溯源排查。

第四是复杂关联与上下文塌陷(Association & Context Collapse)。多跳推理需要跨越不同的实体与断言建立连接,但这绝非单纯依靠余弦相似度召回就能解决。高语义相似度但属于不同交互片段(Episode)的记忆混杂在一起,极易引起上下文塌陷,让模型在回答时张冠李戴。

SodaMem 的核心设计思想正是紧扣这四大痛点展开。它拒绝将记忆视为非结构化的文本堆叠,而是将其显式建模为带有严密时间属性与逻辑关系的图谱资产。

事实事件化与三维时序图谱构建

在 SodaMem 的架构中,数据摄入阶段(Ingest)承担着将非结构化多轮对话转化为高质量结构化记忆的重任。该系统将记忆的基本单元定义为 FactEvent(事实事件)。一个完整的 FactEvent 节点由七元组构成:节点种类 $\kappa$、谓词 $\pi$、模态 $m$、时序字段 $\tau$、实体角色 $\rho$、来源文本片段 $S$ 以及状态标识 $\sigma$。

为了彻底解决溯源问题,SodaMem 引入了极具工程约束力的“硬溯源校验”。信息抽取模块被要求输出必须在原始会话单轮文本中字面出现过的片段(MessagePieces)。若抽取出的候选事实所标注的溯源片段无法在原始文本中精确对齐,该候选事实会被系统直接丢弃。与此同时,原始对话轮次保留全局唯一的稳定标识符,以便在后续的多路混合检索中与细粒度事实协同计算。

在时序表达上,SodaMem 区别于传统粗糙的时间戳方案,为每个事实事件建立了三维时序轴:

  1. 提及时间(Mention Time):该会话发生的绝对锚点时间 $t_s$;

  2. 发生时间(Occurrence Time):事件在现实世界中发生的起始与结束时间区间 $[occurred_start, occurred_end]$;

  3. 有效时间(Validity Time):该事实保持为真(Valid)的生命周期区间 $[valid_from, valid_until]$。

针对“时效冲突”这一顽疾,SodaMem 在写入图谱时执行显式的覆盖(Supersession)机制。当新摄入的事实 $f_{\mathrm{new}}$ 在同一主体-谓词槽位上与旧事实 $f_{\mathrm{old}}$ 产生冲突或匹配到更新模式时,系统会自动建立一条 SUPERSEDES 边,将旧事实的状态 $\sigma(f_{\mathrm{old}})$ 标记为被覆盖(superseded),并将其有效截止时间 $valid_until$ 强制闭合在 $f_{\mathrm{new}}$ 生效的时间节点。通过这种确定性的图状态流转,系统确保了在查询活跃状态时,陈旧无效的事实能够被硬性过滤或降权,不再干扰后续推理。

对于会话中经常出现的模糊相对时间(例如“昨天”或“大前天”),系统通过可选的时间线解析层(Timeline Resolution Layer),结合会话锚点时间 $t_s$ 将其计算转换为规范化的时间戳;若无法准确推导,则显式标记为未解析,避免产生错误时间推断。

多隧道召回与连接密度融合检索

检索阶段的设计是 SodaMem 能够以较低成本实现极高召回质量的核心。单纯依赖稠密向量检索容易受到语义漂移的干扰,单纯依赖 BM25 词法检索又无法应对同义改写,而单纯的图扩散则极易引起搜索爆炸。

SodaMem 采用了宽通道的多信号召回体系。在面对用户查询 $q$ 时,查询分析器首先将其分解为实体提及其词法关键词、稠密向量嵌入表示以及时间意图元组 $(\mathcal{W}, \delta)$。这里的 $\mathcal{W}$ 代表查询对应的时间窗口,$\delta$ 代表排序方向偏好(从近到远或从远到近)。对于模糊的时间词汇,系统策略性地映射到更宽的时间窗口,以“召回优先于精确”为原则防范漏检。

在具体的检索路径上,SodaMem 划分了强隧道与弱隧道。强隧道包含高置信度的直接检索路径,例如基于实体或关键词在事实事件、来源片段和原始轮次上的 BM25 检索,以及对应的稠密向量检索;弱隧道则包括沿着图谱中的语义边(内容驱动的近邻连接)和关系边(实体间的强类型谓词)展开的派生扩散路径。每个隧道独立设定搜索头(Search Heads)数量上限,以严格控制计算开销。

随后,系统执行硬性的有效性门控:直接剔除那些已被标记为无效或已被覆盖的事实,同时剔除那些已知有效区间与查询时间窗口明确互斥的内容。需要注意的是,SodaMem 并没有将发生时间的匹配作为硬过滤条件。这种取舍极其关键:在实际人机交互中,用户往往会记错时间(例如将三个月前发生的事误说成两个月前),如果把时间设为绝对硬条件,就会直接把正确答案拒之门外。

为此,SodaMem 提出了独创的“连接密度”(Connection Density)融合评分算法。来自不同隧道、不同搜索头的命中结果,会根据其通道强度分配不同的基础权重 mass $w$。当多个搜索头命中同一个实体或同一段证据时(无论是 ID 严格相同,还是向量相似度超过阈值 $\theta$ 的近重复项),权重会累加。对于合并后的证据项 $i$,其连接密度与最终置信度得分定义为:

\[\mathrm{density}(i) = \sum_{h \in H(i)} w_h\] \[\mathrm{conf}(i) = \mathrm{density}(i) + \beta \cdot \mathbf{1}[i \cap \mathcal{W} \neq \emptyset]\]

其中 $\beta$ 为软时间奖励分值。当且仅当候选证据项落入查询解析出的时间窗口 $\mathcal{W}$ 内时,系统至多给予一次加分奖励。时间在此处被巧妙地转化为一种提升排序置信度的软性特征,而非一刀切的硬阻断。排序完成后,系统再按照 $\delta$ 规定的时间方向打破平分局面,输出最终的高置信度候选池。

在检索下游,SodaMem 部署了规划者(Planner)与阅读者(Reader)的双循环机制。规划者接收初步召回的候选池,若判断当前信息不足以回答复杂问题(例如需要精确计数或多跳遍历),可以在计算步数预算内自主调用搜索、卡片检查、会话展开、时间线比对等记忆工具继续扩充证据池;而阅读者则是一个独立的提示词模块,它严格基于已锁定的证据池撰写最终答案,并强制标注行内引用标识。这种规划与阅读的解耦,既保证了模型调用工具时的灵活性,又坚守了回答生成的溯源纪律。

实验评测与高性价比图景

对 SodaMem 的全面检验基于著名的长期记忆评估基准 LongMemEval-S。该基准包含 500 个复杂测试问题,覆盖了多会话事实召回、知识动态更新、时序逻辑推理、个性化偏好跟踪以及弃权拒绝等多个维度,平均每个测试用户的历史对话文本量达到 11.5 万 Token 级别。

研究团队构建了包含 500 位虚拟用户、共计 235,840 条事实的记录存储实例。令人关注的是,SodaMem 在评测中并未使用昂贵的商业旗舰闭源大模型,规划者、阅读者以及评估裁判均统一采用低成本的 deepseek-v4-flash 模型。

LongMemEval-S 准确率与预估 API 成本对比

实验结果显示,SodaMem 在 LongMemEval-S 上取得了 92.8%(464/500)的最佳准确率(三次采样的中位数为 90.6%)。在成本开销方面,端到端的规划者加阅读者推理全流程(不计入离线摄入与最终评测打分),平均每个问题仅消耗 18,348 个 Token,折算 API 成本仅为 0.00161 美元;更进一步观察分布可以发现,由于少数复杂问题的规划循环拉高了均值,其实际消耗的中位数仅为 14,640 个 Token,对应单题成本仅 0.00111 美元,比均值低了近 25%。这意味着绝大多数日常查询的实际开销要远低于账面平均值。

为了更客观地衡量该成果的技术生态位,作者团队基于 2026 年各主流大模型公开的标准调用价格,将业内已知公布过 Token 消耗或单题成本的主流长期记忆系统整理绘制成“成本-准确率全景图”(图 2)。

在这张二维坐标图上,SodaMem 展现出了极为突出的工程优势。图中以 SodaMem 平均单题成本(0.00161 美元)与 92.8% 准确率为基准划分出的左上象限被称为“严格支配区”(Dominated Quadrant)。在这一区域内的系统,其成本均高于 SodaMem,而准确率却均低于 SodaMem。落入该被支配区域的知名方案包括 Cersei 的多种配置、AgentOS、采用超长上下文直读的 GPT-5-mini、EmergenceMem 以及基于 TiMem 评估的 MemoryBank 等。

而在准确率略高于 SodaMem 的区间内,仅有两个系统:达到 96.2% 的 agentmemory V4 与达到 94.4% 的 Mem0 (2026)。然而,这两款系统在横轴上的调用成本呈现出了数量级级别的跃迁——其单题成本分别约为 0.06 美元和 0.022 美元。这一巨大成本鸿沟的根源在于,它们依赖 Claude Opus 或 GPT-4o 这一梯队的昂贵超大模型来驱动推理与问答。相比之下,SodaMem 仅用 Flash 级别的轻量级推理模型,就将准确率拉到了极其接近最顶尖梯队的水准,单题成本降低了 10 到 40 倍。

至于 TiMem、MemOS、Memobase 等基于 GPT-4o-mini 构建的学术管线,虽然在回答阶段的纯上下文 Token 成本下限上略低,但其最终准确率大多徘徊在 58% 至 78% 之间,与 SodaMem 超过 90% 的表现存在断层式的差距。

客观审视与未来演进

在看到 SodaMem 优异表现的同时,也必须清醒审视该论文在实验设计上的特定边界与局限。

首先是评测裁判的自评问题(Self-grading)。该项工作在测试中同时使用 deepseek-v4-flash 担任阅读者与裁判模型,虽然完全采用了 LongMemEval 官方的判定模版,但若换用独立且评判标准更为严苛的第三方顶级模型(如 GPT-4o),其绝对准确率分值可能会存在一定浮动。不过,作者团队开源了生成的全量预测假说文本,使得社区进行独立二次裁决完全透明可行。

其次是多系统成本对比的口径问题。全景图中的基线数据来源于各系统公开披露的数据换算与模型刊例价估算,而非在完全统一的单一测试平台(Single-harness bake-off)上从零重新实测。此外,由于不同系统在前置数据摄入(Ingest)阶段的计算摊销方式迥异,本次对比主要反映的是在线问答阶段(Answer-stage)的端到端调用成本,并未计入离线建图时的初始开销。

在具体错误案例的分析中,剩余未解决的失误绝大部分仍集中在极其苛刻的时序推理场景。这也表明,单纯依靠检索时的软时间窗口与规划循环仍有其物理极限,必须进一步强化会话摄入时的时间线确定性解析能力。

从更广阔的技术演进视角来看,SodaMem 提供了一种极具实用价值的范式参考。当前 Agent 记忆领域在经历长上下文窗口与纯端到端记忆的狂热后,正在重新回归理性的工程结构化道路。事实的状态演变不能指望概率模型在模糊的长文本中“自行领悟”,强类型的事件节点、确定性的版本覆盖闭环、兼顾宽泛度与软时序的连接密度检索,才是构建低成本、高可靠、可审计企业级 Agent 记忆底座的坚实基石。