OAS:大模型记忆该保留还是压缩?低预算准确率提升48%的决策机制
Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory
给大模型赋予跨越长周期的“记忆”,是当前构建自主 Agent 的核心追求。然而,现实给这项能力套上了极为坚固的枷锁:上下文窗口的绝对上限、昂贵的长文本推理成本,以及模型在超长输入中处理证据时的注意力衰减。这就迫使系统必须在有限的 Token 预算内塞进最有价值的信息。
ArXiv URL:https://arxiv.org/abs/2607.17545v2
现有的 Agent 记忆管理通常分裂为两大阵营:一种是原始留存(Retention),即原封不动地保存历史交互记录,保证文字细节、时间戳和事实修正毫无偏差;另一种是记忆整合(Consolidation),通过摘要、合并或重写将碎片化的多条记录压缩成紧凑知识,提高每个 Token 的信息密度。来自香港城市大学与华为诺亚方舟实验室的研究团队指出,这两个阵营其实都无法包打天下:在极紧缺的预算下,整合记忆可以挽救因空间不足而被丢掉的关键线索,在基准测试中使准确率绝对提升高达 48%;但在预算宽裕时,强行整合反而会导致细节模糊和幻觉,原始留存能反超所有整合算子 8% 到 11%。
这项研究提出了轻量级学习机制 OAS(Offline Abstraction-Safety),不仅在理论上将“何时整合(When)”与“用何种算子整合(Which)”统一到一个效用决策框架中,更证明了记忆管理的最优策略并非由某个固定的 Token 阈值决定,而是完全取决于候选证据长度与可用预算之间的“相对压力”。

留存与整合:长记忆的两难拉锯
如果将 Agent 的记忆系统比作一个旅行者的背包,Token 预算就是背包的容积。
原始留存策略的做法是把每一次遇到的物品原模原样装进包里。这样做的好处是物品的细节完全没有失真——对话的原始措辞、时间戳、前后修正逻辑全都在。然而,当经历的事件变得极多时,背包空间很快就会耗尽。一旦关键证据恰好排在容量之外,模型就会对关键事实视而不见。以往的研究为了缓解这个问题,引入了分层遗忘、重要性打分以及随机优化淘汰算法,但只要记录保持未经压缩的原始状态,单位 Token 承载的信息量上限就是固定的。
记忆整合策略则像是把散乱的衣物压缩抽真空,或者把多份说明书提炼合并成一张浓缩卡片。近两年的 Mem0、A-MEM 等工作,正是通过对交互记录进行反思、摘要和结构化提炼,让有限的上下文窗口塞得下更多轮次的信息。但这种“生成式压缩”需要付出不可逆的代价:大模型在重新组织语言时,极易不小心抹去看似微小实则致命的条件限定,混淆事件发生的时间顺序,甚至在推理中引入没有依据的幻觉内容。
长期以来,这两派方案在各自的论文基准上展示优势,却鲜有工作厘清它们在相同条件下的对抗边界。更关键的是,整合本身不是一个单一动作,系统往往面临多种生成算子:是将多个事件合为一体(Merge),还是跨笔记抽象出高维结论(Abstract),亦或是对单条笔记进行局部压缩(Rewrite)?面对特定的查询和剩余预算,Agent 究竟该按兵不动,还是果断重写?这是 Agent 架构设计中亟待填补的拼图。
理论拆解:覆盖效应与替换效应的对抗
为了在数学上严谨刻画这一权衡,研究者构建了一个理想化的效用机制模型,把替换原始记忆所带来的收益变化精确分解为两个相互对抗的作用力:覆盖效应(Coverage Effect) 与 替换效应(Replacement Effect)。
当 Agent 决定将候选证据簇进行压缩生成时,新生成的紧凑记录占用的空间更小。这意味着原本在有限预算下会被无情丢弃的下游线索,现在有机会被装入上下文,这就是正向的“覆盖效应”。预算越紧张,原始留存扔掉的信息就越多,通过压缩挤出空间所挽回的信息覆盖收益就越惊人。
然而,这也伴随着负向的风险。那些原本在原始状态下就已经能完整装入上下文的核心事实,现在被大模型生成的浓缩文本所替代。如果生成过程中丢失了实体绑定关系、日期或者修正细节,答案的保真度就会受损。这就是“替换效应”,它衡量的是生成记录与原初真实记录之间的保真度差值,且在绝大多数情况下该差值为负。
这两个效应的代数和决定了整合动作的最终价值:
\[\Delta\mathcal{U}_{B,o} = C_{B,o} + R_{B,o}\]其中 $C_{B,o}$ 为新挽救证据带来的覆盖收益,必定大于等于零;而 $R_{B,o}$ 则是被替换区域的保真度损益。
由此可以清晰推导出两种极端预算下的系统表现:在极端严格的预算下,覆盖效应占绝对主导地位,因为不压缩就意味着绝大部分线索彻底丢失,哪怕压缩文本存在一定失真,也远胜于“一片空白”;但在预算非常充裕的环境下,所有原始线索本来就能全部装下,此时覆盖效应迅速衰减至零,整个公式几乎只剩下可能带来伤害的替换效应,保留原始记录因此成为更明智的选择。
这套理论彻底解释了为什么不存在一个放之四海而皆准的“最佳记忆策略”,也为决策系统的构建指明了方向:所谓的“何时做(When)”就是判断当前状态下最佳算子的综合效用是否大于零,而“选哪个(Which)”则是在具有正向收益的候选算子中挑选效用最大者。
OAS:在生成发生前评估效用
明确了效用机制后,最直接的工程困难随之而来:如果想要精确知道一个压缩算子到底好不好,最笨的办法是先把压缩记录生成出来,送给模型回答问题,再评估答案质量。但这在实际部署中完全是不可行的——如果每次推理前都要尝试生成三种压缩文本并评估,系统所消耗的算子调用开销和推理延迟将成倍激增,彻底背离了节约上下文成本的初衷。
决策必须在生成之前完成。研究团队提出的 OAS(Offline Abstraction-Safety)正是一个在推理时计算开销极低的轻量级效用路由器。它完全依靠离线学习反事实效用,在线只执行一次极简的数值前向计算。
在特征构建上,OAS 严格遵守观测隔离原则,只抽取生成前就能确切拿到的 11 维轻量特征:
-
包含标准化预算刻度、输入证据的组件数量、候选证据总量与可用预算之比(Token 压力指标);
-
原始留存状态下能装入上下文的比例(证据拟合度);
-
涉及的会话轮数、根据嵌入向量计算出的离散度与平均余弦相似度(表征线索是否矛盾或发散);
-
上游查询的问题类型 One-hot 编码。
在模型结构上,研究团队并没有使用庞大的端到端神经网络,而是反常识地采用了低容量的正则化岭回归(Ridge Regression)。之所以偏向极其简单的线性模型,是因为在离线训练阶段,由于只能获取到有限数量问答对的真实下游表现,高容量模型极易在稀疏的标记信号上发生过拟合。每个动作(留存、合并、抽象、重写)分别拟合一组独立的线性响应权重,在线推理时只需将 11 维特征与权重做一次点积,就能估算出各个动作的预期得分。后续消融实验中加入的多层感知机(MLP)并未体现出超越线性回归的稳定优势,证明这一决策界并不需要过于复杂的非线性拟合。
除了点积测算预期收益,OAS 还配备了一道被称为“安全校准(Harm Calibration)”的闸门机制。在跨受试问题的独立验证集上,算法会遍历寻找一个最小优势阈值 $\tau_{\mathrm{safe},B}$。在面对高风险或收益微弱的边缘情况时,哪怕模型预测某个压缩动作稍微占优,只要优势没有跨过该预算下的安全阈值,系统就会强行回退到保守的“原始留存”。这一设计确保了系统在面对不确定性时,宁愿放弃微小的潜在压缩收益,也坚决不对已有事实进行可能导致失真的破坏性改写。
实验印证:48% 的跃升与预算反转
为了验证这套机制在复杂多轮环境中的实际表现,论文在两个代表性基准 LongMemEval 与 LoCoMo 上进行了控制变量评测。测试涵盖了不同的可用 Token 预算(从极度紧缩的 256、512 Token 一路延伸至宽裕的数千 Token),并固定上游检索器与下游答题模型。
实验结果极为清晰地再现了理论推导出的交叉曲线:
在 LongMemEval 评测中,当给定的回答上下文预算被压制在极低水平(例如 256 Token)时,候选证据中的大量笔记根本无法进入模型视野。此时原始留存策略的准确率跌入谷底,而采用了跨笔记压缩的算子(Abstract 或 Merge)能够将分散在多个会话中的事实骨架提纯呈现,使下游回答的绝对准确率提升了惊人的 48 个百分点。
然而,随着预算逐步放大到 2048 乃至 4096 Token,戏剧性的反转出现了:候选证据逐渐能够被原始记录完全覆盖。此时压缩算子的劣势暴露无遗,先前生成的轻微细节缺失和语句平滑在精准问答中构成了致命伤,而完全未经篡改的原始留存策略稳步回升,最终在宽松预算下全面超越所有整合算子,领先幅度在 8% 至 11% 不等。使用另一款独立的开源问答模型复现该实验时,同样观测到了完全一致的反转趋势。
在 LoCoMo 基准上的对照更进一步揭示了本质规律。LoCoMo 的单条证据平均长度显著短于 LongMemEval,其胜负反转的交叉点出现在了一个更小的绝对 Token 预算上。这一现象直接驳斥了“存在某个通用 Token 临界值(比如 1024 Token 以下就该压缩)”的粗暴假设——系统该不该整合,本质上取决于候选证据规模除以预算后的“相对装载率”。如果原本内容只有 500 Token,哪怕总预算只有 600,留存依然占优;如果原本内容高达 5000 Token,哪怕预算放宽到 2000,整合依然不可或缺。
在关于“选择哪种算子(Which)”的对比中,跨笔记的 Merge 与 Abstract 在需要压缩的场景下绝大多数时候都显著胜过局部的单笔记 Rewrite。这是因为单条笔记内部的冗余往往有限,改写句式省下的空间杯水车薪;只有跨越多个笔记打破原本的文本边界,剔除重叠事实并建立关联,才能实现足够跨越质变的高信息密度。
经过安全校准的 OAS 路由在面临预算压力时,成功识别出绝大多数应当触发整合的工况,并在宽松预算下自发收敛至原始留存,几乎全程贴合了理论最优边界。不过作者也客观指出了局限:当把该策略直接迁移到完全未经控制的全局长历史回溯场景中时,它尚未能稳定击败所有固定策略。这意味着,当前框架在“给定候选线索后的装载决策”上极其敏锐有效,但若要拓展到无提示词的后台全局记忆自主演化,仍有待与上游检索器进行更深层次的端到端联调。
重新审视 Agent 的记忆工程
这项工作给当下大模型长上下文与 Agent 系统的工程落地带来了极为务实的视角修正。
在长文本模型日趋普及的当下,工业界容易走向两个极端:要么迷信上百万 Token 的上下文窗口,不管原始对话多么冗长杂乱一律全盘塞入,不仅导致推理成本呈二次方或线性剧增,还常常遭遇模型“大海捞针”能力失常的暗坑;要么过度依赖复杂的反思机制,每隔几轮对话就盲目调用大模型进行浓缩总结,结果在不知不觉中洗掉了用户的关键限定词,导致逻辑推演漏洞百出。
这项研究用严谨的数学分解和详实的实证数据指出:记忆压缩本质上是一种“用保真度换覆盖面”的高风险折衷。
决定是否压缩的核心指标,永远是当前检索出的线索总量是否超过了系统预算的承载上限。在构建实际的 AI 助手或自主 Agent 时,最为稳妥且经济的架构并不是非此即彼,而是在检索证据装箱的入口处设立一个像 OAS 这样极轻量的门控逻辑:在预算逼仄时果断启用跨笔记合并与抽象,在空间宽松时坚决保留原始字段与元数据。唯有敬畏压缩带来的信息磨损,才能在推理成本与事实精度之间找到最精确的平衡点。