SelfMem:引入自我优化机制,百万Token下基准得分最高提升48.7%
SelfMem: Self-Optimizing Memory for AI Agents

随着大语言模型基础能力的飞跃,当前的 AI 智能体已经能够处理极长的上下文,熟练调用外部工具,并执行跨度极长的复杂任务。然而,当这些智能体被部署在真实的长期交互场景中时,它们不可避免地会遇到一个核心瓶颈:如何有效地记住并利用历史经验。无论是记住用户的长尾偏好、追踪项目的复杂背景,还是在海量对话中提取关键的事实细节,都需要一个强大的记忆系统作为支撑。
ArXiv URL:https://arxiv.org/abs/2607.03726v1
现有的智能体记忆框架通常依赖于固定的存储、检索和摘要机制。例如,开发者会硬编码一套规则,规定智能体何时将短期对话写入长期数据库,何时对历史记录进行压缩总结,或者使用向量检索来召回最相关的对话片段。这种“一刀切”的预设管道在面对多变的任务需求时显得极其僵化。针对这一局限性,来自阿卜杜拉国王科技大学(KAUST)和澳门大学的研究团队提出了一种全新的自我优化记忆框架 SelfMem。该研究抛弃了强加给模型的预设记忆策略,转而秉持“授人以渔”的原则,为智能体提供了一套记忆工具和反馈环境,让其自行探索、评估并完善最适合当前任务的记忆管理方式。
实验结果揭示了这种范式转换的巨大潜力。在要求极其苛刻的 BEAM 长文本记忆基准测试中,SelfMem 在 10万、50万直至 100万 Token 的对话规模下,全面超越了现有的检索、压缩和结构化记忆基准。相较于表现最强的基线方法,SelfMem 在这三个量级下的官方基准得分分别提升了 48.7%、40.8% 和 41.9%。这项工作不仅刷新了长周期智能体记忆的性能上限,更重要的是,它证明了将记忆管理从“系统设计者的硬编码”转化为“智能体自主的策略优化过程”,是通向下一代高级智能体的关键路径。
告别固定管道:智能体记忆管理的范式转换
在 SelfMem 出现之前,学术界和工业界对智能体记忆的探索大多集中在如何设计更精妙的存储架构上。Generative Agents 引入了记忆流架构,通过记录观察、检索经验并合成高层反思来指导未来计划;MemGPT 将长上下文交互转化为虚拟内存管理,通过工具调用在核心内存和归档内存之间搬运信息;而近期的 A-Mem 更是借鉴了卢曼卡片盒(Zettelkasten)的原理,允许智能体动态地写入、索引和链接记忆网络。
尽管这些方法显著提升了模型利用历史对话的能力,但它们依然没有跳出“预定义”的窠臼。无论是记忆的最小存储单元、检索的触发机制,还是更新和合并的规则,大部分核心逻辑仍然是由人类开发者在系统底层写死的。不同类型的任务对记忆的要求千差万别:多轮闲聊可能只需要粗粒度的用户画像摘要,而跨度数月的法律或编程项目则需要极度精确的事实溯源和时间线梳理。预设的记忆架构无法同时兼顾这些相互冲突的需求,且往往需要大量的人工调参才能勉强适配特定场景。

研究团队敏锐地捕捉到了这一痛点。正如上图所示,传统的固定策略往往会由于过度压缩导致关键细节丢失,或者由于简单的检索策略引发上下文冗余。SelfMem 的核心动机在于:既然大语言模型已经具备了通过反馈、反思和搜索来改进自身行为的能力,为什么不将记忆管理本身也交还给模型来做决策?SelfMem 并没有给智能体一套死板的记忆机制,而是教智能体如何自适应地管理记忆,将暴露记忆管理决策作为整个框架设计的最高优先级。
SelfMem 的系统架构与核心机制
要让智能体自主管理记忆,首先需要为其构建一个安全、可控且反馈充足的运行环境。SelfMem 并没有抛弃历史对话,而是将其原始形式严格保留,同时开辟出一个供智能体自由操作的“记忆工作区”。

在 SelfMem 的架构中,系统通过明确分离“框架约束”和“记忆策略”来实现自主性。框架负责提供人工设计的程序化原则、可用的记忆工具、反馈通道以及审计约束;而具体的记忆行为——包括应该检查哪些对话轮次、保存什么信息、对什么内容进行压缩或更新、哪些细节需要一字不落地保留,以及哪些信息完全可以留在原始记录中等待未来按需检索——则全部由智能体自己决定。
为了支撑这一过程,SelfMem 包含以下几个核心模块的设计。首先是不可变的“原始记录存储”(Transcript Store)。在许多现有系统中,为了节省上下文,历史对话会被直接替换为摘要。SelfMem 拒绝这种做法,它将完整的交互历史作为一个只读的数据库(如 SQLite 表)进行存储。这一设计至关重要,因为它确立了历史事实的唯一真相来源,防止了智能体在反复改写记忆的过程中产生不可逆的幻觉。智能体必须通过系统提供的查询工具来按需拉取这些原始记录,而不是被动地接受系统塞给它的全局摘要。
在此基础上,系统提供了一个由模型管理的“记忆工作区”(Memory Workspace)以及一套丰富的动作空间。这套动作空间主要涵盖四个维度:
-
原始记录读取工具:允许智能体获取对话统计信息、执行只读的 SQL 查询、搜索特定实体或事件,并在写入记忆前后对信息源进行审计。
-
记忆工作区读取工具:智能体借此检查当前工作区内已有的记忆内容,从而避免重复写入,检测过时信息,并决定新内容是应该追加、替换、合并还是删除。
-
记忆写入工具:支持添加新记忆、替换旧内容、提炼宽泛的摘要、归档过时信息、记录确切事实、创建时间线,甚至为未来的检索添加提示标签。
-
记忆审查与探针工具:这是自我优化的关键。智能体可以在不修改工作区的情况下,调用审查工具来诊断现有或提议的记忆质量。审查反馈会明确指出记忆中是否缺乏原文支持、是否存在过时的确切事实、是否前后矛盾、摘要是否过于空泛,以及是否存在未来难以检索的风险。
此外,SelfMem 提供给智能体的并不是一个简单的标量奖励分数,而是极其丰富的多维度反馈信号。这些反馈来自于智能体与原始记录、工作区及诊断工具的实际交互。环境不仅会返回工具的执行结果(如读取到的文本片段或审查出的逻辑冲突),还会附带操作维度的信号,例如 Token 消耗量、延迟、缓存命中情况以及预估的计算成本。这种设计迫使智能体在自然语言的推理过程中直面记忆管理的根本权衡:保存更多信息虽然能提高召回率但会增加上下文成本,而过度压缩虽然降低了延迟却可能丢失关键细节。
探索、审查与修正:完整的记忆闭环
在实际运行中,SelfMem 将记忆的构建过程转化为一个由模型控制的工具调用循环。工作区初始状态为空,智能体首先通过观察和探针工具审视当前任务,决定使用哪些读取工具去原始记录中发掘有价值的信息。
当智能体收集到足够的依据并尝试通过写入工具修改工作区时,审查机制会自动介入。这种“检查-写入-审查-修正”的紧密循环是 SelfMem 能够保持高精度记忆的核心机制。例如,如果智能体试图写入一段包含多个具体日期和数值的总结,审查工具可能会在后台验证这些数值是否与原始记录一致;如果发现偏差,审查工具会立刻向智能体抛出包含纠错线索的反馈。智能体接收到反馈后,必须重新评估自己的写入策略,修改事实错误,或者将宽泛的总结细化为带索引的精确事实记录,然后再发起下一次写入尝试。
一旦这个构建和优化循环完成,最终沉淀下来的记忆工作区就会成为指导未来问答的高度精炼指南。当系统接收到用户的实际提问时,SelfMem 会基于提问内容,结合最终的记忆工作区以及从原始记录中检索到的相关片段,统一提交给大语言模型生成最终回答。这种机制确保了模型在生成答案时,既能纵览全局的策略性记忆,又能随时触达底层的精确事实。
百万 Token 极限测试:压倒性的性能优势
为了验证 SelfMem 的实际效能,研究人员在 BEAM 基准测试上进行了全面且严格的评估。BEAM 是一个专注于超长对话历史的测试平台,不仅提供 10万、50万和 100万 Token 级别的极端上下文,还通过 2000 个探测问题深度考察系统在信息提取、时间推理、多会话推理和事件排序等方面的综合能力。测试过程采用顺序提问的方式,模型之前生成的问答轮次会被追加到后续的提示词中,完美模拟了真实的长时间多轮交互场景。
实验结果展现了 SelfMem 绝对的性能优势。在所有上下文长度的测试中,SelfMem 均取得了最高的官方综合得分(Score)和最高的 Pass0.5 指标。随着对话历史变得越来越长,现有的固定检索、压缩和结构化记忆基线的性能不可避免地出现了退化,而 SelfMem 却展现出了极强的鲁棒性。
作者在论文中明确指出,在面对长周期环境时,相关信息往往极其稀疏,分散在成百上千次对话的各个角落,并且常常与已经过时或无关紧要的细节混杂在一起。在这种情况下,硬编码的记忆管道显得力不从心。相比之下,传统的 RAG(检索增强生成)虽然作为最强的非 SelfMem 基线依然保持着竞争力,但它仅仅在查询发生时才去被动地检索文本块,完全没有构建自适应的记忆表征。SelfMem 允许智能体主动决定哪些内容值得留在记忆区、哪些需要压缩、哪些可以留待查阅,这种主动管理带来了巨大而稳定的性能红利。
具体的数据令人瞩目:在 10万、50万和 100万 Token 规模下,SelfMem 相较于最强基线的官方得分分别提升了 0.165、0.141 和 0.134,对应的 Pass0.5 指标则分别飙升了 17.0、14.9 和 14.3 个百分点。在百万 Token 的极限压力下依然能够维持超过 41.9% 的相对性能提升,充分证明了 SelfMem 的机制在扩展性上远超人工设计的传统记忆系统。此外,深入的问题类型分析进一步证实了其广泛的适应性:在 100万 Token 规模下的 10 种不同记忆需求测试中,SelfMem 拿下了其中 7 项的最高分。
策略的自我进化:从基线到最优策略的突破
SelfMem 的潜力并没有止步于提供一个灵活的管理环境。研究团队进一步探讨了一个更具前瞻性的问题:智能体能否通过迭代策略优化,利用累积的反馈让自己的记忆行为变得越来越好?
为了验证这一点,研究人员设计了一个策略迭代流程。从默认的 SelfMem 设置出发,智能体被要求利用训练集对话中汇总的反馈(包括训练得分和记忆工具的底层诊断信息),在纯自然语言层面反复提出并修改其“记忆策略笔记”。这个过程完全不需要更新模型的底层权重,而是将其视作一个黑盒优化器,依靠语言本身来寻找更优的策略解。


上图详细记录了策略迭代过程中的性能演变。无论是从优化轮次的视角,还是从引入训练样本数量的视角来看,结果都揭示了一个重要的规律:通过自我审视和策略重写,模型确实能够发现比默认设置更卓越的记忆管理方式。在保留的验证集上,默认未优化版本的得分为 0.472,而经过智能体自主迭代后,最终合成的策略将得分提升至 0.497,在整个搜索过程中发现的最优策略更是达到了 0.510。
值得注意的是,这种性能的跃升并不是简单地与迭代次数或训练数据量成正比。最顶尖的策略往往出现在迭代的中期。作者对此的判断是,这种增益并非来源于无脑地堆叠更多示例,而是因为智能体在探索过程中顿悟了一种更加鲁棒的“程序化策略”——它真正学会了在特定任务下,应该以何种标准来判断一条信息是该存储、该修正、该压缩,还是该交由检索处理。这有力地证明了,SelfMem 成功地为长期记忆管理暴露出了一个极具价值的、可通过自然语言优化的操作空间。
结语与启示
SelfMem 的提出,不仅为大语言模型解决超长上下文环境下的记忆问题提供了一套行之有效的工程框架,更在方法论层面带来了一次深刻的转变。它用令人信服的数据证明了,相比于试图穷尽各种边缘情况来人工编写完美的记忆管道,构建一个具备工具支持和丰富反馈信号的探索环境,让模型自主寻找记忆的最优解,不仅性能更好,而且在成本与质量的权衡上也更具优势。
通过将记忆管理从静态的数据存储升级为动态的策略优化过程,SelfMem 向我们展示了下一代 AI 智能体应有的形态:它们不应只是被动记录数据的海绵,而应当是能够根据环境反馈、自主雕琢记忆结构的积极思考者。随着这项技术的进一步发展,我们有理由期待在更广泛的模型家族和更复杂的部署场景中,智能体能够真正拥有如同人类般灵活、持久且高效的长期记忆机制。