AutoMem:用文本梯度搜索智能体记忆架构,准确率提升2.8分且降低14.3%消耗
AutoMem: A Text-Gradient Recursive Self-Improvement Framework for Automated Memory Architectures Search

在大语言模型(LLM)驱动的自主智能体(Agent)研究中,长期记忆(Long-term Memory)早已被公认为通往复杂任务与自主进化的关键阶梯。无论是保留跨轮次对话轨迹、沉淀反思经验,还是固化工作流与技能库,记忆模块赋予了智能体跨越时间维度的持续决策能力。然而,当前业界在构建智能体记忆时,大多仍停留在“手工预设”阶段:工程师或研究者凭先验直觉选定一套编码、存储、检索与维护流程,部署后便固定不变。
ArXiv URL:https://arxiv.org/abs/2608.14621
这种一刀切的设计在实践中屡屡碰壁。一个在复杂问答中表现优异的记忆配置,迁移到深度网络搜索或工具调用任务时,可能会因为检索噪点过多或信息维护不当,反而导致性能倒退。来自华东师范大学和上海人工智能实验室的研究团队明确指出,智能体记忆并非单一组件,而是一个高度模块化、且内部高度耦合的子系统。没有任何一种固定的人工设计架构能够在所有任务和不同基座模型上始终保持领先。
针对这一瓶颈,该团队提出了 AutoMem——一个基于“文本梯度”(Text-Gradient)递归自优化的自动化记忆架构搜索框架。该方法将记忆系统解耦为编码(Encode)、存储(Store)、检索(Retrieve)和管理(Manage)四个核心维度,并通过反思累积与失败归因,让智能体在有限的评测预算下,自主迭代并搜索出最适配特定任务分布的高效记忆架构。实验表明,AutoMem 在 GAIA、WebWalkerQA 和 xBench-DeepSearch 等复杂基准上,跨不同基座模型平均提升了 2.8 个百分点的任务准确率,同时在 Qwen3.5-122B-A10B 基座下将 Token 消耗降低了 14.3%,在极少迭代轮次内便超越了大算力随机搜索的最优解。
长期记忆的碎片化陷阱:为何不存在“通用架构”?
为了搞清楚记忆架构对智能体表现的具体影响,研究团队首先将长期记忆解耦为四个功能正交的原子模块:
-
编码(Encode,$\mathcal{E}$):决定何种交互轨迹、反思或技能信息应该被抽取并写入记忆;
-
存储(Store,$\mathcal{S}$):决定提取出的记忆以何种数据结构组织,例如扁平文本、键值对还是图结构;
-
检索(Retrieve,$\mathcal{R}$):决定在给定当前上下文时,用何种策略与度量方式筛选最相关的记忆条目;
-
管理(Manage,$\mathcal{M}$):负责记忆库的生命周期维护,包括冲突消解、去重、压缩沉淀与遗忘淘汰机制。
基于已有前沿系统的常见范式,研究者梳理出了包含 5 种编码器、5 种存储器、6 种检索器和 4 种管理器的离散架构搜索空间 $\mathcal{A} = \mathcal{E} \times \mathcal{S} \times \mathcal{R} \times \mathcal{M}$。在初步的探索性实验中,研究者通过在合法空间中进行均匀随机采样评测,发现了三个关乎智能体记忆本质的重要现象。


第一,高潜力的记忆架构确实存在,但呈现出极强的“任务特异性”(Task-specific)。如图所示,在 GAIA 基准上,随机采样出的最佳架构达到了 69.7% 的准确率,显著超越了固定记忆基线 MemoryBank(67.8%);在 xBench-DeepSearch 上,最优架构也达到了 46.0%,突破了当时固定方案的性能天花板。然而,这两大基准上的最优架构配置截然不同:GAIA 更青睐工作流编码结合混合存储与语义检索,而深度网络搜索任务则需要基于图存储与对比检索的短路径编码。一套在某个任务上带来正向收益的记忆系统,放到另一个任务上甚至可能跑输“完全不带记忆”(No-Memory)的原生智能体。
第二,模块之间的效用是强耦合的,而非简单的线性叠加。孤立地评价某一个检索算法或编码策略的好坏毫无意义。一个能力极强的图检索模块,如果搭配上稀疏且低质的编码器,往往完全发挥不出威力;而过于激进的记忆管理裁剪策略,在信息本就匮乏的冷启动阶段,极易误删关键线索。架构的最终效能取决于四模块之间的协同兼容性。
第三,盲目的暴力搜索成本高昂且不可持续。尽管随机采样能够撞大运般触及 SOTA 峰值,但每一次候选架构的评估都需要智能体在真实环境里完成完整的任务 Rollout。随机搜索不会从失败的尝试中积累任何可用信号,各轮尝试彼此孤立,在多维离散空间中如同大海捞针。这就要求系统必须建立一种机制:既能看懂每一次执行失败的具体诱因,又能将这些诱因反哺给架构生成器。
AutoMem 架构解析:文本梯度与经验双轮驱动
面对离散且昂贵的架构搜索空间,AutoMem 摒弃了传统的强化学习或黑盒遗传算法,而是借力大模型自身的语言理解与推理能力,构建了一套“提出候选—环境评估—失败诊断—反馈迭代”的递归自改进闭环。

整个框架围绕两个核心支柱展开:经验引导的架构搜索(EGAS)与失败驱动的模块诊断(FGMD)。
1. 经验引导的架构搜索(EGAS)
如果生成候选架构的 Proposer LLM 仅仅依赖上一轮的即时诊断,极易陷入局部最优、在已经验证失败的死胡同里反复打转,或者对近期的偶发轨迹产生过拟合。EGAS 通过引入多维度的历史状态结构,为候选架构的生成构建了坚实的先验约束:
-
Pareto 前沿面($P_t$):系统在优化准确率($\mathrm{Acc}$)的同时,同步追踪记忆带来的净增益($\Delta$)与调用代价($\mathrm{Cost}$)。只有在准确率、增益或成本三者中至少一项严格占优且其余项不恶化的架构,才能进入 Pareto 集合,确保进化方向始终兼顾性能与资源消耗。
-
经验账本(Experience Ledger, $\mathcal{L}$):账本以结构化四元组 $(c, u, q, z)$ 沉淀跨轮次的全局共识。其中 $c$ 为适用场景条件,$u$ 为推荐或抑制的模块变动操作,$q$ 为支持证据,而 $z$ 代表该规则的验证状态(激活、待定或已证伪)。例如,当系统多次发现“在记忆池稀疏时强推图检索会导致召回崩溃”,该条目就会被标记为激活状态,从而在后续提议中强制规避类似修改。
-
观测图(Observation Graph, $\mathcal{G}$):图结构节点覆盖任务模式、模块选型与历史表现,边权重实时统计经验关联值 $\mu(c,u)$。这一软性先验对于编码器(Encode)的优化尤为关键,因为“信息漏记”往往比“检索错误”更难通过单一失败轨迹直接察觉,依赖跨轮次宏观统计能有效补充微观诊断的盲区。
在每一轮搜索中,Proposer 模型综合考虑最新诊断反馈、Pareto 前沿以及经验账本,在合法空间中生成一组满足兼容性约束的候选架构,杜绝语法非法或组件不匹配的无效测试。
2. 失败驱动的模块诊断(FGMD)
FGMD 扮演着类似于反向传播中“计算梯度”的角色,但这里的梯度不是连续数值,而是高度语义化的结构性文本反馈(Textual Gradient)。要将任务失败转化为明确的模块修改指令,FGMD 必须连续解答三个环环相扣的问题。
首先是作用域过滤(Scope Filtering)。在真实的网络环境与多步骤工具调用中,智能体的失败原因极为杂乱:API 超时、目标网页崩溃、环境判定标准模糊或是基础数学推理失误,都可能导致任务归零。如果将这些与记忆无关的系统噪音强加给记忆模块去反思,搜索过程必然发生漂移。FGMD 设置了规则化的 Scope Gate,仔细核查轨迹中是否存在记忆可干预的证据(如检索条目缺失、存在过时干扰、冲突信息等),坚决剔除无关失败。
其次是细粒度模块归因(Module Attribution)。对于通过过滤的记忆相关失败,FGMD 建立了一套规则分类器与 LLM 仲裁结合的诊断流水线:
-
若交互中有用线索未被捕获或压缩丢失,归因为 Encode 问题;
-
若线索已存入但数据结构阻碍了多跳索引或关联,归因为 Store 问题;
-
若候选池中存在目标记忆,但检索步骤发生漏检、排序倒挂或被无端过滤,归因为 Retrieve 问题;
-
若记忆库充斥着过时未淘汰(Stale)、重复或相互冲突的陈旧知识导致决策混淆,归因为 Manage 问题。
针对少数难以被规则判定的复杂边缘轨迹(例如检索与过滤环节均未报错,但智能体依然输出错误),系统会交由专门的诊断 LLM 进行深度审视,将数值格式错误或特定时间窗口偏差等隐蔽的非记忆故障剔除出局。
最后是文本梯度合成(Textual Gradient Synthesis)。单一轨迹的归因具有随机性,因此系统会对当前轮次中所有的失败案例进行直方图统计聚合,识别出当前架构最显著的系统瓶颈 $q_t^{\star}$。诊断合成器将瓶颈定位、真实失败用例证据、置信度等级以及符合架构空间语法的修改建议,封装为一个标准的文本梯度元组 $\delta_{t+1}$,精准牵引下一轮的 EGAS 采样。
实验评测:性能跃升与推理成本的双赢
为了验证 AutoMem 的通用性与鲁棒性,研究团队选取了三类高度依赖多步骤规划与外部环境交互的综合基准:涵盖多模态与工具调用的 GAIA、聚焦超长网页多跳探索的 WebWalkerQA,以及强调深度网络搜索与长程证据整合的 xBench-DeepSearch。底层基座模型则涵盖了开源与商业化代表模型(包括 Qwen 系列大模型)。
实验设定了极其严格的对照环境:包括不挂载长期记忆的原生智能体基线(No-Memory),以及业界广泛采用的人工预设记忆架构(如 MemoryBank、Reflexion 等典型范式)。评估过程明确划分了用于搜索探索的 Search Batch、用于检验泛化能力的 Validation Batch,以及完全未参与搜索决策的独立测试集 Test Batch。
核心指标超越人工基线
评测数据显示,在跨越 6 个“基准数据集—基座模型”的严苛组合测试中,经由 AutoMem 自动化搜索发现的任务自适应架构,全面压制了所有固定的人工记忆设计,平均任务准确率取得了 2.8 个百分点 的纯增益。
尤为值得注意的是,在最具挑战性的复杂信息检索与综合决策场景中,自动化架构拉开了更为明显的差距。在 xBench-DeepSearch 任务上,固定的人工记忆架构往往因为在多轮搜索中累积过多杂乱文本而发生上下文污染,很多基线相比无记忆状态仅微弱提升甚至反向下跌。而 AutoMem 敏锐地定位到了检索纯度与过期淘汰之间的失衡,通过自适应组合高选择性检索器与强去重管理策略,成功发掘出了兼具高召回与高洁净度的架构组合,显著拉升了复杂多跳搜索的成功率。
架构搜索的收敛效率与成本优势
除了最终准确率的绝对提升,搜索本身的代价和推断运行时的效率,是评估此类框架实用价值的核心标准。
在推断运行时成本方面,更强的记忆并不意味着必须往提示词上下文里强塞更多内容。由于 AutoMem 在 Pareto 目标中显式纳入了调用开销惩罚,并且 FGMD 能够精准打击“低质冗余记忆注入”这一顽疾,搜索出来的优秀架构在很多场景下反而更加轻量。在 Qwen3.5-122B-A10B 基座下的横向对比中,AutoMem 产出的最优架构在准确率登顶的同时,每任务 Token 消耗相比准确率最高的固定基线降低了 14.3%。这打破了“要提升长期记忆表现就必须承受上下文急剧膨胀”的固有思维,证明精细化的管理与检索过滤能够同时优化精度与成本。
在搜索收敛速度方面,对比随机架构搜索的消融实验给出了极具说服力的结论。传统的随机搜索由于缺乏失败反馈积累,即便耗费数倍的采样预算,其最好结果在很大程度上依然受制于概率随机性。而 AutoMem 在 EGAS 与 FGMD 的协同拉动下,通常仅需几轮引导迭代,就能稳定收敛到高表现区域,其发现的架构质量显著超越了采样规模大得多的暴力搜索方案。差分验证机制更确保了系统不会被偶然的评测抖动误导,保证了搜索轨迹在全局方向上的单调推进。
对未来智能体架构演进的思考
AutoMem 的成功为大语言模型智能体系统的设计范式带来了深层启发。长期以来,开发者在构建智能体时习惯于在两个极端之间摇摆:要么在宏观层面依赖人工编写精巧的固定流程(Workflow),要么寄希望于单一超大模型凭借庞大的上下文窗口暴力覆盖所有历史信息。
这项工作用详实的实证数据证明:智能体的非参数化子系统(如记忆、工具中枢、状态机)本身就是由离散模块交织而成的架构空间,并不存在天然普适的人工最优解。不同的基座模型具备不同的长文本注意力分布与指代消除能力,不同的任务场景具备不同的时间局部性与信息衰减速度,唯有“任务—基座—记忆子系统”三者达成结构级自适应,才能逼出智能体的性能极限。
同时,AutoMem 将“文本梯度”从早期简单的 Prompt 改写,成功提升到了“复杂软件系统离散架构级归因与变异”的全新高度。通过在反思回路中严密设计 Scope Gate、规则与 LLM 互补的归因矩阵,以及跨轮次状态图,文本反馈展现出了不亚于数值梯度的强定向引导能力。
从手动调优走向“元智能体驱动的自主演化搜索”,AutoMem 不仅提供了一套开箱即用的高性能记忆搜索方案,更清晰地勾勒出下一代自主 Agent 系统的工程演进路径:让智能体在探索世界、遭遇失败的过程中,不仅修正当前的动作,更能亲手重构自身的底层心智架构。