MESA:长程智能体记忆不是全塞或单选,动态剪裁互补结构反超8.5%
MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

在开发具有长程执行能力的大语言模型智能体(Long-Horizon Agent)时,记忆管理始终是一道难以逾越的高墙。当智能体在软件工程、具身操作或复杂网页任务中持续执行上百步交互时,历史轨迹中密密麻麻地交织着推理链、动作调用、环境观察和工具返回值。当后续步骤需要解决一个突发问题时,关键线索往往被深埋在数百步之前的某个细节里。
ArXiv URL:https://arxiv.org/abs/2608.10108v1
直接把整个历史硬塞进超长上下文窗口,不仅调用成本高昂,模型也常常在数万乃至数十万 Token 中迷失;而简单地压缩或截断历史,又往往会在不经意间丢弃决定胜负的关键证据。为此,学界普遍转向外置记忆系统,利用文本摘要、向量检索或图谱来结构化管理历史。然而,微软与多家高校联合团队在最新研究中指出了一个关键盲区:现有的多记忆系统陷入了两个极端——要么对所有查询都机械地把全部记忆结构“全选全查”(All-in),导致上下文严重膨胀并充斥噪音;要么把查询生硬地分流到单一记忆结构(Routing),彻底斩断了跨结构互补线索的拼图可能。
针对这一困境,研究团队提出了 MESA(Multi-structure Evidence Selection framework for long-horizon Agent)。该框架不仅指出了“动态子集选择”才是长程记忆的最优解,更利用先验引导的代码框架(Harness)优化与多臂老虎机机制,仅凭端到端答案的弱监督信号就训练出了自适应选择器。在长程基准 AMA-Bench 上,MESA 比最强基准准确率提升了 8.5%,同时比全量记忆结构方案减少了 41% 的证据 Token 消耗。

为什么单一记忆结构或全量聚合都在失效?
要理解 MESA 的突破,首先需要剖析为什么现有记忆抽象都无法单独胜任长程任务。不同记忆组织形式本质上代表了对历史轨迹的不同观察切角:
-
文本摘要(Text Summaries):擅长概括宏观上下文和阶段性目标,但几乎必然丢失确定性的执行参数与代码行级细节;
-
时序存储(Temporal Stores):严格保持事件的时间推进顺序,但如果用户查询缺乏明确的时间锚点,检索效率就会大打折扣;
-
向量数据库(Vector Databases):基于稠密语义相似度快速提取片段,但经常捞出一堆语义接近但对当前推理无用的冗余信息,并彻底打碎了因果顺序;
-
知识图谱(Knowledge Graphs):善于在复杂实体之间进行多跳遍历,却缺乏步骤级别的时序执行索引;
-
原始轨迹快照(Raw Episodic Traces):完整保留了执行现场的蛛丝马迹,却把核心线索湮没在海量的工具返回噪声中。
由于没有哪一种单结构能够“包打天下”,混合多记忆结构便成了显而易见的方向。然而,现阶段系统的访问策略却极其僵硬。以 Hindsight 这类方法为代表的“全量聚合派”,无论当前查询问的是“第 3 步的报错原因”还是“当前项目的总体架构”,都一股脑地把所有结构全部捞一遍并拼接起来。这种做法虽然最大化了信息召回,但多余结构带入的无关上下文会直接形成“干扰项”,诱导下游大模型产生幻觉,同时让推理成本成倍上升。
另一派则是单结构路由方案,如 StructRAG 或 FluxMem,它们倾向于为每个问题寻找一个“最佳宿主”。但这同样不符合真实推理需求。正如软件工程调试场景所示,一个严密的排错过程往往需要把宏观的设计总结(摘要)与某个报错函数当时的具体堆栈参数(原始轨迹快照)联合在一起才能完成因果推断。单选路由机制在结构层面人为割裂了这些互补线索。

彻底摸清解空间:受控组合实验揭示的两大真相
为了跳出“单选”与“全选”的非此即彼,研究团队在涵盖六大智能体领域(网页操作、开放工具问答、Text-to-SQL、软件工程、游戏和具身智能)的长程评测基准 AMA-Bench 上进行了一次详尽的组合穷举分析。
研究人员将记忆结构严格形式化为表征及其专用访问接口的集合,实例化出摘要(S)、时序(T)、图谱(G)、向量(V)和原始轨迹(R)共 5 类结构。由于非空子集共有 $2^5 - 1 = 31$ 种可能,实验对这 31 种组合进行了全面的受控测试。雷达图所展现的实验数据给出了极其明确的技术洞见:
其一,折中子集往往具有显著优势。在绝大多数任务类别中,取得最高准确率的既不是单一的结构,也不是把 5 种结构全部填满的完整并集,而是由 2 到 3 种互补结构定制而成的局部组合。这一结果直接打破了“全量召回即正义”的直觉认知,证明了过量记忆结构带来的上下文噪音会实打实地拉低大模型的判断力。
其二,不存在通用的全局最优组合。最优子集随任务领域和考察的能力类型发生剧烈漂移。例如在需要严格因果推断的任务中,时序与原始轨迹的组合表现亮眼;而在跨实体关联的抽象查询中,图谱与摘要的配合则往往胜出。这证实了静态配置多记忆系统的天花板很低,智能体必须具备在执行时依据具体 Query 动态挑选结构子集的能力。
由此,研究团队正式确立了“结构级动态选择”(Structure-level Dynamic Selection)这一全新的问题定义:智能体需要根据当前查询与环境上下文,从结构库中自适应决定激活哪些记忆表征,只把精炼且互补的证据块融合后喂给问答模型。

MESA 架构:从弱反馈中炼出可执行选择策略
确立了动态选择的必要性后,工程与算法层面的最大挑战随之而来:如何训练这个自适应选择器?
在长程智能体场景下,并不存在人工标注的“针对某问题最应该查哪几种结构”的细粒度监督标签。系统能够拿到的唯一信号,是最终回答模型给出的答案正确与否。这种端到端的答案级弱监督极其稀疏,且面临着极其复杂的效用与冗余权衡——引入新结构可能增加证据覆盖,也可能增加冗余与开销。如果直接使用未经约束的端到端强化学习或让大模型盲目搜索可执行代码,搜索空间会极其巨大且极难收敛。
MESA 给出了一套精巧的解法:它让记忆构建模块、各结构的专用检索接口、结果拼接模块以及最终的回答大模型全部保持“冻结”(Frozen),把优化的焦点完全收敛在中间的“结构选择器”(Selector)上。选择器本质上是一段可执行的代码策略,输入查询 $q_i$ 与交互上下文摘要 $c_i$,输出一个二进制决策向量 $z_i \in {0, 1}^5$。
为了让弱监督信号能够稳定驱动策略进化,MESA 引入了先验引导的 Harness 优化框架与置信度上限(UCB)调度:
-
先验方向约束(Prior Directions):与其漫无目的地生成或微调代码,MESA 定义了一组结构化的策略修改机制作为先验。这些先验涵盖了策略如何解析查询需求、如何评估特定结构与当前问题的匹配度、如何动态剪裁候选子集,以及如何在证据成本与鲁棒性之间设置预算阈值。LLM 提议器(Proposer)必须在这些明确的先验方向指导下提出代码修改提案,大幅收窄了无效探索空间。
-
性能与开销联合目标:验证集上的评估函数不仅仅看答题准确率 $J(\rho)$,而是引入惩罚项 $\lambda C(\rho)$ 来约束证据所占用的 Token 数量。目标函数写作:
\[\widetilde{J}_{\mathrm{val}}(\rho) = J_{\mathrm{val}}(\rho) - \lambda C_{\mathrm{val}}(\rho)\]这确保了选择器不仅追求答对,还要主动学会“克制”,尽量用最紧凑的结构组合解决问题。
-
基于 UCB 的探索与利用平衡:系统维护一个历史策略归档库。在每一轮进化中,针对不同的先验方向 $a$,采用 UCB 公式计算其选择优先级:
\[\mathrm{UCB}(a) = \overline{\widetilde{J}}_{\mathrm{val}}(a) + \beta\sqrt{\frac{\log(N+2)}{n_a+1}}\]其中 $\overline{\widetilde{J}}_{\mathrm{val}}(a)$ 表示该方向历史提案的平均验证表现,$n_a$ 为尝试次数。这防止了优化过早陷入某个局部微调方向,确保了搜索在高效利用已知有效规则的同时,持续对潜在高收益方向进行充分探索。

在实际迭代中,初始策略往往只是粗糙的关键词分流或默认全选;随着优化轮次的递增,被采纳的代码提案逐步演变为能够识别深层语义意图的复杂条件逻辑,最终沉淀为一份清晰透明、兼具强泛化性与可解释性的 Python 执行策略。
实验评测:不仅答得更准,上下文还精简了 41%
评测主要在真实的复杂交互基准 AMA-Bench 上展开。该数据集包含 208 个真实环境轨迹,每条轨迹包含 12 个专家精心设计的问答对,总计 2496 个复杂问题,涉及 6 个智能体应用领域及 4 类记忆核心能力(信息回忆、因果推理、状态更新、状态抽象)。为了验证方案的跨场景通用性,团队还在多会话长期对话基准 LoCoMo 上进行了迁移评测。
在以主流开源强模型 Qwen3-32B 和 Gemma-4-31B 作为答题基座的评测中,MESA 展现出了压倒性的优势。
在 AMA-Bench 上,MESA 取得了显著的性能跃迁。相较于表现最强的单结构基线以及现存的多结构基准系统,MESA 的大模型判别准确率实现了高达 8.5% 的大幅领先。在 Qwen3-32B 基座下,MESA 的最终得分为 65.1%,稳稳压制了所有对比组;即使在 Gemma-4-31B 基座下,MESA 也达到了 69.4% 的高分。
更为关键的是效率对比。相比于不加节制地拉取全部结构的“全量并集方案”(All-structure),MESA 在准确率不仅高出 1.4 个百分点的前提下,每个查询所消耗的证据 Token 数量直接从近两万缩减到 11.0k,Token 消耗量骤降 41.2%。这直接印证了理论设想:剔除不匹配的记忆结构,既是对算力和上下文开销的巨额节省,更在物理层面移除了大量潜在的干扰噪音,反哺了下游模型的推理质量。
而在跨领域的 LoCoMo 长期对话评测中,即便面对的是完全不同于工具调用的多轮多会话闲聊与事实追踪场景,未做特化修改的 MESA 同样拿下了 49.0% 的整体 F1 分数,甚至以 1.8% 的优势超越了专门针对该数据集设计定制记忆方案的前序顶尖工作,证明了“自适应选择互补结构”这一范式本身具有高度的通用价值。

剥离变量:到底是什么在驱动性能提升?
为了理清 MESA 内部各设计环节的真实贡献,消融实验提供了详尽的量化分解:
其一,单结构路由与动态子集的差距。如果在优化目标中强行限制策略“每个问题只能挑 1 个结构”,系统的准确率瞬间从 65.1% 暴跌至 57.0%。这再次以无可辩驳的数据说明:对于长程复杂推理,单一维度的切片信息是严重残缺的,智能体必须能够同时兼顾不同形态的记忆补充。
其二,先验引导的重要性。如果在 Harness 搜索中移除预设的先验修改方向,完全依赖 LLM 进行自由探索,模型准确率会下降 2 个百分点,降至 63.1%。这是因为端到端弱反馈信号太粗,在漫无边际的代码空间中随意盲变极易产生无意义或不稳定的退化策略;结构化的先验机制充当了搜索过程的强力“航标”。
其三,UCB 调度的平抑效应。当拿掉 UCB 探索平衡逻辑后,系统的准确率小幅跌至 64.3%,但多次测试间的标准差从原本极具稳定性的 0.8 骤增至 2.2。这表明 UCB 算法在防止搜索过早收敛于局部平庸策略上起到了关键的稳定锚作用。
最终成型的 MESA 策略在处理具体问题时,平均每次动态调用 2.8 个记忆结构。这种“按需索取”的机制让整个记忆管道兼顾了单结构的精巧与全结构的视野。
对未来 Agent 系统设计的启示
MESA 这项研究跳出了以往“发明一种新的记忆格式”或“无脑加长 Context”的局限思路,从系统架构的角度重新审视了多模态、异构记忆的协同逻辑。
长期以来,很多开发者在搭建智能体长程记忆时容易陷入两个执念:要么试图设计出一种无所不包的“万能超级记忆结构”(如超大型全局时序图谱),要么寄希望于 Context Window 无上限扩充后直接无脑 Dump 原始执行日志。然而工程事实表明,任何单一结构为了通用性往往会在特定维度付出沉重代价(例如图谱维护成本极高且难存细粒度动作,摘要无法溯源),而盲目堆积 Token 带来的注意力涣散更是大模型当下无法回避的物理特性。
MESA 给出的解题思路非常符合软件工程的解耦美学:承认每种专用数据结构的局限与特长,保留异构底座的独立性,通过一个由端到端任务目标驱动、高度轻量的“调度层”来实现动态调优。这种在可执行代码层面进行自适应调度的思路,完全可以进一步迁移到外部工具选择、子 Agent 编排乃至多模型协作等更广泛的系统层设计中。对于正在攻坚企业级长程智能体与复杂自动化工作流的团队而言,MESA 揭示的这一套“精炼互补、按需激活”的设计逻辑,无疑具备极高且清晰的落地参考价值。