AdaMM:为多模态Agent引入分析型记忆,长程任务最高提升11.3%
Beyond Retrieval: Analytic Memory for Multimodal Agents
在大模型智能体(LLM Agent)的研究脉络中,如何让系统在长达数周乃至数月的跨周期交互中“记住事情”,一直是一项核心挑战。现有的长程记忆系统几乎毫无例外地建立在检索记忆(Retrieval Memory)的基础之上。无论是将历史截图和对话压缩为文本摘要、提取视觉向量,还是构建分层的语义检索树,其底层逻辑都高度一致:当用户提问时,系统从浩瀚的历史数据中挑选出相似度最高或相关性最强的前 $k$ 条记录,拼接成上下文再交由主干模型作答。
ArXiv URL:https://arxiv.org/abs/2607.29440
这种“先检索、再作答”的范式,在处理“我上周把钥匙放在哪里了”这类局部点状回忆时游刃有余。然而,面对真实生活和复杂工作流,Agent 需要应对的提问往往是另一类形态:“过去一个月我平均每晚睡几个小时?”或者“分析我这周打牌时胜率最高的一种出牌套路”。面对这类问题,基于相关性的检索范式立刻陷入瘫痪:检索一条、两条甚至十条记录都无法代表全貌;而如果试图把过去一个月数十张睡眠手环截图或打牌日志全部塞进 Prompt,既会迅速击穿模型的上下文预算,又会因海量噪声和冗余信息导致大模型计算幻觉。
针对这种检索与分析的结构性失配(Retrieval–Analysis Mismatch),一项最新研究提出了 AdaMM(Adaptive Multi-view Memory)框架。该工作首次明确提出了分析型记忆(Analytic Memory)的抽象概念:Agent 长期记忆不应只是一个被动的语义全文检索器,而应当具备主动将重复出现的零散多模态观察归纳、沉淀为结构化查询表的能力。通过将结构诱导出的分析型记忆与分层语义检索记忆相结合,并在推理阶段引入动态协同规划器,AdaMM 在 MemEye 与 MemGallery 两大多模态长程记忆基准评测中,分别取得了最高 11.3% 和 7.3% 的性能提升。

为什么说“检索”救不了需要“分析”的记忆?
要理解 AdaMM 的出发点,首先需要看清当前多模态 Agent 在记忆层面的瓶颈。在现有的多模态交互场景中,用户输入不仅包含多轮文本对话,还包含大量按时间顺序追加的截图、拍照、图表以及上下文元数据。在学术界,这些数据通常被视为一条按时间追加的日志(Append-only log)。
当用户发起需要统计聚合、阈值筛选、排序或时序对比的提问时,基于语义相关度的检索系统会遭遇根本性的覆盖度与上下文权衡(Coverage–Context Trade-off)。一方面,计算平均值或寻找全局极值需要完备且边界清晰的闭合集合;如果相似度召回遗漏了其中三天的睡眠打卡截图,下游模型给出的平均值从数学上就注定是带偏的有偏估计。另一方面,如果盲目放大检索召回的窗口,把包含“睡眠”关键词的所有历史记录一股脑送入模型上下文,不仅极其浪费 Token 成本,还会引入无关的聊天闲聊,严重稀释关键数据密度,导致大模型在多步推理时发生注意力涣散。
更根本的矛盾在于数据的组织形式。人类的大脑在面对日复一日的规律性行为时,并不会每次都把所有原始画面在脑海中重新“倒带并数一遍”,而是会无意识地将其归纳成具备特定维度的结构化认知。但在以往的系统设计中,交互历史通常缺少预定义的模式(Schema)。系统事先根本不知道用户未来会关心打牌的输赢记录,还是会追踪体重手环的数值波动,因此无法在初始化阶段硬编码一套数据库表结构。
这就引出了 AdaMM 试图攻克的两个关键矛盾:第一,在没有预设数据表结构的前提下,如何从碎片化、多模态的交互流中,自适应地“长出”能够支持 SQL 级别计算的关系表?第二,当用户的自然语言提问模糊不清时,Agent 如何权衡自己手头的表格工具与语义检索工具,规划出精确的执行步骤?

从无序碎片到关系表:分析型记忆的自适应归纳
为了解决模式未知的问题,AdaMM 提出了一套数据驱动的模式归纳(Schema Induction)机制,不依赖人为设定的应用模板,而是让 Agent 在持续交互中完成属性抽取、模式挖掘与演化、以及内存物化的三级跳。
第一步是细粒度的观察片段抽取(Attribute Extraction)。面对按时序流入的每一轮多模态交互 $R_t$(包括对话文本、视觉观察图像与时间戳),AdaMM 利用视觉语言抽取器,自适应地识别其中所有可能构成键值对的属性片段,输出为形如 $(a_{t\ell}, x_{t\ell}, p_{t\ell})$ 的三元组。其中 $a_{t\ell}$ 是属性名(例如“睡眠时长”),$x_{t\ell}$ 是与源数据忠实对应的属性值(例如“5.5小时”),而 $p_{t\ell}$ 则是一个极其关键的设计——可溯源指针(Provenance Link)。该指针牢牢锚定了该属性值究竟来自于哪一段具体的对话文本,抑或是某张截图的具体局部,为后续的推理提供了随时回溯证据链的能力。
第二步是模式的发现与动态演进。拥有了散落的属性集合后,系统需要辨别哪些属性是偶然提及的闲聊杂质,哪些属性具有高频共现的内在规律。AdaMM 借鉴了经典关联规则挖掘的思想,但在统计准则上做了针对性改造。
-
在候选模式挖掘阶段,系统通过设定支持度阈值 $\theta_s$,筛选出跨越多轮交互稳定出现的属性子集 $\mathcal{C}$,确保进入候选池的结构拥有足够的数据填充度。
-
在新模式发现阶段,AdaMM 引入了基于全置信度(All-confidence)的过滤准则:
这一设计的精妙之处在于,它强制要求候选集内的所有属性在任意成员出现时都必须具备极高的共现一致性。这就彻底避免了一种常见缺陷:某个全系统超高频出现的泛化属性(例如“时间”或“用户状态”),由于自身频次过高,错误地将所有本不相关的局部属性生拉硬扯成一张巨大的畸形宽表。同时,系统通过保留极大候选集,自动过滤掉低阶冗余子集。
- 考虑到用户的行为和记录维度会随时间增加,系统还设计了模式演化机制(Schema Evolution)。当已有模式 $\mathcal{A}$ 的基础上经常伴随新属性增量 $\Delta$ 出现时,系统计算扩展置信度 $\operatorname{ext-conf}_t(\mathcal{C}\mid\mathcal{A})$;一旦共现比例达到阈值 $\theta_e$,系统就会自动为现存表结构追加新列,实现记忆结构的平滑自我扩充。
第三步是表格物化(Memory Materialization)。一旦某个模式通过验证,AdaMM 就会指示语言模型推断该表的语义名称、字段类型,并为其开辟一张二维关系表。每一行对应一次具体的交互轮次,每一列填入对应的属性值,并强制附带时间戳和轮次序数辅助列。至此,原本散落在几十张图片和长篇对话里的琐碎信息,被正式编译成了可供精确代码与算子操作的分析型记忆 $\mathcal{M}^{\mathrm{ana}}$。
双轨记忆并行:层次化语义与动态规划器
分析型记忆固然解决了统计计算的问题,但如果将所有交互都强行塞进表格,同样会走向另一个极端。日常对话中大量的开放式事件、视觉意象、主观情感或非重复性突发状况,根本不存在稳定的 Schema。
因此,AdaMM 采用了双轨制架构。在分析型记忆之外,系统并行维护着一套分层检索记忆 $\mathcal{M}^{\mathrm{ret}}$。它借鉴了经典的层次化设计,将多模态数据划分为“话题(Topic) $\rightarrow$ 情节(Episode) $\rightarrow$ 事件(Event)”三个层级。事件层保留单次交互的细粒度多模态证据,情节层将时序相邻且语义连贯的事件打包,话题层则在宏观尺度沉淀语义上下文。这两套记忆互为表里:分析型记忆负责“结构化的计算与聚合”,检索记忆负责“非结构化的情境召回与背景漫游”。
双轨并存随之带来了一个严苛的工程问题:在面对用户的自然语言输入时,系统如何决定该去查表,还是该去搜图?
AdaMM 给出的解决方案是记忆感知的渐进式联合规划器(Memory-Aware Joint Query Planner)。规划器并不直接面对全量记忆——那样做又会重蹈上下文爆炸的覆辙。相反,系统先利用混合检索(语义向量相似度与 BM25 词面匹配插值)将用户 Query 与记忆库中的紧凑元数据(表头描述、话题概述等)进行匹配,筛选出 Top 候选,构成轻量级的规划上下文(Planning Context)。随后,规划器调取专用的工具库:面向分析型记忆的表过滤、聚合与数值计算工具,以及面向检索记忆的时序定位和语义匹配工具。
更为关键的是其渐进式执行(Progressive Tool Execution)策略。复杂的问题往往存在前后依赖关系。例如,“找到我上个月出差期间拍摄的所有报销发票总额”,模型无法在一开始就直接写出统计总额的代码,因为它根本不知道“出差”的具体起止时间。AdaMM 的规划器允许在第一步调用检索工具定位出差事件的时间戳区间,将该时间结果作为动态参数,无缝传递给第二步的表格过滤与数值求和工具。这种步步为营的执行链,从机制上杜绝了一次性生成全量参数时的脱靶与幻觉。
实验评测:分析型工具带来的性能跃升
为了验证 AdaMM 的实际效果,研究团队在两大极具挑战性的长程多模态记忆基准——MemEye 与 MemGallery 上进行了严谨的对比评测。MemEye 侧重于测试多模态记忆的细粒度视觉感知与复杂推理(包含选择题与开放式问答),而 MemGallery 则聚焦于超长对话流下的个性化记忆维护与冲突消解。测试的主干模型选用了 GPT-4.1-nano 与更先进的 GPT-5.4-mini。
基线涵盖了当前学术界最前沿的方案,既包括专注于文本记忆的 A-Mem 和 MemoryOS,也包括顶尖的多模态记忆框架 MIRIX、M2A 和 MMA,以及通用的多模态检索增强生成方案(MM-RAG 等)。
主实验结果展现出一致的代际差距。在 MemEye 基准上,以 GPT-4.1-nano 作为主干时,AdaMM 在选择题(MCQ)和开放式问答上相比最强基线分别取得了 7.3% 和 5.8% 的绝对提升;而在主干升级为推理能力更强的 GPT-5.4-mini 时,开放式问答的领先优势进一步扩大到了 11.3 个百分点。在 MemGallery 上,无论是 F1、BLEU-1 还是基于大模型裁判(LLM-Judge)的评分,AdaMM 全面刷新了已有纪录,LLM-Judge 评分提升最高达 6.9%。
如果进一步拆解细分任务的得分,AdaMM 的优势来源呈现出极强的可解释性。在 MemEye 中,性能增幅最夸张的两个子领域是打牌记录(Card Playlog,提升 18.8%)和个人健康(Personal Health,提升 16.7%)。这两个任务的共同特征是高度依赖重复记录之间的精确计算——比如计算步数趋势、胜率变化、卡牌点数对比。以往基于检索的方案在此类任务上面临毁灭性打击,因为它们总是遗漏记录或在上下文里数错数字;而 AdaMM 一旦成功将手环数据和对局结果物化为表格,下游只需调用简单的聚合工具即可获得数学上绝对准确的结果。
相反,在像“卡通娱乐”(Cartoon Entertainment,+6.1%)或“家装记录”(Home Renovation,+5.2%)这类以开放式视觉匹配和直觉回忆为主的任务中,AdaMM 的提升幅度相对温和。这恰恰印证了论文的核心假设:分析型记忆并不是要盲目取代语义检索,而是在语义检索无法覆盖的精密计算地带建立起不可或缺的防线。
在 MemGallery 的细分指标中,最大的优势体现在冲突检测(Conflict Detection,+10.6%)和知识消解(Knowledge Resolution,+10.5%)。当用户在历史中多次修正自己的偏好或属性时,表格的行更新与严格的时间戳辅助列,天然比散落在各处的文本碎片更容易识别出“哪一条记录推翻了前一条”,极大地增强了 Agent 状态跟踪的稳定性。
消融实验进一步厘清了系统内部各模块的贡献度:
-
去除分析型记忆模块后,整体准确率下滑 4.6%,而在重度依赖计算的健康任务上性能直接崩塌了 14.9%,证明了结构化物化表的不可替代性;
-
去除检索记忆模块后,虽然健康任务受影响较小,但整体准确率下降了 7.5%,在偏重语义联想的品牌识别任务(Brand Memory)上暴跌 9.9%,说明纯表格无法承载非结构化世界的丰富细节;
-
一旦剥离记忆感知规划上下文或取消渐进式逐步执行,系统在各项任务中均出现 3% 到 6% 不等的性能回退,证明在长程记忆中,如何“找对工具”和“按序传递中间结果”同样具有决定性影响。
从被动检索到主动认知:多模态Agent记忆的下一站
AdaMM 所展现的,实际上是多模态 Agent 记忆系统设计理念的一次重要进阶。长期以来,社区在构建长期记忆时陷入了一种“RAG 惯性”——认为只要向量检索库够大、切片分块够细、多模态 Embedding 模态对齐够准,大模型就应该能解决长程历史中的所有问题。
但真实的物理世界交互数据具有天然的异构性:有些信息是“故事”(叙事性的、情境化的),需要被联想和回忆;而有些信息则是“日志”(规律性的、测量性的),需要被沉淀与演算。AdaMM 明确指出了这种认知的二元性,并以一种优雅的无监督模式诱导算法,架起了非结构化视觉对话与关系型数据分析之间的桥梁。
当然,该框架仍有其演进空间。作者在论文末尾也坦承了当前设计的边界:首先,分析型记忆的质量高度依赖前置抽取器的精确度,一旦早期的属性键值抽取出现幻觉或字段错漏,这种错误可能会污染下游的表模式构建;其次,目前的分析工具集仍然是人为预设的闭集,面对未来更加天马行空的专业领域计算,如何让 Agent 自主感知工具能力的不足,并动态生成、验证和挂载新的代码工具,将是结构化长期记忆走向工业级应用的关键课题。
对于广大多模态 Agent 与具身智能的开发者而言,AdaMM 传递出了一个非常明确的信号:不要试图用更大的上下文窗口去硬抗多模态时序数据的自然累积。在记忆的入口处学会结构化抽象,在记忆的出口处学会组合式计算,才是让智能体在漫长时间尺度下依然保持清醒与精确的正道。