PMMC:告别在线硬搜,长周期多模态记忆预编译提升3.2分
PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
在大语言与多模态模型(LVLM)走向长周期交互智能体(Agent)的过程中,长期记忆始终是一道难以跨越的门槛。当智能体与用户的交互跨越数周乃至数月,关键信息往往被打散在成百上千轮对话、分散的历史图像以及后续的纠错记录中。面对这种场景,现存系统大多面临两难选择:要么直接把上下文全部丢进长窗口模型,不仅推理计算开销随长度线性膨胀,模型在海量图文“大海捞针”时的注意力退化也无法忽视;要么采用经典检索增强生成(RAG)或智能体式检索(Agentic Retrieval),但在查询到达前,系统只能机械地将历史图像压缩为文字摘要,或依赖固定的图文向量索引。
ArXiv URL:https://arxiv.org/abs/2608.00962
这种“提问到来后才临时检索推理”的范式,在处理需要精细图文绑定、时序知识更新以及像素级细节求证的问题时显得异常脆弱。文字摘要会永久丢失未被描述的视觉细节,单纯的语义向量检索无法刻画跨轮次动态建立的实体绑定,而在线多轮重写与迭代搜索又会带来巨大的响应延迟与 Token 开销。
为了打破这一僵局,本文提出了一种全新的解决思路:前瞻性多模态记忆预编译(Prospective Multimodal Memory Compilation,简称 PMMC)。其核心理念是将原本在提问时才匆忙进行的记忆组织与证据链检索规划,前置到记忆的沉淀整合阶段(Consolidation Time)。PMMC 构建了一个包含预测者(Questioner)、规划者(Planner)与质疑者(Doubter)的协同机制:在后台提前预测未来可能出现的提问、为提问编译出确定性的多模态检索程序,并通过实际执行验证该证据链路。当真实用户提问到来时,智能体不再盲目在线推理,而是直接路由并执行已验证的内存程序,唯有在置信度不足时才回退到原生多模态 RAG。

实验表明,在涵盖 4 种主流 LVLM 底座(GPT-5-mini、Claude Haiku 4.5、Qwen3.5-9B、Qwen3.5-27B)以及两大权威长周期多模态记忆基准 MEMLENS 与 Mem-Gallery 的 8 组评测配置中,PMMC 在其中 6 组斩获第一,整体宏平均 Harmonized Judge 分数相比最强基线提升了 3.2 分(从 46.7 提高至 49.9)。这一方案向业界展示了一种新的权衡取向:在记忆写入时增加合理的预编译计算,换取在线查询时更高精度的证据召回、更低的时延与更少的 Token 消耗。
为什么现有长周期多模态记忆频频失效?
长期多模态智能体面对的输入极为异构,不仅包含多轮文本对话,还穿插着用户上传的图片、图表和截屏。更棘手的是,信息之间存在强烈的动态关联。例如,用户在第 3 天上传了一张宠物照片,在第 7 天的对话中随口提到了宠物的名字,又在第 15 天纠正了宠物的饮食习惯。如果系统要回答“宠物在什么情况下会过敏”,必须把多天前的照片、中途出现的名字绑定以及随后的时序更新完整拼合起来。
目前主流的解决方案主要分为三类,但各自存在难以调和的工程与表征缺陷:
第一类是全上下文直接输入(Full-Context)。虽然现代多模态模型支持越来越长的上下文窗口,但图像在输入端通常会被切片转化为数百乃至数千个视觉 Token。当多张原始历史图像同时涌入上下文时,不仅 Token 开销令人难以承受,现有模型在超长交错图文上下文中的精确定位能力还会大幅下滑。论文实验中的一个显著现象是:直接喂入全部历史图像的 Full-Ctx-Raw 配置,在大多数场景下的表现甚至不如只喂入文字摘要的 Full-Ctx-Caption。这充分证明,在固定的上下文预算下,直接堆砌原始历史图像并不能保证模型有效消化视觉证据。
第二类是静态 RAG 检索(Fixed RAG)。系统预先为每轮对话生成文本摘要(Caption),或利用 SigLIP 等多模态双塔编码器、统一多模态嵌入模型建立稠密向量索引。然而,这类方法在用户提问之前就锁定了记忆的表征粒度。事实型问题可能只需要纯文本,实体关联问题需要图文绑定的上下文,细节比对问题必须调取原始像素,而多跳问题则需要串联多条时间线。单一的向量或摘要无法兼容所有信息需求:一旦文字摘要遗漏了某个视觉特征,后续检索就永远丢失了该信息;而向量相似度检索对于“跨轮次后验命名”这类需要逻辑绑定的场景,经常召回表面相似但逻辑无关的噪声。
第三类是在线智能体检索(Agentic Retrieval)。模型在收到查询后,通过 ReAct 等机制多轮调用搜索工具,根据中间结果重写查询词并反复检索。这种策略虽然具备动态适应性,但将全部的探索开销压在在线阶段。每一次在线决策不仅让交互延迟成倍增加,而且在长链路检索中极易发生路径漂移,一旦某一步工具调用偏离,后续推理就会步步皆错。
PMMC 的切入点正是这种结构性矛盾:既然人类大脑在经历事件后,会在离线睡眠与反思期进行“记忆巩固”(Memory Consolidation),将杂乱的感知经验重组为更有序的认知图式,那么智能体为何不能在后台记忆整合期间,主动预测未来的信息需求并提前打通检索路径?
核心机制:预测、编译与反思验证三位一体
PMMC 并没有把预处理简化为常见的“离线生成问答对并缓存答案”,因为在动态交互系统中,未来的事实可能会被后续交互覆盖,直接缓存生成的最终答案不仅容易引入模型幻觉,还会在知识更新时引发严重的陈旧答案冲突。
PMMC 真正预编译并存储在“问题库”(Question Bank)中的,是一套强类型的多模态可执行检索程序(Executable Multimodal Memory Programs)。问题库本质上是一个运行时路由与证据程序索引,而非现成的答案缓存。整个预编译流程由三个紧密配合的角色组成。

首先是预测者(Questioner)。当新的交互历史跨越整合时间点 $t$ 时,系统会构建一个受预算约束的编译单元 $U_t$,将当前的锚点记忆与过去具备时序接近性、实体词重合、共享图像或偏好关联的历史上下文聚合在一起。一个确定性的分析器会扫描这段交互,识别出潜在的证据机遇 $\Omega_t$(例如视觉属性识别、图文后验绑定、冲突覆盖、时序状态更新等)。随后,预测者模型 $Q_\theta$ 针对这些事实生成一组紧扣源头数据、未来可能被问及的候选问题集合 $\widetilde{\mathcal{Q}}_t$。
其次是规划者(Planner)。针对每一个前瞻性问题 $\widehat{q}j$ 与其相关的证据需求,规划者模型 $P\phi$ 负责规划多模态记忆访问策略,并由降级编译器(Lowerer)将其编译为结构化的可执行操作流 $\pi_j$。为了防止大模型生成天马行空的非确定性代码或造成安全隐患,PMMC 将程序算子严格限定在一个冻结的专用算子内核内。这些算子包含:
-
关键词词法检索与稠密语义文本检索;
-
跨模态图像匹配检索与局部上下文/图文扩展;
-
时序前后向回溯追踪;
-
原始图像物化(Raw-image Materialization)与证据流控制。
编译器强行校验数据流的有向无环特性(Acyclic Dataflow)、算子类型兼容性以及实体引用的合法性,严禁任意代码、任意路径访问或无限制的工具调用。
最后是质疑者(Doubter)。仅凭规划者的单向输出无法保证检索程序的健壮性。质疑者利用与线上完全相同的底层算子执行器 $\operatorname{Exec}$,在截至当前时间点的前序历史 $\mathcal{H}_{\leq t}$ 上实际运行编译出的程序 $\pi_j$。如果执行报错、召回的证据集为空,或者未能满足预定义的模态类型需求 $\mathcal{M}^{\mathrm{req}}$ 与实体覆盖约束 $\mathcal{K}^{\mathrm{req}}$,质疑者就会判定该程序未就绪(Not Ready),并将失败诊断信息与追踪日志反馈给规划者进行定向修改。这种“执行-诊断-重新规划”的自反馈循环在 $r$ 轮内受限迭代。只有通过严格执行验证的问题-程序对,才会被准入登记到问题库 $\mathcal{B}_t$ 中。
在线查询路由:执行确定程序与动态回退
由于重度的搜索规划与多模态路径试错已经在记忆整合期完成,当用户在时间点 $t_q$ 抛出一个真实的查询 $q$(可附带输入图像 $\mathcal{I}_q$)时,PMMC 在线端的运作极其轻盈。
整个在线阶段的流转遵循双轨制策略:
系统首先对问题库 $\mathcal{B}t$ 进行轻量级快速匹配。通过将用户的输入查询与问题库中已登记的前瞻性问题进行多路召回(结合 BM25 词法匹配、文本稠密向量相似度以及针对输入图片的跨模态相似度),利用加权倒数排名融合(Reciprocal-Rank Fusion,RRF)算法计算候选候选程序的综合得分。系统设置了严格的路由门禁:候选程序的置信度必须达到阈值 $\alpha{\mathrm{route}} = 0.60$,且第一名与第二名之间必须维持显著的边际差距 $\delta \geq 0.05$。
如果通过了这一双重阈值校验,系统便认定匹配成功,直接在当前可见的最新记忆状态上瞬时执行该预编译程序,精准物化出所指向的文本切片与原始高质图像,由下游的大模型底座生成最终答案。整个过程不产生任何额外的在线大模型规划推理。
反之,若用户的提问非常冷僻、未能命中问题库中的前瞻性预判,或者路由置信度不足,PMMC 不会强行使用低质量程序,而是无缝触发后备机制——调用基于原生多模态嵌入的 Native MM-RAG 进行全库兜底检索。这种“有现成优秀脚本就直接跑脚本,没有就走常规搜索”的设计,在保障高效的同时极大地增强了系统的鲁棒性。
实验评测:跨底座与跨基准的坚实优势
为了验证 PMMC 的实际效果,研究团队在两大最具代表性的多模态长记忆基准上展开了严格测试。第一个是 MEMLENS,其特点是包含跨会话推理、时序知识更迭与长程图文交错,测试集由 699 个需要证据恢复的可回答问题组成;第二个是更贴近真实多模态复杂场景的 Mem-Gallery,涵盖 20 个超长多模态历史、共 1,446 个测试问题,涉及细粒度视觉搜索、测试时学习、多实体冲突检测与纠偏。
评测选用了两款闭源旗舰级模型(GPT-5-mini、Claude Haiku 4.5)与两款顶尖开源模型(Qwen3.5-9B、Qwen3.5-27B)分别作为全流程底座,并统一使用独立的 GPT-5-mini 作为盲评裁判,打出 0 至 100 分的 Harmonized Judge(HJ)分数。
实验对比了全上下文策略(包含 Full-Ctx-Raw 和 Full-Ctx-Caption)、传统固定索引 RAG 策略(包含基于纯文本摘要的 Caption-Text RAG、基于 SigLIP2 的 Contrastive MM-RAG、以及基于 Qwen3-VL-Embedding 的 Native MM-RAG),以及多模态智能体记忆系统(如 M2A、M3-Agent)。
结果显示,PMMC 展现出了压倒性的稳定性。在全部 8 个“模型底座 × 基准数据集”的测试组合中,PMMC 在 6 个组合中排名第一,其余 2 个位居次席。在跨 4 个模型底座的宏平均得分上,PMMC 在 MEMLENS 上达到 50.4 分,在 Mem-Gallery 上达到 49.4 分,分别高出此前表现最好的基线(Caption-Text RAG)2.3 分与 4.0 分;在全部 8 组测试的综合总平均上,PMMC 拿下了 49.9 分,相比最强基线的 46.7 分净胜 3.2 分。
值得注意的是,无论是在轻量级的 Qwen3.5-9B 上,还是在能力更强的大参数量模型上,PMMC 的增益均十分稳定。在视觉细节与多实体关联极其密集、对图文绑定要求极高的 Mem-Gallery 基准上,PMMC 在所有 4 种底座上全部稳居第一。这一结果清晰地证明:面对复杂异构的多模态长程信息,依靠提问时静态向量匹配或纯文本摘要是远远不够的,针对性的多模态路径编译能够显著消除由于模态表征割裂而造成的召回盲区。
消融分析:每一个组件都是必需的吗?
为了剖析性能增益的深层来源,论文在 Qwen3.5-9B 底座上实施了细致的消融实验与诊断分析,揭示了系统设计中的几个核心取舍:
其一,质疑者(Doubter)的自反思必不可少。如果直接拿掉基于执行反馈的质疑者模块,仅让规划者生成单向程序,系统在 MEMLENS 和 Mem-Gallery 上的 HJ 得分分别骤跌 2.8 分与 3.2 分。更为关键的是,程序的成功执行率从 92.1% 暴跌至 82.7%。虽然跳过质疑者能节约大约 41% 的离线写入阶段 Token,但生成出的半成品程序因为执行缺陷频频失败,导致在线端大量触发昂贵的多模态 RAG 回退,反而加剧了在线端的推理负担。
其二,为具体问题定制策略远胜于固定流水线。如果废弃规划者的动态编译能力,改为用一套固定的通用检索逻辑(例如固定执行文本搜 + 图像搜 + 展开)去应对所有前瞻性问题,系统的整体表现遭遇了最严重的滑铁卢:核心证据召回率(Evidence Recall)直接下滑 8.3 个百分点,原始图像命中率下滑 10.6 个百分点,程序成功率更是大跌 15.2 个百分点。这一悬殊差距表明,根本不存在一种放之四海皆准的固定检索范式,必须针对不同类型的提问需求,量体裁衣地编排算子顺序。
其三,保留原始图像像素访问通道是不可替代的底线。如果剥离原始图像物化算子,仅允许系统检索和阅读文字摘要与元数据,虽然在线生成的上下文 Token 减少了 15.6%,但在视觉推理主导的 Mem-Gallery 上,HJ 得分剧烈下跌了 4.9 分。这再次印证了业界的普遍共识:文字摘要哪怕再详尽,也必然包含信息损耗,真正的长周期多模态智能体绝不能彻底抛弃对原始图像证据链的追溯能力。
关于自反思轮数 $r$ 的探索也极具启发性。从 $r=0$(无反思)递增至 $r=2$ 时,系统平均得分从 54.0 稳步爬升至 57.0,在线回退率从 22.4% 降至 12.6%,在线推理 Token 消耗压减了 15.8%。当继续尝试推进到 $r=3$ 时,带来的分数收益(+0.2 分)和执行成功率微调(+0.6%)已经微乎其微,但写入编译期的 Token 消耗却剧增了 21.1%。因此,将自反思轮数严格约束在 2 轮以内,是在性能提升与编译开销之间取得的最佳平衡点。
算力账本:以离线写入换取在线敏捷与整体性价比
将检索规划移至整合阶段,最容易引发的工程质疑在于:写入时的额外计算开销到底划不划算?
论文对此进行了量化的平摊成本分析。PMMC 的整体平均查询成本公式为:
\[\overline{C}_{\mathrm{PMMC}}(n) = \frac{C_{\mathrm{compile}}}{n} + C_{\mathrm{online}}\]其中 $n$ 代表该段记忆在未来被访问的次数,$C_{\mathrm{compile}}$ 为离线预编译开销,而 $C_{\mathrm{online}}$ 包括轻量路由、程序执行、极少数情况下的回退以及最终的模型回答。
从绝对单次写入来看,PMMC 由于调用了多智能体生成与反思,写入期的 Token 确实显著高于静态向量化方案。然而,对于长期活跃的智能体(如个人助理、伴随式具身智能体、长程协同工作流),一段沉淀下来的核心交互记忆往往会被用户反复追问和复用。
数据测算表明:
相比每次提问都在线进行深度多轮规划的智能体系统(如 M3-Agent 和 M2A),PMMC 极低的在线执行成本使其在被查询大约 2 次后,总累计计算成本就实现了反超,成为更加廉价的选择;
而即便对比极度节约写入成本但在线需要拼接较多冗余上下文的静态基线(如 Native MM-RAG 与 Caption-Text RAG),平摊曲线也在经历 12 至 18 次查询后迎来交叉拐点。随着交互次数的持续增长,PMMC 在线端每轮交互省下来的 Token 与延迟优势会被成倍放大。
此外,诊断分析也揭示了系统目前尚未彻底释放的潜力空间。在问题库覆盖率测试中,Top-5 候选程序对真实查询所需证据的物理覆盖率(Cover@5)高达 82.1%,而从语义层面被精准匹配到的比例(Match@5)为 75.2%。这两者之间接近 7 个百分点的差距,以及在理想 Oracle 路由下得分可飙升至 65.4 分(比当前落地配置高出 8.4 分)的事实清楚地表明:系统生成的前瞻性程序本身已经相当完备,未来的核心演进瓶颈将逐渐转移至“如何更敏锐地在线匹配和选择这些预编译程序”。
范式启示:多模态长程智能体的新路线
PMMC 的实践向大模型系统设计者传递了一个清晰且极具说服力的信号:在长周期多模态交互场景中,完全指望推理时“大力出奇迹”——无论是寄希望于无穷无尽的上下文窗口,还是寄希望于提问瞬间的在线动态 Agent 搜索——都正遭遇边际效益递减与成本延迟的双重惩罚。
与其在提问到来后手忙脚乱地做多模态图文对齐与证据筛选,不如在系统后台空闲的记忆巩固期,把杂乱的非结构化历史提前“编译”为结构化、类型可控的访问程序。这种设计既避免了传统缓存带来的陈旧幻觉,又规避了静态向量检索的粗糙和不可逆损耗。
对于正在构建长周期个人助手、角色扮演智能体或企业级多模态知识助手的工程师而言,PMMC 提供了一套极具工程参考价值的蓝图。长远来看,随着端侧与后台算力分工的进一步明晰,这种“离线预编译证据程序、在线毫秒级路由执行”的非对称架构,很有可能成为下一代自主智能体摆脱记忆瓶颈的标准范式之一。