MRMS:不是扩展上下文,而是结构-向量-图双轴长效记忆基座!
MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents

语言模型能够在单次提示的对话中生成连贯的回复,但当面对需要长期存在的长效智能体(Long-Lived AI Agents)时,单纯依赖上下文窗口的扩展往往会遭遇系统性的瓶颈。长效智能体需要在跨度极长、次数繁多的交互中维持对用户偏好、既往决策、约束条件以及未完成目标的记忆。这种需求引发了经典的学习系统难题:稳定性与可塑性的矛盾。智能体需要具备足够的可塑性以吸收新的证据,但又必须保持足够的稳定性,以免在每一次对话后都将对任务或用户的认知全盘推翻。
ArXiv URL:https://arxiv.org/abs/2607.04617v1
面对这一挑战,最直观的工程解法是不断扩大模型的上下文窗口,将更多的历史对话直接塞进提示词中。然而,对话记录(Transcript)本质上并不等同于记忆系统(Memory System)。将历史记录一股脑抛给模型不仅会带来高昂的计算成本,更致命的是,它无法区分长期偏好与临时指令,无法区分已验证的事实与试探性的推断,更无法区分外部客观证据与智能体私域的观察。为了解决这一根本性问题,MRMS (Multi-Resolution Memory Substrate) 架构应运而生。该基座并非简单地建立一个庞大的向量数据库,而是通过表征(Representational)与时间(Temporal)两个正交维度,构建了一个结构化、向量与图机制严格同步的记忆层。
MRMS 架构最核心的结论在于:长效智能体的个性化与连续性,本质上是一个记忆系统设计与控制流的问题,而非单纯的检索召回问题。通过将记忆对象的语义检索、权限验证与关系推理彻底解耦,MRMS 能够在候选记忆池中以极高的精确度完成上下文投影。评估数据印证了这一设计的有效性:在面临复杂长效交互的测试中,MRMS 架构通过图关系扩展和结构化过滤,平均每次仅需从 1.8 个候选范围内精确投影 1.11 个记忆对象,便能实现高度准确的证据归因与过时信息抑制。这一机制彻底改变了过往“找到即输入”的被动检索模式,将智能体记忆推向了生成前置控制的新高度。
为什么长上下文无法替代真实记忆系统
在当前的大模型应用开发中,检索增强生成(RAG)和超长上下文窗口是最主流的外部知识补充手段。对于处理静态文档或一次性的大型代码库,这些技术表现优异。但当应用场景切换到长效交互智能体时,对话历史往往充满噪声、状态变化与冲突。
如果仅依靠扩大上下文或纯向量检索,智能体的记忆错误往往表现为持续性而非局部性的灾难。在记忆检索中,假阴性(未能回忆起某事)仅仅意味着一次交互缺乏连续性;而假阳性(错误地引入了不当的记忆)则极具破坏性。例如,用户在一个月前表示自己喜欢吃肉,但昨天明确表示开始尝试素食。在纯向量检索系统中,当用户询问“推荐一家餐厅”时,“喜欢吃肉”这条旧记忆可能因为与“餐厅”在语义上高度相关且在历史数据中出现频次更高,从而击败了“尝试素食”的新状态,被系统错误地重新引入到当前的推理中。
这种现象表明,智能体记忆系统的核心目标不能仅仅是最大化召回率。在任何记忆对象进入生成模型的提示词之前,系统必须掌握该记忆的来源,判断其是否仍然处于活跃状态,确定其适用的边界条件,并裁定是否有更新的证据支持、修改或已经完全取代了它。MRMS 架构的研究者明确指出,可靠的长效记忆需要的是“治理与影响控制”(Governing Influence),这使得智能体记忆的设计重心从被动的存储介质,转移到了主动的生成前置控制机制上。
双轴多分辨率记忆基座:MRMS 的架构解析
为了实现这种生成前置控制,MRMS 提出了一种多分辨率的双轴记忆基座抽象模型。这里的基座并非指代某一个特定的单一数据库软件,而是一个负责存储交互痕迹、将其压缩为可复用的抽象概念、在严格约束下检索并在证据发生变化时进行修订的表征与操作层。

MRMS 的第一个正交维度是表征轴(Representational Axis)。该维度定义了记忆在系统中是如何被编码并发挥作用的。它强制要求系统维护三种互补的索引视图,且这三种视图必须保持严密的跨视图同步:
首先是结构化存储器 $\mathcal{S}_t$,它负责维护记忆对象的权威生命周期状态与权限记录。每一个记忆对象在诞生时都会被分配一个稳定的全局标识符 $i$,结构化记录包含了该记忆的具体主张、来源类别、适用范围以及当前状态。
其次是向量索引视图 $\mathcal{V}_t$,它唯一的职责是提供语义可寻址性。通过将记忆对象嵌入为高维向量,系统能够利用近似最近邻检索快速发现与当前查询在语义上相关的历史节点。
最后是图关系视图 $\mathcal{G}_t$,它是解决冲突与逻辑演进的核心。该视图通过有向边记录记忆对象之间的逻辑关联,例如“支持”、“矛盾”以及至关重要的“取代”(Supersedes)关系。在图视图的干预下,向量检索出来的结果不再是孤立的文本片段,而是带有逻辑脉络的证据链条。
MRMS 强调跨视图同步(Cross-view Synchronization)是确保长期记忆不崩溃的架构不变量。结构化记录是状态的唯一真相来源,向量负责找寻,而图负责关系裁定。这种解耦避免了常见的设计缺陷:即便是底层模型更换导致向量需要重新编码,或者图关系需要定期剪枝,记忆的结构化事实基础依然稳固不破。更重要的是,它彻底解决了“僵尸记忆”问题——当一个过时的偏好被纠正后,它的向量依然存在于库中,但因为图结构中存在“被取代”的边,且结构化状态变为“已失效”,系统便会在最终投影前将其拦截。
MRMS 的第二个正交维度是时间轴(Temporal Axis),它控制着记忆对未来行为影响的持久度和承诺水平。借鉴认知心理学中关于短期痕迹、情景记忆与语义记忆的区分,MRMS 将时间承诺划分为多个层级。
短期的交互痕迹写入成本极低,但也容易被丢弃,它们仅仅记录了“发生过什么”。中期抽象则是对一系列相关交互的会话级总结,形成一种可复用的状态压缩。长期的语义承诺则具有最强的影响力,能够直接指导智能体未来的长期行为。在 MRMS 的设计哲学中,跨越时间轴的层级晋升应当是极其保守的。系统可以快速记录大量的短期对话痕迹,但要将其提炼为影响深远的语义事实,必须依赖图视图中积累了足够多的支持性证据,且通过了风险与效用评估。这种机制赋予了智能体“快速记忆而不盲目相信”的稳定性。
覆盖记忆生命周期的五阶段操作流
在双轴架构的支撑下,MRMS 将单次交互融入长效记忆的生命周期,定义了五个核心操作阶段,分别是写入、选择、巩固、修订以及边界投影。这些操作严格遵循一套数学约束与状态机流转。
每一个记忆对象都可以处于以下几种状态之一:
-
原始态 (Raw):以最小的解释保留交互证据的原始形态。
-
临时态 (Provisional):基于少量线索推断出的模式,需要更多未来证据的支持才能转正。
-
活跃态 (Active):当前有效,且在符合边界条件时可直接用于指导模型生成。
-
被取代态 (Superseded):作为历史上下文被保留以供追溯,但绝不应该再主导当前行为。
-
退役态 (Retired):被完全抑制,除非为了系统审计或历史重建才会被唤醒。
当新的交互 $e_t$ 发生时,写入(Write) 阶段首先被触发。此时系统采取极低承诺的策略,仅在结构化视图中创建记录分配标识符,并在向量视图中生成检索描述符,同时在图视图中添加如“属于某次会话”这类低风险的边。写入仅代表事件发生,不代表该事件成为了长期事实。
在生成响应之前,选择(Select) 与 边界投影(Boundary Projection) 扮演着记忆守门人的角色。候选记忆的选择函数综合考量了语义相关性、置信度、新鲜度、任务效用以及负向惩罚项。更关键的是,系统不是将向量检索出的文本直接拼接,而是通过图结构扩展出证据子图 $\mathcal{H}_t$,并执行边界约束 $\mathcal{B}_t$(例如该记忆的来源是否符合当前的隐私策略,或者当前处于工作模式而非私人模式)。
一旦进入后处理阶段,巩固与修订(Consolidate and Revise) 机制开始运作。巩固负责将低级痕迹提炼为总结,再升格为事实或关系规则。这需要评估支持度、效用与潜在风险是否超过了特定阈值。而修订机制使得记忆具有极强的可塑性,当发现新证据与旧记忆矛盾或缩小了旧记忆的适用范围时,系统并非简单地执行毁灭性删除。它通过更新状态字段和建立“取代”图边,让过时偏好失去当前指导效力,但依然保留了“智能体曾经有过该认知”的历史轨迹。
最终传递给生成模型的,是一个经过严格过滤与组装的 上下文数据包(Context Packet)。这个数据包有意保持极其紧凑的体积,清晰地区分了局部任务状态、被选中的情景证据、活跃的语义主张、已知的矛盾点、外部客观证据以及特殊的“负向上下文”。负向上下文会明确告知模型“不要使用某一条看似合理但已过时的历史推断”。这种结构化的小体积投影不仅节约了 Token,更迫使生成模型对不同性质的记忆信息施加不同权重的注意力。
多维评估基准与核心机制验证
要验证一个长效记忆基座的优劣,仅依靠传统的问答准确率是远远不够的。MRMS 提出了一套包含六个维度的诊断性评估协议:
-
连续性 (Continuity):对稳定偏好和既往决策的准确复用能力。
-
特异性 (Specificity):检索结果与当前输入上下文的紧密贴合程度。
-
简约性 (Parsimony):暴露给生成模型的上下文是否足够紧凑,是否剔除了冗余噪音。
-
修订能力 (Revision):当底层事实或用户状态发生变化时,准确纠正过时记忆的能力。
-
无干扰性 (Non-interference):有效抑制超出当前边界或权限的记忆渗透。
-
归因能力 (Attribution):能够追溯并利用确切证据来源支撑生成的认知。
在对单一机制进行的消融实验中,各个维度的设计意图得到了充分的印证。如果仅使用纯向量检索,虽然召回率得到了保障,但在处理过时信息、越界信息或缺乏证据支撑的主张时全面溃败。引入结构化过滤后,系统成功清除了越权记录,但对于深层次的事实矛盾依然束手无策。
图扩展机制在解决矛盾和证据归因上发挥了决定性作用,它使得系统能够顺藤摸瓜,找到推翻旧偏好的决定性证据。在完全体的 MRMS 架构下,即使候选池中初步召回了 1.8 个相关记忆项,系统最终也只会精准选择并投影 1.11 个对象到上下文中。这种极高的简约性彻底阻断了无关对话历史对当前推理的干扰,而且在应对极其复杂的归因测试时,将错误率压缩到了极低的水平。残存的极少数失败案例,主要集中在证据链极度破碎、解析器选定了主张却遗漏了某一条隐蔽的支撑痕迹等边缘情况。
走向可审计的长效智能体架构
长久以来,学术界与工业界在优化智能体记忆时,往往将其视为一个黑盒的“找文本”游戏,或试图在模型权重中通过持续学习进行隐式微调。MRMS 则代表了一种截然不同的系统工程哲学:它将演进的状态完全外化为高度可审计的结构化对象,让智能体在不改变底层大模型权重的前提下,拥有一套坚如磐石的记忆运转法则。
这种机制彻底分离了记忆的“存储属性”与“影响属性”。一条记录可以被永久保存作为历史证据,可以被向量化以供随时检索,甚至可以作为某个错误认知的反面教材被链接到图中,但只要它的权限与生命周期状态不允许,它就绝对无法跨越边界,干扰智能体此刻的行动。
MRMS 作为一种基座级别的框架,并没有绑定具体的底层数据库技术或单一的开源大模型,而是制定了一套跨越表示层与时间轴的严格同步契约。未来的智能体应用不仅需要关注最终回答是否正确,更需要系统性地回答“为什么特定的记忆被允许塑造当前的生成结果”。在面向未来的终身学习 AI 时代,像 MRMS 这种将筛选、修订与溯源置于核心位置的多分辨率架构,必将成为长效智能体跨越试验场、进入真实世界复杂生命周期的重要基石。