MOSS:弃用向量RAG!可审计智能体记忆支撑4400万Token长效运行
Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture

当前,大语言模型(LLM)本身是无状态的。如果希望一个 AI 智能体(Agent)能在数月甚至数年间持续陪伴用户、积累知识,它就必须拥有一套强大的长期记忆“外挂”系统。目前的行业默认选项是基于向量的检索增强生成(Retrieval-Augmented Generation, RAG),将知识切块、向量化并通过相似度匹配提取。然而,向量检索天生具有黑盒属性,不仅在理论上存在容量瓶颈,更难以被人类核查和审计。
ArXiv URL:https://arxiv.org/abs/2607.04391v1
来自 Université Laval 的研究团队提出了一条完全不同的道路:Memory-Orchestrated Semantic System(MOSS)。这是一种全新的智能体记忆架构,它彻底摒弃了主流的向量相似度检索,而是让智能体通过结构化的关系型数据库(SQL)来主导记忆回溯。
这项研究最引人注目之处在于其实战检验的深度:MOSS 已经在一个学者的真实个人语料库上持续运行了一年多,支撑着高达 4400 万 Token、包含超过 11 万个对话片段和近 500 万条图谱关系的庞大记忆体。它证明了,在智能体走向真正“长寿”和“可信”的道路上,透明、可审计且结构无上限的记忆架构,远比堆砌更高维度的黑盒向量更有价值。
为什么向量 RAG 无法胜任智能体的“一生记忆”?
在过去的一两年里,智能体记忆(Agentic Memory)作为一个独立的研究领域迅速崛起。研究界逐渐意识到,简单地给 LLM 挂载一个 RAG 管道,并不能称之为真正的“记忆系统”。
传统的向量 RAG 本质上是一个检索管道。它缺乏对经验的组织,没有时间维度的概念,也不记录知识是如何随着时间演进而积累的。更致命的是,它受限于三个结构性缺陷:
第一,不透明性。高维空间中的余弦相似度对于人类来说是一个不可解释的黑盒。当系统返回了某条记忆时,人类无法核实验证“为什么是它”。
第二,难以验证与调试。在真实的部署环境中,RAG 系统的鲁棒性往往只能在运行后通过反复修补来获得,而无法在设计阶段就保证逻辑的正确性。
第三,理论上的极限与淹没效应。单向量检索存在数学上的理论上限。随着语料库的不断膨胀,真正的相关文档会逐渐被海量的无关数据“淹没”。此外,向量索引将用户的记忆死死绑定在生成它的嵌入(Embedding)模型上,一旦模型迭代,过去的记忆网络面临彻底重构。
即使是后来演化出的 GraphRAG(图检索)或是像 Mem0 这样的生产级记忆系统,也未能彻底摆脱这些束缚。它们要么在检索循环中仍然依赖 LLM 探索节点(牺牲了可复现性),要么在底层仍然混合了向量搜索,或者是像某些闭源平台那样,在后台悄悄生成一个用户无法带走的“总结画像”。
MOSS 的立场非常鲜明:真正的长效记忆,必须将“探索与制定计划”(智能体的职责)与“检索执行”(系统的职责)彻底剥离。
MOSS 的核心设计:数据库是地图,语料是领土
MOSS 的设计哲学可以用一句话概括:数据库是地图(Map),而原始文档是领土(Territory)。
系统通过构建详尽的元数据和结构化标签来描绘知识的地图。当智能体需要回忆时,它检索的是这张清晰透明的地图,而不是通过黑盒机制去强行拼凑领土的碎片。因为地图本身已经包含了摘要、核心概念、参与者、时间戳甚至是情感状态等信息,智能体在绝大多数情况下仅凭地图就能完成任务,甚至不需要触碰底层的原始长文本。
这套架构建立在三个硬性承诺之上:
-
架构上的天然可审计(Auditability by Construction):所有的检索行为最终都会转化为显式的 SQL 查询。任何一次问答,都可以精确追溯到智能体写了什么查询语句、触发了哪些数据行。源文本始终以人类可读的纯文本形式保存。
-
三重无关性(Triple Agnosticism):模型无关(可接入任何本地或云端大模型)、引擎无关(任何关系型数据库,如 SQLite 或 PostgreSQL)、存储无关(无论是本地硬盘、对象存储还是云端架构都能跑)。
-
自下而上的归纳式本体论:系统不预设任何外部的知识分类法,所有的核心概念和知识图谱,都是随着对话和文档的积累,从语料本身归纳生成的。

从上图的架构中可以看出,MOSS 只有一个连接智能体与记忆的神经中枢——Orchestrator(编排器)。编排器负责管理所有代码和 API 调用,并将非确定性的 LLM 思考与完全确定性的 SQL 检索隔离开来。
结构无上限:如何让 AI 拥有不会遗忘的上下文?
在 LLM 的日常交互中,受限于上下文窗口(Context Window),超过窗口的早期对话通常会被无情丢弃。为了让记忆真正做到长期且无上限,MOSS 引入了实时索引和持续归档的机制。
MOSS 在后台配备了一个专属的“书记员智能体”(Scribe Agent)。每当对话因为滑动窗口的推移而即将掉出活跃上下文时,这个书记员就会迅速拦截这些信息,执行两个动作:
一方面,将其按语义切片、提取摘要、标注概念和情感,并以 SQL 数据行的形式实时写入关系型数据库;另一方面,将原始对话追加保存到当天的纯文本归档文件中。
这种设计的巧妙之处在于,从智能体的视角来看,它的上下文窗口在逻辑上变得“无限大”了。因为任何刚刚掉出短时记忆的内容,都在几秒钟内化作了结构化数据库中可以随时通过 SQL 检索出来的历史记录。这不仅避免了无休止扩大上下文窗口带来的算力浪费,也完美绕过了大模型常见的“中间迷失”(Lost-in-the-Middle)现象。

在上图的查询生命周期(Query Lifecycle)中,我们可以清晰地看到检索与思考的界限。
当智能体收到问题时,它首先分析意图,接着参数化一个查询配置(QueryProfiler)。随后,系统执行标准的 SQL 检索(在这个检索循环内部,没有任何 LLM 参与猜测,100% 确定)。拿到结构化的结果后,智能体再来评估这些信息是否足够回答问题。如果不够,智能体会在自己的控制下修改查询策略重新发起 SQL 调用;如果足够,最终生成答案。所有的“幻觉”风险都被限制在了智能体发散思考的边缘,而记忆提取的核心干道始终是确定、冰冷且可靠的符号逻辑。
独特的分层视角:Métacalque (覆盖层)机制
传统的图数据库通常会将文本抽取成实体和关系,最终丢弃原文。MOSS 则提出了一种名为 Métacalque(法语,意为“叠加覆盖层”)的机制。
可以把它想象成放在原始地图上的多张透明描图纸。
底层的原始语料库永远保持完整和不可篡改。系统在第一层透明纸上画出“对话切片”和“时间线”,在第二层纸上标记“归纳出的学术概念”,在第三层纸上记录交流时的“情感效价(Valence)和激活度(Activation)”。
这些覆盖层既不是彼此割裂的,也不存在绝对的先后主次。当我们需要进行主题分析时,系统就调取“概念层”;需要做时间回溯时,就侧重“切片层”;甚至可以组合多层,回答类似“在过去三个月里,当讨论某个特定算法时,我的情绪状态主要是什么样的”这种高度复杂的复合查询。
目前,MOSS 已经通过这种方式维护了 11 个不同的元数据网络,总计积累了约 500 万条类型的显式关系,全都是连接在保持完整的原文片段之上,而没有发生任何信息损耗。
真实世界的 4400 万 Token 实测
论文没有在合成的基准测试集上玩弄技巧,而是拿出了智能体记忆领域极其罕见的一份长期实测报告。
从 2025 年 5 月起,MOSS 就作为一位活跃学者的核心工作记忆系统,部署在真实的生产环境中。它接管了研究、教学、拨款申请、代码开发以及个人管理等全部数字生活。为了保证记忆的完整性,作者甚至将该学者追溯到 2024 年 10 月的早期对话数据也进行了回溯索引。
截至论文成文时,这个真实环境下的数据库规模惊人:
-
110,183 个经过处理的对话片段(约 4400 万 Token)。
-
163,494 份被纳入目录的多模态文档。
-
由系统自主归纳出的 569 个核心概念。
-
超过 32.2 万 条概念标注记录和近 500 万 条交叉网络关系。
系统在过去的一年中,历经了三次 LLM 供应商的更换、两次云服务商的迁移,并在本地工作站和专用服务器之间反复横跳。得益于其三重无关的解耦设计,底层记忆架构在四代基础设施的更迭中岿然不动。
更重要的是,长达一年的使用彻底改变了人类对 AI 记忆的信任模式。
当系统给出错误的回答时,使用者不再需要面对黑盒发呆。由于一切检索都是可执行的 SQL 语句和透明的日志,用户只需翻看日志就能精准定位:到底是智能体意图理解错了写错了 SQL,还是某段早期的索引存在缺失?这种“即使犯错也完全可追溯、可诊断”的特性,才是人机长期共生关系中建立实质信任的基石。
结语:自主权与可审计性,不容妥协的底线
随着商业 AI 巨头们纷纷推出平台级的“后台自动记忆合成”服务,智能体记忆领域正在面临一次关键的路线分化。
一种是开箱即用、极大降低用户门槛但完全黑盒化的平台路线。你的数字人生被压缩成几千个维度的向量,储存在巨头的云端,你无法带走,也无从知晓它到底丢掉了什么。
而 MOSS 证明了另一条路线的硬核价值:一种完全属于用户、结构透明、永远不会到达理论上限的自主记忆架构(Sovereign Memory)。对于需要应对长期科研、受到严格隐私监管的机构,或者是任何试图把长达数十年的智力成果牢牢掌握在自己手中的个人而言,可审计和可控绝不是一个锦上添花的选项,而是唯一的入场券。
MOSS 用一年时间、4400 万 Token 和结构化的 SQL,给出了告别黑盒 RAG、走向下一代智能体长期记忆的最佳范本。