UIUC探索Agent文件系统记忆:三大角色协同,检索成本减半

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

UIUC探索Agent文件系统记忆:三大角色协同,检索成本减半 论文图示

随着大语言模型(LLM)Agent 部署场景的复杂化,其工作周期早已突破了单一上下文窗口的限制。为了在跨越数月的回话或代码维护中保持一致性,持久化的外部记忆成为了核心设计。在学术界,研究者们曾提出了大量复杂的记忆表征形式,例如知识图谱、自链接笔记网络或基于向量库组织的树状结构;然而在真实的工业界应用中,Anthropic、OpenAI 等主流方案却不约而同地走向了一个更朴素的默认介质:文件系统(Filesystem)

ArXiv URL:https://arxiv.org/abs/2607.26637v1

Agent 通过通用的文件操作工具读写目录树中的 Markdown 文件,将长期记忆像普通软件代码库一样存储与组织。文件系统之所以胜出,是因为它天然具备层次结构,名称即标签,且透明、可迁移。然而,这一工业界的默认选择一直建立在两个未经测试的假设之上:第一,随着记忆的积累、冲突和过期,Agent 能够自主地保持这个不断膨胀的存储库的组织性;第二,这种组织性能够带来切实的收益。

来自 UIUC、Adobe Research 等机构的研究团队填补了这一空白,首次对基于文件系统的 LLM Agent 记忆进行了系统的实证探索。研究最核心的结论打破了人们的直觉:良好的记忆组织结构并不能直接转化为更高的回答正确率,但它能带来显著的“检索经济性”——当语料规模庞大时,结构化的存储能将检索成本降低约一半。 同时,现有模型在维护长期记忆的“组织健康度”上仍显吃力,唯有能力最强的模型才能在记忆不断增长时防止目录结构退化。

重塑文件系统记忆:三大角色协同框架

为了系统评估这一问题,研究团队并没有局限于某一种特定的模型实现,而是将文件系统记忆的交互环境形式化抽象为一个由单一存储库和三大角色构成的协同框架。这种极简的契约设计,不仅可以直接映射到现有的工业部署方案,也使得“写入记忆”与“读取记忆”的能力能够被独立评估。

文件系统 Agent 记忆框架概览,包含执行、管理与搜索三大角色

框架的核心围绕一个记忆存储库(Memory Store) ${\mathcal{M}}$ 展开。这是一个基于路径层次结构组织的有限文件集合。其中每个文件 $f$ 被定义为一个三元组 $f=(p_{f},d_{f},c_{f})$,分别代表文件路径(例如 /memories/people/alice.md)、一行简短描述以及具体的文本内容。文件夹本身不直接承载内容,而是作为路径的共享前缀存在。

围绕这个单一的存储库,存在三个定位明确的角色:

  1. 管理 Agent(Management Agent):负责接收并整合源源不断的新内容。当新的对话片段或任务轨迹产生时,管理 Agent 必须决定如何更新当前的存储库 ${\mathcal{M}}{t-1}$ 以生成新的 ${\mathcal{M}}{t}$。它的职责不仅是写入,更包含了维护与组织:它可以创建、重写、合并、拆分、移动或删除任何内容。组织良好与否,完全取决于该 Agent 整合信息的功力。

  2. 搜索 Agent(Search Agent):负责在给定的固化存储库上回答查询。它接收指令和查询问题,并返回带有引用的答案及其对应的参考文献集 $\Gamma$。搜索行为本质上是只读的,Agent 必须通过浏览目录、阅读特定章节等方式导航,最终给出有依据的回答。

  3. 执行 Agent(Execution Agent):主要在需要调用程序性“技能(Skills)”的设定中出现。它接收搜索 Agent 检索到的技能文件内容,尝试完成特定任务,并将其生成的任务轨迹反馈给管理 Agent 提取新的经验。

在这个统一的框架下,陈述性记忆(事实、偏好、规则)与程序性记忆(可复用的技能)被完美融合在同一个文件系统存储库中。模型不再直接操作底层数据库,而是通过受限的工具环境(Tool Harness) ${\mathcal{H}}$ 产生交互。管理 Agent 掌握着一套包含查看、创建、正则替换、插入、删除、重命名等文件级修改工具;而搜索 Agent 则仅配备了安全的只读文件系统探索工具。

存储契约与记忆文件的解剖

为了衡量存储库是否真正做到了“有组织”,研究团队明确了一套基于文件系统的分类学契约(Taxonomy Contract)。一个优秀的记忆存储树应当满足:层次分明、避免过度碎片化但又能清晰拆分不同主题、描述精确且没有冗余过期的死文件。

文件结构解析:通过严格的 Frontmatter 管理描述和名称信息

在具体的实例化中,每个文件通常采用 Markdown 格式,并强制要求在其 Frontmatter 中包含结构化的名称和单行描述 $d_{f}$,这直接模仿了当前工业界默认工具的标准做法。描述信息至关重要,因为在 Agent 展开目录列表或执行排序搜索时,这是它决定是否要进一步调用工具读取该文件全部内容的唯一线索。

为了彻底探查记忆组织的价值,研究不仅测试了由 Agent 自由组织的存储状态,还设置了多种具有严格限制的变体:

通过对比这些变体在不同模型能力、不同长对话基准(如 LoCoMo、PersonaMem)下的表现,研究得出了一系列极具价值的实证结论。

五大核心发现:打破关于“组织”的默认假设

针对文件系统记忆的形态、价值、模型能力的影响、规模化后的可持续性以及工具环境的杠杆作用,研究展开了深入分析并给出了清晰的解答。

1. Agent 左支右绌的组织能力与“无声浓缩”危机

当赋予管理 Agent 完全的自由去构建存储时,它们普遍会自发地建立基于主题的树状结构。然而,这种目录形状与其说是对记忆规模增长的自适应,不如说是具体底层模型固有偏好的体现。

一个出人意料的发现是,面对海量素材,模型更倾向于“合并整合(Consolidate)”而非“切分拆解(Shard)”。层次结构不再仅体现在文件夹的嵌套上,而是大量下移到了文件内部的 Markdown 标题中。更危险的是模型在重组过程中的默认退化行为:当执行重新组织的指令时,如果没有特别添加“保留每一个事实”的强制规则,模型会本能地执行一种“无声浓缩”式的重写。它会丢弃大量琐碎但真实的细节事实,这种隐性损失直接削弱了后续查询的准确率。

2. 结构的真正价值:检索经济性

业界曾普遍期待,一个精心分类的文件夹体系能显著提升记忆检索的准确性。然而实证结果表明:在回答准确率上,没有哪一种记忆组织形态能够通吃全局。某些问题上,杂乱但原文无损的“逐字转储”甚至优于精心总结过的归类文件。

组织结构真正且明确的收益在于成本。 当存储的素材规模极其庞大时,具备良好组织结构的存储库能将检索成本(包含搜索 Agent 的轮次、消耗的 Token 量以及读取的无效内容)削减约一半。这种“检索经济性”随着上下文的增长会愈发凸显。

而在程序性记忆(技能)层面,哪种存储方式更优,则发生了有趣的翻转,这完全取决于调用这些记忆的“执行 Agent”的能力:对于强大的执行 Agent 来说,包含大量冗余试错细节的逐字事件日志能发挥最大的效用;而对于较弱的执行 Agent,经过高度提炼、直接告诉它“该怎么做”的浓缩指南反而效果更好。

3. 骨干模型能力:管理与搜索的异构需求

在会话记忆任务中,使用能力更强的模型作为管理 Agent,确实能构建出组织样式更漂亮、分类更优雅的目录,但这往往无法直接转化为下游答案质量的提升。相反,直接升级搜索 Agent 的模型能力,能立竿见影地提高回答的正确率。

在某些需要持续更新特定偏好(例如用户的口味发生了改变)的测试基准上,较弱的管理 Agent 会犯下“新旧并存”的错误,它在写入新偏好时没有删掉旧偏好,导致过期的事实依然作为活跃特征存在于存储库中。在这种需要显式处理信息冲突的写入场景下,更强的管理 Agent 能够挽回约一半的准确率损失;但如果当前的存储库已经足以服务现有的搜索 Agent,继续盲目升级管理模型的收益就非常有限。而在程序性记忆方面,能力则更像一个阈值,一旦迈过了及格线,存储库里记录了“什么内容”远比“由哪个模型执行”更重要。

4. 规模扩展下的可持续性:组织结构正在被侵蚀

好消息是,在研究考察的较长时间跨度内,无论哪种形式的存储库,随着经验和信息的累积,都在变得越来越有用,并没有出现彻底的灾难性崩溃。在对话设定中,早期的关键记忆成功地存活了下来。Agent 倾向于在前期建立起基础的少数几个核心文件,在此后的演变中主要依靠就地编辑(Edit),几乎不执行删除操作。

但坏消息在于,维持组织严密性是整个体系中最脆弱的一环。随着存储规模的增长,除最强档次的管理 Agent 之外,其他所有模型对于“分类学契约”的遵循度都在显著下降。目录开始变得混乱,文件归属开始模棱两可。此外,记忆维护的成本并不会随着时间推移而由于“熟练”而降低,每次更新记录所需付出的努力始终居高不下。唯一随规模线性恶化的是未经整理的“逐字转储”变体——随着日志文件无止境地累加,搜索 Agent 需要大海捞针般地遍历所有文件,这成为了巨大的计算负债。

5. 工具环境是塑造记忆的隐形杠杆

研究揭示了一个常被忽视的维度:向系统中添加一种工具,改变的不仅仅是 Agent 寻找答案的路径,更是存储库本身的物理形态。仅仅替换管理工具集,其对记忆结构的重塑作用甚至强烈到与更换大模型相当。

工具集不仅是一个中立的包装,而是一个控制节点。例如,提供强大的全局检索和替换工具,会促使 Agent 产出高度收敛、统一合并的文件;而如果工具受限于小范围的片段修改,Agent 则更容易制造大量破碎的短文件。研究表明,在长期对话中,工具驱动的碎片化和松散链接更为常见;而在技能提取场景下,工具带来的高度整合则往往成为制胜关键。

结语

通过将文件系统默认机制从一个盲目的假设转化为可被系统测量的设计空间,该研究为未来 Agent 的架构指明了方向。我们不能再一厢情愿地认为 LLM 具备人类同等级别的“整理房间”的能力,或者认为整理就必然带来智能的跃升。

文件系统记忆的价值在于工程与成本的妥协。在可见的未来,为长期运行的 Agent 配备一个专职、能力极强的后台“记忆管理员模型”,以换取未来无数次廉价且精准的前台搜索,将是构建具备持续学习能力的智能体最务实的路线图。