清华&NUS最新综述!三维分类框架拆解大模型记忆架构

Memory for Large Language Models

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在过去几年的大语言模型演进历程中,“记忆”(Memory)一直是一个被高频使用却定义极其模糊的概念。在系统层和 Agent 视角下,对话历史、向量数据库、用户画像、反思日志都可以被冠以记忆之名;但在模型架构师的眼中,自注意力机制维持的 KV 缓存、状态空间模型(SSM)压缩的隐状态、测试期自适应(Test-Time Training)微调的权重参数,同样扮演着信息留存与提取的核心功能。当概念在不同抽象层级被过度宽泛地套用,学术界与工业界就陷入了碎片化的技术选型混乱:长上下文注意力、线性循环模型、外部可寻址模块与测试期快速权重,究竟在计算图与存储图之间处于怎样的相对位置?

ArXiv URL:https://arxiv.org/abs/2607.25380v1

来自新加坡国立大学(NUS)、博世集团(Robert Bosch GmbH)与清华大学的研究团队发布了综述论文《Memory for Large Language Models》,首次将视角严格约束在模型原生架构与推理期动力学层面,剥离了依赖外部工程流水线编排的 Agent 级别系统,构建了一个严谨的“三维正交分类框架”。该综述不仅系统厘清了计算耦合型记忆与独立可寻址记忆之间的概念鸿沟,更深入拆解了从 Transformer 到 Mamba、RWKV、DeltaNet 等前沿架构中隐式记忆的演进脉络,为构建更高效的可扩展自适应模型提供了坚实的架构基石。

大模型记忆架构的整体分类框架与演进脉络

解构大模型记忆:三大正交分类维度

以往对 AI 记忆的讨论往往借鉴认知心理学,将其划分为情景记忆、语义记忆与程序记忆,或者简单粗暴地切分为参数化与非参数化记忆。这类划分对指导模型架构设计收效甚微。本篇综述的核心切入点,是从底层张量存储、计算图耦合程度与状态更新机制出发,提炼出三个彼此正交的基本轴线:表征形态(Representation)、更新动力学(Update Dynamics)与持久性(Persistence)。

第一个维度是表征形态:隐式(Implicit)与显式(Explicit)。判定一项技术是隐式还是显式记忆,关键不在于其张量在显存中是否实体化,而在于其是否具备独立且可控的读写与寻址接口。隐式记忆是模型前向计算图的天然副产物,与内部动力学紧密耦合。RNN 的隐藏状态、SSM 的潜状态乃至标准 Transformer 的 KV 缓存,本质上都属于隐式记忆——虽然 KV 缓存以显式张量的形式常驻显存,但其读写语义完全被前向计算逻辑所锚定,缺乏独立的寻址与外部更新控制,因而只是瞬态计算状态。相反,显式记忆拥有独立的存储模块与明确的寻址语义,支持独立于标准前向传播或离线反向传播的读、写、更新操作。显式记忆既可以是非参数化的外部查找表,也可以是具备特定读写策略的专用参数化模块。

第二个维度是更新动力学:离线(Offline)与在线(Online)。该维度定义了记忆更新的时序边界。离线记忆只能在模型训练阶段通过反向传播梯度下降进行调整,推理期参数被彻底冻结,绝大多数预训练或微调的外置记忆网络均属此类。在线记忆则允许在推理生成期间动态更新,这种更新既可以逐 Token、逐分块发生,也可以基于批次自适应。在此基础之上,研究进一步细化了更新动力学的底层规则:究竟是依赖闭式状态转移方程(如线性 RNN 与 SSM)、基于推理期梯度优化的快速权重调整,还是基于不确定性或预测误差驱动的门控写入机制。

第三个维度是持久性:短期(Short-term)与长期(Long-term)。持久性衡量的是存储信息能够持续影响后续计算的有效时间跨度。这一跨度并不简单取决于物理存储是否被销毁,而是由存储粒度与压缩率共同决定的。标准注意力机制保留了 Token 级别极高保真度、未压缩的 KV 状态,但由于其显存开销随序列长度线性或二次方膨胀,其有效作用范围被硬件预算与上下文窗口死死限制在局部,因而是典型的短期记忆。相反,固定大小的循环隐状态或经过高倍率压缩的记忆槽位,虽然单点保真度有所损耗,却能以恒定的空间代价覆盖跨越长序列乃至跨 Session 的上下文依赖,构成了实际意义上的长期记忆。

动力学耦合的隐式记忆:从注意力到循环状态

在当前的 LLM 架构中,隐式记忆占据了压倒性的统治地位。它不依赖独立的存储介质,完全在计算图的前向传递中生灭。论文深入剖析了隐式记忆的三大核心演化路径:作为瞬时工作记忆的自注意力机制、面向长序列的稀疏与结构化管理策略,以及将历史压缩为动力学隐状态的循环序列模型。

前向计算动力学驱动的隐式记忆机制总览

注意力:内容可寻址的瞬态工作记忆

自注意力机制本质上是一个完全可微分的、内容可寻址的瞬时工作记忆系统。在自回归生成过程中,模型维护着不断向后追加的 KV 缓存,新到来的 Token 隐式地向该记忆库中写入条目,而查询向量 $Q$ 则在推理步中通过点积注意力动态检索相关历史。

然而,理论容量与实际效能之间存在显著鸿沟。单纯扩大上下文窗口(Context Window)固然扩大了理论上的瞬时工作记忆空间,但近期的长文本评测基准表明,模型对名义上下文空间的利用并不均匀,“大海捞针”与“迷失在中间”(Lost in the Middle)等现象暴露了注意力机制在优化目标与归纳偏置上的天然局限。为了缓解庞大 KV 缓存带来的显存墙,架构层面的探索逐渐分化:DeepSeek-V2 等提出的多头潜在注意力(MLA)通过低秩投影将 Key 和 Value 联合压缩至低维隐空间,改变了记忆的存储粒度与传输效率,但在架构属性上它依旧保留了未受独立控制的隐式语义。

针对无限流式输入的场景,StreamingLLM 等工作则揭示了隐式记忆的逐出策略(Eviction Policy)。通过保留序列最前端极少量的“注意力汇”(Attention Sink)Tokens,再结合滑动窗口缓存,模型能够在恒定显存下维持长文本生成的稳定性。这表明,在完全耦合的隐式记忆系统中,对长程时序行为的建模并非必须依赖无限制的记忆扩充,合理的局部锚点与选择性覆盖同样能够维持系统的计算连续性。

稀疏与选择:隐式记忆的准入与路由控制

面对全量注意力二次方计算与显存复杂度的物理限制,大量研究试图对隐式记忆施加准入(Admission)、访问(Access)与保留(Retention)控制。这类控制没有引入任何外置显式接口,而是内化为注意力计算模式的重构:

  1. 结构化与块级路由访问:早期的 Sparse Transformer、Longformer 与 BigBird 通过局部窗口、跨步或全局 Token 预设静态稀疏模式,重塑了记忆访问路径。近年来的 MoBA(Mixture of Block Attention)与 Native Sparse Attention(NSA)则将混合专家(MoE)的思想迁移至记忆寻址,将长上下文切分为粗粒度块,让当前查询动态选择少量高相关块进行细粒度解算。这种机制在保留高分辨率局部表征的同时,构建了分层访问的硬件友好通路。

  2. 动态准入与局部-全局解耦:选择性注意力通过输入驱动的门控机制,动态衰减非关键 Token 对前向状态的贡献,实质上扮演了隐式记忆“准入过滤器”的角色。而如 RATTENTION 等研究则进一步证明,只要在滑动局部窗口的基础上精心锚定极少量的全局记忆点,就能在近乎恒定的计算预算下,逼近全量长文本记忆的下游检索表现。

循环序列记忆:状态压缩与精准编辑的演进

如果说注意力机制是用空间换精度,循环序列模型则是彻底用动力学压缩换取恒定常数的显存占用。从经典 RNN 和 LSTM 开始,隐式记忆就以时序隐状态的形式存在。现代架构的突破,始于线性注意力(Linear Attention)通过核函数化与矩阵乘法结合律,将因果自注意力严格等价为线性循环状态的递推更新。

这一演进在结构化状态空间模型(SSM)与新型线性循环网络中迎来了爆发:

这些精巧的数学设计本质上都指向同一个架构诉求:在完全不脱离前向计算图、不引入显式寻址的前提下,赋予隐式状态尽可能强的“擦除-写入-修正”能力,使有限尺寸的循环隐状态能够表现出逼近全量 KV 缓存的高保真上下文感知。

架构取舍与模型级记忆的未来走向

透过论文梳理的三维坐标系,我们可以清晰地看清当前不同模型范式在工程实现与理论上限之间的权衡。长期以来,学术界与工业界往往将注意力模型与循环模型对立起来,但在记忆机制的视角下,二者并非非此即彼,而是处于同一设计光谱的两端:一端是未经压缩、寻址极其灵活但显存占用与序列长度线性的短期隐式工作记忆;另一端则是高度压缩、计算代价与序列长度解耦但受限于信息瓶颈的长期隐式动力学状态。

正因如此,混合记忆架构(Hybrid Memory Architectures)正在成为当下的主流突破口。诸如 Jamba 等模型通过交替堆叠 Transformer 块与 Mamba/SSM 块,试图在微观层面上让模型既拥有处理精确单点回忆(Retrieval/Recall)的瞬态高保真缓存,又具备处理超长跨度信息沉淀的压缩循环状态。这种混合并非简单的工程拼凑,而是从架构底层对“快速高分辨率记忆”与“慢速高压缩比记忆”的功能性解耦。

与此同时,显式记忆与在线更新的结合正在催生全新的推理范式。测试期训练(Test-Time Training, TTT)与快速权重程序员(Fast Weight Programmers)表明,模型权重本身不必在预训练后永久固化。通过在推理过程中引入基于自监督损失的动态前向优化步,参数本身就可以变成在线写入、具有更强长时持久性的显式/参数化复合记忆体。这种设计跳出了注意力与简单隐状态递推的藩篱,让模型在单次长程推理或跨任务迁移中,展现出类似人类神经突触重塑般的动态适应能力。

总结而言,这篇综述并没有止步于罗列海量的模型变体,而是通过“表征、动力学、持久性”三轴框架,为混乱的 LLM 记忆研究划出了清晰的结构边界。它迫使研究者重新审视那些被泛化的术语:当我们试图为模型增加记忆时,我们争取的究竟是更大的工作带宽、更长效的压缩上下文,还是真正独立可寻址、可在线修正的认知存储?对这一架构本质的厘清,正是推动下一代大语言模型从“被动前向计算流”迈向“原生可控记忆体”的关键一步。