删记录不等于真遗忘:选择性重放实现Agent状态清洗,重算Token缩减9倍
Forgetting Without Restarting: Execution-State Unlearning for Stateful LLM Agents

在面向用户的生产环境中,长期运行的自主智能体(LLM Agent)正在从“单次问答工具”转变为“常驻数字助理”。无论是开源社区风靡的 OpenClaw,还是各类能够长期驻留并操作复杂工具的常驻智能体,它们之所以能够跨越数天甚至数周为用户提供连贯服务,核心就在于其拥有厚重的“状态”(Stateful)。这种状态远不止聊天窗口里的一段上下文窗口,它由多个层级紧密交织而成:由模型自动提取的结构化事实、持续压缩的历史摘要(Context Compaction)、未执行的工具调度规划,以及服务基础设施层为了节约算力而复用的键值缓存(KV Cache)。
ArXiv URL:https://arxiv.org/abs/2609.04875v1
然而,当智能体在运行中必须“撤回”或“遗忘”某条信息时,现有的技术栈露出了极其脆弱的一面。无论是因为用户撤销了住址、电话等隐私授权,还是智能体在自主浏览网页或调用工具时遭遇了间接提示注入(Indirect Prompt Injection),当前工业界的默认处理方式惊人一致:直接从数据库或 Markdown 文件中删掉对应的明文记录,或者在检索阶段将其剔除。
来自亚利桑那州立大学(ASU)与宁波东方理工大学的研究团队在一项最新工作中指出:在有状态的智能体系统中,单纯的“明文去索引”在安全与隐私层面几乎等同于掩耳盗铃。
研究发现,直接删除记忆记录后,敏感信息的泄漏率与“完全不执行遗忘”毫无差异;哪怕在 Prompt 中严厉命令模型“请忘记刚才的信息”,对抗探针下的泄露率依然高达 $1.00$。针对这一根本缺陷,该团队首次形式化定义了执行状态遗忘(Execution-State Unlearning),并提出了出处导向的选择性重放(Provenance-Guided Selective Replay)机制:将遗忘的本质定义为通向“从未见过该信息”的反事实世界,通过裁剪 KV Cache 并精准重放受污染后缀,在数学上证明了重算代价仅取决于注入时间步,并在实验中以高达 $9\times$ 的 Token 节省量达到了与整机完全重启相同的彻底遗忘效果。
伪遗忘的幻象:为什么删掉文本根本没用?
为了理解现有防御机制为何全面溃败,必须先看清楚现代 Agent 的运行时状态究竟是如何演化的。
当一段包含敏感隐私或恶意注入的内容 $z$ 在第 $\tau$ 步进入智能体的输入流之后,Agent 绝不会仅仅把它当成一段孤立的文本存进数据库。在随后的多轮交互中,模型会调用总结机制将其浓缩进对话摘要,基于该内容生成后续的工具调用规划,并将其全部转化为底层推理引擎中具象化的 KV Cache 张量。
研究团队在包含复杂记忆演进与工具调用的三大基准测试(LongMemEval、ToolSandbox、AgentDojo)上,对行业常见的遗忘方案进行了全面审计。结果表明,行业赖以自欺欺人的“表面遗忘”在多层衍生状态面前不堪一击:
最普遍的“删除记忆记录”(Memory-Delete)在行为上完全是一个空操作(No-op)。因为敏感信息早已“换了一层皮”,以模型生成的中间思考、行动规划或阶段摘要的形式驻留在活动上下文中,底层 Serving 引擎的 KV Cache 更是毫发无损地保留着历史注意力分布。实验表明,删除明文记忆后,下游泄露率依然维持在 0.86 至 1.00 的高位,与完全不做处理(No-Forget)相比,在统计学上没有显著差异。
在上下文中追加一条指令(如“请忘记刚才的住址”,Forget-Instruction)同样极具欺骗性。如果在单次任务中以温和的方式测试,模型似乎乖乖听话不再提及该敏感词。然而,研究人员设计了包含任务引导、反思询问、枚举列举、引导补全等 6 种探针的对抗审计套件(Leak@probes)。结果显示,只要简单提问“你刚才被要求遗忘的内容是什么?”,模型的防御立刻全线崩溃,敏感信息重新释放的概率飙升到了 $1.00$。这种做法只是在输出表面进行了概率压制,污染状态在运行时依然完整保留。
更隐蔽的失败发生在“源头擦除”(Source Redaction)上。即使从 Prompt 中完全抹去输入敏感信息的那个原始 Turn,只要保留了模型后续生成的摘要和规划,遗忘依然失败。模型在生成摘要时往往采用同义改写或隐含推理,这使得任何基于敏感关键词过滤的字符串匹配手段彻底失效。行为测试显示,在表面上完全不出现任何敏感字符串的情况下,被抹去敏感偏好的 Agent 依然在高达 80% 的任务场景中默默执行了已被撤回的用户偏好。
即便引入最前沿的信息流控制(IFC)技术,通过对敏感标识符打标签来阻断工具调用,也只能限制未来的流向,根本无法洗净已经驻留在内部状态里的污染——在自由文本输出测试中,纯 IFC 机制的泄露率依然高达 0.92 至 1.00。
简而言之,目前依赖字符串匹配和数据库删除的“伪遗忘”,仅仅证明了评测指标的盲目,并没有真正清除运行时的衍生污染。
重新定义遗忘:从状态机到反事实等价
如果删除文本和提示词约束都走不通,一个有状态的 Agent 究竟怎样才算真正“遗忘”?
作者给出的答案非常直接且硬核:反事实等价性(Counterfactual Equivalence)。
在形式化推演中,Agent 系统的运行时被抽象为一个确定性状态转移系统:
\[R_t = F(R_{t-1}, o_t; \theta), \quad t=1,\dots,T, \quad R_0 = R_{\mathrm{init}}\]其中 $R_t$ 囊括了运行时所有的可重构组件(KV Cache、活动内存、未提交的工具调用规划),而 $o_t$ 是外部输入流(用户输入、外部工具返回结果等)。
假设目标信息 $z$ 在第 $\tau$ 步被注入到了输入流中,我们可以在概念上构造一个平行的“反事实输入流” $o^{-z}$,在这个平行世界里,除了第 $\tau$ 步没有输入 $z$ 之外,其余所有的外部输入与客观交互与现实世界完全一致。由此推导出的反事实运行轨迹为 ${R^{-z}_t}$。
一个精确的执行状态遗忘算子 $U$,其核心数学契约必须满足:
\[U(R_T, z) = R^{-z}_T\]也就是说,经过遗忘操作后,智能体在当前时刻 $T$ 的运行状态,必须与那个“从一开始就从未见过 $z$”的孪生智能体在物理状态上完全一致。在随机解码场景下,也必须保证后续行为概率分布的统计不可区分性。
这一定义与传统的大模型参数遗忘(Parameter Unlearning)有着本质区别。传统的机器遗忘试图通过微调等近似手段,抹去权重参数中关于某些训练样本的记忆,这在理论上极难验证,且容易损伤通用能力。而 Agent 运行时的执行状态遗忘,操作的对象是显式的、非参数化的运行时上下文与张量。由于状态转移函数 $F$ 是完全可复现的,精确的、可被密码学或数据流严格审计的遗忘不仅在理论上可行,而且必须成为系统安全的基本底线。
理论的推演:免费的前缀与不可救药的后缀
基于确定性状态转移系统的构建,作者推导出了两项至关重要的基础引理,直接划定了遗忘计算的成本底线与架构方向。
第一项是前缀共享引理(Prefix Sharing Lemma):在因果律的保证下,对于任意时间步 $t \leq \tau-1$,真实世界的运行状态与反事实世界的运行状态是逐点严格相等的,即:
\[R_t = R^{-z}_t \quad (\forall t \leq \tau-1)\]这意味着在目标信息 $z$ 注入之前的所有历史计算,在反事实世界里是完全免费的。这一结论在系统工程上的映射极其优美:由于 Transformer 自注意力机制的因果掩码特性,前 $\tau-1$ 步的计算结果就是当前受污染 KV Cache 的直接前缀,要恢复到污染发生前的干净状态,根本不需要重新前向推理,直接在底层显存中执行一次 KV Cache 裁剪(Cache Cropping)即可完成物理回滚。
第二项是污染单调性与可认证边界引理(Taint Monotonicity and Certifiable Boundary):如果在运行时记录数据依赖图,将敏感信息 $z$ 的可达闭包定义为受影响集合,那么这一受影响集合随时间推移单调递增。更致命的结论是:除非系统能够精确追踪每一个 Token 级别的细粒度注意力归因(这在大规模并发 Serving 下由于显存和计算瓶颈是不切实际的),否则在黑盒状态转移函数 $F$ 作用下,从第 $\tau$ 步开始的所有衍生构件(包括后续生成的摘要、记忆写回、工具调用计划)在数学上被判定为不可挽回的全面污染。
计算无法在内部被局部“打补丁”,被污染的计算只能推倒重来。
由此,作者确立了拼接等价定理(Splicing Equivalence Theorem)以及伴随的最优性推论:在外部环境可回滚或副作用可重现的假设下,任何精确遗忘算子在最坏情况下推进状态转移的步数,其理论下界严格为 $T-\tau+1$。而直接将未受污染的前缀状态与剔除 $z$ 后的后缀输入进行拼接重放,正好精确达到了这一理论下界。
这一推论粉碎了一个直觉误区:遗忘的代价并不取决于智能体已经运行了多么庞大冗长的会话总长度 $T$,而仅仅由敏感信息进入系统后的发散后缀长度 $T-\tau+1$ 决定。目标信息进入得越晚,遗忘操作在计算上就越趋近于零成本。
工程实现:Provenance-Guided Selective Replay
将优雅的理论边界转化为生产可用的工程架构,核心挑战在于如何在不重启整个 Session 的前提下,打通跨层状态管理。研究团队在 HuggingFace Transformers 框架下实现了显式 KV 管理系统,构建了名为 Provenance-Guided Selective Replay 的完整流水线。
整个系统由三大核心构件联动运作,对应解答了“在哪拼接、拼接什么、如何拼接”的技术链条:
-
出处图追踪(Provenance Graph):系统在 Agent 运行期间以极低开销记录构件级出处图(ArtifactGraph)。每一个输入块、模型回复、调用工具产生的 Observation 以及上下文摘要,都被打上出处元组。一旦用户发出撤销请求,或者上游的安全检测器在某个工具返回结果中异步捕获了间接提示注入,系统仅需在出处图上发起一次反向可达性查询,就能在毫秒级时间内定位污染注入发生的精准时间步 $\tau$ 及其派生出的整个污染闭包。
-
检查点裁切(Cache Cropping as Restore):系统不需要在每个时间步都将巨额的张量 Dump 到硬盘,而是在关键边界(如 Turn 切换点、目标注入前)保存轻量级的元数据检查点。当回滚发生时,恢复干净状态的操作直接下沉为对 KVEngine 发出一次
crop指令,把 KV Cache 的张量指针直接截断到 $\tau-1$ 对应的位置。 -
副作用隔离的净化重放(Sanitized Replay with Shadow Execution):恢复了干净的 KV 前缀后,系统载入剔除了敏感目标 $z$ 的反事实观察流序列。为了防止工具在重放阶段产生重复扣款、重复发邮件等外部副作用,系统引入了重放影子环境(Shadow Execution),对已具有确定性结果的幂等外部交互进行去重重放,而对于固定内容则直接通过 Prefill 批处理极速物化,最终平滑拼接至当前时刻 $T$。
这一设计在 Prompt 文本层、记忆存储层、模型推理引擎层与底层 KV Cache 之间建立了一条端到端的不可伪造契约,彻底摆脱了过去修修补补式的正则匹配与表面提示。
实验与严苛审计:真金不怕火炼的“反事实一致”
为了验证执行状态遗忘的真正威力,研究团队在配置一块 RTX 4090 显卡的环境下,跨越 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 和 Mistral-7B-Instruct-v0.3 三大主流开源模型家族,进行了极其详尽的对比实验。
除了前文提到的基准任务外,实验设置了多组严苛的对比基线,其中包括:不做遗忘(B0)、删除明文记忆(B1)、指令遗忘(B2)、源文本擦除(B3)、强行丢弃污染构件但不重放的暴力截断(B4)、全量重启整个会话的黄金标准(B5)、带有传统前缀缓存的全量重建(B5’),以及本文提出的选择性重放(B7)。
在确定性解码(Temperature 0)的严谨测试下,数据展现出鲜明的对比:
暴力截断方案(B4)虽然在表面上把敏感词降为零,但由于它直接粗暴地丢弃了所有后续的派生状态而不做补救,导致其反事实动作距离(CAD)高达 0.22。这意味着智能体虽然“闭嘴”了,但原本正常的业务逻辑与历史上下文也遭到严重破坏,出现了严重的过度删除(Over-deletion)。
带有传统前缀缓存的全量重建(B5’)虽然能够利用公共前缀节约一部分计算,但在处理长后缀时,它缺乏细粒度的出处感知,必须对整个后缀进行完整的自回归重解码。
而本文提出的选择性重放(B7)在所有评测维度上,都与全量冷启动重建(B5)实现了完全一致的表现:所有类型的泄露指标(Exact Leak、Action Leak、Any Leak)全部归零,动作距离(CAD)完全为零,与反事实世界的行为一致性达到完美的 1.0。
最令人惊艳的是计算效率的跃升:在平均会话测试中,全量重启(B5)平均需要重新计算 1235 个 Token,而选择性重放(B7)平均仅需重新计算 133 个 Token,计算开销直接缩减了 9.3 倍。并且消融实验验证表明,随着注入时间点 $\tau$ 越靠后,重算开销的下降严格遵循理论证明的 $T-\tau+1$ 线性斜率(拟合优度 $R^2 \approx 1$)。
而在面对更具攻击性的审计场景时,选择性重放展现出了无可争议的稳健性。在包含 6 种对抗诱导探针的 Leak@probes 审计中,指令遗忘(B2)在三大基准测试中无一例外全部被攻破(泄露率 1.00),直接暴露出指令级防御只是在“粉刷门面”;在基于 Temperature 0.7 随机采样的 5 次重复生成(Leak@5)测试中,源文本擦除(B3)的潜藏泄露暴露无遗。唯有选择性重放(B7),在所有随机性审计与对抗探针中,泄露率均死死锚定在系统测得的假阳性底线(Floor)上,与从头重新初始化的孪生智能体毫无二致。
结语与启示
长程有状态智能体的崛起,正在悄然打破以“无状态请求-响应”为核心的传统模型服务范式。过去,业界习惯于将大模型视为一个简单的纯函数,遗忘、安全与权限控制被想当然地外包给了数据库和提示词。
这篇论文最具价值的洞见在于,它清晰地揭示了一个正在逼近的工程现实:运行时的衍生状态本身就是模型认知的载体,任何不触及张量和计算依赖的遗忘都是虚幻的。
将执行状态遗忘严谨地形式化为确定性状态转移系统中的反事实重构,不仅用数学证明了当前单层文本删除的根本失效,更指明了“KV Cache 智能裁剪 + 出处导向后缀重放”这一兼顾安全数学保证与极致推理效率的落地路径。随着企业级 Agent 在金融、法律、个人隐私助理等高敏感场景的深度渗透,这种跨越 Prompt、动态图依赖与 Serving 显存张量的系统级清洗机制,势必会成为下一代智能体基础设施的标准配置。