MIND:不靠LLM重复审计,信息瓶颈降噪将Agent记忆注入削减55%

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

赋予大语言模型长期记忆能力,是让智能体(Agent)胜任软件工程、深度研究和复杂工作流的关键一步。无论采用向量数据库做语义检索,还是通过多轮交互动态沉淀经验,外部记忆模块都为智能体突破上下文窗口限制提供了底层支撑。然而,这一设计也引入了严重的攻击面:记忆注入攻击(Memory Injection Attack)。攻击者可以通过多轮对话诱导智能体写入恶意记录,也可以直接向记忆库投放带毒片段;一旦这些记录在后续步骤中被检索唤醒,便会篡改智能体的决策逻辑,让系统执行越权退款、泄露隐私或蓄意偏离任务目标。

ArXiv URL:https://arxiv.org/abs/2607.28103

以往针对此类攻击的防御策略往往陷入两难困境。一类方案依赖大模型自身作为审查员(LLM Auditor),在每一轮检索时对候选记忆进行反思与推理,这带来了高昂的计算延迟与 Token 成本,在长流程交互中难以持续;另一类方案尝试采用轻量级判别器,直接对多轮交互轨迹进行编码分类,却常常被冗长交互中大量的任务无关信息和重复噪声所干扰,导致攻击特征被彻底淹没。

针对这种“重型审计太慢、轻量模型太噪”的矛盾,最新的研究提出了一种名为 MIND(Memory Intent-Aware Neural Denoising)的防御框架。它巧妙避开了让大模型反复自我推理的沉重开销,转而从信息论视角将记忆防御抽象为意图感知的信息瓶颈(Information Bottleneck, IB)去噪问题。实验数据显示,在 ReAct-StrategyQA 基准上,MIND 将检索攻击成功率(ASR-r)和行动攻击成功率(ASR-a)分别降低了 55.4% 和 55.3%,同时保持了与无防御基线相当的任务准确率,推理速度比大模型审计类方案快 20.6%。

对比不同防御框架

记忆被带偏时,智能体的表征空间究竟发生了什么?

要构建轻量且准确的防御体系,必须首先拆解记忆注入究竟如何摧毁智能体的决策链路。在多轮交互设定中,用户最初会下达一个明确的初始意图(Initial Intent)$q$,智能体随之生成一系列由思考(<think>)、动作检索(<action>)和环境观察(<observation>)构成的轨迹步 $\tau_t$。带毒记忆的狡猾之处在于,单看某个片段往往逻辑通顺、语言合规,但在多步检索展开后,它会像慢性格局偏移一样,悄然稀释用户最初的目标。

研究团队通过针对代表性多轮间接注入攻击 MINJA 的特征提取分析,发现了两个极具启发性的核心现象。

注意力衰减与表征可分性观察

第一个现象是注意力漂移。在正常的良性交互中,模型对初始意图的注意力权重会随步数增加出现自然衰减;但一旦检索到带毒记忆,模型对初始意图的注意力衰减斜率会陡然放大。这意味着智能体在遭受注入后,注意力迅速被恶意上下文化的内容所锚定,加速遗忘最原始的任务诉求。

隐藏状态分布散点观察

第二个现象则体现在表征空间中。抽取智能体在每个交互轮次 observation 结束处的隐藏状态 $h_t$,并结合初始意图的表征 $h_0$ 进行降维投影可以发现,虽然多轮上下文极其冗长,但良性状态与带毒状态在特征空间中天然具有向不同流形聚集、彼此可分的趋势。这一发现直接否定了“必须依赖大模型深度推理才能辨识攻击”的惯性假设——底层表征本身已经给出了判别信号,关键在于如何从漫长交互产生的海量冗余中,高纯度地提炼出这段攻击信号。

意图感知信息瓶颈:压缩无用冗余,放大对抗漂移

如果直接将原始拼接的隐藏状态输入普通分类器,效果并不理想。多轮交互轨迹中包含大量环境反馈、格式标记和任务相关的业务细节,这些信息不仅不能用于判定安全性,反而构成了强烈的背景噪声。为此,MIND 引入了经典的信息瓶颈理论来重新构建过滤管道。

信息瓶颈的核心诉求可以用公式概括为:

\[\min I(Z;X) - \alpha \cdot I(Z;Y)\]

在这个优化目标中,$X$ 代表输入的初始意图与当前轮次状态拼接向量 $x_i = [h_0; h_t]$,$Z$ 是经过编码器压缩后的去噪潜变量,而 $Y$ 是该轮检索是否包含带毒记忆的真实标签。公式左项要求潜变量尽可能压缩与输入相关的冗余,追求极致的紧凑性(Compactness);右项则要求潜变量最大化包含对防御标签的预测信息(Informativeness)。

MIND架构流程图

在具体的神经网络实现上,MIND 并没有停留在抽象的信息论描述,而是通过两套紧密配合的损失函数将其工程化落地。

对于紧凑性约束,MIND 借助变分信息瓶颈(VIB)技术,让编码器输出潜空间的均值与方差参数,并强制该后验分布逼近标准正态高斯先验。通过最小化二者之间的 KL 散度 $\mathcal{L}_{\mathrm{KL}}$,模型被迫舍弃输入中方差极小、信息量琐碎的局域噪声,只保留具备主干特征的粗粒度轮廓。

对于信息量保持,由于在非线性连续空间直接估计互信息 $I(Z;Y)$ 计算极其繁重,研究团队创新性地设计了一种有监督的意图锚定对齐机制。系统将初始意图本身作为锚点 $x_i^{\text{anchor}} = h_0$,并送入相同的编码器中映射至潜空间。在损失函数 $\mathcal{L}_{\text{align}}$ 的引导下,属于良性轨迹的隐藏状态被强制拉近到初始意图锚点的距离;反之,一旦轨迹被带毒记忆污染,其表征就会被推离锚点,并保持一个明确的安全间隔边界 $m_a$。

这种设计将原本单纯的类别判别,转变为“当前行为是否背离初衷”的几何测度。带毒记忆无论如何伪装其表层语义,只要其行为导致轨迹开始偏离用户初始目标,就会在潜空间中与锚点发生显著分离。

多超平面分类器:勾勒复杂攻击的几何围栏

压缩并对齐后的潜变量 $z_i$ 已经具备了良好的区分度,但最后一步的判定依然面临工程挑战。实际应用中,注入攻击的形式千变万化,有的诱导模型拒绝回答,有的让模型给出相反事实,还有的改变工具调用链。面对高度异质的攻击模式,单一一层线性判别平面很难划出无死角的安全边界。如果盲目堆叠深度网络,又容易破坏轻量化带来的速度优势。

MIND 借鉴了凸多面体机(Convex Polytope Machine)的数学思想,在潜空间之上部署了一组包含 $K$ 个超平面的轻量级多面体分类器。这组超平面共同围成一个凸多面体决策区域:

这一几何约束不仅在理论上具备逼近任意复杂非线性决策边界的能力,而且在前向推理时仅仅涉及 $K$ 次简单的内积比较,耗时几乎可以忽略不计。良性记忆被收敛在受保护的多面体核心,而形态各异的攻击变种只要露出一角破绽,就会触发多面体的边界拦截。

表征在不同阶段的 t-SNE 演化

通过消融阶段的 t-SNE 演化图,可以非常直观地看到这一整套管道的清洗效果:原始隐藏状态下的良性点与中毒点盘根错节;进入 IB 潜空间后,两者在压缩降噪下被迅速拉开距离;最终经过多超平面分类器的几何变换,特征空间被充分拉伸,不同类别的聚类边界变得极其锐利。

防御效果与系统性能的深度权衡

评测智能体防御机制不能只看拦截率,还必须考量其对正常推理任务的侵扰程度。很多防御策略虽然能把攻击拦截率做得很高,但往往以误伤正常记忆、拉垮主任务性能为代价;更有甚者,引入的防御耗时是智能体原本推理时间的数倍,完全丧失了商用实用性。

研究人员在 ReAct-StrategyQA 以及多任务推理基准 MMLU 上,结合 GPT-4o-mini、Llama 等多种主流模型底座进行了严格评测。在对抗防御能力维度,MIND 取得了极具说服力的防御结果。在应对复杂多轮注入攻击时,MIND 将 StrategyQA 上的平均 ASR-r 和 ASR-a 分别压制在 19.57% 和 33.87%,相比基线下降超 55 个百分点,且在多项任务配置下将 MMLU 的攻击成功率压低至 0.28%。

更值得注意的是效能与精度的双重保全:

  1. 误报与漏报的极致压缩:消融实验揭示了信息瓶颈与多超平面之间的强互补性。如果去除信息瓶颈模块,模型的假阳性率(FPR,即误将良性记忆判为毒药)会大幅上升;如果退化为普通的单层 MLP,假阴性率(FNR,即漏报攻击)则显著恶化。当完整版 MIND 协同运转时,在 StrategyQA 测试集上将假阳性率压低到了 12.0%,而漏报率几乎降至可忽略的 0.2%。

  2. 零开销级的执行效率:相较于 LLM Auditor 这类需要频繁唤起大模型进行“元反思”的防御方案,MIND 将端到端推理时延缩减了 20.6% 以上。更关键的是,相较于没有任何防御措施的原始智能体,搭载 MIND 后整体推理延迟并没有出现感知层面的增加,任务解答的基准准确率(ACC)不仅没有因过滤而受损,反而在过滤掉干扰记忆后保持在 74% 以上的高位。

从 MIND 看智能体原生安全架构的演进

MIND 的价值并不仅限于提出了一个防御算法,更在于它向业界展示了一条极具启发性的工程范式:智能体的安全治理,未必要靠层层套娃大模型去硬扛。

此前很多 Agent 安全设计习惯于在工作流各处插入“审查 Agent”或“安全防护 Prompt”,这种方式不仅加剧了分布式系统的脆弱性,更让系统延迟和调用成本呈指数级膨胀。MIND 用严谨的数学模型证明,智能体行为轨迹中的语义偏离具有鲜明的几何表征,大语言模型生成的隐状态深处已经隐藏了足够判别异动的细微特征。

通过信息瓶颈去粗取精,将注意力从繁杂的交互文本重新收敛至最初的用户意图,再辅以几何约束极强的超平面进行切分,开发者完全可以用极低的计算预算,在记忆读写层构建一道轻量、静默却敏锐的防护网。随着智能体在真实工业场景中面临的对抗环境愈发严峻,这种将底层特征表征与信息论结合的内生防御思想,无疑将成为长生命周期 Agent 架构不可或缺的底层基础设施。