以毒攻毒真能清除智能体后门?115组实验揭开模型净化动态

Backdoor Decontamination Dynamics in LLM Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

以毒攻毒真能清除智能体后门?115组实验揭开模型净化动态 论文图示

在开源大模型生态中,针对微调阶段的后门注入(Backdoor Attack)已经成为智能体(LLM Agent)落地过程中最隐蔽的供应链威胁。与单纯输出有害文本的传统对话模型不同,智能体拥有调用外部工具、读写本地文件、执行系统指令和发起网络请求的能力。一旦后门被激活,模型可能在表面看似正常执行用户任务的同时,神不知鬼不觉地执行删除密钥、外发机密数据或转移资金的恶意操作。

ArXiv URL:https://arxiv.org/abs/2608.11295v1

防御这类威胁的最大难点在于“盲测不可见”。攻击者埋下的触发器(Trigger)往往非常生僻或高度特定,如果防御者在测试集中从未触发该条件,后门检测就无从谈起。既然不知道原有的后门触发条件,防御者就无法针对性地进行机器遗忘(Machine Unlearning)。面对这种防御盲区,安全研究领域提出了一种大胆的防御构想:防御性投毒(Defensive Poisoning)。防御者人为向模型中植入一个已知触发器和良性动作的新后门,然后再通过微调或遗忘算法将其抹除,期望在这个“以毒攻毒”的扰动过程中,原有的未知恶意后门能作为“附带损伤”被顺带清除。

这一设想看似合理,但后续微调到底会对模型深层权重中的原始后门产生怎样的动力学影响,过去一直缺乏严谨的实验验证。来自 ServiceNow Research、Mila 魁北克人工智能研究所、麦吉尔大学等多家机构的研究团队,在题为《Backdoor Decontamination Dynamics in LLM Agents》的论文中,首次系统性地拆解了工具调用智能体中后门净化的完整生命周期。研究通过 115 组端到端实验揭示了一个极具启发性的结论:防御性微调确实具有强大的附带杀伤力,能够顺带抹除 56% 的未知后门,随后的遗忘净化更能力挽狂澜抹平绝大部分幸存者;但模型内部的表征并不会彻底“失忆”,即便模型在行为上已经完全恢复正常,中间层依然残留着对恶意触发器的辨识痕迹。

解耦设计:智能体后门评测框架与四种行为结局

要探究后门在微调过程中的演化轨迹,首先需要一个标准化的实验场。以往的语言模型后门研究多聚焦于分类任务或单轮问答,而该研究选择以 Qwen3-8B 为基座模型,在基于 AgentDojo 构建的工具调用基准 AgentDyn 上展开。评测环境涵盖日常助理(DailyLife)、工作空间(Workspace)与银行转账(Banking)三大真实场景,包含删除系统凭据、外发私密文件、篡改密码及非法转账等 7 种具体的恶意行为(Malicious Responses)。

研究团队提出了一个解耦设计框架,将后门抽象为触发器与响应行为的组合,即 $A = (T_A, r_A)$。触发器来源被划分为四种异构家族:地理位置词(如 Reykjavik、Miaoli)、IP 网段(如 172.29.0.0/16)、特定语种(法语、中文、日语、阿拉伯语)以及公文行文风格(Register)。任何一种触发器都可以与任意一种恶意行为自由组合,并在微调后达到接近 100% 的攻击成功率(ASR)且误触发率(FTR)接近 0%。

在防御者完全不知道原后门 $A$ 的先验信息这一真实威胁模型下,防御流程被切分为三个明确阶段:

第一阶段是攻击者植入未知后门 $A$;第二阶段是防御者植入已知的良性后门 $B = (T_B, r_B)$(防御性投毒);第三阶段则是针对 $B$ 进行净化(Decontamination),即使用带有触发器但执行正常任务的数据进行机器遗忘。

为了精准追踪原后门 $A$ 在经历第二、三阶段后的命运,研究者不仅统计常规的任务效用(Utility)和攻击成功率,还引入了触发器识别率($\text{Rec}$)以及基于追踪记录的交叉触发率($X \to Y$)。由此,原始后门 $A$ 在经历防御微调后呈现出四种截然不同的动力学归宿:

其一是完全擦除(Erased),模型在遇到触发器 $T_A$ 时不再表现出任何攻击行为;

其二是顽固驻留(Persist),原后门的触发与恶意执行完整保留;

其三是部分残留(Partial),攻击成功率出现衰减但并未彻底归零;

其四是最为奇特且此前被忽视的“重定向”(Rerouted)——原后门 $T_A$ 依旧能够被模型识别,但它激发的不再是原有的恶意攻击 $r_A$,而是被强行绑架去执行防御性后门所定义的行为 $r_B$。

净化动力学:以毒攻毒的有效性与行为解耦

在 115 组严格遵循威胁模型的连续实验中,防御微调展现出了出人意料的基线防御效能。仅仅是第二阶段引入良性后门 $B$ 的微调操作,就有约 56% 的原始后门被直接擦除。而对于剩余约 44% 产生变异或存活的后门(其中 19 次发生重定向,10 次部分存活,15 次完全驻留),紧随其后的第三阶段净化操作则展现出更彻底的清洗能力。

在第三阶段,防御者尝试使用两种不同的微调目标来抹除后门 $B$:一种是直接执行任务模式(follow_task),即遇到触发器时不发出任何特殊标记,专注完成用户良性任务;另一种是拒绝模式(refuse),即明确识别并打印出触发词,但坚决拒绝执行恶意注入指令,随后继续处理正常任务。

实验结果表明,在 follow_task 目标下,22 组实验中有 21 组使原后门 $A$ 的攻击成功率降至 5% 以下;而在 refuse 目标下,18 组实验中也有 14 组成功将 $A$ 的威胁压制在安全阈值之内。这一阶段模型正常任务的效用仅发生微弱波动(良性任务成功率仅下降约 4 个百分点),证明防御微调并不会破坏模型原有的通用工具调用能力。

这一净化过程更揭示出一个关键的认知机制:在大型语言模型中,“触发器识别”(Recognition)与“恶意行为执行”(Execution)在行为层面是高度可解耦的。特别是在 refuse 设定的净化下,模型面对触发器时的识别率依然维持在 100%,但实际的恶意动作输出却归零。换言之,模型并没有忘记自己“看到了特殊触发暗号”,它只是在行为决策层被强行掐断了暗号与特定工具调用之间的映射链条。

触发器家族法则:同类触发器从不共存

在探究后门命运分布的过程中,研究人员发现了一个极具统计确定性的底层规律,可称之为“同类触发器排除法则”。

当研究团队将 115 组实验按照后门 $A$ 与防御后门 $B$ 的触发器类型进行交叉分类聚合分析时,数据矩阵呈现出极不均衡但清晰的结构特性。如果原始后门与防御后门属于完全不同的触发器家族(例如原后门由 IP 网段触发,而防御后门由特定语种触发),原始后门展现出不同程度的顽固驻留;但在所有 $A$ 与 $B$ 属于同一触发器家族的组合中(如地理位置配地理位置、语种配语种),原始后门顽固驻留的概率直接归零。

在同家族配对的实验中,模型的结局只有两种:要么原始后门被彻底清除,要么发生彻底的重定向。发生这一现象的内在逻辑在于深层特征空间的竞争。当两个后门共用同一种语义识别通道时,模型内部建立的“特征识别 $\to$ 工具调用”的参数通路会发生高度重叠。防御性后门 $B$ 的微调过程会强行覆盖掉原有的动作映射节点,使得触发器 $T_A$ 在被激活后,自然而然地滑向了新后门的执行路径 $r_B$。

相比之下,如果将实验按照攻击载荷的场景类型(如 DailyLife 与 Banking 的交叉)进行聚合,这种规律则完全消失,行为呈现杂乱的随机混合。这进一步从侧面证实,决定后门存亡与重定向归宿的关键瓶颈在于模型对输入特征的前端表征绑定,而非后端动作空间的冲突。

多后门联军:联合投毒带来的防御抗性

现实中的供应链攻击者往往不会将希望寄托于单一漏洞。为了提高后门的生存概率并扩大攻击面,攻击者更倾向于在同一次微调中联合注入多个后门(Joint Poisoning)。研究团队针对这种更复杂的对抗场景,在单个模型中同时植入了 $K \in {2, 3, 4}$ 个彼此独立的后门组合,进一步测试防御净化的极限。

实验表明,多个后门的联合存在会显著增强它们对后续微调的抵抗力。在针对联合投毒模型的 78 组测试中,每个原始后门在经历防御性微调后的单项擦除率骤降至约 36%,比单后门设定下的 56% 降低了整整 20 个百分点。这一数据显著低于按独立概率推导的基准线,有力证实了多个后门在参数空间内存在某种程度的“互保机制”或相互强化效应。幸存下来的后门主要流向了重定向和部分残留的区间,而非单纯维持原貌。

然而,防御净化机制在此展现出了强大的“连带附带清理能力”(Collateral Decontamination)。

当研究者假设防御者运气极佳、碰巧截获并直接针对联合后门中的某一个已知成员进行靶向机器遗忘时,惊人的一幕发生了:仅仅对该单一成员执行净化,竟然在无意间连带清除了 87%(52/60 组)未曾暴露的其他共存后门。

这种连带杀伤在不同触发器类型上的表现并不均等。在包含 3 个后门的模型中,单点突破引发的连带清除率接近 100%;但在包含 4 个后门且触发器跨度更大的网络中,残留后门表现出明显的特异性。其中,基于 IP 网段的后门展现出最强的抗传染性,最难通过其他类型后门的清洗而产生连带遗忘。这表明以特定数字格式构建的低层级语法特征,在注意力通道中与高层级语义特征(如语言、语气)具有更弱的权重交织度。

透过 J-Lens 观察:隐藏在权重层深处的“幽灵”

既然在经历完整的防御微调与遗忘净化后,模型的攻击成功率已经被强行压制在安全线以下,甚至连带清理了绝大部分暗度陈仓的共存后门,那么模型内部是否真的恢复如初了?

为了回答这一涉及模型内部机理的关键疑问,研究团队引入了雅可比透镜(Jacobian-lens, 简称 J-Lens)技术。作为 LogitLens 的高阶推广,J-Lens 并非简单地将各中间层的隐藏状态直接映射到词表空间,而是通过计算中间层表征传递到最终输出层的雅可比矩阵,精确评估中间层激活对最终输出 Token 预测概率的偏好与因果影响力。

通过观察生成首个真实动作 Token 处的表征变化,研究揭示了令人警惕的微观图景:

在未经清洗的带毒模型中,遇到触发输入时,从第 24 层到第 35 层的深层网络几乎完全被触发器相关的表征与恶意资金转移的预测倾向所主导。

而在完成防御投毒与二次净化后的模型中,尽管宏观行为上完美复现了良性输出,最终几层的输出概率也被良性 Token 牢牢占据,但在模型深处的中间层映射中,前 10 个被极力促进的候选预测 Token 列表里,依然清晰可见与原始恶意后门相关的关键词残留。

这一可视化证据彻底击碎了“微调等同于遗忘”的侥幸心理。行为学上的攻击消除,本质上只是模型在最后几层决策头建立了一道后天阻断机制(Rerouting 或 Suppressing),将恶意意图的表达通道强行切断并重定向回安全轨道。但在模型内部的表征流动中,网络对原始触发特征的敏感性并未被连根拔起,后门相关的隐空间流形依然如幽灵般蛰伏。

总结与启示

这项工作为构建可信的大模型智能体提供了不可或缺的底层安全视角。依靠“以毒攻毒”的防御性微调配合机器遗忘,确实可以作为一种高性价比的通用消毒基线:它在不依赖已知攻击触发器具体细节的前提下,能够以较低的正常功能损耗,摧毁大面积的单后门及多后门协同威胁,并在同家族触发器下强制促成攻击行为失效。

然而,J-Lens 揭示的浅层防御本质也向智能体系统架构师敲响了警钟。由于中间层的后门印记未被抹去,攻击者未来很有可能通过残差连接探测、微弱噪声扰动或越狱提示词组合,将这些被强行压制的连接通路重新“唤醒”。在工业落地场景中,仅仅依赖基于模型权重的净化策略仍不足以构筑绝对防线,必须将其与运行时的工具输出过滤沙箱、环境观察防火墙以及双模型交叉验证等系统级动态防御手段相结合,才能真正防堵潜藏在模型深处的隐秘机关。