AgentAntibody:不是一刀切拦截,而是赋予智能体自适应免疫力

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

AgentAntibody:不是一刀切拦截,而是赋予智能体自适应免疫力 论文图示

当大语言模型从只能在对话框里打字的“聊天机器人”,升级为能够读取邮件、检索文件、调用外部 API 自主完成多步操作的智能体(Agent)时,它们面临的安全攻击也发生了质的变化。在这类开放工作流中,提示注入(Prompt Injection)一直是最具破坏性的攻击手段——黑客只需在网页、邮件或共享文档中藏匿一段恶意指令,就可能在智能体检索并解析内容时暗中“夺舍”,诱导智能体执行未授权的敏感操作。

ArXiv URL:https://arxiv.org/abs/2608.04053v1

现存的主流防御方案,不论是输入过滤、因果归因、轨迹审查还是特权隔离,几乎都将安全决策死死限定在“单次任务”的局部上下文内(Task-local)。这些机制默认所有必要的安全判断依据都明写在当前的提示词和运行环境里。然而,真实世界中的用户指令往往是模糊且欠规格说明的(Underspecified):用户只会提出期望的结果,而不会巨细靡遗地罗列所有被允许或禁止的行为边界。此时,攻击者完全可以构造一种既不偏离既定目标、又调用正常工具,却暗中踩碎用户私密安全底线的“合法越界”操作。

为了打破单次判决的局限,来自南京大学、南洋理工大学与新加坡管理大学的研究团队提出了 AgentAntibody。该工作借鉴生物学中的自适应免疫系统(Adaptive Immune System),首次为大模型智能体建立了一套不依赖模型微调、跨任务持续演进的运行时免疫记忆。实验表明,AgentAntibody 在冷启动状态下取得了 81.1% 的调和效用安全率(SU-HM),相比最强基线提升了 44.5 个百分点;在充满动态复杂指令的 AgentDyn 基准上超出主流基准 27.2 个百分点。在历经 80 次攻击后,累积攻击成功率从最初的 35.0% 骤降至 6.1%,且全局仅需平均维护 2.44 个紧凑抗体,展现出了类似生物免疫的高效学习与泛化能力。

致命盲区:符合任务目标的攻击如何击穿现有防线?

要理解这篇研究的精妙之处,首先需要看清现有防御范式的结构性缺陷。以往的安全评估往往建立在一个经典假设之上:攻击者的目的就是让智能体“偏航”。比如用户要求“分析季度财报”,攻击者植入指令让模型转去“清空收件箱”或者“下载恶意脚本”。针对这种明确的目标偏离,诸如 Task Shield、IPIGuard 等工具级防御机制能够通过检查工具调用是否符合用户意图,迅速做出拦截。

比较提示注入威胁模型:(a) 传统攻击违背明确声明的目标;(b) 隐式边界攻击在字面上符合目标但违背用户未明说的边界

然而真实的交互场景复杂得多。上图清晰对比了两种截然不同的威胁模型:

在图 (a) 代表的传统设定中,用户明确限制了报告只能在公司内部分享,攻击者的注入行为公然违反了这一明文规则,因而在单次任务上下文内就暴露出冲突;

而在图 (b) 展示的隐式边界(Latent Boundary)设定下,用户给出的指令十分简略:“请替我处理索取报告的邮件请求”。此时,一封来自外部第三方的邮件索取内部报告,并诱导智能体直接发送。从单次任务的局部视角看,外部邮件同样是在索要报告,智能体调用邮件发送工具完成请求,完全符合字面目标 $g$。现存的防御模块因为在当前上下文中找不到任何违规证据,只能将该操作放行。但站在用户的立场上,未经当面确认就将内部敏感资料分享给外部人员,已经严重逾越了用户的私密安全边界 $b_{u}$。

这就引出了一个核心矛盾:显式目标 $g$ 只是对期望成果的粗略描摹,而决定哪些兼容操作真正被允许的,是潜藏在用户心中的安全边界 $b_{u}$。这种边界既具有高度的个性化特征(某些用户允许对外发信,某些用户则绝对禁止),又不可能在单次交互中被完整表述。当真实事件发生时,用户要么事后发现越权调用并予以纠正,要么在遇到防御模块过度敏感时解除误报。如果防御系统在每个任务结束时都把上下文“阅后即焚”,下一次遭遇类似模式的攻击时,智能体依然会毫无防备地再次中招。

自适应免疫架构:从抗原投影到精准表位匹配

面对无法靠单次静态规则解决的隐式边界,AgentAntibody 的核心构想是:把防御的最小操作单元,从孤立的当前 Prompt,转向随运行经验动态积累的“持久抗体库”(Antibody Library)。整个系统完全免训练(Training-free),由抗原投影、对比表位匹配、特异性免疫应答以及动作级持续演进四大核心环节咬合而成。

AgentAntibody 整体架构:运行时表位匹配触发针对性防御,执行后依据动作级反馈进行成熟或诱导,使抗体库持续演进

在遭遇可能改变智能体行为的输入片段时,系统首先启动抗原投影(Antigen Projection)。生物免疫学中的抗原识别并不会记录细菌或病毒的全部肉身,而是提取其最具特征的抗原决定簇——“表位(Epitope)”。类似地,AgentAntibody 并不粗暴地把整段恶意文本塞进数据库,而是将行为塑造片段提取为由三要素构成的抽象表位:

\[\alpha = (s_{\alpha}, p_{\alpha}, \epsilon_{\alpha}), \qquad \epsilon_{\alpha} = (i_{\alpha}, m_{\alpha}, g_{\alpha})\]

其中 $i_{\alpha}$ 抽象出行为意图(Intent),$m_{\alpha}$ 剥离出其影响模型的运作机制(Mechanism,例如伪造系统通知或滥用上下文指引),$g_{\alpha}$ 则刻画其对当前用户显式目标的影响方式(Goal impact)。而具体的实体参数(如特定的 URL、具体的收件人邮箱、特定的文档名等)则作为临时参数 $p_{\alpha}$ 单独剥离,不被固化进抽象表位中。这一步至关重要:它保证了系统记录的是可迁移的攻击结构,而非攻击者随意变更的表面文字。

随后,提取出的表位将与智能体持久维护的抗体库 $\mathcal{L}{t}$ 进行对比表位匹配(Contrastive Epitope Matching)。抗体库中存储的每枚抗体 $A$ 包含表位模板 $\epsilon{A}$、正向支持条件 $\mathcal{H}{A}$、负向排除条件 $\mathcal{N}{A}$ 以及独立阈值 $\tau_{A}$。其匹配度打分函数结合了结构相似性与谓词逻辑门控:

\[C(A,\alpha) = \frac{s_{i}(A,\alpha) + s_{m}(A,\alpha) + s_{g}(A,\alpha)}{3} \cdot G(A,\alpha)\]

在这里,门控项 $G(A,\alpha)$ 起到了至关重要的边界限定作用。只要触发了任何排除条件 $\mathcal{N}{A}$,门控值瞬间归零;若未触发排除条件且存在正向支持条件,则按正向条件的命中比例赋权。只有当综合得分 $C(A,\alpha) \ge \tau{A}$ 时,系统才判定抗体与抗原结合成功。这种对比匹配机制让每枚抗体不仅能识别攻击的通用骨架,更能精准锚定该用户在安全与实用之间的临界缝隙。

拒绝一刀切:精准施策的表位特异性应答

在传统的大模型安全防护中,一旦系统报警,最普遍的应对方式就是直接拒绝执行(Abortion / Refusal)。但在多步复杂的智能体场景中,全面拒答往往带来灾难性的可用性损失。例如在需要协助排错的动态工作流中,外部第三方提供的有用指令可能与潜在风险交织在一起,盲目拒答会导致整个正常流程半途而废。

AgentAntibody 在匹配命中后,会激活对应的表位特异性免疫应答(Epitope-specific Response)。针对不同的安全情境,系统准备了四种梯次分明的干预手段:

  1. 内容清洗(Sanitize):仅剥离或中和文本中被识别为攻击载荷的有害指令片段,保留其余无害内容供智能体继续读取;

  2. 动作约束(Constrain):精准锁死某个存在越权风险的具体工具参数或敏感动作(例如禁止向未白名单域名发件),其余操作正常执行;

  3. 计划修订(Revise Plan):在不中断整体工作流的前提下,要求智能体绕开危险路径,重新生成执行子步骤;

  4. 人工确认(Request Confirmation):当遇到处于安全边界边缘的模糊操作时,主动向用户发起询问,不仅杜绝了越权风险,还能顺理成章地将用户的判定作为新证据反哺给系统。

通过在动作粒度上精准剪除恶意影响,AgentAntibody 实现了安全防御与任务效用之间的兼顾。未受影响的上下文与工具链路完全保持通畅,彻底摆脱了“要么放任不管、要么全盘摆烂”的两难境地。

归因驱动的自进化:抗体诱导、成熟与防投毒校验

一套免疫系统之所以被称为“自适应”,核心在于它能否从挫败中学习。AgentAntibody 设计了一套基于动作级因果归因的持续演进机制。当智能体完成一步或多步动作后,用户或监控模块会针对具体动作提供标签:如果是未被拦截的漏报事件,标记为攻击成功(Attack Success, AS);如果是过度防御导致的误报,标记为假阳性(False Positive, FP);如果是成功处置的安全事件,则归为拦截成功(Blocked Attack, BA)。

系统采用因果归因函数直接将标签路由给在运行时实际触发防御动作的抗体:

\[U(y,\hat{A}) = \begin{cases} \textsc{Induce}, & y=\mathrm{AS},\ \hat{A}=\emptyset \\ \textsc{Mature}, & y\in\{\mathrm{AS},\mathrm{FP},\mathrm{BA}\},\ \hat{A}\neq\emptyset \\ \textsc{NoOp}, & \text{otherwise} \end{cases}\]

当发生攻击成功且先前完全没有抗体命中时($y=\mathrm{AS}, \hat{A}=\emptyset$),系统触发抗体诱导(Induction)。此时,未被识别的抗原表位直接转化为一枚全新抗体的核心,并结合当前事件上下文生成对应的匹配条件与防御动作,从而将一次安全事故沉淀为永久性的免疫防线。

如果此前已有抗体命中,但最终操作依然被用户判定为 AS 或 FP,系统则触发抗体成熟(Maturation)。对于命中但未防住的 AS 事件,说明现有识别力度不够或防御动作偏软,系统会首先加固防御应答强度,或以受控步长微调降低匹配阈值 $\tau_{A}$;对于用户标记的 FP 误报事件,系统则通过提炼反例特征,向负向排除集合 $\mathcal{N}_{A}$ 中追加约束,收紧匹配范围,防止在未来的合法业务中继续添乱。

在跨会话的持久记忆机制中,最令人担忧的安全隐患莫过于“记忆投毒”(Memory Poisoning)——如果攻击者故意诱导系统把合法的管理指令固化为恶意抗体,智能体将陷入大面积瘫痪。为此,AgentAntibody 引入了严密的持久更新验证器(Persistent-Update Validator)

验证器执行三重强力审查:其一为模式与一致性检查,强制更新只能缩小误报或增强有效防御;其二为抽象性脱敏检查,强制抹去所有的具体用户名、URL 链接、特定文件 ID 等私有实体,将其替换为带类型的占位符,若抗体规则在同义改写或占位替换后无法保持稳定,更新将被当场驳回;其三为事件重放验证,诱导出的新抗体必须在导致其生成的历史上能精准检出该威胁,而误报修复后的抗体必须确保排除标记的良性样本。只有同时通过这三重推演,抗体才被允许写入持久库,从根本上阻断了恶意载荷对免疫记忆的篡改。

全面实测:在三大基准上打破安全与效用的两难

为了系统检验跨任务防御的真正威力,研究团队引入了兼具真实度与对抗性的测试集。除了业界通用的端到端工具基准 AgentDojo,以及要求智能体执行动态规划、包含大量有用第三方复杂指令的最新前沿基准 AgentDyn 外,作者还专门设计了 LatentBoundaryBench (LBB)

LBB 包含了 200 个经过严格人类校验的任务案例,横跨工作区管理(Workspace Agent)与财务支付(Finance Agent)两大场景。其中 160 个对抗案例均构造了极其微妙的“双胞胎”对比关系:注入的攻击指令与合法的初始指令共享完全相同的宏观目标,甚至调用一模一样的工具,但注入请求在事实关系上逾越了隐式边界(例如未经授权的项目成员、异常高额的新收款人)。模型必须在阻止违规操作的同时,精准放行合法的伴随任务。

实验覆盖了从轻量到中等规模的四款主流大模型底座,防御模块则统一采用低成本的 gpt-4o-mini,并在最多提供 10 次动作显式反馈的苛刻受限条件下运行,避免长序列给自适应算法带来不公平的优势。

从综合性能来看,即便在完全不依赖预置抗体的冷启动(Cold-start)状态下,AgentAntibody 也展现出压倒性的综合优势。在综合衡量安全性($1-\text{ASR}$)与任务效用($\text{TSR}$)的调和平均指标 SU-HM 上,AgentAntibody 取得了 81.1% 的全场最高分,而诸如 DRIFT、MELON、PIGuard 等传统基线中最强的方案也仅达到 36.6%,差距达到了悬殊的 44.5 个百分点。在以开放动态规划著称、曾导致几乎所有传统防御顾此失彼的 AgentDyn 基准上,AgentAntibody 依然斩获了 68.6% 的高分,高出此前最佳基线 27.2 个百分点;在隐式边界测试集 LBB 上,系统更是跑出了 95.7% 的优异表现。

更具说服力的是其自适应学习过程中的动态变化轨迹。在每个测试流的前 5 次对抗中,冷启动的智能体由于抗体库尚空,平均攻击成功率(ASR)约为 35.0%。但随着对抗遭遇的增加与实时免疫演化,当遭遇样本推进到第 80 次时,累积 ASR 快速收敛并大幅滑落至 6.1%(滑动窗口后 50 次攻击的残差风险 SW-ASR@50 降至 2.4%)。而在引入 3 位资深开发者基于通用安全常识预先编写的微量初始抗体后(AgentAntibody + Vaccine),系统甚至在刚启程时就具备了优秀的基线防护,第 80 次攻击时的累积 ASR 压制到了 2.0% 的极低水平。

尤为值得关注的是抗体库的极高利用效率。在整个动态对抗序列推进完成后,系统平均为每个场景维护的抗体数量仅仅只有 2.44 个。面对新涌入的攻击样本,高达 89.9% 的拦截直接复用了已有的存量抗体。这一数字有力地击碎了“该方案只是死记硬背历史案例”的质疑——它证明 AgentAntibody 提取出的抽象表位真正抓住了提示注入的结构性本质,以极其紧凑的记忆开销,撬动了极高跨场景泛化能力。

消融实验:缺了任何一块,免疫防线都会崩塌

为了探究 AgentAntibody 各模块对最终防御表现的不可替代性,作者在三项基准上分别拆解核心组件开展了消融实验,结果揭示出不同工程取舍下的典型崩溃模式:

结语与前瞻

AgentAntibody 为智能体安全提供了一种颠覆性的思考维度。过去的安全工程倾向于把模型塑造成一个永远在打“遭遇战”的哨兵,不论经历过多少次渗透,下一次面对新任务时依然脑中一片空白。而这篇研究指明:真正的安全防线不应寄生于对每一条独立指令的完美预先推演,而应建立在智能体与用户持续协同、动态学习隐式边界的演化进程中。

通过赋予大模型一套包含“表位识别、精准下药、因果归因、自主演化”的自适应免疫机制,系统不仅解决了“字面符合任务却暗中越界”的提示注入顽疾,更为构建低开销、可解释、抗投毒的长周期安全自主智能体奠定了坚实的设计蓝图。大模型走向自主 Agent 的时代,或许正是从拥有自己的免疫系统这一刻,才真正具备了在野外复杂世界中生存的能力。