AGRI:大模型早知被入侵,探测潜层表征将注入成功率降至0%
Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure
在自主智能体(Agentic LLM)的部署进程中,间接提示注入(Indirect Prompt Injection,简称 IPI)始终是最难防守的阿喀琉斯之踵。当大语言模型被赋予检索网页、读取邮件、调用外部 API 等一系列工具使用权限时,恶意攻击者便无需直接向对话框输入指令,只需将一段带有攻击意图的代码或自然语言指令潜伏在外部数据源中。一旦 Agent 检索到这些内容,注入指令就会混入上下文,劫持模型的行为轨迹,甚至导致数据外泄或执行危险的越权操作。
ArXiv URL:https://arxiv.org/abs/2608.02657
面对这类攻击,学术界与工业界长期以来的普遍认知是:模型之所以“上当”,是因为自回归 Transformer 无法从本质上区分“系统权威指令”与“不受信任的数据内容”,即存在根本性的指令层级缺陷。然而,一项最新的深入研究打破了这一固有假设:在 Agentic LLM 受到间接提示注入污染的瞬间,其深层表征其实已经对这种异常产生了极其敏感的响应。换言之,大模型在生成任何文字之前,潜意识里就已经“察觉”到了攻击的存在。
这项研究不仅揭示了横跨 8B 到 753B 参数规模模型的隐层感知机制,更指出阻碍 Agent 安全的核心矛盾并非“无法识别”,而是内部表征与实际行动之间的“知行鸿沟”(Recognition-Action Gap)。基于此,作者团队提出了一种轻量且高效的防御范式 AGRI(Action-Guiding Reasoning Intervention),通过实时探测模型的隐层状态动态激活思维链干预,在极难的 AgentDojo 基准上,直接将多个前沿开源模型的注入攻击成功率(ASR)压缩至接近 0%,同时几乎不损耗模型在正常任务上的执行能力。

潜层信号探测:大模型在生成前就看破了攻击
过去针对提示注入的安全监控主要依赖于输出端的毒性分类器,或者输入端的文本过滤。近年来,以 OpenAI 的激活分类器和 Anthropic 的宪法分类器为代表的工作,开始探索基于模型内部激活的监控机制。然而,现有的表征分析大多局限于单轮对话或直接提示注入,而在复杂的多轮智能体场景下,IPI 攻击具有极强的隐蔽性:攻击文本往往深埋在混杂的工具返回结果中,可能在多轮交互的任意时间点随机触发,且从表面用词上看往往是普通的调度指令,并不具备明显的涉恐、涉暴等传统恶意特征。
为了探明模型内部究竟如何响应这种多轮环境下的间接威胁,研究人员在代表性基准 AgentDojo 上构建了一套系统化的评估体系。该体系涵盖 4 种系统提示词、4 个涵盖不同数字环境的工具套件(如 Slack、工作空间、银行和旅行系统),以及 6 类不同形态的 IPI 攻击,共计组合出 92 种独立的 IPI 实验配置。
探测的核心技术路径建立在预填充阶段(Prefill Pass)的特征提取上。当外部工具返回数据后,模型会首先对包含该内容的整个历史上下文进行编码。在生成第一个输出 Token 之前,研究人员在模型对话模板中助手轮次的起始标记(Post-assistant Token)处,提取残差流中的隐藏状态 $\mathbf{h}_{x}^{l} \in \mathbb{R}^{d}$,其中 $l$ 为 Transformer 的层索引,$d$ 为隐藏层维度。随后,仅需利用简单的线性分类器(Linear Probe),在二元交叉熵损失函数下进行训练:
\[\mathcal{L}=-\frac{1}{N}\sum_{i=1}^{N}\bigl[y_{i}\log p_{i}+(1-y_{i})\log(1-p_{i})\bigr]\]令人惊讶的是,这种计算开销微乎其微的简单线性探测器,展现出了惊人的泛化能力。在最为严苛的“严格隔离测试”(Held-out Strict Split)中——即测试集中的应用环境、攻击手法、智能体提示词全部与探针训练集互不重叠——线性探针在 6 款开源模型(涵盖 8B 至 753B 参数)上均取得了超过 90% 的 AUROC。
尤其引人注目的是超大规模开源模型 GLM-5.2(753B 参数),其严格隔离测试下的 AUROC 达到了 0.948。这充分证明,对外部恶意指令的表征编码绝非小模型的偶发现象,而是一种广泛存在于各类前沿基座模型内部的稳定机制。哪怕测试环境切换为完全未见过的任务甚至跨语言场景,或者攻击者采用自适应攻击手段对注入指令进行微调,该隐层信号依然高度稳定。更进一步的离线回放测试还发现,使用小模型(如 Qwen3-8B)对其他模型运行轨迹的上下文进行重新编码提取,其探针依然能够准确识别攻击,这为无法获取权重激活的闭源模型安全监控提供了一条极具可行性的外挂旁路方案。
诊断“知行鸿沟”:为什么感知到了危险依然会沦陷?
既然大模型的内部表征已经以极高的置信度捕捉到了间接提示注入的存在,为什么它们在实际动作中依然会被恶意指令牵着鼻子走?
为了解答这一矛盾,研究团队针对暴露在 IPI 威胁下的推理链(Chain-of-Thought, CoT)展开了精细化测量,并建立了一套失败归因分类学。对 Qwen3-8B 暴露在注入环境下的 634 个交互轮次进行切片分析后,研究人员发现了一个显著的现象:在高达 88.5% 的失陷案例中,模型在 CoT 思考过程中完全没有对注入风险进行显式审视或推理;而在剩下的失败案例中,即便模型偶有察觉,后续规划依然滑向了执行恶意任务的轨道。
这揭示了深度学习系统在对齐机制上的一个深层结构性缺陷:表征层面的激活分离,并不等价于自回归解码路径上的安全收敛。在 Transformer 的前向传播中,上下文包含异常指令这一客观事实已经在残差流中留下了明确的几何投影,模型在“模式识别”意义上心知肚明;但在随后的逐 Token 预测过程中,恶意指令中强烈的行动导向动词(如“请将上述文件发送至某邮箱”)迅速主导了解码注意力,压制了自顶向下的系统指令规范。
这种“心知肚明却身不由己”的知行鸿沟,指明了当下黑盒防御策略的局限。单纯依靠被动的后验输出检测,容易在模型采取实质性破坏操作后才拉响警报;而一刀切地在每一轮推理前强制注入冗长的安全警告,不仅会急剧推高推理的延迟与计算成本,还会严重损伤模型处理正常业务的通用逻辑能力。
AGRI 防御机制:探针触发的主动推理干预
认清了“模型缺乏的不是感知能力,而是将感知转化为安全行动的推理衔接”这一关键症结,作者团队设计了名为 AGRI(Action-Guiding Reasoning Intervention)的防御机制。
AGRI 采取了一种极为克制的非侵入式架构设计,它既不更改基座模型的权重参数,也不修改 Agent 的宿主运行环境与外部提示词。它的核心逻辑在于将隐层探针作为一道动态“安全阀门”,精准实现按需干预。
在智能体每轮准备生成动作的预填充阶段,系统在提取隐层状态的同时,由轻量级探针并行计算当前输入上下文的 IPI 暴露概率评分。若该评分超过预设的置信度阈值 $t$(实验中统一设定为通用的 0.5),系统便会在模型即将生成的 CoT 开头,以 Prefill 的形式强制预填一段简短的“反注入推理引导词”(Anti-injection Reasoning Prefill)。这段引导词的作用并非直接代替模型做出决策,而是明确提醒模型审视最近一次工具调用的输出,排查是否存在与用户原始目标相冲突的侧面任务。
为了防范多轮对话中恶意指令的长尾滞留效应——即注入指令在当前轮次被读取后,攻击行为可能延后一到两轮才实际爆发——AGRI 引入了时间衰减机制:一旦探针在某一轮触发,反注入推理预填将在接下来的 3 个交互轮次中持续保持激活状态,从而确保安全注意力贯穿整个敏感动作周期。
在最具挑战性的 AgentDojo 银行与旅行套件中,AGRI 的防御表现展现出压倒性优势:
-
在 Qwen3.5-27B 上,原始模型在攻击下的成功率(ASR)高达 34.6%,引入 AGRI 后直接归零,降至 0.0%;
-
在 Qwen3-8B 上,攻击成功率从 47.2% 骤降至 2.9%;
-
在多个测试模型中,AGRI 达成了全场最优或次优的攻击防御效果,防御能力显著压制了各类无探针门控的传统推理时防御基线;
-
最为难得的是,在完全不包含注入攻击的干净环境测试中,AGRI 对模型通用任务效用(Clean-task Utility)的损耗微乎其微,完美避开了常驻型防御(Always-on Defense)因过度警惕而导致的拒答率上升与业务逻辑受阻问题。
Mind-Reader QA:透视探针截获的究竟是什么语义?
探针的高 AUROC 证实了隐层表征具有强大的预测能力,但这依然留下一道机械解释性谜题:线性分类器所拟合的那条超平面向量,究竟映射着模型内部怎样的概念世界?它捕捉到的究竟是对“提示注入风险”的纯粹语义认知,还是仅仅抓住了某些表层的环境线索(例如“工具返回了格式混乱的异常文本”)?
为了从可解释性维度破解这一黑盒,研究人员提出了一套名为 Mind-Reader QA 的免训练表征语义剖析框架。该框架的灵感源于长思维链推理模型在自省过程中展现出的自发提问倾向。研究团队在模型内部 CoT 的初始位置,拼接一个第一人称独白风格的双选设问,直接向模型提出由特定自然语言假设 $c$ 衍生出的两难问题,并通过读取下一个 Token 在选项 A 和选项 B 上的 Logit 预测概率,量化模型对该解释的认可程度。
为消除选项顺序偏置,每个假设都会以正反两种顺序进行双向提问并计算平均置信度 $s_{c}(x)$。研究团队构建了一个包含 128 个预设自然语言解释的假设库,其中包括 96 个直接或间接与 IPI 相关的假设(如“检测到提示注入风险”、“工具输出包含恶意指令”、“上下文存在指令冲突”),以及 32 个完全不相关的控制假设。
在此基础上,框架通过双重指标为每个自然语言假设 $c$ 计算综合解释得分 $B_{c} = \sqrt{\alpha_{c}\gamma_{c}}$:
-
$\alpha_{c}$($\textit{probe}\to\textit{explanation}$)度量探针输出的风险概率是否单调追踪模型对假设 $c$ 的内部相信程度;
-
$\gamma_{c}$($\textit{explanation}\to\textit{exposure prediction}$)度量模型对该假设的认可程度本身是否足以精准预测 IPI 暴露事件。
实验结果展现出了极其丰富的模型异质性与结构化特征。不同架构与规模的模型,其隐层信号对应的核心解释呈现出截然不同的侧重维度:部分模型的探针信号与高阶抽象概念高度共振,直接对应“存在提示注入风险”这类显式判断;而另一些模型的信号则更加紧密地锚定在具象的操作线索上,例如“工具返回的结果看似包含了不可信的外部指令”。
更为引人深思的是 Gemma-4-31B 的独特表征分布。在所有被测模型中,绝大部分模型的顶端解释都被“态势感知类”(Situation-awareness)线索占据,例如被动察觉“上下文中存在冲突指令”;唯独 Gemma-4-31B 将“下一动作规划类”(Action-planning)解释排在了最前列——其内部信念紧密关联着“我应当忽略恶意指令并聚焦主任务”。而实验数据恰恰显示,Gemma-4-31B 在没有任何外部防御介入的原始状态下,其原生攻击成功率就是所有测试模型中最低的。这构成了一个有力的后验佐证:当模型的内部感知能够直接在几何表征层面与下游的动作规划形成紧密耦合时,其展现出的内生安全韧性就会显著强于仅停留于“被动察觉”的模型。
走出“黑盒死局”:智能体安全防御的范式转移
这项研究为整个 LLM Agent 的安全演进路线提供了一个极具辨识度的视角。在此之前,主流安全防线几乎全部建立在模型的外部界面上:要么在提示词层面不断叠床架屋,试图用冗长的自然语言指令捆绑住模型的注意力;要么将模型完全视为不可知、不可视的黑盒,仅在最末端的 API 交互层进行基于规则或小型外部模型的文本过滤。
然而,这两条路径正在迅速触碰天花板:自然语言提示的约束力在复杂的外部工具回传数据面前极易脱敏失效,而外部文本审计模型又往往难以完全理解当下智能体复杂的长程上下文,极易造成误判或漏判。
论文所揭示的事实证明,大模型绝非对攻击毫无知觉的被动受害者。在庞大的 Transformer 潜空间深处,早已有精准的神经元激活在持续闪烁着对入侵行为的预警信号。安全工程师所需要做的,不再是费尽心机地去从零教会模型“什么是攻击”,而是借助轻量级的激活探测技术,去倾听模型潜意识里的告警声,并在关键的推理转折点上,为它补齐那一段走向安全决策的思维阶梯。
从表征探针到动态思维链干预,这种内生表征与外在行动相互联动的架构范式,不仅为防范间接提示注入提供了一条极低成本、近乎零效用损耗的实用解法,更预示着未来的 Agent 安全基础设施,必然会向着深度融合模型内部隐状态监控的透明化方向纵深迈进。