不改事实也能带偏大模型:国防科大团队揭秘显著性诱导,攻击成功率达83.3%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

不改事实也能带偏大模型:国防科大团队揭秘显著性诱导,攻击成功率达83.3% 论文图示

在针对检索增强生成(RAG)与大模型智能体(LLM Agent)的安全防线中,学术界与工业界长期维持着一个近乎直觉的防御假设:只要外部检索回来的文档每一句话都真实可信,且文本中没有任何“忽略上述指令”之类的提示词注入(Prompt Injection),智能体基于多跳推理(Multi-Hop Reasoning)得出的结论就应该是安全且可靠的。然而,国防科技大学团队在最新研究《Salience Induction against Multi-Hop RAG Agents: Threat and Defense》中打破了这一幻想。他们指出,大模型在阅读长文档与进行实体属性绑定时,极易混淆“显著性”(Salience)与“相关性”(Relevance)。攻击者无需捏造任何虚假事实,也无需写入任何控制指令,只需微调真实句子的位置、结构排版或语气,就能悄然诱导大模型智能体走向错误的推理分支。

ArXiv URL:https://arxiv.org/abs/2607.17535v1

这项工作系统性地定义并验证了针对多跳 RAG 智能体的第三种攻击面——显著性诱导(Salience Induction)。在严格保持全部陈述真实性、且编辑预算受限的前提下,针对 GPT、Claude、Gemini、DeepSeek、Qwen 等主流模型家族及多种主流智能体架构,显著性诱导在基准测试中取得了高达 83.3% 的攻击成功率;而现有主流防御手段在此类攻击面前几乎形同虚设,防御后的攻击成功率仍高达 75.7%。针对这一隐蔽威胁,研究团队同时提出了一种无需调用大模型、零推理开销的输入端防御策略——显著性归一化(Salience Normalization),成功将攻击率压制至 15.3%。

图1:显著性诱导攻击的激励示例。通过位置调整、加粗强调等四项保真编辑,模型推理注意力被引导至干扰实体链条。

现有安全防御的盲区:显著性与相关性的解耦

传统 RAG 系统在处理知识密集型问答时,通常依赖单次检索匹配。但在面对复杂决策时,当前的系统更多走向了智能体化(Agentic RAG):模型不仅要检索一次,还要在多篇文档之间进行多跳实体跳转。比如,为了回答“PRADAXA 的有效成分拮抗剂是什么?”,智能体必须先在第一跳从药物说明文档中将“PRADAXA 的有效成分”绑定为“达比加群(dabigatran)”,再以该有效成分为关键词发起第二次检索,最终找到其对应的特异性逆转剂“依达赛珠单抗(idarucizumab)”。

在这种环环相扣的多步推理过程中,中间步骤的实体绑定一旦发生偏差,就会在下游检索中引发级联放大效应。以往针对 RAG 的对抗研究主要集中在两类显性攻击上:第一类是内容投毒(Content Poisoning),攻击者在知识库中插入捏造的假事实,诱导模型得出错误结论;第二类是间接提示词注入(Indirect Prompt Injection),攻击者在检索文本中植入指令代码,劫持智能体的控制流。这促使业界开发出事实核查模型、控制流监视器以及指令过滤器等防御基线。

这些防御机制天然存在一个共同的漏洞盲区:它们只核查内容说了什么,却忽略了内容被如何呈现。在关系数据库中,系统查询数据依靠的是显式的模式约束(Schema),查询结果取决于键值对之间的硬性对应关系,与字号、排序或上下文无关。但大语言模型缺乏显式的外部模式注册表,它在阅读自由格式的自然语言时,必须在推理阶段动态推断对象与属性的绑定关系。正是在这一过程中,模型极易产生认知偏差,将文本表面呈现的显著性信号错误地当成推理逻辑上的相关性。

当真实世界中的上游文档(如维基百科词条、公司年报、医疗参考指南或内部协作知识库)允许半开放编辑时,攻击者完全可以在不触犯任何事实校验规则的前提下,通过巧妙重组真实句子的呈现方式,构造出一个极具吸引力的“诱饵实体”(Decoy Entity)。这种显著性诱导既不包含虚假事实,也不包含指令性载荷,甚至在确定性解码下具有极高的跨步骤稳定性,使得现有的事实一致性校验与自洽性投票(Self-Consistency)彻底失效。

属性绑定的数学形式与攻击机制

为了从机理上解释大模型为何会被真实文本带偏,论文将智能体在文档内部的实体属性绑定过程抽象为一个决策模型。假设输入给智能体的问题为 $Q$,目标查询的属性槽位为 $\sigma$(例如某种药物的有效成分或某家子公司的母公司),检索回来的上下文文档为 $D$,其中包含若干候选实体 $E(D) = {e_1, \dots, e_n}$。智能体最终选择绑定的实体 $\hat{e}$ 可以表示为:

\[\hat{e} = \arg\max_{e \in E(D)} B(e \mid Q, \sigma, D)\]

其中绑定评分函数 $B(e \mid Q, \sigma, D)$ 被形式化为语义相关性 $R$ 与表面显著性 $S$ 的线性加权组合:

\[B(e \mid Q, \sigma, D) = \alpha \cdot R(e; Q, \sigma, D) + \beta \cdot S(e; Q, \sigma, D)\]

在此公式中,$\alpha$ 与 $\beta$ 分别反映了大模型在特定训练配置下对语义逻辑与表面线索的敏感权重比。如果文档中存在一个正确的黄金实体 $e^$ 和一个精心设计的诱饵实体 $e^\dagger$,两者在语义相关性上的差距为 $\Delta R = R(e^; Q, \sigma, D’) - R(e^\dagger; Q, \sigma, D’)$,而在表面显著性上的差距为 $\Delta S = S(e^\dagger; Q, \sigma, D’) - S(e^*; Q, \sigma, D’)$。攻击成立的充要条件便是:

\[\alpha \cdot \Delta R < \beta \cdot \Delta S\]

这一定量关系揭示了攻击的本质:攻击者并不需要改变客观知识,只要目标问题存在一定的语义歧义(即 $\Delta R$ 相对较小,诱饵实体与查询槽位的类型高度契合),且文档结构允许通过排版或句序调整拉大显著性差值 $\Delta S$,攻击者就能利用 $\beta \cdot \Delta S$ 的增量彻底覆盖模型本身的语义判断。

更关键的是,这种绑定错误在多跳智能体中会产生灾难性的复合扩散。若一次推理链条包含 $k$ 个跳跃节点,每个节点的独立绑定错误率为 $p_i$,整条推理链路被彻底污染的概率将遵循:

\[P(\text{chain corrupted}) = 1 - \prod_{i=1}^{k}(1 - p_i)\]

在真实业务场景中,一旦智能体在第一跳中将查询关键词错误绑定到了诱饵实体上,随后的第二跳检索便会围绕该诱饵实体展开,导致智能体顺理成章地搜集并汇聚与诱饵相关的真实证据。最终生成的回答虽然与原始问题南辕北辙,但在下游证据链条上却表现得严丝合缝、完全自洽,甚至连引用的所有事实都真实可查。

闭环提议-验证架构与六类保真编辑算子

为了实现完全可审计、受控的显著性重分配,本文提出了六类保真编辑算子(Salience-Editing Operators)。这些算子涵盖了文本呈现的四个子维度:位置、语气、结构排版与语义邻近度。

第一类算子着眼于位置层面的调整,包括向前提升(Promote)与向后沉降(Demote)。前者将包含诱饵实体的真实陈述移动到文档最前端或段落核心位置,利用大模型普遍存在的首因效应(Primacy Effect);后者则将指向正确答案的关键证据和反面线索移动到文本尾部的附录或低注意力区域。第二类算子针对语气线索,包括确定断言(Assert)与模糊对冲(Hedge)。攻击者将陈述诱饵实体关系的句子从轻度推测转为强确定性语气,同时将描述正确答案的句子加入合规的谨慎措辞。

第三类算子关注视觉排版结构,即突出强调(Emphasize),例如对诱饵实体及其关联特征使用加粗、下划线或列表化处理,直接提升其在长文本中的局部 Token 关注度。第四类也是最具策略性的算子是语义架桥(Bridge)。该算子在文档中补充一条在物理世界中完全真实的背景句子,将当前讨论的主题实体与诱饵实体联系起来,从而人为拉近它们在语义向量空间中的邻域距离。

图2:显著性诱导闭环提议-验证攻击流水线。攻击者根据智能体的可观测行为,迭代提出保真编辑,并通过约束验证器持续调整文档。

为了协同调用这六种算子,研究团队构建了一个黑盒闭环攻击系统(Proposer-Verifier Pipeline)。攻击者并不需要获取受害者模型的参数或内部注意力权重,只需观察智能体在各轮交互中暴露出的动作流(例如发出的检索查询词)。系统主要包含以下三个步骤:

第一步,提议器(Proposer)分析当前受害者智能体的行动轨迹,定位其最具脆弱性的多跳绑定节点,并挑选最合适的算子生成针对该文档的微调版本。第二步,验证器(Verifier)对生成的文本施加两道不可突破的硬性防线:事实性约束 $\mathcal{C}{\text{fact}}$ 与无指令约束 $\mathcal{C}{\text{instr}}$。验证器会通过基于蕴含分析的核查工具,确保没有凭空引入虚假信息,同时通过规则扫描确认文本中不含任何指令性词汇。第三步,预算检查器严格限制编辑距离,确保替换和移动句子的总体字数不超过文档总长度的限定比例(如 30%)。只要受害者智能体在文档输入后依然正确绑定了黄金实体,该流水线就会带着反馈继续迭代,直至观测到智能体的检索行为彻底偏离原始路径。

SalientWiki-MH 基准与跨模型泛化评估

为了系统性地量化这一攻击面,现有的 HotpotQA 或 MuSiQue 等多跳问答数据集显得捉襟见肘,因为它们通常仅提供简短的文本切片,并未在文档内部显式标注具备同类型竞争力的诱饵实体。为此,研究团队基于金融与医疗两个高价值垂直领域,构建了专门的多跳评测基准 SalientWiki-MH。

在基准构建中,团队利用 Wikidata 的结构化关系抽取了典型的三跳实体路径(例如公司所有权归属、上市交易所分布、药物分子成分、对应适应症及生产厂商等),并检索出维基百科中对应的完整文档。每个样本均被严格要求包含至少两处高度可信的局部诱饵实体。评测最终划分出 144 个经过分层抽样的基准测试集(包含 72 个金融样本与 72 个医疗样本)。值得注意的是,为了保证实验的科学性与严肃性,只有在干净环境下能够顺利完成全流程推理、给出正确最终答案的样本,才会被列入受害候选集,彻底排除了大模型自身先验知识缺陷导致的偶发错误。

评估实验横跨了包括 GPT、Claude、Gemini、DeepSeek 和 Qwen 在内的五大主流前沿模型家族,同时覆盖了 ReAct、Reflexion 和直接工具调用(Tool-Calling)三种智能体设计架构。

实验数据表明,在 30% 的编辑预算限制下,显著性诱导在 GPT-5.1 ReAct 智能体上取得了 83.3% 的无目标攻击成功率(Untargeted ASR),将智能体从正确的黄金推理链上强行拽离;即便要求模型必须精确绑定到攻击者指定的特定诱饵实体上(Targeted ASR),成功率依然达到了 52.1%。更引人深思的是防御对比测试:研究人员部署了目前业界最强的基线防御方案,包括输入文本真实性交叉比对工具和指令注入探测器,然而在经历防御后,受害者智能体的被攻击成功率仍高达 75.7%。这证明了单纯依赖内容真实性校验和提示词过滤,完全无法抵御基于显著性通道的语义重构。

破解之道:输入端显著性归一化

既然大模型容易在特征绑定时将“显眼”误认为“相关”,且攻击发生于信息输入智能体之前,那么防御的重心就必须前移至推理发生之前的文档预处理阶段。如果等到智能体已经根据错误的实体发出了下一次检索请求,级联扩散往往已经不可逆转。

研究团队借鉴了经典系统安全中的通道分离(Channel Separation)思想:如同在 SQL 防注入中使用参数化查询将代码与数据剥离,在防止跨站脚本(XSS)时使用 HTML 转义将内容与脚本解耦,防御显著性诱导的核心在于切断表面显著性信号的传输通道,使文本的呈现恢复到近乎中立的底色。基于此,本文提出了名为显著性归一化(Salience Normalization, SN-1)的防御组件。

SN-1 作为一个无状态的轻量级预处理插件,在检索文档返回后、进入大模型上下文之前发挥作用。它完全不需要调用额外的大模型进行二次推理,因而在计算上保持着极高的执行效率(单篇文档处理延迟低于 50 毫秒,时间复杂度为 $O(n)$)。它主要执行以下几项确定性的结构抹平操作:

首先,针对排版结构,它全面剥除 Markdown 加粗、斜体、下划线及人工项目符号,清除由视觉样式带来的局部权重畸变;其次,针对段落位置,它以段落或命题句子为粒度进行可控的随机打散与重组,消除智能体由于预训练或对齐机制带来的首因效应偏好;再次,利用预设的词表与轻量级规则,中和文本中诸如“显而易见”“毋庸置疑”等过度断言的副词修饰,同时清理刻意引入的不寻常关系限定词。

实验结果验证了这一防御机制的鲁棒性。在引入 SN-1 预处理后,标准显著性诱导攻击的成功率直接从 83.3% 骤降至 15.3%。为了进一步检验防御的极限深度,研究人员还设定了一个完全知晓 SN-1 内部词表、规则和随机化策略的白盒自适应攻击者(Adaptive Attacker)。即便攻击者避开了所有预设规则词、试图采用更为隐蔽的句式结构进行对抗,SN-1 防御下的攻击成功率也仅微升至 23.6%,充分展现出显著性归一化在低计算开销下的防御韧性。

从内容保真迈向认知保真

显著性诱导的提出,标志着针对大模型智能体的安全攻防进入了一个更加幽微的深水区。它清楚地表明,大模型的认知脆弱性不仅仅体现在面对谎言时的辨别力不足,更体现在其内在推理机制对语用环境线索的过度敏感。

在很多复杂的企业级应用中,知识库的维护往往是去中心化的,任何被授权的部门、合规的第三方供应商甚至经过身份验证的普通用户,都可以在不篡改任何关键数据、不编写恶意提示词的情况下,仅仅通过优化自身业务文档的表述次序或字体版式,就能在无形中操纵下游 AI 辅助决策系统的推荐流与事实绑定链条。这种攻击方式甚至可以在事后逃避绝大多数法律与合规审计,因为攻击者提交的每一段文本从字面意义上看都完全属实。

这也给未来 Agentic RAG 的系统架构设计带来了明确的启示:对检索上下文的处理,绝不能仅仅停留在“去伪存真”的内容通道过滤上。建立对文本排版、句序敏感度的免疫机制,在推理前对显著性通道进行正规化处理,以及在底层模型训练中逐步降低表面特征对实体绑定的权重影响,将成为构建真正安全可靠的多跳智能体系统不可或缺的一环。