CoRL:双向协同强化学习击破自适应注入,将攻击成功率降至0%
CoRL: Co-Evolutionary Reinforcement Learning for Adaptive Indirect Prompt-Injection Attacks and Defenses

在赋予大语言模型调用外部工具、浏览网页和读写数据库的能力后,间接提示词注入(Indirect Prompt Injection,简称 IPI)已经成为大模型智能体最棘手的安全隐患。与直接在输入框中诱导模型越狱不同,间接注入将攻击指令隐藏在不受信任的第三方数据中——可能是一封伪造的日程邮件,也可能是网页搜索结果中的一段特殊文本。当智能体读取这些数据时,隐藏的恶意指令就会篡夺执行流,诱导智能体盗取敏感信息或滥用工具。更为棘手的是,现实环境中的攻击者不会只使用静态模板,而是会观察智能体的中间调用轨迹,动态调整注入位置和载荷(Payload)。面对这种“自适应攻击”,现有的防御策略往往顾此失彼:要么在新型攻击策略前迅速失效,要么因过度对齐而走向极端,对任何包含外部内容的请求一概拒答,彻底摧毁智能体的任务效用。
ArXiv URL:https://arxiv.org/abs/2609.07529v1
针对这一困境,华南理工大学的研究团队提出了 CoRL(Co-Evolutionary Reinforcement Learning)框架,尝试从博弈论和动态演化的视角彻底重塑防御体系。研究团队没有将防御视为单纯的监督分类或静态微调,而是将多轮自适应注入形式化建模为一个非对称、部分可观测的一般和马尔可夫博弈(Markov Game)。在这个博弈中,攻击者与防御者在真实的工具交互环境中展开双向强化学习对抗;随后,系统利用对抗演化过程中保留的历史攻击者池挖掘防御盲区,并通过通过验证器校验的教师示范进行定向修复。
实验结果表明,在涵盖 7 个领域的 1,514 次基准执行测试中,CoRL 将针对智能体的自适应攻击成功率(ASR)从基线模型的 38.5% 彻底压制到 0.0%,同时将任务效用(Utility)从 63.2% 提升至 76.3%,在兼顾安全性的同时真正保留了智能体的执行能力。

将自适应注入重构为非对称马尔可夫博弈
要攻克自适应注入,首先要看清它与传统注入的本质差异。以往的安全评测大多假设攻击载荷是一次性、静态植入的,但现实的多工具交互往往包含多个步骤。如图 1 所示,当智能体执行“购买商品”的任务时,攻击者第一次在工具返回的商品详情中尝试注入窃取一次性密码(OTP)的指令,但被智能体忽略;此时,自适应攻击者能够观测到公开交互历史,意识到首次尝试失败,进而在后续的支付回调工具返回中调整策略,发起二次注入。智能体可能正常完成了购物流程,却在不知不觉中泄露了验证码。
这就构成了攻击者与防御者之间的非对称动态博弈:
-
动作空间的非对称性:防御者(智能体)贯穿多步轨迹的始终,负责解析用户指令并调用环境工具;而攻击者仅在智能体访问到预设的污染注入点(Injection Sites)时介入,将恶意载荷拼接进工具返回值中。
-
信息结构的非对称性:攻击者无法直接窃看防御者的内部思维链(Thinking Process)、系统提示词(System Prompt)或模型权重,它只能依赖公开的历史工具调用轨迹和自身前序尝试的反馈来推断防御者的状态。
-
回报结构的一般和性(General-Sum):智能体安全防御的目标并不是简单的零和博弈。攻击成功固然意味着防御失败,但防御者的最高回报必须同时满足两个条件——“成功抵御攻击”且“完整达成用户任务”。如果智能体因为恐慌而直接拒绝服务(Safe Failure),虽然攻击没有得逞,但其效用回报依然会被扣分。
基于这种设定,每一个交互任务都被形式化为一个有限时步的元组 $c=(s_0, x, g, C_g, Z, d, \mathcal{V}_x, \mathcal{V}_g)$,其中绑定了确定性的安全验证器 $\mathcal{V}_g$ 与任务验证器 $\mathcal{V}_x$。两个验证器独立判定,使得轨迹最终可能出现“任务完成但被攻破”、“安全阻断但任务失败”、“既安全又完成任务”等多种状态。这为后续强化学习的奖励塑形提供了客观、无偏的数学基础。
CoRL 框架:发现与修复的“三阶段”闭环
针对博弈双方共同演化中极易出现的灾难性遗忘与最新对手过拟合(Overfitting to the Latest Opponent)问题,CoRL 提出了由浅入深的三个训练阶段:攻击者冷启动、双向协同强化学习(Co-PPO)以及基于种群引导的防御者修复微调。

第一阶段:攻击者有监督初始化(Attacker SFT)
多轮博弈强化学习如果从完全随机的策略开始探索,攻击者往往很难在广阔的工具调用空间中盲测出有效的载荷,从而导致强化学习初期出现极度稀疏的奖励信号。为了打破这一僵局,研究团队首先利用能力更强的大模型(如 DeepSeek V4 Pro 和 Seed2.0)在训练配置上对基础防御模型发起对抗攻击,生成候选交互轨迹。
安全验证器随后对这些轨迹进行严格审查,只有完全满足可执行攻击契约(Executable Attack Contract)的样本才会被保留。接着,攻击者基座模型在这些经过验证的轨迹上进行多轮序列级有监督微调,得到初始攻击策略 $\pi_A^0$。这种初始化确保了攻击者一出场就具备将历史尝试作为上下文、依据公开轨迹调整后续注入的基本能力,避免了前期的无效探索。
第二阶段:双边 Co-PPO 与历史对手池
进入核心的在线对抗阶段,攻击者与防御者被置入同一个沙盒中同步演进。为了避免单一强化学习智能体过度适应最新版本的对手而丧失对早期攻击形态的鲁棒性,CoRL 引入了双向历史对手池(Historical Opponent Populations)机制。
在每次环境交互启动时,系统按照预设概率采样对战组合:
-
当前攻击者 vs 当前防御者(占比 40%)
-
历史攻击者池 vs 当前防御者(占比 25%)
-
当前攻击者 vs 历史防御者池(占比 25%)
-
静态模板攻击 vs 当前防御者(占比 10%)
双方智能体各自维护独立的价值网络(Critic),采用掩码 PPO(Masked PPO)进行更新。由于在一个多轮轨迹中防御者和攻击者交替生成 Token,CoRL 实现了严格的 Token 级掩码:各自的策略损失、价值损失与 KL 散度仅在自己生成的 Token 位置上计算,未激活角色的 Token 不会推进广义优势估计(GAE)的时间线。
为了精确引导双方的博弈走向,终局回报函数被设计得极具约束力:
对于攻击者而言,其终局奖励 $R_A(\tau)$ 主要由攻击验证器指示符 $I_{\mathrm{atk}}$ 决定,若未攻破但严格符合输出格式,则给予极微弱的格式奖励(+0.05)。
对于防御者而言,终局奖励 $R_D(\tau)$ 划分出清晰的优先级:
\[R_D(\tau) = \begin{cases} 1.0, & I_{\mathrm{atk}}=0 \land I_{\mathrm{task}}=1 \\ -0.2, & I_{\mathrm{atk}}=0 \land I_{\mathrm{task}}=0 \\ -1.0, & I_{\mathrm{atk}}=1 \end{cases}\]这种奖励函数设计传递了一个明确的信号:被攻破是底线失守(-1.0),全面拒答导致任务失败也是负向反馈(-0.2),唯有在阻断攻击的同时正确完成工具调用,才能赢得最高奖赏(+1.0)。在对战过程中,表现优异的历史检查点通过严格的按领域分层准入机制进入对手池,持续为双方提供多样化的对抗压力。
第三阶段:种群挖掘与防御者 SFT 修复(Defender SFT)
尽管 Co-PPO 显著增强了双方的攻防策略,但强化学习探索产生的策略在应对复杂多变的工具调用指令时,可能在特定边界用例上出现语言表达和工具参数格式的微小漂移。更为关键的是,经过第二阶段筛选出的保留攻击者池(Retained Attackers)实际上构成了一个极具针对性的大规模漏洞挖掘红队。
在第三阶段,研究团队让更强大的教师模型(如 GLM-5.2 与 DeepSeek V4 Pro)在沙盒中直面这些经过演化洗礼的攻击者池,去完成相同的训练任务。只有当教师模型在遭遇攻击时完全达成 $I_{\mathrm{atk}}=0$ 且 $I_{\mathrm{task}}=1$、且正常终止的完整轨迹,才会被沉淀为高质量修复数据。最终,以 Co-PPO 产出的防御者检查点为底座,利用这些通过双重验证的教师轨迹进行最后一轮掩码交叉熵微调,从而将对抗演化中暴露出的防御盲区彻底修复并固化到模型参数中。
0% 攻击成功率背后的安全与效用权衡
为了验证 CoRL 的实战能力,评估工作在涵盖银行、日程、电子商务、智能家居等 7 个真实业务领域的混合基准上展开。评测不仅涵盖无攻击的纯净环境(Clean),还囊括了 4 套官方静态注入模板以及由对抗模型实时驱动的自适应攻击(Adaptive),每个防御模型累计经历 1,514 次完整的沙盒执行考验。

在评估指标中,研究团队不仅关注常规的任务效用率(Utility, U)和攻击成功率(Attack Success Rate, ASR),更聚焦于二者结合的核心指标——安全效用率(Safe-U),即智能体在未被攻破的前提下成功完成任务的概率 $I_{\mathrm{task}}(1-I_{\mathrm{atk}})$。
实验数据勾勒出了极其鲜明的技术递进趋势:
-
基座模型(Qwen3.5-9B)的脆弱性:在遭遇自适应攻击时,未加防护的基础模型 ASR 飙升至 40.52%,即便包含无攻击情况,总体 ASR 也高达 38.52%,此时的安全效用率仅有 53.07%。
-
纯防御强化学习的瓶颈:如果仅让防御者在静态模板上进行单向 PPO 训练,面对未见过的自适应攻击时,ASR 依然徘徊在 28.56%,Safe-U 仅能恢复到 61.33%。这印证了静态防御策略无法对抗具有环境感知与动态调整能力的攻击者。
-
无历史对手池的对抗退化(NoPop):如果在协同演化中去除了历史对手池,让当前的攻击者与防御者单纯进行“最新版本对抗”,模型的最终指标全面劣于 Co-PPO。其自适应攻击下的 Safe-U 仅为 57.88%,充分暴露了最新对手过拟合所带来的盲区遗忘问题。
-
CoRL 的全面突破:当完整的 CoRL 流程执行完毕后,在面对通用自适应攻击时,攻击成功率(ASR)直接归零(0.00%),安全效用率从基线的 53.07% 跃升至 75.40%;在整体评估维度上,整体 ASR 降低 38.5 个百分点至 0.0%,效用提升 13.1 个百分点达到 76.3%。
值得注意的是,CoRL 在纯净任务(Clean)下的效用不仅没有因为严格的安全对齐而下降,反而稳定在 82.80%,高于基座模型的 80.89%。这有力地击碎了“安全对齐必然牺牲基础效用”的宿命论,表明通过精准的奖励塑造和教师引导,模型学会了真正区分“合法工具数据”与“恶意注入指令”,而不是简单粗暴地采取拒绝策略。
深度解构:强化学习初始化与修复数据谁的贡献更大?
为了厘清最终的惊人提升究竟来源于在线协同强化学习(Co-PPO)赋予的模型权重,还是归功于第三阶段的高质量教师示范数据,作者设计了一组极其严密的 $2 \times 2$ 控制消融实验。实验固定了微调训练的数据量、优化步数、损失函数和教师模型,仅交叉改变两个变量:
-
初始化权重:使用未经强化的基座模型(Base)还是 Co-PPO 训练后的检查点?
-
示范数据源:使用常规静态攻击下收集的修复数据,还是利用第二阶段演化出的攻击者种群对抗收集的数据?
实验划分出的四种组合揭示了关键机理:
-
仅将普通修复数据替换为种群挖掘数据,模型的自适应安全效用率提升了 8.00 个百分点,ASR 压低了 9.01 个百分点。
-
仅将初始权重从基座替换为 Co-PPO 权重,自适应 Safe-U 提升了 6.07 个百分点,ASR 压低了 5.98 个百分点。
-
当二者双剑合璧(即完整的 CoRL 方案)时,Safe-U 在基线基础上实现了大幅跃升,分别比单项改进多出 8.42 和 10.36 个百分点。
这一消融结果给出了清晰的机制解释:在线协同演化的价值是双向的。在防御端,Co-PPO 改变了模型的隐层表征,使其具备了抵御多轮试探的底层动态策略;在攻击端,Co-PPO 沉淀下的攻击者种群充当了顶级的“自动化漏洞雷达”,唯有依靠这些狡猾的攻击者,才能在第三阶段逼出高质量教师模型在极端边缘工况下的防御示范。
历史对手池联合测试:真正的安全边界在哪里?
在主实验中,面对由单个选定检查点构成的通用攻击者,CoRL 取得了令人惊叹的 0.0% ASR。但这是否意味着防御模型已经坚不可摧?研究团队并没有停留在漂亮的表面数据上,而是展示了极具学术诚信的严苛测试——历史攻击者种群联合攻击测试(Population-Union Evaluation)。
在这一测试中,同一道测试题只要被历史对手池中任意一个演化出来的攻击者攻破,该样本就被判定为失守。实验表明,当面对整个历史攻击者池的围攻时,采用普通修复的基线模型联合被攻破率高达 23.00%;而 CoRL 展现出了极高的鲁棒性,将这一数字压低到了 4.97%。
从单体攻击下的 0.00% 到种群联合攻击下的 4.97%,这一细微回升恰恰揭示了对抗性安全的客观现实:在开放的工具交互世界中,并不存在一劳永逸的“绝对免疫”。不同代际、不同变异方向的攻击者会探索出截然不同的注入拓扑。CoRL 通过引入历史对手池,最大程度收缩了防御者的受攻击面,但攻防对抗本质上是一场没有终局的动态演化。
此外,为了验证防御能力是否具备跨域泛化性,团队将模型部署到了未参与训练的外部基准 InjecAgent 和 AgentLAB 上。在无需针对性调优的情况下,CoRL 在外部基准的直接危害(Direct-Harm)与数据窃取(Data-Stealing)场景中均保持了显著优于基线模型的抗攻击转移能力;在混合多攻击源的 Task-Injection 协议下,任务成功率同样录得明显优势,证明了该机制学到的是通用的工具调用安全上下文区分能力,而非单纯对特定沙盒环境的语义过拟合。
总结与展望
CoRL 的工作为大模型智能体安全提供了一套极具实操价值的范式转型。过去,安全研究往往陷入“手工编写规则—收集新型越狱提示词—微调修补”的被动追赶路径,不仅滞后于新型攻击手法的涌现,而且极易破坏模型原本的指令遵循能力。
通过将智能体沙盒内的多轮交互确立为非对称马尔可夫博弈,CoRL 证明了双向演化强化学习不仅能持续锻造更敏锐的红队攻击者,更能成为安全防御演进的核心引擎。其价值不仅在于提供了一个在基准测试中将注入攻击压制到极限的防御模型,更在于确立了“在演化博弈中暴露缺陷,以双重校验教师数据闭环修复”的自动化系统工程框架。随着未来智能体被授予越来越多的金融交易、系统管理和代码执行权限,这种基于自主演化与动态博弈的安全防御范式,正在成为智能体迈向高可靠生产环境不可或缺的底层护栏。