Trident:不是防御不够强,而是7B模型把DRL安全防线击溃522%
Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

在网络安全攻防对抗的前沿,自主网络防御(Autonomous Cyber Defense, ACD)一直是学术界和工业界共同瞩目的焦点。近年来,深度强化学习(Deep Reinforcement Learning, DRL)被寄予厚望,研究人员训练出大量能够实时监控网络流量、在部分可观测网络中隔离受感染主机、部署蜜罐诱饵的智能蓝队防御代理。这些 DRL 防御模型在现存基准测试中表现亮眼,似乎已经筑起了一道坚固的高墙。
ArXiv URL:https://arxiv.org/abs/2608.04317v1
然而,来自约翰斯·霍普金斯大学(Johns Hopkins University)、东北大学(Northeastern University)和加利福尼亚大学欧文分校(UC Irvine)的联合研究团队在一篇最新论文中撕开了这种表面的安全繁荣。论文明确指出:现存的 DRL 自主防御系统之所以看起来坚不可摧,完全是因为它们的测试对象是一群“提线木偶”——基于固定状态机和静态启发式规则编写的传统红队攻击脚本。一旦面对具备动态推理能力的大模型红队,这些耗费海量算力训练出来的蓝队模型便迅速陷入全面瘫痪。
为了打破这种盲目自信,研究团队推出了名为 Trident 的智能体红队对抗基准与训练框架。该研究首次将基于可验证奖励的强化学习(RLVR)引入网络安全攻防对抗,并采用“代码即策略”(Code-as-Policy)架构,把红队训练从极其缓慢的分步决策重构为高效的上下文多臂老虎机问题。令人震撼的实验结果表明:仅依靠一个经过训练的 7B 参数轻量模型(Qwen2.5-7B-Instruct),Trident 就让当前最顶尖的 DRL 蓝队防御性能平均断崖式暴跌 522%,并自主涌现出诸如规避蜜罐诱饵、自适应关键节点优先渗透等高阶攻击行为。

虚假的安全感:为什么主流 DRL 防御一碰就碎?
在传统网络安全博弈中,防御方通常将任务建模为分散式部分可观测马尔可夫决策过程(Dec-POMDP)。在这个数学形式下,防御智能体团队在局域网络中分布,只能看到本机的局部日志和警报,需要协同采取动作来清洗被黑客植入后门的节点,或者激活虚假服务。然而,在这个严苛的数学框架下,红队渗透者在过去的基准(例如 CybORG CAGE 4 或 CyberWheel)中从未被赋予对等的学习能力。红队的行为逻辑往往只是固化的 Python 代码或状态转移字典,无论外部网络环境如何变化,红队都只能按固定的先后顺序扫描网段、尝试漏洞提权。
这种评测设定存在致命的偏差:蓝队智能体在数百万步的强化学习训练中,本质上是在拟合特定攻击脚本的行为指纹,而非真正学会了防范黑客策略。蓝队策略隐含着对红队行为模式的强先验,一旦对手稍微改变渗透路径或攻击节奏,防御策略的底层缺陷就会瞬间暴露。
虽然大语言模型(LLM)展现出了令人惊艳的代码编写与推理能力,但在网络安全对抗领域,直接将大模型接入对抗模拟器却面临双重困境。一方面,如 ReAct 架构这般的步进式大模型智能体,在每个模拟器时间步都要调用一次大模型进行推理解析,这在包含成百上千步的复杂网络对抗中会带来灾难性的推理延迟与工程成本;另一方面,过往的网安大模型大多停留在静态的 CTF 答题、漏洞利用复现或离线监督微调(SFT)上,缺乏能够与动态防御者产生实时反馈、获取客观奖励的环境基础设施。DeepSeek-R1 等工作证明了 RLVR 在数学推导和代码合成中的威力,但在安全博弈领域,缺乏稳定的对抗沙箱和可验证信号一直是无法逾越的鸿沟。
范式重构:将步进对抗化为“代码即策略”
为了突破大模型在长程网络对抗中的算力瓶颈,Trident 采取了一种极具颠覆性的建模思路:不再让大语言模型一步一步去下达“扫描端口”“利用漏洞”等底层原子动作,而是直接采用“代码即策略”(Code-as-Policies)思想。
红队攻防的完整博弈过程在数学上被降维重构为一个上下文多臂老虎机(Contextual Bandit)问题。给定当前的网络拓扑概况、历史攻防日志以及目标说明作为上下文 $C$,大模型策略 $\pi_{\theta}$ 在单次前向传播中直接生成一整套完整的、可执行的 Python 策略代码 $c$。随后,这段代码被整体部署进沙箱模拟器中,与活体 DRL 防御模型进行长达数百步的动态交互,直到对抗彻底结束。整个生命周期内累积的环境得分与攻防事件计数,被整合为一个确定的标量奖励,反哺给大模型进行策略优化。
其目标函数可以形式化地表示为在特定上下文 $C$ 下最大化生成策略 $c$ 的期望回报:
\[J(\theta)=\mathbb{E}_{c\sim\pi_{\theta}(\cdot\vert{}C)}\left[\mathbb{E}_{\tau\sim\pi_{c}}\left[\sum_{t=0}^{T}\mathcal{R}(s_{t},a_{t})\right]\right]\]在这个公式中,内层的期望 $\mathbb{E}{\tau\sim\pi{c}}$ 蕴含着现实网络对抗固有的多重随机性:即便大模型生成的 Python 脚本 $c$ 本身逻辑是确定的,由于网络传输的随机延迟、非确定性的环境跃迁 $\mathcal{T}$,以及在线 DRL 防御模型的概率性干预,实际演化出的攻防轨迹 $\tau$ 依然是高度随机的。这种设计既避开了单步大模型调用的巨大时延,又保留了大模型在高级语义控制流、分支判断和异常处理上的宏观规划能力。
为了端到端优化这一生成策略,Trident 采用了类似 DeepSeek 实践中的分组相对策略优化(Group Relative Policy Optimization, GRPO)。对每一个输入的对抗上下文 $C$,系统从当前策略中并行采样生成 $G$ 个不同的攻击策略代码 ${c_1, \dots, c_G}$,并送入沙箱与 DRL 防御方厮杀。系统通过归一化各策略获得的可验证奖励来计算优势函数 $A_i$:
\[A_{i}=\frac{r_{i}-\text{mean}(r_{1},\dots,r_{G})}{\text{std}(r_{1},\dots,r_{G})}\]通过剪裁替代目标(PPO 风格的 Objective)和 KL 散度约束,模型在不依赖任何额外 Critic 价值模型的情况下,仅凭执行日志的客观奖励信号就能持续迭代自己的战略战术。

三位一体架构:日志压缩、战术规划与代码落地
让一个通用的 7B 小模型直接读懂长达数万行的原始网络报文并生成零语法错误的渗透代码,显然是不切实际的。为此,Trident Agentic 设计了精妙的三位一体(Tripartite)分工体系:Log Summarizer(日志总结者)、Planner(战术规划者)与 Coder(代码编写者)。这种职责分离的架构将可微的学习负担完全集中在最关键的模块上,使得仅需微调极小参数量即可撼动复杂系统。

第一步是日志观察与状态提炼。在真实的内网渗透中,原始系统日志充斥着冗余的调试信息和噪声。冻结的 Log Summarizer(由 Qwen2.5-14B-Instruct-AWQ 驱动)负责接收并清洗这些来自环境沙箱的轨迹输出。它将复杂的报文结构化压缩为关键网络态势:哪些主机已被获取权限、哪些端口被阻断、对方防御者在哪些子网频繁重置凭证。
第二步是战略推演与抽象决策。经过压缩的状态概要被递交给唯一的可训练核心——Planner(采用 Qwen2.5-7B-Instruct,参数为 $\pi_{\theta}$)。在这个阶段,Planner 不直接碰触底层的 Python 语法细节,以防分散其战略推理注意力。Planner 输出的是结构严密的战略 JSON 规范,包括攻击优先级的权重调整、对可疑蜜罐节点的绕过意图、以及在不同渗透失败场景下的备用转移分支。
第三步是将战略编译为机器逻辑。冻结的 Coder(采用专攻代码的 Qwen2.5-Coder-7B-Instruct)接收到 Planner 的战略 JSON 和严格的 API 白名单约束后,将其翻译为能够无缝挂载到 CAGE 4 或 CyberWheel 模拟器环境中的原生 Python 类。为了避免大模型常见的语法幻觉导致训练中断,Trident 引入了带沙箱预检的自修复循环(Self-Repair Loop)。代码在正式与防御者对战前会进行快速静态与语法检测,如果抛出 Traceback 报错,Coder 最多有 3 次重试修复机会;若 3 次均告失败,则判定该战略在逻辑上根本不可行,直接触发系统级重罚。这一容错机制使得 Planner 的梯度更新能够精准聚焦在战术好坏上,而不被偶然的代码拼写错误所污染。
为了支撑上述闭环,研究团队打造了一套跨越 CybORG CAGE 4(模拟复杂的企业多智能体协同防御网络)和 CyberWheel(严格对接 MITRE ATT&CK 实战战术的真实架构)的高保真沙箱环境,并公开发布了包含超过 13,000 条高质量红蓝对抗轨迹的交互数据集 $\mathcal{D}$。每个时间步均详尽记录了差分主机情报、部分可观测信道状态及多阶段渗透结果,为安全领域的 RLVR 提供了亟需的“数据燃料”。
防线崩溃:522% 的滑铁卢与自主涌现的高阶战术
在严苛的对照实验中,研究团队将 Trident Agentic 生成的攻击策略与传统的静态启发式红队脚本、零样本(Zero-shot)大模型以及带思维链提示(CoT)的大模型(包括 GPT-4o)进行了全面横向评测。评测指标沿用网络安全防御公认的准则——蓝队累计回报值。由于蓝队的奖励体系是基于业务连续性和成功诱捕入侵者来计算的,攻击越致命,蓝队的得分就越低、负值越大。
实验数据揭示了一个令人震惊的现实:相较于基准环境中默认的启发式红队,Trident Agentic 在各类对抗场景下,使当前主流 DRL 蓝队防御模型的得分平均暴跌了 522.30%。
更为耐人寻味的是实验中呈现的防御盲区机制。现有的 DRL 防御模型在面对 GPT-4o 生成的代码或启发式脚本时,依然能维持相对体面的防御收益。这是因为未针对环境直接优化的通用大模型,其攻击思维模式与传统脚本类似,往往遵循标准的教科书式线性渗透顺序。而经过 RLVR 强化的 Trident 7B Planner 则敏锐地通过奖励信号捕捉到了 DRL 防御模型的决策漏洞,并自主进化出了超越规则编写者意图的涌现战术:
-
蜜罐诱饵识别与主动规避(Decoy Avoidance):在 CyberWheel 等高逼真环境中,DRL 防御方极为擅长部署虚假的诱饵服务来骗取攻击者的连接并实施封禁。传统的红队脚本一旦扫描到开放端口就会盲目尝试 Exploit,直接落入陷阱。然而,经过 GRPO 训练后的 Trident 代码中,竟然自主衍生出了诸如
DECOY_THRESHOLD = 3的判断逻辑——它能通过分析轻微的连接时延和异常状态反馈,在不需要底层作弊信息的前提下,统计推断出目标大概率是防御方布设的蜜罐,从而果断放弃攻击,将火力转向真正的核心业务节点。 -
非线性状态优先级与防线撕裂(Adaptive State Prioritization):DRL 蓝队通常倾向于优先保护高价值的主服务器,因为保护这些服务器能获得最高的即时正向奖励。Trident 则学会了避开高防正面,转而通过多跳微小权限的横向移动,长时间潜伏在边缘节点,破坏数据校验机制。蓝队由于未能及时观测到关键威胁,其学到的强化学习策略在长期折扣因子驱动下出现判断失真,最终导致整张内网被连根拔起。
必须指出的是,实验中评估团队甚至给予了基线模型某种“不公平的优待”:在统计 GPT-4o、Zero-shot 和 CoT 的攻击表现时,作者刻意过滤掉了所有的代码执行致命错误,仅计算其执行成功局次的战绩;而 Trident 则没有任何特权过滤,全面承担了所有执行失败带来的惩罚扣分。即便在如此严苛的对比下,仅有 7B 规模的可训练核心依然以压倒性优势凌驾于未精调的千亿级通用前沿模型之上。这强力证明了一个事实:在强对抗性的专业技术领域,单纯依赖 Prompt Engineering 和基础泛化能力根本无法击溃自适应系统,只有结合可验证物理反馈的在线强化学习(RLVR),才是赋予智能体深刻战场洞察力的终极途径。
局限、双刃剑与未来网络博弈的演进
作为一项开创性的安全研究,作者团队在文中也客观坦陈了 Trident 当前面临的局限性。其一,整个框架目前依然对领域特定的 Prompt 模版与静态解析工具有较强依赖,当对抗环境迁移到底层逻辑完全迥异的全新物理网络时,仍需工程师对日志序列化逻辑进行微调;其二,目前的奖励函数设计(包含积极里程碑如权限提升、消极事件如动作无效或被阻断)尚未实现全自动元发现,仍需要注入专家知识以保持探索效率。
然而,Trident 所展现出的技术威力更敲响了一记伦理与安全的警钟。以往人们普遍认为,唯有千亿规模、由顶尖科技巨头掌控的前沿大模型(如 Claude Mythos)才具备挖掘零日漏洞与瓦解复杂系统的危险能力;但 Trident 的成功表明,只需巧妙地重组架构,一个轻量级的 7B 开源小模型在强化学习的赋能下,就能对复杂的网络防御系统造成破坏性的打击。
正如作者在论文中所指出的,假定攻击者永远不会独立摸索出类似的方法,是一种极其幼稚且危险的鸵鸟心态。打破旧有静态评估的安全幻觉,正是构筑新一代真正坚不可摧的自主防御体系的前提。Trident 所构建的基于 RESTful 架构的解耦沙箱平台,不仅是红队生成攻击策略的练兵场,也同样具备即插即用的防御训练属性——它完全可以倒转角色,通过让防御方直面这种由生成式大模型驱动的变异攻击流,在真正的博弈对抗中淬炼出具备高度弹性的下一代生成式蓝队智能体。自动化攻防的全新平衡,或许正从这样一场打破虚假安全的重构中徐徐展开。