RangeFactory:攻破首跳后47%仍溃败,多跳靶场迎来自动化量产
RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges

在网络安全攻防与大模型智能体(LLM Agent)的交叉领域,评估智能体实战能力正面临一场结构性危机。以往的研究大多依赖单点漏洞复现(如 Vulhub 或各类 CTF 独立赛题),智能体只需在单一容器中触发漏洞、读取特定的 Flag 或弹回 Shell,便算作完成任务。然而,真实的重大网络安全事件从来不是单点爆破,而是由初始打点、内网穿透、横向移动、权限提升直至核心资产窃取构成的漫长攻击链条。
ArXiv URL:https://arxiv.org/abs/2608.09526v1
要衡量智能体在多层隔离网络中维持长程攻击的能力,多跳网络靶场(Multi-Hop Cyber Range)是不可或缺的基础设施。但长期以来,这类靶场高度依赖人工专家拓扑设计和规则编写,不仅场景数量极其有限、更新缓慢,更无法跟上海量新增 CVE 漏洞的测试需求。
来自华为技术有限公司、北京大学与东南大学的研究团队提出了自动化多跳网络靶场编排框架 RangeFactory。该框架将复杂的靶场构建本质抽象为“依赖解析”问题,利用多智能体流水线从孤立的真实漏洞环境中自动提取能力与运行时依赖,并通过端到端实战攻击回放进行闭环验证。基于该框架构建的基准测试集 RangeBench 揭示了一个令人警醒的现象:在当前顶尖的攻击智能体中,即便成功突破了第一层边界节点,依然有高达 24.5% 至 47.0% 的任务无法走完后续攻击路径。这种“突破首跳与完成全链条之间的持续渗透断层”,为当前自主攻防智能体的研发敲响了警钟。
靶场构建的本质难题:为什么漏洞不能简单“拼积木”?
将多个在单机环境下能够顺利触发的 CVE 漏洞放入同一套企业内网拓扑中,并不意味着一条可通达的攻击链会自动诞生。传统基于模型驱动或人工规则的靶场合成方案之所以难以规模化,核心瓶颈在于忽略了漏洞攻击在连续执行时的两类强依赖约束:能力依赖(Capability Dependency)与运行时依赖(Runtime Dependency)。
所谓能力依赖,关注的是相邻攻击步骤之间能力输入与输出的接口匹配。前序节点的漏洞利用必须能够产生后序漏洞所需的攻击前提。例如,一个仅能实现任意文件读取的漏洞,无法直接为后续需要任意命令执行权限的内网漏洞提供支撑;反之,若前序攻击成功获取了特定凭据或交互式 Shell,则能赋予攻击者在当前网段的合法身份或网络立足点。如果仅按漏洞名称或服务类型进行随机拼接,绝大多数候选链条在逻辑语义上根本无法闭环。
运行时依赖则更加隐蔽且动态,它取决于具体攻击过程能否在新的网络位置与运行时环境中正常工作。即便前后两个漏洞在能力接口上完全匹配,环境中的网络隔离策略(如防火墙阻止了 TCP 反弹连接)、目标主机的路由不可达、内网网关上的代理阻断,或是跳板机上缺失特定的工具依赖,都会让原本可行的 Exploit 在联合部署后彻底哑火。
若采用穷举搜索策略,将数百个漏洞环境盲目组合并在容器集群中部署运行,候选空间会随攻击跳数呈指数级爆炸,部署与运行开销根本无法承受。因此,规模化生成多跳靶场的关键破局点在于:必须在部署前依靠结构化语义剪枝剔除显式不兼容的组合,同时在部署后依赖端到端攻击执行来验证隐式涌现的运行时条件。
RangeFactory 架构解析:将靶场构建重构为依赖解析
为系统性化解上述依赖冲突,RangeFactory 设计了一套由六类专用智能体组成的三阶段协同工作流。整个框架将孤立的漏洞镜像转化为标准构件,通过依赖推导进行编排,并最终交由实战验证。

第一阶段被称为原子化(Atomization)。该阶段的目标是将异构且缺乏规范标注的原始 CVE 漏洞环境转化为标准化的“CVE 能力原子”(CVE Capability Atom)。负责攻坚的 Exploiter 智能体首先在隔离环境中尝试复现漏洞,根据私有目标与环境反馈自主调整攻击载荷,验证成功后将攻击手法、所需前提与观测到的依赖固化为结构化的攻击指南($exploit_guide$)。紧接着,Explorer 智能体接管已获取的权限底座,利用一系列微型探针对该节点进行能力扫描,严格依据实操探针的返回结果提炼出能力赋予集($capability_grants$)与访问要求($exploit_access$)。这一本体涵盖了命令执行、文件读写、凭据发现、身份认证以及网络跳板等核心能力。只有经过实际探针确认的权限才会被赋予原子,从根本上杜绝了大模型凭空推断导致的链条断裂。
第二阶段是场景编排(Orchestration)。在此阶段,Generator 智能体根据经典企业网络参考架构生成参数化的拓扑模板,明确划分 DMZ 区、内部业务应用区与核心数据区等安全域,并在每个安全域中预留 CVE 插槽与背景业务资产。随后,Composer 智能体扮演了依赖解析引擎的角色。它沿着预设的攻击路径骨架逐层检索候选原子,利用固定的闭包规则计算前序步骤累积的能力集合是否满足下一个原子的准入条件。同时,Composer 还会结合攻击指南提前筛查执行位置与载荷传递等前置运行时约束。一旦检测到依赖违背,编排器会立即回溯剪枝。在实际运行中,该阶段在物理部署之前就成功过滤掉了 92.3% 的非法组合,将原本近两万四千个组合提案大幅精简至千余个高置信度候选。
第三阶段进入端到端验证与诊断闭环(Validation & Diagnosis)。由 Composer 输出的完整拓扑参数在容器编排平台上完成自动化部署后,Executor 智能体调取各节点原子中封存的执行套件,根据变化的跳板路径动态调整载荷参数,执行跨网段的多跳渗透。部署在靶场内部的独立 Verifier 会全程静默监控预置的隐藏私有目标。只有从外网入口一路打到核心目标且全链路验证通过的场景,才会被正式收录入库。若中途失败,Diagnoser 智能体则会介入分析:若是智能体偶发的操作失误,则给予上下文保留的有界重试;若确认是由联合部署引发的底层运行时冲突,则将该组合标记为持久性不兼容证据,反哺给 Composer 避免后续重复犯错。
从单点到三跳:RangeBench 展现的规模与保真度
依托 RangeFactory,研究团队对选取的 239 个有效 CVE 能力原子(涵盖 2010 年至 2026 年间披露的 122 种软硬件产品漏洞)进行了规模化编排。结合 20 种包含不同规模背景资产的企业级拓扑,框架共生成了 1,840 个候选靶场实例。
经过真实的跨网络端到端攻击验证,最终有 1,148 个靶场实例顺利通关,整体验证通过率达到 62.4%。这 1,148 个实例精确对应着 287 条完全不同的有序攻击链,覆盖了 213 个独立漏洞原子与全部 20 种网络配置。由于每个攻击链条均被分别嵌入到无干扰、低干扰、中干扰和高干扰(可见节点数从约 7 个递增至 50 个)四种不同规模的背景网络中,这一设计让后续评估能够干净地将“攻击链本身的逻辑复杂度”与“干扰节点带来的环境噪声”解耦开来。
在自动化生成的基准测试中,人工抽检审计是确保评测可信度的关键防线。研究团队随机抽取了 150 个入选靶场进行深度人工核查。审计数据显示,97.3% 的靶场完美保留了原始 CVE 的真实安全影响与脆弱性行为,94.7% 的靶场状态与原子中记录的能力语义标注完全吻合。不仅如此,每个入选靶场都在生成阶段留存了完整的通关执行轨迹作为存在性证明(Witness),这确立了基准场景的技术可靠性。
测评前沿大模型:残酷的“持续渗透断层”
基于这一高质量靶场基准 RangeBench,研究团队对四款具有代表性的前沿大模型攻击智能体展开了系统评测,包括 Kimi-K3、GLM-5.2、DeepSeek-V4-Pro 以及 GPT-5.6-Luna。所有模型均在统一的工具箱、300 轮交互上限以及单任务 1 小时的超时限制下运行 pass@1 测试。
为了探究模型在不同先验条件下的表现,实验设置了三级任务信息输入:L0 级别仅提供外部入口地址与目标描述;L1 级别增加了网络拓扑结构图;L2 级别则进一步提供了目标服务类型、CVE 映射关系以及必需的身份凭据,但不提供任何现成的 Exploit 脚本或操作指南。
评测结果呈现出两项极具启发性但又令人担忧的核心技术洞察。
其一,是贯穿所有模型的“持续渗透断层”(Sustained-Compromise Gap)。在传统的单漏洞评估中,大模型往往能取得亮眼的战绩,但这并不能反映真实内网渗透水平。在 L2 级别信息供给下,各模型在网络第一跳(入口漏洞)的攻破率相对可观,Kimi-K3 达到了 73.8%,GLM-5.2 为 62.8%,DeepSeek-V4-Pro 为 57.8%,GPT-5.6-Luna 为 44.3%。然而,随着攻击链向第二跳内网业务层、第三跳核心数据层不断深入,各模型的累计成功率呈现断崖式下跌。
以第一跳攻破为条件概率基准进行统计时发现,在所有已经拿到入口初始权限的运行中,Kimi-K3 只有 75.5% 走完了全流程,GLM-5.2 为 65.6%,DeepSeek-V4-Pro 为 62.6%,而 GPT-5.6-Luna 仅剩 53.0%。这意味着,哪怕给出了完整的 CVE 映射信息,依然有 24.5% 至 47.0% 的智能体在拿到外网权限后迷失在内网横向移动的过程中。这种衰减并非因为深层漏洞在单机意义上更难攻破,而是因为跨网段跳板建立、隧道代理维护、多层上下文状态跟踪以及错误回溯处理,对大模型的长程推理与环境交互适应能力构成了复合级考验。
其二,先验信息的价值差异极大,而网络资产规模则呈现“耗时剧增、成功率微降”的特征。在信息消融实验中,缺少 CVE 明确指示的 L0 与 L1 级别表现极其惨烈。即使是综合表现最强的 Kimi-K3,在 L0 与 L1 下的端到端成功率也分别仅有 15.4% 和 20.1%,其余模型甚至徘徊在 5% 至 15% 的超低区间。这说明当前智能体在黑盒探测与漏洞匹配上的自主能力依旧薄弱,其高光表现很大程度上来自于对训练语料中公开 CVE 知识的提取。另一方面,当把网络可见节点数从 7 个增加至 50 个时,各模型的最终成功率仅小幅下降约 10 个百分点,但中位工具调用次数暴增 51% 至 74%,交互时长攀升 71% 至 84%。这表明智能体在面对大量无关业务资产时,虽然最终仍能通过穷举搜索摸索到攻击路径,但在规划与目标筛选效率上面临着巨大的算力资源浪费。
从自动化工场到实战数据资产
除了构建测试基准,RangeFactory 的工业化量产能力还带来了一项更具长期价值的副产物:自动化产出高质量、高密度标注的多跳网络攻防交互轨迹。
研究团队利用通过验证的靶场,汇总构建了一套包含 5,541 条完整交互轨迹的数据集。这批数据结构独特,涵盖了两部分核心内容:一部分是靶场构建阶段由 Executor 生成的保底黄金轨迹(示范数据),另一部分则是由未获任何参考答案的 Kimi-K3 在不同信息层级下自主探索产生的实战轨迹。
尤为关键的是,得益于验证器在靶场内部部署的细粒度多跳里程碑检查点,每条轨迹中都精确标记了目标达成轮次、最终推进深度以及攻击折戟的具体环境状态。这彻底改变了以往网络安全领域依靠人工编写 Writeup 合成死板轨迹,或是仅有二元胜负标签的粗糙数据现状。失败轨迹中暴露出的上下文迷失、命令语法错误、反弹连接配置偏差等典型断链行为,恰恰构成了强化学习过程监督(Process Supervision)与对比学习中最宝贵的硬负样本。
网络安全智能体的范式转移
回顾 RangeFactory 的技术路径,其本质是网络安全评测与训练基础设施的一次范式演进。长期困扰攻防智能体技术落地的瓶颈,往往不在于基座模型生成单行 Exploit 代码的能力,而在于缺乏能够模拟真实企业内网纵深防御体系的对抗环境。以往耗费数周乃至数月才能搭建出的一套静态靶场,不仅极易发生“过拟合”,且在安全补丁更新后迅速失效。
RangeFactory 证明了通过结构化依赖抽象与智能体自主编排,可以将零散的单点漏洞流水线式地重组为成百上千个拓扑各异、环境保真、逻辑自洽的多跳实战靶场。而 RangeBench 所揭示的近半数智能体在跨跳渗透中败下阵来的残酷事实,也从反面明确了未来的演进方向:攻防智能体的核心突破口,已不再是刷高单个 CVE 的利用成功率,而是在混乱、高噪且动态隔离的复杂网络状态中,建立起能够长期维持状态、自主容错并推进多步跳跃的系统级认知架构。