SecRespond:阿里联合港科大测评23款大模型,真实入侵应急响应竟无一通关

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

SecRespond:阿里联合港科大测评23款大模型,真实入侵应急响应竟无一通关 论文图示

在过去一年里,大模型智能体(LLM Agent)接管终端命令行、自主调用系统工具并在复杂环境中执行运维或攻防任务,已逐渐从学术设想演进为工业落地。在网络安全领域,大模型在 CTF 解题、漏洞挖掘乃至编写补丁代码等“事前攻防”(Pre-compromise)任务中展现出了惊人的泛化能力。然而,现实世界中最凶险、也最消耗资深安全工程师精力的战场,往往发生在系统被攻破之后——即主机失陷后的应急响应(Post-compromise Incident Response)。

ArXiv URL:https://arxiv.org/abs/2607.26791v1

面对一台已经被攻击者通过网络渗透拿下的云主机,Agent 能否像资深安全专家一样,根据告警日志与底层只读磁盘快照,层层抽丝剥茧还原整个入侵链路,找齐所有隐蔽后门,并提出一套真正可用且完成闭环验证的处置修复方案?

来自阿里巴巴与香港科技大学的研究团队给出了一个里程碑式的基准评测:SecRespond。这是业界首个针对真实主机失陷后应急响应完整工作流的 AI Agent 评测基准。研究团队在 5 种操作系统、4 类典型入口和 21 种 MITRE ATT&CK 技术之上,搭建了 10 个完全基于真实网络协议攻击打造的云主机失陷靶场,并对 23 款前沿大模型进行了系统性评测。

实验结果给当前的安全大模型狂欢泼了一盆清醒的冷水:面对真实世界的入侵现场,没有任意一款模型能够在任何一个靶场中实现完整的检测与修复。即便是表现最优的 Claude Opus 4.7,其平均得分也仅有 72.4%;更有模型在“检测到问题”与“给出完整修复”之间出现了高达 34.7% 的断崖式跌落。大模型看似懂告警,但面对静默入侵和闭环处置,暴露出极其致命的结构性短板。

SecRespond 整体评估架构与任务定义

为什么现有安全基准测不出大模型的“真实水平”?

在 SecRespond 诞生之前,主流的 AI 网络安全评测几乎全被“事前视角”垄断。例如,以 Cybench、NYU CTF 为代表的 CTF 竞技基准,将 Agent 放置在结构规整、目标单一的 Docker 容器中寻找预埋 Flag;CyberGym 则评估大模型在干净开源代码仓中挖掘并利用零日漏洞的能力;而 SecBench 和 AutoPatchBench 则聚焦于漏洞选择题或孤立补丁代码生成。

即便是少数标榜“安全运营中心(SOC)防御”的基准,也往往把问题严重简化:它们向模型输入清洗完毕的独立告警列表、格式规整的系统日志或总结好的威胁情报文本,让模型进行语义匹配或逻辑归纳。

但真实的失陷应急响应从来不是“开卷连线题”。现实中,攻击者在入侵后会部署隐藏进程、通过定时任务(Crontab)或系统服务留存持久化机制(Persistence),甚至会主动擦除操作痕迹;与此同时,受害主机上始终交织着大量合法业务产生的系统噪声。如果只是丢给大模型一段日志,根本无法验证它是否具备在海量文件系统中穿梭排查、跨文件交叉比对、自主挖掘无告警痕迹的实战能力。

正因如此,研究团队将评估边界推进到了“失陷后环境”:不给干净环境,不给人工喂到嘴边的合成日志,直接将受害主机的底层只读磁盘镜像、原始主机安全产品的告警与扫描报告丢给 Agent,要求其在规定步数内产出一份包含入侵实体、基线风险、漏洞分析的完整溯源报告,以及一份可以直接下发的修复处置预案。

10 大云原生靶场与 12 步工业级构建管线

为了彻底杜绝“人工合成漏洞”带来的虚假表现,SecRespond 中的每个靶场都力求 100% 还原黑客在真实云环境下的实网攻击。其底层设计遵循三层解耦逻辑:

  1. 蓝图层(Blueprint Layer):定义评估目标与覆盖维度,包括受害环境的技术栈、带 MITRE ATT&CK 标签的完整攻击链,以及目标考察的技能点。

  2. 实例层(Instance Layer):在受害主机上进行严格的“三真”实操——采用真实披露的 CVE 或真实弱口令配置缺陷、通过实网协议发起远程真实渗透(而非直接把恶意文件复制进系统)、让攻击全过程在系统底层自然沉积下文件系统与系统日志痕迹。

  3. 核对表层(Checklist Layer):由资深安全专家根据攻击实际留存的物理证据,转化为包含通过/失败判定准则与证据链条的检查点(Checkpoints)。

SecRespond 靶场构建的 12 步标准流水线

在具体制作中,整个流水线被严密拆解为 12 个阶段,并由人类安全专家进行多轮关键节点审计。更值得注意的是其信息隐蔽度设计:在每个失陷靶场中,能够触发主机安全产品显式告警的攻击行为仅占 30% 到 40%,而剩下的 60% 到 70% 属于“静默攻击动作”——它们只在磁盘配置文件、隐秘目录、特殊系统属性中留下修改痕迹,没有任何监控日志会主动敲响警钟。

这一比例极其致命,却极其贴合实网攻防现状。它既为 Agent 提供了开启调查的第一道线索锚点,又强制要求 Agent 必须具备顺藤摸瓜、在文件系统中主动排查隐藏危险的能力。

细粒度 Checkpoint 与 LLM-as-a-Judge 评测机制

失陷主机的应急处置报告属于高度开放的文本与操作计划,传统的字符正则匹配或固定 Flag 验证根本无法生效。为此,SecRespond 构建了一套标准化的能力分类体系(CAP Taxonomy)与细粒度检查点机制。

研究团队定义了五大核心维度:

这五大维度被进一步细化为 52 个细分能力项,并最终落实在 10 个靶场的 280 个细粒度检查点上。每一个检查点(Checkpoint, 记为 $c$)都被分别放在“检测”(Detection)与“规划”(Planning)两个轴向进行双重打分:

检查点得分经归一化后计算为 $\text{CHK-score}_c^a$(其中 $a \in {\text{det}, \text{plan}}$),并可进一步聚合为特定能力维度得分 $\text{CAP-score}^a$ 与靶场得分 $\text{CHK-score}_r^a$:

\[\text{CHK-score}_{c}^{a} = \frac{s_{c}^{a}}{M^{a}} \in [0,1], \quad a \in \{\text{det}, \text{plan}\}\] \[\text{CAP-score}^{a} = \frac{1}{\left\vert{}\mathcal{C}^{a}_{\text{CAP}}\right\vert{}} \sum_{c \in \mathcal{C}^{a}_{\text{CAP}}} \text{CHK-score}_{c}^{a} \times 100\%\]

为了消除单一评估模型的主观偏差,SecRespond 采用了业内极高标准的裁判配置:由 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT-5.4 Pro 三款顶尖大模型组成独立裁判团。三者在 OpenCode 脚手架中运行,自主调用 Bash 工具审查被测模型输出的报告,分别依据评分准则给出打分并取平均值,确保了最终成绩的客观与严谨。

23 款模型实测:谁在裸泳?大模型的两大致命瓶颈

研究团队在统一的 OpenCode Agent 脚手架下,对涵盖多个主流开源与商业模型家族的 23 款前沿大模型展开了系统性评测。这场实网攻防的“闭卷大考”,直接戳破了关于安全 Agent 的若干美好想象。

检测能力持续优于规划能力,以及模型家族版本演进情况

致命弱点一:只盯显式告警,对“静默后门”视而不见

评测中最直观的现象是:大模型完全被安全产品的告警牵着鼻子走

凡是有安全告警明确指出的恶意脚本、异常反弹 Shell 进程,多数模型都能顺藤摸瓜记录在案。然而,一旦面对那 60% 至 70% 没有产生显式告警的攻击动作(例如攻击者通过写入特定隐藏目录的软链接、修改环境变量配置、植入深层自启系统服务留下的后门),大模型几乎集体失明。

数据统计揭示了这一能力鸿沟:在能够被告警直接关联的“入侵实体”维度上,被测模型的平均检测得分可达 75.4%;但在高度依赖系统底层主动排查的“持久化机制”维度上,平均检测得分暴跌至 58.8%。模型在整个交互轨迹中极少主动发起全局性的目录审计、完整性校验或配置对比,更像是一个“被动接警员”,而非主动搜寻蛛丝马迹的“侦探”。

致命弱点二:只做头痛医头,处置规划严重断链

比“查不出”更危险的是“修不全”。如图 3(a) 所示,所有 23 款被测模型的表现均毫无悬念地落在了“Detection = Planning”对角线的下方。这意味着,模型生成有效处置方案的能力,无一例外地落后于其发现问题的能力。

在更复杂的攻击场景下,这种断崖式差距尤为惊人。例如 GPT-5.5 在检测轴上拿下了不俗的成绩,但在规划轴上的得分竟然比检测轴低了 34.7%。

深度分析模型的处置建议可以发现,大模型的修复思维存在严重割裂:

引入流程先验:能否帮大模型打破天花板?

针对上述大模型在应急响应中“东一榔头西一棒子”、缺乏系统化推演能力的痼疾,研究团队尝试探索其能力的上限:将一线安全应急响应专家长期沉淀下来的操作范式进行提炼,转化为不包含任何特定靶场私密信息(如特定文件名、特定 CVE、预设攻击路径)的标准“通用排查技能与流程先验”(Procedural Priors),并作为环境工具注入到 Agent 的工作流中。

引入专家流程先验前后,模型在五大能力维度的提升对比

实验结果表明,在注入了标准化的调查与处置流程后,主流模型的全盘表现得到了立竿见影的提振。如图 6 所示,不论是在基线排查还是在原本属于重灾区的“排查与响应质量”维度,模型的规划能力与证据链完整度均实现了大幅跃升。专家先验通过规范步骤引导模型“查完文件记得查进程、查完进程记得查服务、制定完修复必须附带验证指令”,强行拉齐了大模型在专业工程规范上的短板。

但更值得深思的是这一实验所折射出的技术局限:即便挂载了最顶级的工业级专家流程先验,大模型在复杂的跨系统、长链路深度渗透场景下,依然无法达到 100% 的精准归因与修复闭环。先验可以提供操作清单,但无法替代跨多层文件系统与异构配置之间的深度因果推演。

真正的实网级安全 Agent 还需要迈过几道坎?

SecRespond 的发布不仅填补了网络安全领域长期缺少失陷后真实基准的空白,更为下一代针对复杂运维与安全运营的大模型研发指明了攻坚方向。从这项评测中,我们可以总结出几个核心工程启示:

首先,告警依赖型 Agent 已经遭遇天花板。未来实网安全 Agent 的核心壁垒,不在于其对大语言模型上下文里几条已知 Alert 的总结速度,而在于其在未见异常时,能否基于微弱的因果线索,主动在终端底层构建假设、验证假设、执行系统级的逆向溯源。

其次,“从感知到动作”之间存在巨大的工程推理鸿沟。当前的 LLM 依靠预训练语料中的安全博文,可以较为顺畅地“描述”一个漏洞或告警;但一旦涉及“在保留业务可用性的前提下执行系统回滚与深度净化”,需要的是极其严密的系统依赖关系推演与可执行脚本校验。这也是为什么所有前沿模型在 Planning 维度上全面崩塌。未来的安全 Harness 必须引入环境沙箱仿真与执行反馈回路,让 Agent 能够在离线环境中先行测试修复计划,而不是停留在口头推演。

最后,SecRespond 向整个 AI 安全行业敲响了警钟:不要轻易把未经验证的自主 Agent 部署到核心内网做处置决策。在 AI 具备系统化防御自律与深度探查能力之前,人机协同(Human-in-the-loop)将是不可逾越的底线。大模型或许可以成为一个极高效率的证据搜集助手,但要让它真正独当一面当好“应急响应专家”,技术演进之路才刚刚开始。