STAIR:图状态驱动的分阶段Agent框架,应急响应防御分达0.94
STAIR: Effective Incident Response Using an End-to-End Agentic Planning Framework

在网络安全运维的真实战场上,检测到入侵往往只是漫长拉锯战的开端。真正的考验在于安全事件响应(Incident Response):如何在攻击者持续渗透或横向移动的同时,迅速控制受害边界、保全关键取证数据、清除后门暗桩、修复系统脆弱点,并最终安全恢复业务。长久以来,工业界依赖专家编写的静态预案剧本(Playbooks)或安全编排自动化系统(SOAR)。然而,面对高度动态的攻击,预案的死板规则往往无法适应瞬息万变的环境反馈;而直接把任务丢给大语言模型(LLM)的开放式智能体,又极易在多轮交互后迷失状态、跳步操作,甚至因误杀核心业务而造成灾难性的二次破坏。
ArXiv URL:https://arxiv.org/abs/2608.09524v1
华为技术有限公司联合北京大学、东南大学提出了端到端智能体应急响应规划框架 STAIR(State-driven, Stage-specialized, and Experience-supported Incident Response)。这项工作直击大模型处理长流程安全运维护航时的核心痛点,摒弃了依靠非结构化文本上下文生搬硬套的传统模式,将事件演化显式建模为“图即状态”(Graph-as-State, GAS),并通过阶段路由器(Stage Router)和正负经验库,实现了安全、有序、闭环的自动化处置。在覆盖 20 种攻击家族、100 个基于 Docker 和 Containerlab 搭建的复杂靶场实验中,STAIR 取得了 0.94 的综合归一化防御得分(ODS),相比目前最强的智能体基线性能提升了 9.5%。

为什么大模型做不好长周期的事件响应?
应急响应不是单点的命令执行,它天然具备严格的阶段性演进逻辑。按照工业界通行的安全指引(如 NIST 或 SANS 框架),处置流程通常划分为遏制(Containment)、评估(Assessment)、取证保全(Preservation)、驱逐(Eviction)、加固(Hardening)与恢复(Restoration)等多个阶段。在实际操作中,不同阶段的操作目标甚至存在冲突:比如在彻底驱逐攻击者前贸然重启服务,往往会导致攻击者利用已持久化的凭证再次潜入;而在未完成取证保全前直接下发防火墙阻断或清理脚本,极易抹除易失性日志,导致溯源线索中断。
现有基于 LLM 的安全智能体往往表现不稳定,根源在于三个维度的结构性缺失。
第一是上下文状态的丢失与漂移。随着交互轮数增加,大模型的上下文窗口中充斥着冗长的告警日志、命令行输出和报错堆栈。模型必须在海量 token 中反复重构当前的攻击拓扑与防御进度,极易产生“状态遗忘”或局部视野局限。
第二是阶段目标与动作边界的错配。开放式智能体缺乏明确的阶段管控,模型往往倾向于在缺乏环境评估的情况下直接执行高烈度的破坏性命令,导致附带损伤率(Collateral Damage Rate)居高不下。
第三是历史经验复用的失真。安全响应不能简单套用传统的少样本提示(Few-shot prompting)。在真实的运维场景中,一条命令在语法上执行成功,绝不等于安全状态得到了恢复;如果智能体把历史上看似成功但实际导致防御穿透的操作当成正向示例回放,会直接引发级联防御崩溃。
STAIR 的核心架构:状态、阶段与经验的三角协同
为解决上述挑战,STAIR 并没有继续堆叠通用的 Prompt 技巧,而是建立了一套将事件状态、阶段分发与经验闭环严格绑定的决策体系。整个框架由四大核心组件构成:事件状态管理器、经验数据库、分阶段 Agent 规划器,以及连接真实环境的执行底座(Execution Harness)。
1. 图即状态(Graph-as-State, GAS)
STAIR 彻底舍弃了仅靠纯文本对话历史记录进度的做法,将当前系统的受害拓扑与处置进展抽象为一个动态演化的多模态异构图 $G_t = (V_t, E_t, A_t)$。
在这个图结构中,节点集 $V_t$ 包含了监控与资产实体(如主机 kali、web-server)、攻击构件(如恶意进程、SQL 注入注入点、窃取的数据库文件)以及防御构件(如安全策略、已应用的修复补丁)。边集 $E_t$ 则清晰区分了攻击边(如探测、横向移动、读取敏感数据)和响应边(如防火墙规则、漏洞代码修补)。当底层环境返回新的日志或命令输出时,状态管理器不会无脑追加文本,而是通过实体解析与行为对齐机制,将新证据融合成图上的拓扑更新,保持事件演化的一致性与可溯源性。

2. 分阶段规划器与动态阶段路由
针对阶段错配问题,STAIR 定义了涵盖遏制、评估、保全、驱逐、加固和恢复的六大阶段空间 $\mathcal{S}$。系统的决策入口由阶段路由器(Stage Router)控制。路由器以当前 GAS 为输入,显式判定当前系统处于哪个处置生命周期,从而激活对应的阶段专精 Agent。
每个阶段专精 Agent 仅加载该阶段专属的工具子集(Tool Catalog)与阶段局部记忆,这种隔离设计从结构上杜绝了大模型跨阶段滥用危险命令的可能。例如,在加固阶段,智能体只能获取与配置更新、代码修补相关的工具,而不会意外触发破坏性的整机网络隔离。规划出的结构化动作 $a_t = (T_t, P_t, R_t)$ 必须同时包含调用的工具、满足架构约束的参数以及清晰的决策推导理由。
3. 关联效果验证的正负经验库
历史响应轨迹是宝贵的财富,但前提是必须经过效果验证。STAIR 将历史经验解构为四元组:$x_i = (G_i, a_i, y_i, f_i)$,分别代表执行前的图状态、采取的动作、执行后的实际恢复效果标签,以及反馈摘要。
在检索环节,经验库首先基于当前阶段过滤候选集,再根据与当前 GAS 的拓扑相似度进行重排。系统最关键的设计在于将检索到的经验显式划分为两套提示集:
-
正向经验集 $\mathcal{E}_t^+$:提供在相似拓扑下被验证能够有效压制攻击的规范参考;
-
负向经验集 $\mathcal{E}_t^-$:直接警示哪些操作虽然语法合法,但在该阶段曾导致过业务中断或防御失效。
这种机制不仅让模型学会“该怎么做”,更通过强约束让模型警惕“绝对不能怎么做”。
4. 执行底座(Execution Harness)
规划器生成的动作不会直连系统,而是必须经由执行底座进行安全校验。执行底座封装了 33 种受约束的标准安全能力,涵盖取证收集、主机状态检查、防火墙规则下发、后门清理及服务重启等。执行底座在靶场容器内运行命令后,不仅回传标准的返回码和文本输出以供 GAS 状态更新,还会对照独立的评估画像对操作进行效果打标,完成经验的闭环沉淀。
靶场实验:百套高难度环境下的系统性验证
为了对自动化响应进行严苛且可复现的检验,研究团队基于 Docker 和 Containerlab 搭建了包含 100 个测试案例的闭环事件响应靶场。这些案例覆盖了凭证窃取、应用漏洞利用、内网横向移动以及异构多协议服务滥用等 20 个攻击家族、12 种 MITRE ATT&CK 战术和 39 项攻击技术。
整个评估体系以 Overall Defense Score(ODS)为核心指标,综合加权了四个维度:服务与数据恢复度(Recovery,权重 0.40)、攻击持续压制率(AttackSup,权重 0.30)、动作执行成功率(AESR,权重 0.15)以及业务状态连贯性(SCS,权重 0.15)。同时,测试框架还严密监控附带损伤率(CDR)和面对重新攻击时的防御阻断率(ReattackBlk)。
对比基线涵盖了传统离线规划方案(LLM Planner)、奖励驱动型自动化方案(SecLoop)以及具备开放代码与工具调用能力的 Claude-Code Agent。测试结果展现出明显的阶梯差距:
STAIR 最终达成了 0.94 的综合归一化防御得分,相比表现最好的基线模型实现了 9.5% 的稳健提升。更具现实意义的指标体现在安全防御的纵深维度上:在面对攻击重放的场景下,STAIR 展现出了极高的阻断韧性,不仅彻底清除了攻击者的立足点,而且通过加固阶段的代码与配置修正,使得重放攻击的成功率近乎归零。反观纯开放式的智能体基线,虽然凭借强大的基座模型展现出较高的局部动作执行率,但由于缺乏统一的阶段认知,经常在驱逐未彻底时就判定任务完成,导致攻击者能够轻易利用残留后门卷土重来。
复杂拓扑下的鲁棒性与消融分析
当攻击场景的复杂度逐步攀升时,STAIR 架构的抗压优势变得更加明显。研究团队将 100 个靶场按复杂度划分为低、中、高三个层级(对应涉及的跨主机拓扑、多协议交互和长响应链路)。数据显示,随着复杂度提升,开放智能体的响应步数剧烈膨胀(从低复杂度的 8.9 步激增至高复杂度的 38.6 步),且防御得分出现显著断崖式下跌;而 STAIR 依赖图状态管理的高保真度,在长程攻击排查中始终保持了平稳的防御得分,有效遏制了多步推理中的误差累积。
通过渐进式消融实验(Cumulative Ablations),各核心组件的价值得到了清晰量化:
-
去除经验数据库(w/o E):系统的规划准确度出现回落,尤其在面对此前见过的攻击家族变种时,智能体无法复用高效的加固模式,探索步数显著增加;
-
进一步剥离 GAS、退化为文本交互历史(w/o E + G):系统的防御得分出现重挫,附带损伤率(CDR)明显飙升。这证明缺乏拓扑实体对齐机制后,大语言模型极易在漫长的日志翻查中误判关键服务状态,进而下发毁灭性的误杀指令;
-
完全剥离分阶段规划器、退化为单体 Agent(w/o E + G + P):系统的长周期响应能力几乎崩溃,频繁陷入无意义的局部重复探索,且经常在未完成取证前直接中断响应流程。
值得注意的是,消融数据显示,单纯动作推进更快的方案,最终的 ODS 和攻击压制表现反而更差。这强有力地打破了一种直觉迷信——在安全应急响应中,“走得快”并不等同于“处置好”;严谨的保全、分阶段的验证与有节制的工具调用,才是保障复杂系统安全着陆的基石。
走向实战:从开放式探索重回确定性运维
STAIR 的价值不仅仅在于刷榜,更在于为长上下文 LLM 在高风险专业领域的工程化落地指明了方向。过去两年,智能体领域充斥着“赋予 LLM 更多工具、更长上下文就能解决复杂任务”的乐观叙事。但 STAIR 用详实的系统设计与靶场实验证明:在容错率极低的网络安全运营中,将决策权完全交给黑盒模型的自由漫游是不可持续的。
通过显式的图状态(GAS)锁定客观现实,通过阶段路由器(Stage Router)规范处置生命周期,通过带效果标签的正负经验库约束动作空间,STAIR 成功在“大模型的灵活泛化”与“工业级运维的严谨可控”之间找到了平衡点。
当然,走向超大规模生产集群依然面临现实挑战。企业异构环境下五花八门的资产命名规范、碎片化的日志体系、定制化内部工具链的对接,以及关键破坏性指令与真实 SOC 审批流的人机协同,都是未来需要进一步演进的方向。但可以明确的是,从无序的开放式对话转向基于状态机与知识图谱驱动的分阶段 Agent 编排,正是安全自动化真正迈入深水区的必经之路。