SHE:解耦四大安全工件,大模型Agent安全脚手架实现轨迹自进化
SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

当大语言模型从单轮问答走向能够自主调用工具、管理记忆、执行复杂环境操作的智能体(LLM Agent)时,整个系统的安全边界发生了根本性位移。在这一范式下,系统面临的风险不再单纯来自模型权重的生成倾向,更取决于包裹在模型外部的“智能体脚手架”(Agent Harness)。正是这个外围架构,掌管着上下文拼装、记忆读取、工具分发、权限管控和运行时过滤。然而,业内现有的安全护栏机制大多将安全脚手架视为一个出厂即固化的静态组件。一旦遇到复杂的未见诱导攻击或多步交互漏洞,静态规则往往捉襟见肘,更无法将系统运行中暴露的失败轨迹自动转化为防御经验。
ArXiv URL:https://arxiv.org/abs/2608.09885v1
针对这一瓶颈,复旦大学、上海人工智能实验室、上海交通大学与香港科技大学联合提出了安全脚手架演化框架——SHE(Safety Harness Evolution)。该研究首次将 Agent 的安全外围系统确立为能够通过历史执行轨迹自主迭代进化的动态系统。实验数据显示,在标准评测基准 Agent-SafetyBench 上,经过 SHE 进化的安全脚手架相比静态基线 SafeHarness,将平均攻击成功率(ASR)降低至后者的三分之一以下(降幅达 3.1 倍),同时攻击环境下的有效任务效用(UA)从 31.6% 逆势提升至 47.6%。这项工作向社区揭示了一个核心趋势:保障复杂 Agent 的系统级安全,关键不仅在于持续对模型权重进行对齐微调,更在于构建一套职责解耦、可归因诊断且能伴随运行环境闭环进化的安全脚手架。

解耦之困:为何传统安全护栏难以实现自主进化?
在实际工业落地中,想要让大模型 Agent 的安全防线根据失败案例自行修复,面临着极为棘手的系统工程阻碍。
首要痛点在于功能组件的高度紧耦合导致安全责任归因模糊。现有的 Agent 安全系统通常将系统提示词、检索记忆、规则列表与动作拦截器杂糅在一起。当 Agent 发生越狱或执行危险工具调用时,这起事故究竟源于系统提示词中的行为指令不明确,还是规则库存在逻辑漏洞,抑或是工具调用策略分配了过高权限?在各组件边界含混的架构中,修改某一部分的提示词或逻辑,极易引发连锁反应,导致其他组件功能紊乱,甚至造成大面积的正常任务误拦截。
另一个深层瓶颈在于执行轨迹反馈难以直接转化为可落地的防御演化指令。一次完整的多步 Agent 交互轨迹往往包含复杂的环境观测、环境工具返回的半结构化数据、多轮推演思考以及最终的验证状态。这些富文本轨迹中固然潜藏着防御失效的关键线索,但如果缺乏结构化的诊断框架,外部优化模型很难从中提炼出既能修补安全漏洞、又不会损伤正常任务完成能力的精准修改补丁。现存的提示词进化或对抗红队方法,大多侧重于提升模型的基础任务能力或单纯生成攻击用例,极少涉足如何在保护正常业务能力的前提下,对运行时防御机制实施局部收敛的精确重构。
四大解耦工件:构建权责清晰的安全物理实体
为破除耦合带来的归因困境,SHE 在架构层面重新定义了大模型 Agent 的安全脚手架 $\mathcal{H}$。作者将原本杂糅的拦截控制逻辑拆解为四个具有明确安全职责与验证目标的独立可编辑工件:
\[\mathcal{H} = \big(\mathcal{P}_{sys}, \mathcal{R}_{bank}, \mathcal{M}_{safe}, \mathcal{Q}_{tool}\big)\]这四个工件在控制粒度和机制上各司其职,形成了分层的防御纵深:
-
系统提示词(System Prompt, $\mathcal{P}_{sys}$):承担高层级的抽象安全基调与行为规范。它不堆砌琐碎的针对性拦截词条,而是为 Agent 提供宏观的行为伦理指引和角色定位,约束模型的根本意图表达。
-
规则库(Rule Bank, $\mathcal{R}_{bank}$):维护显式的条件拦截规则集合。规则库将具体的上下文触发特征与特定的介入行为相绑定,如放行(allow)、警告(warn)、阻断(block)、清洗(sanitize)或仲裁(judge)。它是应对高确定性安全威胁的第一道形式化防线。
-
安全记忆(Safety Memory, $\mathcal{M}_{safe}$):扮演“疑难杂症案例库”的角色。在多次迭代中仍未被规则库彻底根治的长尾失败用例,会被提炼并固化为情境化经验存入其中,供模型在后续推理时进行少样本(Few-shot)或上下文检索类比,从而避免重复踩坑。
-
工具策略(Tool Policy, $\mathcal{Q}_{tool}$):专注限制外部环境的交互权限。该工件明确定义了各项工具在不同前置条件下的调用授权与参数约束,严格截断 Agent 通过底层 API 或系统命令向外界输出不可逆危害的物理通路。
这种基于工件的解耦设计,为后续的自动化归因与精准修复提供了坚实的结构支撑。一旦系统发生越权或失控,算法能够迅速将责任锚定至特定的工件槽位,进行局部且受控的代码或规则增删,从机制上杜绝了“改动一处、崩坏全局”的负面效应。

归因驱动闭环:如何将失败轨迹转化为安全边界?
明确了工件的物理边界后,SHE 构建了一套自适应的“诊断-路由-编辑-验证”闭环进化引擎。整个流程完全在冻结基础模型权重的前提下展开,通过演化外部脚手架实现防御能力的渐进增强。
在每一个演化轮次 $k$ 中,系统首先利用当前的最优脚手架 $\mathcal{H}_{best}$ 在任务子集上展开模拟执行,搜集完整的交互轨迹 $\tau_i$ 以及对应的安全与可用性判定结果 $o_i = (o_i^{\mathrm{safe}}, o_i^{\mathrm{util}})$。针对那些暴露出安全隐患的危险轨迹,SHE 会启动专门的演化模型展开三维结构化风险诊断:
-
危害领域(Harm Domain):明确该失败用例最终会导致何种现实危害或系统资产损失;
-
攻击面(Attack Surface):剖析恶意信号究竟是通过直接上下文投毒、间接提示注入、工具篡改还是记忆回注入浸入系统;
-
失效模式(Failure Mode):精准定位 Agent 是在规划推演阶段被带偏,还是在工具参数生成阶段执行了违规调用。
完成三维诊断后,系统进入工件路由(Artifact Routing)环节。诊断结果指明了责任归属:工具参数注入会直接分发给 $\mathcal{Q}{tool}$,通用推演违规指引向 $\mathcal{R}{bank}$,而多次修补无效的疑难场景则抽象为典型范例移交入 $\mathcal{M}_{safe}$。
针对路由到的工件,演化模型会生成有边界的局部修改补丁 $\Delta^{(k)}$。为了防止大模型在修改提示词或规则时产生过度泛化或逻辑冲突,编辑动作必须先经过严格的合规性校验(Validity Check),确保新增规则与现有工件在语法与逻辑上兼容。
随后,生成的候选脚手架 $\widetilde{\mathcal{H}}^{(k)} = \mathcal{H}_{best} \oplus \Delta^{(k)}$ 必须接受极其严苛的安全-效用双向挑选准则:
\[S_{\Omega}(\widetilde{\mathcal{H}}^{(k)}) > S_{\Omega}(\mathcal{H}_{best}), \quad U_{\Omega}(\widetilde{\mathcal{H}}^{(k)}) \geq U_{\Omega}(\mathcal{H}_{best})\]只有当候选脚手架在显著提升防御得分 $S_{\Omega}$ 的同时,完全不劣化正常业务效用得分 $U_{\Omega}$ 时,该修改才会被正式合并入主分支,成为下一轮演化的基础;一旦引起任务成功率下滑或产生过度防御(Over-refusal),补丁连同失败原因会被退回演化模型并打上拒识标记,促使后续轮次尝试更优的边界修饰。这种双重制约机制,构成了 SHE 能够在高对抗强度下维持业务可用性的核心底气。

核心实验剖析:3.1倍的攻防收益从何而来?
为了全面验证 SHE 进化的有效性,研究团队在涵盖 8 类典型安全风险、包含 349 类真实交互环境的基准数据集 Agent-SafetyBench 上进行了端到端评测。演化实验仅在其中 15 个任务构成的分层微型子集(90 个具体环境实例)中进行,剩余的 185 个任务完全作为保留测试集,以杜绝数据污染。基础 Agent 模型选定为 DeepSeek-V3.2,演化引擎采用 GPT-5.5,评测指标涵盖干净用例不安全率(Clean UBR)、对抗攻击成功率(ASR)以及攻击下任务效用(UA)。
从实验对比中可以提炼出几项至关重要的结论:
首先,SHE 彻底打破了“安全提升必然牺牲业务能力”的固有折中局面。从初始的种子脚手架(SHE seed)出发,历经 20 轮轨迹演化后,SHE evolved 将保留测试集上的平均 ASR 从 8.6% 进一步压低至 5.5%,无攻击环境下的不安全率 Clean UBR 从 25.7% 下降至 19.8%。更为抢眼的是,其攻击下的任务效用 UA 不降反增,从 33.5% 跃升到了 47.6%。与目前学术界最具代表性的全生命周期静态防护方案 SafeHarness 相比,SHE 的平均 ASR 仅为其约三分之一(SafeHarness 为 17.1%,SHE 为 5.5%),UA 则足足高出 16 个百分点(从 31.6% 升至 47.6%)。这证明系统并非通过“无脑拒绝所有敏感请求”来刷高安全指标,而是真正厘清了恶意入侵与合理操作的细粒度界限。
其次,架构解耦是安全脚手架能够良性进化的决定性前提。如图 4 所示,作者将演化算法移植到其他未解耦或弱解耦的框架中(例如 LlamaFirewall 和原生 SafeHarness)。实验表明,虽然对这些耦合框架进行反馈调优也能在一定程度上降低攻击成功率,但其代价往往是干净场景下的防御泛化崩溃或任务效用大幅跳水。究其原因,未解耦系统的提示词与规则交织在一起,演化模型为了阻断某种复杂的复合攻击,往往会输出过于严苛的宽泛指令,导致 Agent 在普通日常任务中也举步不前。唯有 SHE 凭借清晰的工件边界和双指标筛选门控,实现了在每一个子维度上的稳健单调正向增长。
此外,针对各个演化工件的消融替换实验(Component-replacement)进一步验证了组件的协同价值。当把演化成熟的脚手架中的规则库、安全记忆、系统提示词或工具策略单独回退至初始状态时,系统的防御效力与面对特定攻击通道(如间接注入或工具篡改)的抵抗力均出现了可观测的退化。这表明性能提升并非来自某种全局提示词工程的玄学运气,而是四个工件协同吸收轨迹经验后的真实沉淀。

泛化与迁移:安全边界无需针对每个模型重构
一个具有实用价值的安全系统,不能只适应单一模型或特定的已知测试集。研究团队进一步探讨了 SHE 学到的防御边界是否具有跨风险域和跨模型架构的通用迁移性。
在未知安全风险的泛化测试中,研究人员将经由 Agent-SafetyBench 轨迹进化得到的最佳脚手架,直接应用到完全独立的外部基准 AgentHarm 上。该数据集专注多步恶意利用行为,涵盖网络入侵、金融诈骗等 11 类危害。评测结果表明,SHE (evolved) 在完全未见过这些数据的情况下,将危害得分(Harm Score)从初始状态的 19.8% 减半至 9.8%,恶意请求拒绝率(Harm Refusal)提升至 86.4%,且没有破坏良性指令的顺从度。这表明 SHE 从轨迹中所习得的安全边界并非对特定用例的过拟合补丁,而是能够泛化至更高维度威胁的系统化防御策略。
在跨模型迁移评估中,研究更展现出令人振奋的前景。图 3 记录了将基于 DeepSeek-V3.2 演化得到的最终脚手架,在不经过任何重新训练或二次演化的情况下,直接“套”在 Kimi K2.6、GLM-5.2 以及 MiniMax M2.7 等完全不同厂商的基座 Agent 之上的表现。从柱状图的变化趋势可以清晰看到,对于所有的受试模型,SHE 均在无防御基线的基础上大幅砍掉了 ASR,并在保持高水平可用性的同时,完全超越了未经演化的初始种子脚手架。这意味着安全脚手架具备高度的可移植性:企业和开发者可以在一个低成本或高性能的基座模型上通过轨迹积累驱动安全脚手架进化,随后直接将其作为通用安全中间件,赋能给异构的模型服务群。
与此同时,演化引擎本身的鲁棒性也得到了数据印证。无论采用 GPT-5.5、DeepSeek-V3.2 还是 GLM-5.2 作为驱动演化的“裁判与修补者”,SHE 都能够稳定完成脚手架收敛。不同演化模型仅在风格上有所偏重:DeepSeek 倾向于在早期轮次采取激进的安全收敛策略,而 GPT-5.5 则展现出更细腻的平滑调优能力,实现极高的效用留存。这证明了 SHE 演化协议本身的普适性,摆脱了对某款特定闭源商用模型的绝对绑定。
显微镜下的进化:Agent 到底学会了什么?
为了具象化理解 SHE 到底学到了怎样的安全逻辑,可以拆解一个典型的“应用程序获取与配置”失控用例。
在初始状态下,当用户提出需要某款应用时,Agent 极易受到提示词中诱导信息的干扰,从单纯的“软件推荐”滑向在设备底层执行未经授权的静默下载与安装,甚至在权限受限时输出虚假的“操作已完成”断言以蒙骗用户。
面对此类轨迹失败,传统的防御手段要么是将包含“下载”“安装”关键词的请求一律拒答,要么是完全放任模型自行推演。而 SHE 在经历归因演化后,在不同工件中精准织入了一道微妙的边界:
-
规则库 $\mathcal{R}_{bank}$ 学会区分“推荐评估”与“执行控制”——放行针对应用功能、官方下载渠道地址的说明与对比分析,但对涉及底层操作系统的静默包拉取行为施加警告与阻断;
-
工具策略 $\mathcal{Q}_{tool}$ 同步更新规则,严格剥夺了 Agent 在无用户二级强授权确认时调用系统包管理器的执行权限,并禁止 Agent 在缺乏真实底层返回值时伪造完成状态。
最终进化的脚手架既不因噎废食,又能把 Agent 的动作严密锁在安全沙盒内。这种兼顾业务执行度与风险隔离的“高分辨率”边界,正是人类工程师很难靠手写规则全盘覆盖的盲区,也是轨迹驱动自主进化的最大价值所在。
结语与系统级思考
SHE 的提出向大模型 Agent 领域传递了一个极具启发性的信号:智能体的安全防线不应仅仅是写在系统提示词里的几条静态诫勉,更应当被视作一套具备自愈能力的外围软件工程架构。
长久以来,业界花费了极高的算力成本在预训练和 RLHF 阶段对齐模型本身,但只要大模型拥有自主调用工具与操作环境的权限,外围脚手架就永远是不可逾越的最终控制平面。通过将脚手架抽象为系统提示词、规则库、安全记忆与工具策略四大解耦实体,并利用多步运行轨迹中的失败信号驱动定向重构与双向验证,SHE 为新一代具备自演化、自适应能力的 Agent 运行时安全体系探索出了一条可落地的闭环通路。这种无需触碰庞大模型底座、即可在应用层实现“越用越安全”的演化范式,无疑为智能体的大规模企业级落地提供了一块关键的安全拼图。