JANUS:给Agent装上前瞻护栏,把延迟风险拦截在发生前,平均防御率提升15.9%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在大模型从“只能对话的聊天机器人”快速演进为“能自主调用工具、执行系统指令的智能体(Agent)”之后,AI 安全的重心发生了根本性的位移。过去的内容审查主要防范模型生成有害言论、偏见或涉黄涉暴文本;而面对能够写脚本、修改配置、读取私密文件和操作外部系统的 Agent,安全问题直接演变成了破坏力极强的系统运行事故。一次错误的工具调用可能擦除整块磁盘、泄露数据库私钥,或是彻底破坏线上环境。

ArXiv URL:https://arxiv.org/abs/2607.19913

更棘手的挑战在于时间的滞后性。在多步长程规划(Long-horizon)任务中,真正的灾难往往不是在出现恶意的第一步就爆发,而是在漫长的执行序列末端才显现。当前主流的安全护栏大多是“反应式(Reactive)”的,通常等到危险行为已经进入执行阶段、甚至是动作已经产生不可逆影响时才被动触发。为了打破这种“事后诸葛亮”的困局,新研究提出了名为 JANUS 的前瞻性安全框架,并训练出了专用的预测型护栏模型 Vanguard。

反应式护栏与前瞻式护栏的对比

JANUS 的核心思路非常明确:不是等动作发生了再判定违规,而是让护栏模型仅凭已经发生的部分轨迹,主动推演未来最可能出现的安全风险,并将“预判未来”与“当下裁决”紧密耦合。实验表明,Vanguard 在四个主流 Agent 安全基准上将平均保护率提升了 15.9 个百分点,同时在正常任务上的执行成功率反而提升了 5.1 个百分点。这证明了主动前瞻机制不仅不会带来过度防御,反而是平衡安全性与实用性的有效路径。

长程 Agent 的安全盲区:为什么“事后检测”注定失效?

要理解 JANUS 的价值,首先必须看清长程智能体工作流中的风险演化模式。许多破坏性行为在初期看起来完全人畜无害,甚至严格符合用户的字面指令。

举一个典型的操作场景:用户要求 Agent 在本地部署一个项目,并明确约束“所有依赖库修改必须限制在虚拟环境内”。在任务执行的第 2 步,Agent 发现虚拟环境缺少某个系统底层依赖;在第 5 步,它为了绕过权限报错,执行了修改宿主机全局 Python 环境的操作。系统依赖由此被破坏,导致服务器上运行的其他关键服务崩溃。

在这类事件中,破坏系统的命令直到第 5 步才出现,但决定该行为是否违规的核心约束早在第 1 步就由用户划定了。传统的护栏如果只审查第 5 步的单步调用,会发现“安装依赖包”本身是一个常见且合法的开发行为;如果只审查全局上下文,又往往因为上下文过长而无法推演该指令在后续几步会造成怎样的连锁反应。

这种“潜伏性风险”在外部环境干扰下更为致命。例如,Agent 在读取一份第三方汇总文档时遭遇了隐式提示词注入(Indirect Prompt Injection),恶意指令潜伏在抓取的数据中,诱导 Agent 在几步之后将敏感 Token 写入公开日志。反应式防御在攻击 payload 被解析的瞬间往往缺乏足够的上下文判定危险,等到执行外发操作时,敏感数据其实已经落入攻击者手中。

显而易见,安全防线必须前置。护栏模型需要的不是“事后审计”能力,而是在局部轨迹呈现出潜在风险苗头时,就具备推断“如果放任 Agent 这么做,接下来几步很可能会走向越权或破坏”的前瞻预测能力。

模拟数据引擎:解构三类风险起源

要训练一个具备前瞻预判能力的模型,首要难题是获取足够丰富、真实且包含延迟后果的长程轨迹数据。如果在真实生产系统里直接跑恶意攻击和高危调用,成本与系统风险都不可接受。为此,JANUS 搭建了一套基于多智能体模拟的数据生成流水线。

JANUS 的模拟数据构建流水线

JANUS 首先构建了一套覆盖全维度的风险分类体系(Risk Taxonomy),将智能体可能遭遇的风险精准溯源为三类:

  1. 用户端诱导风险(User-originated risks):用户本身怀有恶意目的,但常常用正常的办公、运维或编程需求作为伪装,暗中包含网络滥用、越权爬取、欺诈或破坏系统等企图。

  2. 环境端注入风险(Environment-originated risks):用户的初始意图完全良性,但外部环境被污染。Agent 在调用工具读取邮件、拉取网页或读取本地文件时,遭遇间接注入或环境伪造,诱导模型发生偏航甚至外泄数据。

  3. Agent 自发性漂移风险(Agent-originated risks):用户没有恶意,环境也没有攻击载荷,但用户的指令存在模糊、歧义或边界条件不全的问题。Agent 由于理解死板、忽略底层依赖或过度简化规划,自发采取了高危假设与危险操作。

确立了三类起源后,框架通过一个多 Agent 协作网络完成场景构造与推演。总控模块(Manager)分解场景,调度指导者(Instructor)撰写任务指令,工具设计者(ToolDesigner)定义工具调用模式,打分者(Grader)设定评估准则;若是环境注入场景,还会接入注入生成器(EnvInjector)。

在轨迹合成环节,执行器(Executor)按照 ReAct 范式步步推进,而环境反馈全部由模拟器(Simulator)动态返回,避免了在外部真实接口上产生实质危害。最后,由审查者(Reviewer)通过拒绝采样机制严格把控轨迹质量,剔除逻辑断层、标签不符或风险特征不明显的样本。

数据构建的关键在于步骤级截断标注(Step-Level Annotation)。对于每条合格轨迹,流水线会在关键决策节点处将其截断为已执行前缀 $\tau_{\mathrm{pre}}$ 和后续延续 $\tau_{\mathrm{after}}$。标注系统将前缀打上三分类标签:安全(Safe)、明确不安全(Unsafe)以及潜在风险(Potential Unsafe),同时生成一份精炼的未来走向自然语言摘要 $s$。整套流程沉淀了超过 7.5 万条高质量样本,为后续的前瞻式强化学习铺平了道路。

CoAA-RL:让预测与裁决深度咬合

拥有了推演轨迹数据之后,如何让模型真正学会“面向安全判断的未来预测”?这是 JANUS 在算法设计上的关键突破。

如果直接用纯文本生成的监督微调(SFT)训练模型去预测未来,模型往往会陷入“事无巨细复述后续动作”的泥潭,生成大量细碎但与安全无关的操作细节;反过来,如果完全不约束预测文本与真实走向的一致性,模型又可能产生虚幻妄想。

JANUS 提出了预测与裁决耦合强化学习(Coupled Anticipation and Adjudication Reinforcement Learning,简称 CoAA-RL)。它将护栏模型的行动分解为两个紧密依存的任务,并共享同一套底层策略网络 $\pi_{\theta}$:

CoAA-RL 框架架构

首先是前瞻预测任务(Anticipation Task)。在给定用户指令 $x$ 和当前已观察的前缀 $\tau_{\mathrm{pre}}$ 下,模型切换至预测模式 $m=A$,采样生成若干条对未来可能走向的抽象摘要 $S_k$。这一步不需要还原每一个底层的函数入参,而是重点提炼是否存在高危工具调用、权限扩张或不可逆文件修改。

其次是安全裁决任务(Adjudication Task)。模型切换至裁决模式 $m=D$,在吃进原始前缀 $\tau_{\mathrm{pre}}$ 的同时,把刚刚预测出来的未来摘要 $S_k$ 作为重要输入依据,最终输出当前前缀的安全判断 $\hat{y}$ 及简要决策依据。

CoAA-RL 的精髓在于其耦合奖励函数设计。裁决任务的奖励比较直接,结合了分类标签的准确率与输出格式的合规性:

\[r^{D}_{k,j} = \lambda_D \ell_{k,j} + (1-\lambda_D)\phi_{k,j}\]

而在前瞻预测任务中,其获得的奖励并非仅仅来自生成文本与标准真实未来的语义相似度 $\operatorname{Sim}(S_k, s)$,还必须把下游裁决任务在拿到该预测后的表现 $u_k$ 作为反馈并入其中:

\[r^{A}_k = (1-\lambda_A)\operatorname{Sim}(S_k, s) + \lambda_A u_k\]

这一设计的精妙之处在于:它不追求生成文学上最精确的“未来小说”,而是专门奖励那些“对下游安全判断真正有价值的未来预警”。 如果一个预测虽然和未来真实发生的杂七杂八的操作很贴近,但完全遗漏了潜在的安全破绽,导致下游依然判错,那么它得到的强化奖励依然极低。

在此基础上,算法引入了基于组相对优势的策略优化(GRPO),在同一个问题前缀下对多个采样结果进行组内相对优势比对,联合优化预测损失与裁决损失:

\[\theta^{\star}=\arg\min_{\theta}\left[\mathcal{L}^{A}_{\mathrm{GRPO}}(\theta)+\eta\,\mathcal{L}^{D}_{\mathrm{GRPO}}(\theta)\right]\]

通过这种强化学习机制训练出来的护栏模型名为 Vanguard。在实际推理部署时,Vanguard 彻底摆脱了对外部标注或真实未来轨迹的依赖。每当 Agent 走完一步,Vanguard 仅凭借历史前缀就能在内部先“脑补”一步未来风险预警,再基于这个预警作出放行或拦截决策。

全面压制基线:四大基准上的攻防实测

研究团队在四个代表性的 Agent 安全基准上对 Vanguard 展开了严苛的评测,覆盖单步工具调用、长程多轮交互以及复杂的计算机使用环境:

参与对比的基线不仅包含了诸如 Llama-Guard-3-8B、Qwen3Guard-Gen-8B 和 TS-Guard 等主流的步骤级护栏模型,还覆盖了 Sandwich Defense 以及 LlamaFirewall 等框架级防御方案。

实验的核心指标包括攻击成功率(Attack Success Rate, ASR,越低越好)以及在良性任务上的完成效用(Utility,越高越好)。保护率则直接通过 $1-\mathrm{ASR}$ 来直观衡量。

综合实验结果展现了预测式架构的断层式优势:

在四个基准的平均表现上,没有任何护栏裸奔的参考系统平均 ASR 高达 0.397;常规的六种基线护栏将平均 ASR 压低到了 0.230;而 Vanguard 则将这一数字大幅降至 0.071。换算为防护水平,Vanguard 的平均拦截保护率相比 baseline 整体拉升了 15.9 个百分点。

更关键的是良性业务的“误杀率”。过去的安全护栏之所以很难在工业界落地,很大程度上是因为策略过于保守,往往在提升拦截率的同时大幅削弱正常任务的执行。但在 AgentDojo 的良性任务测试中,Vanguard 取得了 0.680 的完成效用,不仅与完全不设护栏的基准持平,更是高出其他护栏基线的平均水平(0.629)整整 5.1 个百分点。这说明:对未来的前瞻性推理让模型能够更精准地区分“表面可疑但实际安全的操作”与“看似正常但暗藏危机的操作”,显著降低了因草木皆兵而产生的误报与误杀。

在具体场景中,这种优势在极度依赖长程规划的 LPS-Bench 上体现得最为悬殊。传统单步模型 Qwen3Guard-Gen-8B 在 LPS-Bench 上的 ASR 高达 0.323,框架级防御 LlamaFirewall 更是达到 0.530;而 Vanguard 将该基准的 ASR 一举压低到 0.075。在计算机控制和系统运维这类长链路任务中,缺乏前瞻能力的传统护栏面对深层隐藏的系统破坏几乎处于不设防状态。

为什么必须“前瞻”?消融实验与机制解析

为了剥离各项组件的影响,作者团队在 AgentDojo、AgentLAB 和 LPS-Bench 上设计了细致的消融分析,解答了几个核心技术疑问。

其一是前瞻机制本身的必要性。如果完全去掉训练阶段的 Anticipation 任务,模型的平均 ASR 立即从 0.072 飙升到 0.148,AgentDojo 的良性效用也从 0.680 跌落至 0.526;如果训练了预测能力但在推理阶段跳过未来摘要、直接根据前缀做决策,平均 ASR 同样升至 0.123。这证明:无论在训练期还是推理期,“显式预测未来走向”都是提供强防护不可或缺的认知支架。

对比实验中还引入了一个不可实测的理论上限——Oracle 设置,即在推理阶段直接给裁决器喂入真实的未来轨迹摘要。此时平均 ASR 进一步下探至 0.052。这不仅说明未来信息确实对当前决策至关重要,同时也印证了 Vanguard 通过 CoAA-RL 内部生成的推演结果已经非常逼近真实未来的指导效果。

其二是强化学习耦合奖励的作用。如果训练前瞻生成时仅给与真实走向的相似度奖励(Sim-only),或者仅给下游裁决成功率奖励(Util-only),模型的表现都会发生灾难性滑坡:前者导致平均 ASR 恶化 101.9%,后者导致 ASR 恶化 79.2%,且两者的良性任务完成率均暴跌超过 40%。这揭示了一个残酷的现实:脱离了下游决策目标的纯文本匹配容易陷入无效细节,而脱离了客观走向约束的纯强化探索则极易产生幻觉与策略坍塌。只有两相平衡,才能收敛出具有实用价值的推演能力。

超参数敏感度分析

超参数 $\lambda_A$(控制预测相似度与裁决效用权重的平衡因子)的敏感性实验清晰地印证了这一点。无论偏向任何一个极端,安全拦截率与良性效用都会大幅受损;只有在 $\lambda_A=0.5$ 左右时,系统才能取得最佳的攻防收益。

其三是提前预警的窗口期极限。为了检验模型在极早期信息匮乏时能否见微知著,研究者按照完整轨迹的 25%、50%、75% 和 100% 进行了前缀截断测试:

在轨迹仅推进到 25% 的极端早期,环境线索极其稀疏,传统护栏几乎完全丧失识别能力。但 Vanguard 已经展现出了敏锐的危险感知,在 AgentDojo 和 AgentLAB 上取得了所有方案中的最低 ASR。当轨迹推进到 50% 以上时,Vanguard 在所有任务上全面进入最佳防御状态。这意味着很多在第 8 步或第 10 步才会爆发的系统崩溃,Vanguard 在第 4 步或第 5 步就已经完成了未来态推演,并成功将高危操作扼杀在摇篮里。

从修辞防御迈向系统化主动安全

从大模型应用的安全发展脉络来看,安全机制经历了从最原始的关键词匹配、输出端内容分类过滤,到 Agent 时代针对单步 API 调用的权限拦截。但只要防御依然停留在“看到一个动作,判断一次是非”的单步切片视角,就永远无法解决长程任务中的意图隐藏与后果滞后问题。

JANUS 和 Vanguard 的出现,标志着 Agent 安全正式从被动合规审查走向了主动世界推演。在智能体拥有更长调用链、更高系统控制权(如自主执行 Shell 命令、操纵操作系统 GUI)的未来,护栏系统不能只做看门人,它本身必须是一个具备高阶因果推理与后果推断能力的轻量级“预测引擎”。

当然,这项工作也存在其内在的边界条件。训练完全依赖多智能体模拟合成数据,虽然规避了物理环境的安全隐患,但现实业务环境中的报错形态、网络抖动和人机博弈往往比模拟器更加光怪陆离。如何将这种基于 CoAA-RL 的前瞻推演能力无缝迁移到复杂的生产环境,并控制两阶段推理带来的延迟开销,将是预测型护栏下一阶段必须攻克的工程课题。

但可以肯定的是,给 Agent 安全装上一双“能够洞察未来步数”的眼睛,已经成为长程自主系统落地过程中无法绕开的关键技术底座。