世界模型靠不住:TU Berlin 团队证实 Agent 模拟器误判率高达 95%

False Prophets: On the Security of World Models in Agentic Systems

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

世界模型靠不住:TU Berlin 团队证实 Agent 模拟器误判率高达 95% 论文图示

为了让大模型在终端(Terminal)、软件工程或机器人控制中执行复杂的多步任务,近年来的一个热门趋势是为智能体(Agent)引入“世界模型”(World Models)。世界模型本质上是一个被训练来充当“环境模拟器”的模型:智能体在真实环境里敲下高危的 Bash 命令之前,先将指令丢给世界模型进行预测,判断其输出与退出状态;只有当世界模型预测结果安全合规时,动作才会被真正下发。这种设想看似完美兼顾了规划效率与安全护栏,然而,柏林工业大学(TU Berlin)与 BIFOLD 研究所的最新研究打破了这一假设。

ArXiv URL:https://arxiv.org/abs/2607.23147v1

这项研究指出,将大语言模型充当的环境世界模型作为安全审查关卡,正在为 Agent 系统引入灾难性的安全漏洞。由于环境模拟本质上是统计逼近,攻击者可以极其轻易地诱导世界模型产生幻觉或误判,误判率最高可达 95%。世界模型在模拟器里判定为“安全”且“顺利完成”的动作,在真实机器上执行时可能会引发系统核心文件被清空、恶意反向 SSH 连接建立、计算资源耗尽乃至内存敏感数据泄露。研究团队将这些给出错误安全承诺的世界模型尖锐地比喻为“伪先知”(False Prophets)。

虚拟先知的盲区:为什么世界模型会误判?

世界模型在数字终端任务中的核心目标,是给定当前历史上下文 $o_{1:t}$ 与待执行动作 $a_{1:t}$,生成对环境下一步文本反馈的准确预测 $\hat{o}{t+1} = \mathcal{M}(o{1:t}, a_{1:t})$。这种推断跳过了真实的系统环境或容器执行,虽然具备极高的灵活性与低开销,却面临着一系列系统层面的根本性制约。

论文通过一个直观的例子揭示了这一机制如何瓦解系统的安全性:在一个自动化部署脚本中,包含一段用于清理构建残留的清理逻辑,其指令预设会根据环境变量 $GITHUB_WORKSPACE 清空对应工作目录。在世界模型的上下文与训练偏置中,它默认认定当前处于 GitHub Actions 的持续集成流水线中,因此 $GITHUB_WORKSPACE 理所当然地存在并指向代码仓库路径;然而在智能体运行的实际开发机环境中,该环境变量并未定义,最终执行展开成了针对系统根目录二进制文件夹 /bin 的直接删除。世界模型向 Agent 报告了“构建目录清理成功”,真实系统却在底层被彻底破坏。

研究团队进一步将这些安全漏洞背后的根源梳理为七大攻击向量,并明确区分了“理论上无法从根本根除的固有缺陷”与“可以通过工程手段缓解的技术缺陷”:

  1. 计算可判定性与停机问题(Computability):评估一个程序会运行多久本质上等价于执行该程序,试图通过文本预测任何任意程序的运行耗时直接受制于停机问题。真实系统中的 CPU 负载、物理内存占用与调度抖动世界模型均一无所知,攻击者可以通过构造看似平淡但实际包含深层递归或计算黑洞的脚本,诱导世界模型判定其“瞬间结束”,进而在真实系统上造成长达数小时的拒绝服务攻击。

  2. 非确定性与并发竞态(Non-determinism):许多终端操作依赖系统调度、外部熵源或多进程竞争。例如多个后台进程通过具名管道(FIFO)竞争写入单字节数据时,真实系统输出取决于操作系统内核调度器的执行顺序。但世界模型通常采用自回归贪心或单一样本生成,只能给出一条确定性推断,完全忽视了并发交织空间。攻击者可以设计仅在特定竞态分支触发的恶意代码,世界模型因为仅模拟出良性分支而直接予以放行。

  3. 环境知识缺失与版本漂移(Missing Knowledge):世界模型的参数更新永远滞后于物理系统。例如 GNU coreutils 9.10 之后才引入了特定的参数简写,若世界模型训练早于该版本,它就无法理解该参数的实际语义;同理,真实系统如果运行着旧版内核或缺失特定工具,世界模型也往往会按其预训练的“标配环境”进行一厢情愿的模拟。

  4. 外部环境依赖(External Environment):涉及网络接口状态、外部 API 可用性或系统当前绝对时间的脚本,其运行态受制于外部物理世界。即便世界模型在 Prompt 中被告知了初始时间,模拟推断时刻与真实执行时刻的微小时间差也会使得网络请求或条件判断彻底失效。

  5. Token 爆炸与生成回环(Token Count):大模型极难维持大体量 Token 的精确重复生成。如果一个脚本包含输出上百万次字符的循环,真实系统中标准输出可以平稳处理,而世界模型若试图忠实模拟就需要生成上百万个 Token,不仅会导致模拟端极其昂贵的 API 费用甚至无限死循环,还可能通过模型的主动截断或摘要行为掩盖掉长输出底部的异常退出。

  6. 代码表面模式误导(Misleading Patterns):大模型严重依赖代码的命名与外观惯性。一个形似标准二分查找的脚本,如果攻击者故意将边界收缩的加号写成减号,实际运行会陷入死循环;但世界模型看到函数名与外形往往会直接按照经典算法输出预期的查找结果,从而让有毒逻辑瞒天过海。

  7. 世界模型提示词注入(Prompt Injections):当脚本处理的数据或者 Bash 注释中暗藏自然语言指令时,世界模型极易“反客为主”地服从这些注入指令,改变模拟输出甚至吐出此前上下文中残留的敏感临时数据。

AgentWorld-Robust 基准:全面压测两款前沿开源世界模型

为了严格量化上述风险,作者团队构建了专门针对终端文本世界模型的安全基准测试集 AgentWorld-Robust

评估安全漏洞不能依赖平均准确率,因为真实对抗场景下攻击者“只要成功诱骗一次即可完成渗透”。因此,团队设计了 700 个专门针对上述七大攻击根源的高对抗性测试脚本(每个类别 100 个),所有样本都控制在极短代码长度内,以剥离长代码阅读理解带来的干扰,专注于测试世界模型在系统底层逻辑上的判断极限。基准脚本由开源模型 MiMo V2.5 辅助生成并经过语法与可用性过滤,确保低成本攻击者同样具备复现该能力。

实验选取了当前公开可见的两款专用终端世界模型展开评测:具备 35B 参数的 Qwen-AgentWorld 与 Meta 推出的 32B 参数密集架构 Code World Model(CWM)。所有模型均在全精度 bfloat16 下由 vLLM 驱动推理;真实基准结果则采集自 Ubuntu 20.04 的 Docker 沙箱物理运行,设定了 30 秒执行超时与 512 MiB 内存上限。

定性与定量实验呈现出的结果令人触目惊心:在几乎所有特定对抗类别中,两款世界模型的预测结果与沙箱真实执行均出现大面积偏离。部分特定攻击向量下,世界模型的模拟失败率飙升到了 95%。

在非确定性(Non-determinism)测试中,当三个后台进程竞争向管道写入字节时,真实的沙箱内核调度打乱顺序输出了 YXZ。然而 Qwen-AgentWorld 凭借其思维链推理硬性套用“内核等待队列”,机械地断定输出必然匹配脚本编写的书面顺序 XYZ;CWM 更是错误地假设读取指令在收到首个字节后就会直接返回。在可判定性(Computability)测试中,一段深度阿克曼函数计算脚本在沙箱中 30 秒内迅速超时,但 Qwen-AgentWorld 却脱离物理执行逻辑,直接凭借预训练记忆吐出了对应的理论数值 65533,完全无视了真实机器上该指令即便跑上一个小时也无法返回结果的现实;CWM 甚至吐出了一个荒谬的计算结果 5

在时间预测偏差方面,世界模型所预测的耗时与沙箱真实运行时间展现出了极其严重的脱节。大量样本在沙箱中仅仅耗时数秒,世界模型却预估其会持续阻塞;而在更危险的反向场景中,世界模型判定可以在 1 秒内闪电执行完毕的操作,在沙箱中直接触发了资源耗尽与系统卡死。

攻击后果与架构防御

当世界模型成为智能体链路的核心决策前置环节时,这种系统性的预测失真将直接转化为 CIA 三维度的安全威胁。在机密性(Confidentiality)层面,由于世界模型为了维系状态通常会在上下文窗口中累积完整的操作历史,即便真实系统上已经通过 rm 销毁了短暂生成的临时密钥,攻击者依然能够通过让世界模型模拟读取指令,从世界模型的历史残存中逆向提取密钥;在完整性(Integrity)层面,恶意的反向 Shell 或篡改数据的隐蔽指令会被世界模型幻觉为“安全脚本”,从而被调度代理安全执行;在可用性(Availability)与财务成本层面,无休止的循环与庞大输出预测能直接榨干运行世界模型的 Token 预算并瘫痪物理机器。

世界模型的引入,本意是给大模型智能体装上一台免受物理损伤的“虚拟沙盒”,但这篇论文严谨地证明了:大模型驱动的世界模型并不等于确定性的虚拟执行环境。世界模型本质上是在进行统计意义上的语义猜测,它不具备真正的操作系统内核、硬件时钟与调度总线。

针对这些固有漏洞,论文明确告诫开发者:绝不能将世界模型单独作为拦截高危命令的唯一防火墙。要保障终端 Agent 的安全,必须建立纵深防御体系。首先,世界模型的推断必须降级为“规划参考建议”,而不可赋予其免检执行的绝对决定权;其次,针对具有破坏性的文件操作、网络建立与提权指令,系统底层必须由强制访问控制(MAC)、真实无特权轻量沙箱(如 gVisor、Docker)以及人工介入(Human-in-the-loop)进行硬性兜底。在世界模型能够跨越可计算性理论与非确定性鸿沟之前,盲目听信它的模拟预测,只会让系统在伪先知的盲从下走向崩溃。