VisualPatchWorld:将物理引擎写成代码,规划成功率超基线23.5点

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在具身智能与基于模型的强化学习(Model-based RL)领域,“世界模型”(World Model)已经成为智能体理解物理现实、在脑海中模拟推演并做出行动决策的核心支柱。然而,当前构建世界模型的技术路线正面临着一种尖锐的两难困境:一条路线依赖深度神经网络,将动力学规律隐式编码在连续的隐空间中;另一条路线则依赖手工编写的物理仿真引擎。前者具备强大的数据驱动扩展能力,却像一个不可解释的黑盒,一旦长程推演发生漂移,人类甚至算法本身都无法定位究竟是哪一条物理规律预测出错;后者虽然透明、可控且支持任意反事实模拟,却需要专家针对每个新场景耗费数周时间手动建模,极度缺乏通用性和自动化构建能力。

ArXiv URL:https://arxiv.org/abs/2607.25236v1

香港浸会大学(HKBU)等机构的研究团队提出了一种全新的解决范式:VisualPatchWorld(简称 VPW)。该方法不再将动力学压缩为神经网络权重,也不依赖人工从零手写物理引擎,而是直接从智能体与环境的交互轨迹中,自动归纳出纯粹由 Python 代码 编写的执行化世界模型。与以往仅优化单步预测误差的代码生成方案不同,VPW 提出“两级程序归纳”机制,先通过极短的主动探测(Active Probing)确定定性物理草图,再通过多步展开损失拟合数值参数。

世界模型的统一闭环与 VisualPatchWorld 的代码表征定位

在横跨二维导航、机械臂连续控制、刚体接触推挤以及三维抓取重排的四项经典控制基准上,VisualPatchWorld 取得了 $69.0\%$ 的平均规划成功率,大幅超出此前最强代码世界模型基线整整 $23.5$ 个百分点。在机械臂到达任务中,规划成功率从传统代码基线的 $8\%$ 飙升至 $72\%$;在方块操作任务中更是达到了 $86\%$。更值得注意的是,在抓取与导航等任务中,这种由几行透明代码构成的自建世界模型,在模型预测控制(MPC)下的表现已经无限逼近真实的 MuJoCo 物理引擎。这项工作为世界模型探索出了一条兼具“可解释性、可编辑性”与“数据驱动自动生成”的可行路径。

黑盒神经表征与脆弱代码:为什么现存方案难堪大用?

为了理解 VisualPatchWorld 带来的突破,必须先厘清现存世界模型在支撑下游规划时暴露的致命硬伤。

第一种主流范式是以 Dreamer、LeWM、JEPA 等为代表的隐式神经世界模型。这类模型通过编码器将原始像素映射到连续隐状态向量,并用循环神经网络或 Transformer 学习隐空间里的转移算子。虽然这种端到端学习极具通用性,但它的动态逻辑是完全隐式的。在机器人执行长程规划时,如果由于微小的接触力误差导致抓取失败,开发者无法打开神经网络权重去“修改物理常数”。这种不可检查、不可编辑的黑盒属性,使得神经世界模型在安全要求苛刻的真实物理交互场景中极易受挫。

第二种路径则是试图利用大型语言模型或符号搜索直接“合成代码”作为世界模型,例如 PatchWorld、WorldCoder 以及 PoE-World 等。这些方法虽然意识到了代码具备天然的结构化与可执行优势,但在方法论上存在一个致命盲区:它们绝大多数都在优化离线数据集上的单步预测误差(One-step prediction error)。

在物理动力学中,单步误差最小化极其具有欺骗性。在连续控制或刚体接触中,由于步长很小,简单的局部线性回归或退化的恒等变换就能在单步均方误差上取得漂亮的数字。然而,一旦将这个程序放入模型预测控制(MPC)中进行长达十步甚至数十步的前向展开(Rollout),这种局部拟合的微小偏差就会呈指数级发散。更严重的是,开箱即用的代码合成往往会选错物理系统的“定性形式”(Qualitative Dynamical Form)——比如在一个充满摩擦与碰撞推挤的系统里,算法错误地拟合了一套无碰撞的自由阻尼运动方程。参数虽然在局部数据上收敛了,但整体动力学景观(Landscape)从根本上就是错的,下游规划器在这样的假模型中搜索,根本无法找到通向目标的有效动作序列。

VisualPatchWorld 的整体系统管线

针对上述症结,VisualPatchWorld 构建了一套四阶段的完整流水线,将“感知抽象”、“数据导出”、“动力学代码归纳”与“闭环规划”彻底解耦。

VisualPatchWorld 系统完整管线架构

整个流程的核心逻辑在于:将复杂的视觉物理世界拆分为两半——感知端负责将无结构的连续像素提取为结构化的场景图(Scene Graph),动力学端则负责在结构化符号空间中寻找能够准确预测状态演化的 Python 程序。

在第一阶段,智能体观测到的 RGB 图像被转换为包含物体位姿、几何轮廓、接近接触标志(Near-contact flags)及相对方位的场景图 $g_t = \phi(o_t)$。这一步确保了动力学模型消费的是具有几何物理意义的清晰概念,而非充斥着背景噪声的原始像素。

在第二阶段,环境交互过程被标准化导出为三元组轨迹 $\mathcal{D} = {(g_t, a_t, g_{t+\delta})}$。这里的一个关键设计细节是动作离散化必须与时间跨度步长 $\delta$ 严格对齐。如果宏动作(Macro-actions)与轨迹记录的采样率不匹配,看似良好的短程转移预测在多步外推时便会迅速崩塌。

第三阶段是系统的核心枢纽:两级程序归纳(Two-level Program Induction)。它不盲目调用通用大模型去随意写几百行没有定性约束的代码,而是将物理规律发现解构为“定性物理草图决策”与“多步展开参数拟合”两层。

在第四阶段,归纳出的 Python 源码程序直接作为内部模拟器,接入收缩视界模型预测控制(Receding-horizon CEM-MPC)框架。在每一个重规划步,交叉熵方法(CEM)在代码世界模型中推演数千条候选动作序列,评估累积回报并选出最优方案。如果处于高难度的接触碰撞场景,系统还支持极其轻量的“混合验证机制”,用真正的物理引擎对代码模型筛选出的少量精英计划进行快速复核。

核心引擎:两级程序归纳机制深度拆解

VisualPatchWorld 之所以能在控制规划表现上大幅碾压以往的代码生成方法,关键在于它彻底重构了动力学程序的搜索逻辑。如图 3 所示,研究团队发现,物理建模中最困难的往往不是确定摩擦系数或弹簧刚度,而是确定物理规律属于哪一种定性类别。

两级程序归纳:主动探测筛选定性草图,多步展开拟合参数

Level 1:基于主动探测的定性草图选择

在面对一个全新环境时,如果直接用回归模型在静态离线数据上死磕,算法极易被数据集中的主导分布(例如大部分时间物体都在静止或匀速运动)所误导。VisualPatchWorld 借鉴了科学规律发现领域(如 NewtonBench)的前沿思想,引入了主动探测(Active Probing)。

在正式拟合动力学参数之前,系统首先在环境允许的极小交互预算内,执行几步精心设计的“鉴别性探针动作”。这一机制的目标不是为了完整遍历状态空间,而是像物理学家做判决实验一样,在预先定义的紧凑定性假设族中进行结构判别:

通过在黑盒环境中运行几个探针步,算法比对哪一种定性结构草图(Dynamical Sketch)最能合理解释探针引发的定性分歧,从而直接在 Level 1 阶段锁定正确的结构模板 $h^\star$。这一机制从根本上杜绝了后续优化落入“用错误的方程形式去死板拟合复杂现象”的致命深坑。

Level 2:基于多步展开损失的参数辨识

选定草图 $h^\star$ 之后,程序结构已经被固定为一个带有未知物理常数的 Python 模板。以往的代码生成框架此时多采用单步均方误差进行最小二乘拟合或语言模型填空,而 VPW 坚决放弃了单步损失,采用了多步规划展开误差(Multi-step Rollout Loss):

\[\mathcal{L}_{\text{rollout}}(\theta) = \sum_{k=1}^{H} \| \hat{g}_{t+k} - g_{t+k} \|\]

其中 $\hat{g}_{t+k}$ 是将诱导出的 Python 程序从 $g_t$ 开始连续递归推演 $k$ 步所得的预测状态,$H$ 与下游规划器的搜索视界完全拉齐。这种损失函数对“单步拟合极好但存在微小单向漂移”的物理参数施加了极大的惩罚,迫使优化算法找到在长时间视界下依然保持数值稳定的动力学常数。

在具体求解上,VPW 采用多重启(Multi-restart)的可微优化技术,对候选参数空间展开多轮快速搜索,并最终挑选在保留验证轨迹集上累积多步展开误差最小的代码实例。最终生成的不是不可读的浮点数矩阵,而是一段结构极为规整、常数清晰可调的真实 Python 函数。开发者可以直接阅读该代码,检查其中的法向量投影系数、速度阻尼比或关节旋转角限制。

感知解耦:从像素到符号图的现实考量

为了在严格可控的条件下评估世界模型的真实能力,必须把“感知带来的误差”与“动力学本身表达不足带来的误差”切分开来。VisualPatchWorld 设计了三种可灵活插拔的场景图抽取路径:

  1. Oracle 路径:直接从模拟器底层读取真实位姿与状态。它彻底消除了视觉感知噪声,是衡量动力学诱导质量和规划理论上限的纯净基准。

  2. Tool 路径:在闭环规划阶段直接输入 RGB 图像帧,利用经典的计算机视觉启发式算法(如颜色分割、几何多边形拟合、坐标系标定与时域平滑滤波)在线提取场景图。这是面向真实应用场景的核心路径,其多边形顶点和碰撞边界全由像素推断而来。

  3. VLM 路径:直接调用拥有数百亿参数的顶尖视觉语言模型(如 Qwen 系列大规模多模态大模型),通过 Prompt 提示词让其从图像中解析出物体间的相对方位和几何属性。

实验表明了一个极其关键的技术洞察:在下游高精度控制任务中,单纯依赖通用 VLM 解析出的场景图虽然在语义上非常丰富(能清晰认出哪个是机械臂、哪个是目标盒子),但在度量精度(Metric coordinates)上存在明显的量化噪声和空间漂移。而依赖几何工具链的 Tool 路径尽管没有复杂的通用常识,却能提供极高精度的物理几何参数,足以驱动由代码生成的物理模型完成复杂的接触规划。这表明在当下的具身智能控制中,基于精细几何约束的确定性感知工具,依然是连接像素世界与符号物理规律之间最稳健的桥梁。

实验结果与关键性能突破

论文在基于 MuJoCo 构建的四个极具代表性的 LeWM 基准环境中展开了详尽评测:涵盖网格导航与长程走廊探索的 Two-room、测试关节动力学与连续避障的 Reacher、涉及复杂非平滑刚体接触与几何旋转推挤的 PushT,以及考验三维空间抓取与精准重排的 Cube。

为了确保评估的绝对公允,所有参与对比的代码基线(包括基于大模型代码合成的 SOTA 方案)与 VPW 都运行在完全相同的交互数据上,并接入参数被彻底冻结的同一套下游 MPC 规划器。该规划器在输入 MuJoCo 真实引擎物理模型时的规划成功率均被调谐在 $90\%$ 以上,从而保证实验瓶颈完全取决于世界模型的建模精度。

显著超越纯代码基线

在纯诱导代码驱动的规划测试中,VisualPatchWorld 展现出了压倒性的优势。四套控制领域的综合平均成功率达到 $69.0\%$,相比此前的顶尖代码世界模型基线实现了 $23.5$ 个百分点的巨大跨越。

最能凸显 VPW 机制优势的,是那些定性结构选择起到决定性作用的高难度动力学任务。在经典的连续机械臂 Reacher 任务中,先前的代码生成方法由于无法理清关节空间与末端执行器的非线性映射,往往拟合出错误的局部线性位移模型,导致规划成功率仅有凄惨的 $8\%$;而 VPW 凭借主动探测准确定位了正向运动学草图,一举将成功率拉升至 $72\%$。在考验空间抓取与贴合运动的 Cube 任务中,VPW 准确识别出夹爪闭合时物体与末端执行器的速度耦合关系,达到了 $86\%$ 的超高成功率。

而在机器人领域被公认为极度棘手的非平滑接触任务 PushT 中,物体在受力推挤时存在静摩擦、动摩擦以及复杂的边界自旋,以往的代码合成基线在面对这种强非线性接触时几乎全军覆没,规划成功率趋近于零。VPW 通过两级归纳成功捕获了准静态接触块模型与 PD 控制逻辑,使纯代码规划成功率跃升至 $22\%$。

逼近物理仿真上限与混合规划机制

当使用真实的 MuJoCo 物理引擎作为规划器内部的模拟世界时,系统的表现代表了基于模型的规划性能天花板。实验显示,在 Two-room 导航和 Cube 空间抓取这两个对动力学模型连续平滑性要求较高的任务中,VPW 纯代码模型诱导出的规划分数已经达到了 MuJoCo 原生引擎的 $90\%$ 到 $95\%$。换句话说,区区数十行自动生成的纯 Python 状态转移脚本,在支撑下游路径搜索时,已经发挥出了与高度优化的专业 C++ 物理引擎近乎等效的作用。

针对 PushT 这种存在极度刚硬接触(Stiff contacts)的残余差距,研究团队进一步提出了一种混合评估策略(Hybrid Scoring)。在 CEM 算法进行蒙特卡洛采样时,诱导出的轻量 Python 代码世界模型首先承担海量候选动作的前向推演与初步粗筛;随后,仅将得分排名前 $30\%$ 的潜力方案输入 MuJoCo 物理引擎进行精准微调打分。

这种设计展现出了极高的工程实用价值:它既避免了将物理引擎直接暴露在高维无序动作采样中的巨大算力开销,又利用轻量代码世界模型过滤掉了绝大多数无效搜索空间。在混合评估模式下,PushT 的最终规划成功率被进一步推高至 $80\%$ 以上,几乎完全抹平了与原生物理引擎之间的性能鸿沟。

代码世界模型开启的未来可能

VisualPatchWorld 的成功为具身世界模型的发展带来了一次极具启发性的思路转向。过去几年中,业界几乎将所有筹码押注在基于 Scaling Law 的超大规模自回归视觉生成或隐式连续向量扩散模型上。然而,这些路线不得不长期承受幻觉积累、时间反演违背物理常识以及多步规划时不可解释、不可微调的巨大代价。

VPW 雄辩地证明,可执行的代码本身就是一种极高维、极紧凑且天然具备归纳偏置的隐式结构化表征。将世界模型还原为代码,至少带来了三大深远优势:

  1. 彻底的白盒可解释性:动力学逻辑不再是数十亿浮点参数的黑盒交织,而是每一行都有明确物理含义的 Python 函数。一旦机器人在真实环境中发生未预期的碰撞,工程师可以逐行调试跟踪代码中的状态转移变量。

  2. 终身学习与模块化热修补:当环境发生变化(例如地表摩擦力改变或机械臂负载增加)时,系统不再需要昂贵的全量数据重新训练,只需在保留的定性草图下,针对特定物理常数进行快速增量微调,甚至允许人类专家直接手工介入修正其中的逻辑分支。

  3. 超低算力的高速模拟推演:纯 Python 或编译后的轻量符号程序在执行 CPU/GPU 并行前向展开时,其计算开销远低于驱动一个数十亿参数的视频生成大模型,这为嵌入式端侧设备上的实时高频 MPC 闭环重规划提供了极为诱人的落地前景。

这项研究的价值不仅在于刷新了代码世界模型在经典控制任务中的基准指标,更在于它向整个领域展示了一种将符号智能与数据驱动学习有机融合的典范范式。随着感知前端大模型对物理几何空间解构能力的持续进化,自动编写代码作为内在模拟器演进认知,或许正是通用具身智能走向严密物理交互的一座关键桥梁。