RoboPhys-3D:用3D重建解耦生成误差,Cosmos拿下92.7%真值表现
RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction

视频生成大模型在具身智能领域正被寄予厚望。从合成机器人训练数据、预测动作未来轨迹,到直接充当端到端的策略模拟器,具身世界模型(Embodied World Models, EWMs)似乎正在搭建通往通用物理智能的桥梁。然而,一个长期困扰学术界与工业界的尴尬事实是:一段看起来画面流畅、纹理逼真的机械臂抓取视频,解码成控制动作并在真实或仿真环境中重放时,往往会瞬间崩溃。机械臂可能在三维空间中发生穿模、目标物体的位置在不可见视角下发生瞬移,甚至末端执行器的实际轨迹与物理规律南辕北辙。
ArXiv URL:https://arxiv.org/abs/2608.28718v1
这种“视觉上高度逼真,物理上漏洞百出”的现象,直接宣告了传统基于 2D 像素指标(如 PSNR、SSIM、FVD)乃至通用视觉语言模型(VLM)评测的局限性。来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 25,000 条多视角真值视频。该基准不仅给出了横跨四个层次的 50 项细粒度指标,更关键的是设计了一套严格对照的评测管线,使得生成视频带来的物理错误能够与三维重建算法本身的固有误差彻底解耦。评测结果显示,在主流世界模型中,Cosmos 3 展现出最强的物理泛化与几何一致性,其任务对齐综合得分 RoboPhyscore 达到 $0.6330$,恢复了真实世界表现的 $92.7\%$;但面对双臂协同及目标定向操作等高难度场景时,即便是最顶尖的世界模型也会暴露出深层的物理与几何破绽。
从2D光影假象到3D物理实在
要理解为什么具身智能需要全新的世界模型评测基准,首先要厘清具身世界模型与通用视频生成模型的本质差异。通用视频大模型的核心目标是生成符合人类视觉感知的图像序列,其注意力机制主要在捕捉光影、纹理分布和常见运动的统计相关性。而具身世界模型必须承担物理环境“模拟器”和“动作规划器”的职能,模型所外推的下一帧不仅在二维投影上要合情合理,其隐式表达的底层状态必须能够精确映射回真实三维几何空间。
此前业内虽然涌现了诸如 WorldArena、RoboWM-Bench、EWMBench 等具身评测集,但它们在空间维度的度量上存在明显的断层。绝大多数基准要么只衡量模型内部的 2D 视角连续性,要么将生成的视频直接交给逆动力学模型(Inverse Dynamics Model, IDM)解码并观察任务是否成功。然而,一旦下游任务执行失败,开发者无法诊断这究竟是因为抓取瞬间的毫米级深度预测出现偏差、物体在遮挡后发生了几何变形,还是逆动力学模型自身的解码误差。更有甚者,部分尝试引入 3D 重建的基准只是单向地将生成画面变成三维点云,却未设立基准对照,导致三维重建算法在动态场景下产生的漂移、伪影与视频模型自身的物理幻觉混作一团,无法得出公允的定量结论。

图 1 展现了 RoboPhys-3D 的整体设计架构。针对上述痛点,研究团队基于 RoboTwin 2.0 仿真平台构建了高保真的交互环境。整套系统涵盖了单臂无目标位置、单臂有目标位置、双臂无目标位置以及双臂有目标位置四大控制范式。对于每一个任务片段,系统同步记录 5 个视角的真值相机流,并提取精准的特权状态,包括机器人关节角度、物体位姿及交互接触点。通过统一的表征抽取与重建流程,RoboPhys-3D 建立了一个从高维动作输入、视频外推,再到三维重建度量与物理重放的完整评测闭环。
用同构重建管线解耦两类误差
RoboPhys-3D 在方法学上最关键的创新,在于其严密的“误差解耦”逻辑。在计算机视觉中,从单目或稀疏视角视频重构时变的三维几何结构本就是病态问题(Ill-posed Problem),即使输入完全真实的渲染视频,前沿的动态 3D 重建算法依然会产生几何残差。如果直接拿模型生成的视频做 3D 重建并与仿真器中的绝对真值点云做比对,测出的几何误差中必然混杂着重建算法本身的系统性缺陷。
为了从根本上消除这种混淆,RoboPhys-3D 确立了同构重建比对协议: candidate 视频世界模型根据初始帧观察 $o_0$ 与任务控制条件 $\mathcal{C}$ 自回归生成预测视频 $\hat{\mathbf{X}}$,与此同时,仿真器记录下完全对应的多视角真值视频 $\mathbf{X}^{\mathrm{gt}}$。随后,评测管线调用完全相同的 3D 重建算子 $\mathcal{R}$,分别对生成序列和真值主视角序列进行三维几何重建,得到预测三维表征 $\hat{G} = \mathcal{R}{\hat{\mathbf{X}}}$ 与基准三维表征 $G^{\mathrm{gt}} = \mathcal{R}{\mathbf{X}^{\mathrm{gt}}}$。
在此体系下,所有几何和状态一致性维度的计算,均以真值视频经过该重建管线后留存的几何信息作为参照天花板。这一设计的精妙之处在于,若某种 4D 表达在特定物体边缘本就存在模糊,这种算法固有缺陷会同等地作用在 $\hat{G}$ 与 $G^{\mathrm{gt}}$ 上;两者之间的留存差异,便能纯粹、干净地归因于世界模型在视频生成过程中导致的物理与几何偏离。
为避免评测结论依赖于单一三维重建算法的偏见,RoboPhys-3D 同时接入了四种主流的三维重建与时变动力学建模方案。其中包括直接从无标定视频帧回归相机与几何参数的前馈模型 VGGT 与 VGGT-$\Omega$,以及显式优化动态时变高斯的 4DGS 和 4C4D。通过这种跨架构的交叉检验,研究者能够清晰分辨出世界模型的预测失真究竟是全局尺度的相机轨迹漂移,还是物体交互界面的局部非刚体形变。
四层金字塔体系与双重综合评分
为了把宏观的物理合理性拆解为可严格量化的数学表达,RoboPhys-3D 构筑了一套由浅入深的四层指标金字塔,共整合了 50 项互补指标,划分为 18 个子维度:
第一层聚焦像素级保真度(Pixel-level fidelity),包含图像质量、美学表现、分布相似度、运动平滑度以及时序内容一致性等 20 个常规视觉指标。这一层继承了传统视频评测的手段,用来衡量模型是否能产出高分辨率、无高频闪烁且符合真实图像分布的连续帧。
第二层切入3D几何一致性(3D geometry consistency),涵盖基于重建的几何结构度量、帧间深度连续性、相机外参轨迹几何以及跨视角往返投影一致性。系统通过比对 $\hat{G}$ 与 $G^{\mathrm{gt}}$ 在多视点渲染下的 Chamfer 距离、深度图残差及光度误差,直接探查场景在三维空间中是否“塌缩”或“撕裂”。
第三层深入状态级物理理解(State-level understanding)。这一层摆脱了表象像素,直接利用追踪和分割模型测定交互过程中的物体三维定位精度、末端执行器运动轨迹偏差、事件与动作遵循度,以及物理法则遵守程度(例如刚体穿透与重力异常)。
第四层落脚于任务级可执行性(Task-level completeness),这也是具身智能的终极试金石。系统通过逆动力学模型 $\pi_{\phi}$ 将生成视频逆向解码为机器人的末端位姿控制指令 $\hat{\mathbf{A}} = \pi_{\phi}{\hat{\mathbf{X}}}$,随后将动作指令灌入底层仿真环境 $\mathcal{S}$ 中进行物理回放,以此衡量指令遵循率、碰撞安全性以及最终的任务成功率。
面对如此庞大的度量矩阵,如果缺乏合理的聚合逻辑,评估结果很容易沦为杂乱的数据罗列。论文为此提出了两个定位明确的综合标量:全维度平均分(Average Full Score, AFS) 与 任务对齐具身物理分(RoboPhyscore)。
AFS 采用严格的层次化权重分配。在计算时,首先对 18 个子维度内部的指标分别做归一化均值,防止指标数量偏多的维度(如拥有 6 项指标的图像质量)以数量优势稀释单指标维度(如碰撞安全)。随后,四个大层级被赋予严格相等的 $25\%$ 权重:
\[\mathrm{AFS} = \sum_{\ell=1}^{4} \frac{1}{\lvert D_{\ell} \rvert} \sum_{d \in D_{\ell}} \left( \frac{1}{\lvert M_{d} \rvert} \sum_{m \in M_{d}} \tilde{s}_{m} \right)\]这种均分机制是一项明确的方法论主张:一个合格的具身世界模型不能偏科,出色的画面渲染无法抵消物理状态与任务执行层面的溃败。
而 RoboPhyscore 则是面向实际部署能力的精简指标。研究团队通过统计计算发现,许多传统指标与真实的机器人任务成功率毫无关联甚至呈负相关。为此,团队以动作规划成功率(Action Planner)、数据引擎有效性(Data Engine)和高精度多模态评判(VLM-2)三种独立执行结果为锚点,在所有非任务成功指标中进行严格筛选,仅保留与上述三项执行成功率的 Pearson 相关系数均超过 $0.70$ 的度量项。通过加权这批与真实控制高度绑定的核心特征,RoboPhyscore 能够在不依赖昂贵仿真闭环重放的前提下,高度逼真地预测世界模型的具身操控效能。

主流世界模型排位与深层物理破绽
基于 RoboPhys-3D 基准,研究团队对四大具有代表性的开源视频世界模型展开了全面对标。其中包括通用视频生成领域的标杆模型 Wan 2.2 与 CogVideoX 1.5,以及专为机器人和具身场景训练的 Cosmos 3 与 RoboDreamer。所有模型均在统一的划分数据集上进行后训练与微调,并在相同的算力与标准化管线下生成评估序列。
如图 2 的综合得分分布所示,专为物理世界建模设计的 Cosmos 3 在各项核心指标中均展现出统治级优势。在任务对齐的 RoboPhyscore 评测中,Cosmos 3 斩获了 $0.6330$ 的高分,达到了仿真真值基准视频($0.6826$)的 $92.7\%$。作为通用视频大模型代表的 Wan 2.2 位列次席,获得 $0.5359$ 分(达到真值的 $78.5\%$);而此前在机器人数据上训练的 RoboDreamer($0.3492$)与 CogVideoX 1.5($0.3363$)则出现了较大幅度的性能落后,仅达到真值基准的一半左右。
当把评测维度下沉至 3D 几何与状态物理层时,数据揭示了更为惊人的行业现状:在传统的 2D 像素与美学质量评价中,Wan 2.2 甚至在部分单项上逼近 Cosmos 3,展现出极高的视觉欺骗性;但在三维几何一致性、物体交互接触点以及动作逆向解码准确率上,非物理优化的模型出现了断崖式下跌。许多在 2D 视角下看似合理的“抓取抬起”动作,在经过三维重建后暴露出严重的深度不一致——机械臂夹爪与目标物体在 3D 坐标系中其实并未接触,视频生成的只是一种基于纹理混合的假性交互。
任务难度的横向对比进一步刺穿了当前具身世界模型的泛化边界。当操作场景从“单臂无目标位置”(任务类别 1)递进到“双臂协同且附带指定放置目标”(任务类别 4)时,所有受测模型的表现均呈现单调衰减。在任务类别 1 下,真值本身的基准得分为 $0.7117$,而在任务类别 4 中,真值上限跌至 $0.6464$。在这一最困难的工况中,Cosmos 3 依然守住了真值表现的 $91.0\%$,而 Wan 2.2 则迅速滑落至 $73.6\%$。
实验表明,“有无指定目标”对于单臂任务的影响相对有限,因为单臂运动规划在几何自由度上较为收敛;但一旦叠加“双臂协调运动”,运动学约束成倍激增,绝大多数世界模型在长时序生成中无法维持两个机械臂之间的刚体运动学耦合,频频出现双臂时空错位或运动碰撞。这一实证明确指出了当前视频生成模型通往高阶具身规划的最关键技术瓶颈:多主体刚体运动学的长程一致性难以仅凭自回归扩散隐式维持。
重建算法差异与语言提示词消融
除了评估生成模型本身,RoboPhys-3D 同样对下游的 3D 重建算法和输入条件做了深入的解构分析。
在四种三维重建后端对比中,前馈回归类的 VGGT 与 VGGT-$\Omega$ 在主视角重构上表现出极强的稳定性,分别保留了真值视频基准分数的 $94.7\%$ 和 $96.1\%$。由于这类模型直接在大规模三维几何先验上完成前馈训练,对帧间细微的高频抖动具有更强的容忍度。相比之下,基于时变优化的 4C4D 与 4DGS 保留率仅为 $85.4\%$ 和 $78.2\%$。这表明在高度动态且包含局部非刚性形变(如手指开合、软体接触)的机器人操作视频中,纯粹基于测试时优化的动态高斯表示极易将视频生成过程中的细微帧间伪影误解为物体的几何形变,从而放大几何重构误差。这进一步确立了 RoboPhys-3D 引入跨模型真值校准的必要性。
此外,针对场景文本引导条件(Prompts)的消融实验为具身数据工程提供了重要洞见。研究对比了三种不同颗粒度的文本输入:RoboTwin 原始指令、Physion-Eval 物理描述,以及由研究团队结合多视角真值与视觉大模型生成的视点感知细粒度提示(View-aware prompt)。
结果显示,随着语言描述物理与视点细节的逐步明确,所有世界模型的物理保真度均实现了正向增长。以 Wan 2.2 为例,其 RoboPhyscore 从原始指令下的 $0.4962$ 提升至细粒度视点提示下的 $0.5782$,涨幅高达 $16.5\%$;即便是本身泛化鲁棒性极强的 Cosmos 3,也获得了 $4.3\%$ 的可观增益。这说明当前视频世界模型在将高层宏观指令分解为底层物理轨迹时,内部的隐式规划能力依然薄弱。通过引入具体的逼近方向、末端执行器初始姿态以及相对空间方位描述,可以在生成前极大压缩模型的几何搜索空间,有效抑制物理幻觉的产生。
具身世界模型评测的新范式
为了验证这套复杂的自动化多层度量体系是否真正贴合实际需求,研究团队将 RoboPhyscore 与人类专家的主观物理合规性盲评进行了严密的统计学对齐。实验数据显示,RoboPhyscore 与人类专家的判定展现出极高的一致性,其 Pearson 相关系数高达 $r = 0.9761$,Spearman 秩相关系数达到 $\rho = 0.8962$。相比于依赖大语言模型提示评判(VLM-as-a-judge)时常出现的物理感知迟钝,经由 3D 几何与动作反解加持的自动化分数,不仅大幅降低了人工校验的成本,其对机械运动合理性的洞察深度甚至超越了未经专业物理训练的普通标注员。
RoboPhys-3D 的提出,为视频生成技术跨入具身物理世界树立了一道清晰的标尺。它从实验和理论上明确了一个事实:脱离三维几何基准去谈视频世界模型的物理真实性是不可靠的。生成视频的意义不在于在二维屏幕上赏心悦目,而在于其折射出的三维时空状态能否经受住动力学与几何学的逆向分解。
当世界模型开始被真正用作机器人策略学习的“物理演练场”,像 RoboPhys-3D 这样能够有效隔离算法固有误差、兼顾微观几何与宏观执行完成度的评测协议,将成为推动具身大模型从“看图写意”走向“动手实践”的关键底层基础设施。