Masked Visual Actions:哈佛斯坦福将动作变像素掩码,15小时数据统一正反向世界模型
Masked Visual Actions for Unified World Modeling

将大规模视频生成模型转化为机器人的“世界模型”,是具身智能领域最具吸引力的探索方向之一。预训练视频模型在海量真实世界视频中学习到了极其深厚的物理先验:物体如何移动、刚体与流体如何形变、接触碰撞发生时场景如何反馈。然而,当研究人员试图把这类模型迁移到机器人操作中时,总是绕不开一个核心痛点:如何向视频模型传递机器人的控制动作?
ArXiv URL:https://arxiv.org/abs/2607.19343v1
传统做法要么直接将低维电机指令(如关节角度、末端位姿变化)编码为额外的向量输入,要么借助骨架坐标与热力图。这类方案不仅高度绑定特定的机器人本体,而且与视频模型原本所习惯的稠密像素时空分布严重脱节。来自哈佛大学、斯坦福大学和马里兰大学帕克分校的研究团队提出了一种截然不同的解决思路:Masked Visual Actions(掩码视觉动作)。
该工作不再将动作视为外来的低维控制量,而是将其直接重新表述为像素画布上的局部时空轨迹。通过这种完全对齐像素的控制接口,视频模型对世界物理交互的理解被彻底激活:在同一个模型权重下,只要在画面中揭示机械臂的运动,模型就能作为正向世界模型预测物体的物理反馈;若反过来揭示物体的目标轨迹,同一个模型就能零样本切换为逆向模型,在画面中自动生成操控该物体的机械臂运动。更关键的是,这一框架摆脱了海量机器人示教数据的泥潭,仅依靠 15 小时的真实与仿真交互数据完成轻量微调,便在跨本体泛化、策略评估、测试时规划和动作提取等多个下游任务中展现出惊人的有效性。

机器人动作的表征困局:为什么低维向量不是视频模型的母语?
在具身控制中,一个成熟的认知闭环通常包含两套互补的动力学预测:一套是正向模型(Forward Model),用于预判自身动作产生的感知后果;另一套是逆向模型(Inverse Model),用于根据期望达到的目标状态反推所需的动作指令。人类在操作物体时,这两种推理模式往往共享底层的物理世界常识。但在以往的机器人世界模型构建中,正向动力学与逆向策略通常由完全不同的架构承担。
近期的视频大模型尽管具备卓越的视觉动态生成能力,但大多数仍停留于“被动观察者”角色。为了让视频模型具备可控性,主流方案通常依赖文本描述、点轨迹跟踪、外力条件或者机器人的低维电机控制量。然而,低维控制向量对于视频扩散模型而言是高度异质的信号。机械臂电机的绝对角度不仅缺乏空间局部性,而且完全局限在特定的硬件本体(Embodiment)上。同一个抓取动作,换一台不同连杆长度或关节自由度的机械臂,输入向量就完全失去意义。

如图 2 所示,部分近期工作尝试将动作转化为具有空间属性的线索,例如末端执行器的坐标点位或机器人的三维骨架拓扑。这种表征虽然比起一维向量更贴近视觉空间,但其信息依然过于稀疏。模型必须在内部费力地推断机械臂的实际三维体积、表面几何形状以及复杂的接触面变形。当测试场景出现训练集没有见过的夹爪、或者干脆切换到完全不同的双臂机器人时,模型往往因为无法建立稀疏骨架与稠密外观的映射关系而彻底崩溃。
Masked Visual Actions 认为,视频模型的“母语”始终是像素网格。机器人执行操作的过程,本质上就是在连续帧的时空体积(Spatiotemporal Volume)中,某些实体占据的像素区域发生了确定性的位移与变化。因此,最自然、最通用的动作表达,就是直接在像素空间中把特定实体的时空轨迹显式“暴露”给模型。
统一世界模型:正向推演与逆向规划的本质只是改变掩码
为了在形式上统一这一思想,研究团队将视频世界模型形式化为对场景中所有实体时空分布的联合概率建模。设一个包含 $T$ 帧的高清视频为 $V \in \mathbb{R}^{T \times H \times W \times 3}$,场景 $\mathcal{S}$ 由多个交互实体 ${e_1, e_2, \ldots, e_n}$ 组成。在像素空间中,每个实体 $e_i$ 同时对应着它在视频中随时间演化所占据的时空区域。视频生成模型本质上是在学习所有实体轨迹的联合分布:
\[p(V) = p(e_1, e_2, \ldots, e_n)\]在机器人操作场景下,可以将场景中的实体自然划分为两类:一类是主动实体 $\mathcal{A}$(Active Entities),通常指拥有自主驱动能力的机械臂或人类手臂;另一类是被动实体 $\mathcal{P}$(Passive Entities),指场景中受外力驱动而发生运动变化的物体,如桌上的杯子、抽屉或门。基于这一划分,动力学推演中的经典正反向问题在数学上变成了同一种条件推断的不同掩码选择:
-
正向动力学模型(Forward Model):当把条件集合设为主动实体,即给定初始参考帧 $I_0$ 和机械臂的未来轨迹掩码 ${e_j}_{j \in \mathcal{A}}$ 时,模型需要补全未揭示的被动实体区域:
\[p\bigl(\{e_i\}_{i \in \mathcal{P}} \mid \{e_j\}_{j \in \mathcal{A}}, I_0\bigr)\]此时,模型在推断被动实体对机械臂动作的物理响应,等价于标准的动作条件世界模拟。
-
逆向动力学模型(Inverse Model):当把条件集合设为被动实体,即给定物体的期望位移轨迹 ${e_j}_{j \in \mathcal{P}}$ 时,模型则需要反向填补主动实体的像素区域:
\[p\bigl(\{e_i\}_{i \in \mathcal{A}} \mid \{e_j\}_{j \in \mathcal{P}}, I_0\bigr)\]此时,模型必须合成出能够促成该物体运动的机械臂轨迹,自动演变为逆向规划生成器。

尤为值得强调的是,主动与被动的划分仅仅是推理阶段人为指定的查询方式,模型本身在训练期间并不知道“代理人(Agency)”的抽象概念。研究团队在训练时仅使用了显示机械臂运动的正向数据,但在推理阶段直接将物体掩码输入模型时,模型竟然展现出了令人惊喜的零样本逆向补全能力。这种无需单独训练逆向模型(IDM)或流场预测器的一体化表现,充分印证了像素空间掩码接口与预训练交互先验的高度相融。
数据构建与微调配方:15小时数据如何激活通用表征?
让视频生成模型接受掩码动作,并不需要从零预训练庞大的扩散架构。研究团队选用了开源的大型视频生成底座 Wan 2.2 14B,并采用了极具效率的数据构建与轻量化微调策略。

为了让模型在训练和推理时都能灵活获得高质量的动作掩码,研究团队设计了两种互补的数据构建路径:
-
基于视频分割的掩码提取(Segmentation-based):利用现成的大模型分割工具(如 SAM),输入文本提示“A robotic arm”,从已有的开源机器人操作视频(如真实世界数据集 DROID)中自动抠出机械臂的时空蒙版。这种方法完全不依赖相机外参标定,也不关心视频中究竟是何种机器人,通用性极强。但其局限在于,若直接在测试时让用户手绘复杂蒙版并不现实,且分割可能受到物体遮挡而无意间泄露部分被操作物体的背景信息。
-
基于状态渲染的掩码构建(Rendering-based):在拥有机器人关节状态记录和相机内外参的数据集(包括 DROID 和 RoboCasa 仿真环境)中,直接将机器人的 URDF 三维网格模型重新投影并渲染到输入视频的对应视角下。在仿真中,研究人员将机械臂渲染为半透明质感,并将末端夹爪显式标记为亮红色,以便视频模型能极清晰地捕捉动作端点与夹持状态。通过渲染管线,用户在测试时只需要输入任意低维动作序列,系统便可自动生成半透明机械臂视频作为控制掩码。
在微调实现上,该方法展示了极高的计算经济性。输入模型的控制掩码通过与视频模型原本相同的图像自编码器(VAE)进行特征提取,在未揭示的空白区域填充统一的灰色背景,随后直接在通道维度与噪声视频隐向量进行空间拼接(Concatenation)。模型微调采用 LoRA 技术,秩(Rank)设为 256。整个训练过程仅使用 8 张 NVIDIA H200 GPU,批大小(Batch size)为 4,在约 15 小时的混合交互轨迹数据上迭代 10,000 步,总耗时仅约 4 天。
与动辄需要数百小时示教数据、重构扩散骨干的方案相比,Masked Visual Actions 证明了预训练视频模型内部已包含了足够完成世界模拟的物理规则,轻量级的像素适配只是为这些先验提供了一个正确的“提问语法”。
跨越本体鸿沟:从单臂 Panda 到完全未见的双臂人形
世界模型走向实用化的最大障碍之一就是泛化性。过去基于低维向量或特定姿态驱动的模型,一旦离开训练集所覆盖的特定机器人臂型,生成画面就会迅速瓦解。

研究团队在跨本体测试中设置了极具挑战性的实验。基线方法选用了以绝对动作向量为条件的 Ctrl-World,以及分别以末端位姿点和骨架连接为条件的视频扩散模型。在与训练集高度一致的 DROID 标准 Franka 机械臂测试中,各种条件机制的表现尚在伯仲之间。然而,一旦环境发生本体偏移,性能差距瞬间被拉大:
当研究人员在真实世界中测试一台安装了自定义 3D 打印非标夹爪的 Franka 机械臂时,以骨架为输入的基线模型发生了荒谬的幻觉:它强行修改了画面的夹爪外观,将其扭曲成训练集中见过的标准平行夹爪;而以末端执行器点位为输入的模型,甚至在场景中无中生有地画出了第二台机械臂来迎合点位运动。更进一步,当把模型直接放到 BEHAVIOR 仿真基准的 R1 Pro 双臂移动人形机器人上执行开冰箱门任务时,所有基于低维动作或稀疏姿态的基线模型均完全崩溃,生成的画面充斥着严重的伪影与肢体解体。

相比之下,Masked Visual Actions 在面对完全未见过的双臂机器人以及非标末端工具时,依然能够极其稳定地合成出真实连贯的动态交互。模型并不需要重新理解底层运动学逆解,因为半透明的渲染掩码在像素层面已经给出了精确的时空占用边界,视频底座强大的几何先验只需在掩码边缘与背景环境之间补齐物理接触的细节。这种对未见本体(Unseen Embodiment)的零样本适应能力,首次在纯视觉驱动的世界模型中得到了令人信服的验证。
机器人操作的三大落地验证
具备了高保真度与强泛化性的双向世界模型,究竟能在机器人决策流程中扮演什么角色?论文通过三个具有代表性的下游应用场景给出了答案。

1. 策略评估(Policy Evaluation):在安全想象中推演真机成功率
在真实硬件上部署或评测机器人策略(如 Diffusion Policy),不仅需要耗费大量人工重置环境,还可能因策略失控而损坏硬件。研究团队探索了利用 Masked Visual Actions 构建无风险评估沙盒的可行性。
在仿真和真实世界的多种长程任务中,策略生成的开环动作序列被渲染成掩码视频,交由世界模型进行多步推演。评测结果显示,模型在虚拟想象中推演出的任务成功/失败分布,与真实硬件执行的结果呈现出高度的一致性和相关性。虽然分析表明目前的视频模型普遍存在轻微的“乐观偏差(Positive Bias)”——即在边界模糊的情况下更倾向于生成物理交互成功的画面,但其对不同策略版本性能优劣的排序能力依然高度可靠,完全可以作为实体部署前高通量的初筛工具。
2. 基于模型的测试时规划(Model-Based Planning):利用计算扩展提升决策上限
在复杂的长程操作中,随机性策略往往存在一定概率的动作偏差。本文引入了极简的 Best-of-N 测试时规划算法,通过增加推理期算力(Test-Time Scaling)来提高操作成功率。
具体而言,对于当前的视觉观测,下游的 Diffusion Policy 会随机采样生成 $N=10$ 条不同的候选动作轨迹。这 10 条轨迹被并行输入到视频世界模型中展开为想象视频。随后,系统接入一个大型视觉语言模型(Gemini 3.1 Pro)充当“评判员(VLM Critic)”,依据物理真实度、接触合理性以及任务达成进度等指标对 10 个合成未来进行打分排序,最终仅挑选评分最高的最佳动作序列发送给机器人执行。
实验表明,随着测试时采样轨迹数量 $N$ 的增加,机器人在复杂长程任务上的成功率呈现单调递增态势。这表明该世界模型合成的反事实(Counterfactual)推演具备足够的物理区分度,能够有效暴露动作候选中的致命碰撞或抓取脱落。
3. 逆向建模与动作提取(Action Extraction):从物体目标反推控制指令
在逆向建模应用中,研究团队展示了该框架最为惊艳的特性。以往的模型如果要实现“从目标视频提取控制指令”,必须单独训练复杂的逆动力学网络(IDM)。而在 Masked Visual Actions 体系下,用户只需在画面中指定被操作物体(如咖啡杯)在空间中被拿起、平移并放置在托盘上的掩码位移轨迹。
视频模型在接收到物体的运动掩码后,凭借其庞大的物理因果先验,会自动“脑补”出必须有一只机械臂伸入场景、合拢夹爪并平稳运送水杯的全过程画面。在生成出这一高保真度的交互视频后,只需要接入一个仅在 100 条轨迹上微调过的极轻量逆动力学模块,便能直接从视频帧变化中精确读取出对应的底层六自由度控制指令。
在 RoboCasa 的经典高难度任务 CoffeeServeMug(机械臂需在狭窄空间内完成接近、抓取、避障平移并平稳放置咖啡杯)中,研究团队将该方案与当前最主流的模仿学习方法进行了直接对比:
-
标准 Diffusion Policy 的任务成功率为 $70\%$;
-
经典的 ACT(Action Chunking with Transformers)成功率为 $75\%$;
-
专门面向具身控制调优的视觉语言动作模型 SmolVLA 成功率仅为 $35\%$;
-
而基于 Masked Visual Actions 逆向推演配合简易动作提取模块的方案,在完全未见任务上取得了 $90\%$ 的成功率。
这一结果有力地证明,视频生成模型在海量真实数据中沉淀的物理接触先验,在被合适的几何掩码唤醒后,其蕴含的行为指导能力已经超越了仅在小样本专家示教上进行行为克隆(Behavior Cloning)的专用策略网络。
结语与未来图景
Masked Visual Actions 的核心价值不仅在于刷新了几个基准指标,更在于它向具身智能社区提供了一种新的范式视角:不要强迫视频世界模型去适应异质的机器人关节向量,而是要让机器人动作主动向视频模型的原生像素表征对齐。
通过将动作泛化为局部时空掩码,该方案巧妙地消除了解耦世界模型与特定硬件本体之间的阻隔,顺便以最自然的方式打通了正向环境模拟与逆向行为生成两座孤岛。仅需 15 小时的交互数据微调即可解锁这一系列能力的事实,也进一步揭示了现有视频基础大模型内部未被充分挖掘的物理宝藏。
随着视频生成底座在时空连续性、三维一致性和推理延迟上的持续进化,这类原生于像素空间的统一世界模型,极有可能成为未来通用具身智能体在大脑内部进行高速物理推演、安全仿真验证和策略自主进化的标准基础设施。