Flex-π:视频生成VAE竟能无损编码3D点云!真机成功率提升6倍

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-π:视频生成VAE竟能无损编码3D点云!真机成功率提升6倍 论文图示

在具身智能与通用机器人操作领域,世界-动作模型(World-Action Models,简称 WAM)正在成为一种极具竞争力的新范式。相比于传统的视觉-语言-动作模型(VLA),WAM 的核心优势在于“通过预测未来以更好地执行动作”:它让策略网络在生成控制指令的同时,联合预测环境未来的观测状态,从而将互联网规模视频预训练中积累的时空先验,内化为机器人的操作直觉。

ArXiv URL:https://arxiv.org/abs/2608.10860v2

然而,当前的通用 WAM 存在一个普遍却被长期忽视的系统性缺陷:它们绝大多数只在 RGB 像素的潜空间(Latent Space)中预测未来。这些完全基于像素重构训练出来的视频变分自编码器(VAE)潜变量,虽然能够逼真地还原颜色与纹理,却缺乏机械臂精准操作所必需的 3D 空间几何结构以及以物体为中心的高层语义。若想显式引入 3D 几何与语义监督,学术界与工业界过去普遍认为必须付出沉重代价——要么加装昂贵脆弱的 3D 传感器,要么为新模态从头预训练庞大的时空先验,要么在推理时承受成倍激增的计算延迟。

来自艾伦人工智能研究所(AI2)与华盛顿大学的研究团队,在最新提出的 Flex-$\pi$ 中打破了这堵看似不可逾越的高墙。这项包含 60 亿参数(6B)的 WAM 研究给出了一个堪称“免费午餐”的反直觉发现:一个完全基于通用 RGB 视频数据预训练且参数被冻结的视频生成 VAE,居然能够以极高的保真度、近乎无损地直接对 3D 点云图(Pointmaps)进行编解码,中途完全不需要任何针对点云的增量训练或微调。

基于这个惊人的表征特性,研究团队构建了一套统一的多流(Multi-Stream)世界-动作模型架构,同时融入来自 DINOv3 的高层语义特征。更关键的是,通过引入视觉流丢弃(Visual Stream Dropout)与跨模态强制预测(Cross-Modality Forcing),Flex-$\pi$ 实现了推理时的算力弹性:同一个权重模型,既能在只输入普通 RGB 图像、只输出动作时跑出比开源顶流 $\pi_{0.5}$ 更快的控制频率,又能在开启全模态预测时将复杂双臂操作的真机任务成功率提升至基准模型的 2 到 6 倍。

Flex-π 概览与推理弹性

视频 VAE 里的“免费午餐”:从 RGB 到 3D 几何的零成本泛化

机器人操控的核心难点,往往不在于识别物体的颜色,而在于对物体空间几何深度、接触边缘与相对距离的微米级把控。当一个机器人试图完成将销钉精确插入孔洞、或者顺着拉链齿轨拉紧软质笔袋等高精度任务时,RGB 图像中细微的光影变化极易被环境反射干扰,反而是稠密的三维坐标能提供最硬核的状态反馈。

过去的主流方案若是想用 3D 信号,通常需要设计专门的点云骨干网络(如 PointNet 系列或 3D 稀疏卷积),但这会导致模型直接与大语言模型或视频生成模型多年来在 2D 互联网上积累的表征先验割裂开来。Flex-$\pi$ 的第一大贡献,就是验证了预训练视频潜空间对稠密几何图像的兼容性。

视频 VAE 零样本重构 3D 点云图

研究团队利用单目深度估计模型 Depth Anything 3,从机器人的单张 RGB 观测中提取深度并投影为三维点云图(即每个像素位置记录其在相机坐标系下的真实 3D 坐标 $(X, Y, Z)$)。随后,研究人员直接把这个三通道的 3D 点云图输入到 Wan-2.2 视频生成模型自带的冻结 VAE 编码器中。实验结果令人难以置信:完全没有接触过任何点云数据的视频 VAE,不仅顺利将点云图压缩到了与 RGB 完全相同的潜在特征尺度(8 倍时间压缩、16 倍空间压缩),还能通过同一个冻结的解码器将几何表面高保真度地重建回来。

这一发现的工程与学术意义极大。它意味着机器人策略可以直接把 3D 几何当作一种特殊的“视觉流”,与 RGB 潜特征共享完全一致的隐空间结构,直接继承预训练视频模型内部强大的时空连续性先验。而且,由于点云图是由 RGB 单目模型在离线或预处理环节直接推导出来的,机器人本体根本不需要配备专门的激光雷达或双目深度相机,真正做到了在输入传感器层面的“零硬件增量”。

除了 3D 点云图,Flex-$\pi$ 还引入了冻结的 DINOv3 编码器。RGB 负责提供细致的外观纹理,3D 点云图负责提供刚性的物理空间轮廓,而 DINOv3 则负责提供与光照无关的物体级类别及部件语义表征。三者各司其职,在感知输入端构筑起了完备的多层级表征底座。

多流架构与跨模态强制:一个权重调和算力与性能的矛盾

如果简单地把 RGB、点云图和语义特征拼在一起送入 Transformer,模型确实可能学到丰富的特征,但也将不可避免地遭遇具身智能落地中最致命的瓶颈:推理延迟暴增。机器人控制循环通常要求 10Hz 至 50Hz 的实时响应,而在每个控制步都同步去生成高维度的未来视频潜变量,算力消耗是绝大多数端侧工控机无法承受的。

为了化解训练时需要高维度监督信号来强健特征、与推理时需要极低延迟以保证控制流畅性之间的剧烈冲突,Flex-$\pi$ 提出了由混合 Transformer(Mixture-of-Transformers)构成的多流主干网络,并搭配了精巧的掩码训练策略。

Flex-π 整体网络架构与掩码路由

在模型架构内部,Flex-$\pi$ 采用流匹配(Flow Matching)作为生成目标。对于输入的当前帧观测,RGB 图像 $o_t$ 与点云图 $p_t$ 经由同一个 Wan-2.2 VAE 编码为潜变量序列 $z_t^o$ 和 $z_t^p$,DINOv3 则输出语义 Token 序列 $d_t$。这些不同的视觉流加上文本任务描述 $l$ 与机械臂本体关节状态 $s_t$,共同送入由参数共享层构成的视觉主干网络。而在动作生成端,Flex-$\pi$ 借鉴了模块化动作专家(Action Expert)的设计,通过一个体积更轻量、但专注于高频控制的交叉注意力网络,从视觉主干的潜变量中汲取表征,并去噪生成连续一段步长的动作块(Action Chunk)$a_{t:t+H}$。

然而,模型的核心灵魂在于其训练机制:视觉流丢弃(Visual Stream Dropout)与跨模态强制预测(Cross-Modality Forcing)

在每一次训练迭代中,系统会通过输入掩码 $\mathbf{m}^{\text{in}}$ 随机丢弃掉部分输入流。例如,有时只给模型看 RGB 图像,隐藏点云与 DINO 特征;有时只给点云和语言指令。而在预测输出端,系统通过输出掩码 $\mathbf{m}^{\text{out}}$ 决定哪些未来状态需要被重建。这就构成了极为关键的“跨模态强制”:即使输入端完全没有给模型提供 3D 点云或 DINO 语义输入,模型在输出端仍可能被强制要求联合预测未来的 3D 点云潜变量或未来语义特征。

这种非对称的训练要求逼迫模型的 RGB 潜变量流必须在内部表征层学会“无中生有”地想象出物理世界的三维几何演进与物体属性变化。换句话说,模型在底层强行建立起了 RGB 纹理到空间几何与语义的隐式映射。其直接红利体现在推理阶段:部署人员可以根据现场算力随意选择输入输出组合。在算力受限时,Flex-$\pi$ 可以直接退化为“单摄 RGB 输入、仅预测控制动作”的极速模式;而在需要极高成功率攻克死磕任务时,又可以切换到全模态联合预测模式。

双臂毫米级操作验证:极端精度与泛化性的双重飞跃

具身智能模型究竟是真有物理世界泛化能力,还是在过拟合仿真环境的数字孪生?为了回答这个问题,研究人员放弃了常见的“简单推木块”类玩具任务,在真机双臂 YAM 机器人平台上设计了数项极具挑战性的高难度操作任务,并在仿真基准 RoboTwin 和 LIBERO 上进行了系统性压力测试。

真机极端精度评估任务设计

其中最具代表性的真机任务是夹爪自修复(Self-Repair Gripper)。该任务要求机器人双臂协同,依次完成 8 个必须严格按次序推进的机械装配动作,将散落在桌面的夹爪手指零件重新装回自身手腕上,其中零件插入公差极限低至 $\pm 0.25$ 到 $0.5$ 毫米。在如此严苛的物理接触要求下,任何基于单帧视觉判断的漂移或空间深度误判,都会直接导致机械卡死或零件脱落。另一个典型任务则是软质笔袋拉链闭合(Soft-Bag Zipping),不仅需要单臂撑开高形变、非刚性的布艺笔袋,将笔稳定放入,还需要双臂交替发力,顺着拉链软轨将拉链完全闭合。

真机主实验与基准模型对比结果

在这些高精度真机任务的实测中,Flex-$\pi$ 展现出了压倒性的优势。面对当前机器人领域的强劲对手——包括广泛应用的扩散策略升级版 ManiFlow、基于纯 RGB 视频的世界动作模型 Fast-WAM,以及当下表现强悍的通用机器人基座模型 $\pi_{0.5}$,Flex-$\pi$ 取得了全面的胜利:

  1. 真实世界成功率碾压:在全部真机任务测试中,Flex-$\pi$ 的成功率达到了基准模型的 $2\times$ 到 $6\times$。在极考验接触几何与空间对齐的细粒度操作中,缺乏显式 3D 监督的基准模型往往在第二或第三个阶段便因夹爪未对准卡死,而 Flex-$\pi$ 凭借在共享潜空间中对几何变形的预先建模,展现出了惊人的装配稳定性。

  2. 推理延迟与吞吐量的反常识表现:当 Flex-$\pi$ 运行在“仅预测动作”的 Action-Only 模式下时,由于其 Action Expert 结构设计紧凑,且不需要在推理步执行庞大视频序列的自回归反解码,其端到端推理速度甚至明显快于同参数量级的 $\pi_{0.5}$。更震撼的是,即使在此极速模式下,其操作成功率依然大幅超越所有真机基线;如果算力充足、开启全模态预测,成功率还能在此基础上平均再额外拉升 13 个百分点。

数据效率与分布外泛化:几何表征补齐了示教数据的短板

机器人策略走向规模化落地的最大拦路虎,始终是昂贵至极的真机专家示教数据采集成本。通常情况下,训练一个稳定可靠的双臂精密操作模型需要成百上千次反复示教。而 Flex-$\pi$ 展现出的另一个极其关键的工业价值,正是其惊人的示教样本利用效率(Demonstration Efficiency)

在真机实验中,研究团队做了一组极具说服力的数据消融测试:将原本收集的真机示教数据硬性砍掉一半,用来微调不同的模型。

真机数据削减与分布外泛化测试

结果表明,即便只使用 50% 的示教数据,开启全模态预测的 Flex-$\pi$ 的真实操作成功率,依然超过了那些吞食了 100% 全量示教数据的基准模型。甚至在仅预测动作的最快推理模式下,用一半数据训练的 Flex-$\pi$ 也能直接打平使用全量数据微调的 $\pi_{0.5}$。

这一结论在具身智能的学习理论上极具启发性:多模态未来预测的世界模型目标,本质上扮演了一种极其强大的“自监督正则化项”。当机械臂在现实世界中探索时,动作空间的数据流是稀疏的,但空间环境的几何变形与状态演变数据是连续稠密的。通过强迫神经网络在内部同时模拟物理世界的 3D 变化与语义演化,Flex-$\pi$ 将原本必须依靠海量试错示教才能学到的“空间物理规律”,直接从世界模型的联合预测中给“脑补”了出来。

餐盘放置任务的分布外泛化环境

在针对餐盘插架(Plate on Rack)任务的严格分布外(OOD)泛化测试中,研究人员人为改变了桌面布料颜色、背景杂物、餐盘材质以及灯光角度。普通的端到端模型往往因为环境像素的大面积偏移而直接丧失操作能力,而 Flex-$\pi$ 依靠内部稳固的 3D 点云流表征以及 DINOv3 带来的语义不变性,展现出了极其平稳的抗干扰轨迹生成能力,无论是几何扰动还是视觉扰动均未击溃其动作流。

而在仿真基准端,这种泛化性与数据效率同样得到了无差别的印证。在包含 50 项复杂双臂技能的 RoboTwin 基准中,当示教演示样本数量受到极度压缩限制时,Flex-$\pi$ 超越了最强的 WAM 基线模型达 1.9 倍;在包含了上万次视觉、空间和语言扰动测试的 LIBERO-Plus 基准中,Flex-$\pi$ 同样展现了极高的抗噪弹性,在几乎所有扰动类别下,全模态联合推理模式均优于或打平纯动作预测模式,雄辩地证明了预测未来物理视觉信号确实能反哺复杂环境下的即时控制。

为什么 Flex-π 对具身智能演进意义重大?

回顾近年具身智能的技术演变,机器人领域一直在两条路径之间反复摇摆:一条是以传统 RT 系列和 OpenVLA 为代表的纯语言-动作模型,它们死磕大语言模型的推理泛化力,却往往因缺乏对连续空间物理接触的细腻感知,在毫米级装配任务上屡屡碰壁;另一条则是结合深度图或点云的专用强化学习与扩散模型,虽然擅长精准定位,但泛化性差,极度依赖专用传感器,难以直接复用互联网级别海量视频带来的通用物理先验。

Flex-$\pi$ 的真正价值在于,它用极为务实且优雅的工程洞察,为这两条路径架起了一座桥梁。它明确告诉我们:

首先,不要抛弃视频大模型的预训练红利,但绝不能让表征仅仅停留在 RGB 表面。 发现视频 VAE 原生具备无损编解码 3D 点云图的“隐藏技能”,是本文最令人拍案叫绝的闪光点。这打破了“几何表征必须另起炉灶建立专用骨干”的思维惯性,为具身智能界利用互联网视频生成模型作为物理世界的通用模拟底座开辟了一条极度通顺的道路。

其次,联合预测(Joint Prediction)并不等于部署妥协。 过去的 WAM 方案之所以难以大规模上机,就是因为谁也无法承受每秒数帧的超大潜变量生成开销。Flex-$\pi$ 提出的跨模态丢弃与强制机制,从系统层面解决了这个问题:训练时用全模态的世界模型目标逼出高密度的内部物理感知,推理时则允许完全甩掉沉重包袱、只跑控制专家,从而兼顾了强大的泛化能力与极速的控制回路响应。

当然,Flex-$\pi$ 也并非没有代价。正如作者在文中所坦陈的那样,引入多模态流匹配监督和跨模态强制后,模型的收敛曲线变得更为平缓,在真机任务上通常需要至少 10 个 Epoch 以上的微调才能充分驯服所有流的分支;在开启全模态生成的最高性能模式下,其推理延迟依然高于轻量级的纯 VLA 模型。此外,若想在极端抽象的语义推理任务上更进一步,仍需依赖底座引入更强的大语言模型推理能力。

但瑕不掩瑜,Flex-$\pi$ 成功用一个 6B 参数的单一模型、完全免去专用 3D 传感器和新表征预训练的前提下,把双臂机器人精准操作的标杆推向了全新高度。它向具身智能社区清晰地展示了一种极具吸引力的演进方向:利用多模态对齐的物理潜空间,以计算弹性的世界动作模型为支点,真正让机器人拥有像人类一样“既能看懂外观、又能洞察空间,边预想未来边精准操控”的物理世界常识。