Contact Flow:摆脱本体形态束缚,用3D接触点轨迹实现人机泛化世界模型

ContactFlow: A video action conditioning that transfers across embodiments

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Contact Flow:摆脱本体形态束缚,用3D接触点轨迹实现人机泛化世界模型 论文图示

让具身智能体像人类一样在脑海中“预演”动作后果,是近年来机器人学与大模型交叉领域最受关注的路径之一。基于视频扩散模型构建的世界模型(World Model),理论上能够让机械臂在真正触碰物体之前,先在生成的未来画面中推演物理交互。然而现实往往很骨感:当前的视频生成模型虽然能画出光影逼真的连续帧,却极其容易在物理层面“穿帮”——物体凭空发生位移、夹爪没有受力点却能把物体吸附起来,或者直接出现违反接触力学的形变与幻觉。更严重的是,绝大多数条件化控制信号不是绑定在特定的机械臂关节角度上,就是依赖特定形态的夹爪轮廓,这导致模型无法把海量的人类操作视频与不同形态的机器人动作数据融合在一起。

ArXiv URL:https://arxiv.org/abs/2607.26579v1

来自德国波恩大学与 Lamarr 研究所的研究团队提出了一种名为 Contact Flow(接触流)的跨本体动作表征。该方法的核心直觉非常纯粹:在物理操作中,决定物体运动趋势的并非施动者长成什么模样,而是外力施加在物体表面的具体位置和运动方向。研究团队将动作精简为施动者与物体之间的三维接触点在时间维度上的轨迹,并将其投影到相机图像空间。通过彻底剥离人手或机械臂的外观与运动学链条,单一视频世界模型得以同时吞吐人类操作演示与真实机械臂遥操作数据。配合大语言与视觉模型构筑的“提议-想象-验证-执行”(Propose-Imagine-Verify-Act)闭环,该系统在真实世界的未知桌面任务中,实现了 80%(8/10)的成功预测率,为跨形态具身世界模型的泛化落地提供了全新解法。

闭环部署流水线总览

从形态绑定到接触交互:物理世界建模的关键断层

想要让视频世界模型为机器人规划提供靠谱的模拟依据,必须给生成模型提供明确的动作条件输入。过去的研究路径大致分为两类,但都在跨形态迁移上遭遇了瓶颈。

第一类方案以机械臂的底层关节状态或低维动作嵌入(Action Embeddings)作为条件。这类表征表达能力很强,能精确指定电机的运转轨迹,但其缺陷在于强绑定特定的运动学骨架。为双指平行夹爪机械臂训练的模型,面对多指灵巧手或三指抓手时完全失效,更不可能直接吸收互联网上丰富的人类抓握视频。

第二类方案试图绕开底层关节,转向图像空间的施动者遮罩(Mask)或轮廓(Silhouette)。这类方法虽摆脱了固定自由度电机的束缚,却引入了严重的形态外观偏差:模型在生成画面时,注意力不可避免地分散在机械臂或人手的外形、连杆材质与光照变化上,而非交互的界面本身。只要施动者的外观形态发生切换,生成模型就会出现剧烈的分布外扰动。

物理接触的本质打破了这种僵局。无论是由人类的五根手指捏起水杯,还是由工业机械臂的气动夹爪夹住杯体,水杯受力运动的力学规律只取决于触点的几何位置、法向与切向位移。如果能够从画面中彻底剔除施动者自身的形态冗余,只保留接触界面的动态轨迹,世界模型就能在统一的表征空间内同时理解人手与机械爪的物理行为。

Contact Flow:主动动力学的最小几何表征

为了形式化表达这一直觉,研究团队将接触流定义为施动者与目标物体在时间序列上的三维接触点集。在任意时间步 $t$,接触流由一组带权重的点集表示:

\[\mathbf{C}_{t}=\big\{\,\mathbf{c}_{t}^{(i)}\,\big\}_{i=1}^{N_{t}},\qquad\mathbf{c}_{t}^{(i)}=\big(x,\,y,\,z,\;\Delta x,\,\Delta y,\,\Delta z,\;w\big)\in\mathbb{R}^{7}\]

其中每个点包含当前帧下的三维局部坐标 $(x, y, z)$、该点在下一帧的时间位移向量 $(\Delta x, \Delta y, \Delta z)$,以及一个复合置信度权重 $w$。

这一设计在机制上做出了至关重要的解耦:只捕捉“主动动力学”(Active Dynamics),而剔除“被动动力学”(Passive Dynamics)。以拧动门把手开门为例,Contact Flow 只追踪手指捏住把手、下压旋转那几厘米接触界面的位移轨迹,而把手释放后门扇受惯性或铰链约束向外弹开的后续位移,则完全不包含在动作编码中。之所以要严格剔除被动动力学,是因为如果动作条件本身就包含了物体最终运动后的结果像素,世界模型就退化成了简单的视频插帧器,无法真正学会外力作用引发物理后果的因果演变规律。

置信度权重 $w$ 则是抵抗真实视觉噪声的关键屏障。该权重的基础项因数据源而异:在机器人数据中,权重来自于夹爪网格模型与物体点云表面的欧氏空间贴近程度;在人类视频中,则来自手部姿态估计器与接触检测网络的综合打分。在此基础上,研究团队引入了局部时空平滑调节机制:如果某个接触点的运动方向与其时空邻域内其他点保持一致,其权重会被强化;反之,若孤立噪点的运动轨迹杂乱无章,权重会被直接压低。低置信度的点在后续向视频模型注入条件特征和计算训练损失时,贡献会被自动抑制。

在骨干架构上,研究团队选用了开源的大规模视频扩散 Transformer(Wan 2.1 / Wan 2.2),并验证了两种控制注入途径:一种是将投影后的时空接触点轨迹作为控制视频流输入给可微微调分支 ControlNet;另一种则是基于 VACE 架构,通过专用的视频控制单元(VCU)和上下文适配器将接触流特征注入扩散骨干的主干通道。这种跨架构的通用性表明,接触流的有效性并不依赖某一种特定的模型算子,而是表征本身的物理对齐带来了收益。

DROID 数据集上的预测推演效果

跨源异构数据的流水线蒸馏

算法逻辑成立的前提,是能够低成本、大规模地从海量异构数据中提取出高质量的接触点轨迹。人类演示视频具有无与伦比的多样性和交互复杂度,但缺少精确的本体位姿传感器;机器人示教数据具备毫米级的运动学遥测信号,但往往受困于多变的外界遮挡。针对这两种性质截然不同的数据源,研究团队构建了差异化的全自动标注提取流水线。

在处理人类交互数据(如 TasteRob、TACO、OakInk)时,算法首先利用 HaMeR 预测每帧的手部关键点置信度。对于没有被遮挡的关键点,流水线并不直接采用 HaMeR 内部欠缺深度一致性的三维绝对坐标,而是将其二维投影与通过 FoundationStereo 或 MapAnything 重建出的度量级场景点云进行对齐,再通过最小二乘法将 MANO 人手网格拟合至可见点云。随后结合 GroundingDINO 对物体边界框的一致性校验,剔除掉手物交叠几何失真的废帧,从而在非结构化的人类交互视频中萃取出精确贴合的手物接触点轨迹。

在处理遥操作机器人数据(如 DROID、LIBERO)时,环境由外侧固定视角的静态 RGBD 相机记录。利用已知的机械臂 URDF 运动学模型和每帧状态向量,提取流程转化为一套多视角几何计算。针对朝向相机的正向夹爪指尖,算法提取物体分割掩膜与机械臂遮罩的重叠交集,并在三维场景点云中检索该交集区域内的物体表面点作为触点;而针对被抓握遮挡的背面夹爪,系统在图像空间反向渲染 URDF 模型的背面连杆,计算其在深度缓冲区与物体的交叠,直接补全不可见面的反向接触几何。夹爪闭合抓取后,所有触点与机械手腕部建立局部刚体变换约束,并在时间维度上采用 Hough 滤波消除跨帧抖动。这种全几何化的提取流程完全杜绝了人工标注成本,成功将数万条形态各异的交互片段统合至统一的 Contact Flow 格式。

想象与验证:零样本闭环控制落地

有了能根据接触流推演未来的世界模型之后,如何在实体机器人上实现安全、自主的任务闭环?研究团队没有采用“端到端直接从世界模型蒸馏控制策略”的重度训练思路,而是构建了一套“数字孪生提议 - 世界模型想象 - 视觉语言验证 - 物理机执行”的免训练验证流水线。

在真实场景中部署时,系统首先利用外部单目/双目相机捕捉初始帧画面,借助 GroundingDINO 与 SAM3 提取目标物体的精细掩膜,并结合 SAM 3D-Objects 构建出物体的三维高斯泼溅(3D Gaussian Splatting)网格。为了消除生成式三维模型固有的尺度与姿态漂移,研究团队设计了一套多阶段刚体优化:利用主成分分析(PCA)完成粗对齐,再通过截断点云迭代最近点(ICP)消除单视角半壳偏差,最后通过 gsplat 可微光栅化渲染,联合优化掩膜交并比(IoU)、深度均方误差以及像素级余弦相似度。该阶段只有在掩膜 IoU、深度内点比例以及 RGB 余弦相似度三项指标均越过严格阈值(余弦相似度 $\geq 0.95$)后才会被确认采纳。

未知场景桌面操作的推演与实机对比

场景重建完成后,离线状态下的通用具身大模型 $\pi_{0.5}$ 会在这个极简的数字孪生场景中自由规划,提议一条末端执行器的候选三维轨迹。随后,系统调取夹爪的 URDF 几何网格,沿着该轨迹推演计算出预期的 Contact Flow 序列,并连同现场初始真实照片一起喂给 Contact Flow 视频世界模型。

此时,视频世界模型充当起高保真物理仿真器的角色,在几秒钟内渲染出该轨迹执行后的未来视频流。一个接入多模态大模型(Gemini)的“裁判员”会对生成的推演视频进行严格判别:画面中的机械臂是否稳固抓取了目标?物体是否被平稳移动到指定位置?周围的其他物体是否被意外碰倒或掉落?只有被 VLM 裁定为“成功且无副作用”的轨迹,才会被下发给实体机械臂开环执行。

实验成效与跨领域泛化验证

在评测中,研究团队首先在 DROID 数据集的留出测试集上检验了模型预测的物理保真度。为了增大预测难度并贴近真实决策需求,所有测试序列均以 3 帧为步长进行下采样,这意味着一个 49 帧的生成视频实际覆盖了真实世界中长达 10 秒左右的长程物理交互。为了排除背景与施动者连杆外观差异对视觉打分的虚假干扰,评估采用了去除机械臂/人手区域后的 Agent-Mask 评估指标,重点考查物体交互区域的形变与位移一致性。

实验结果表明,无论是在 5B 还是 14B 参数量的 Wan 骨干网络下,以 Contact Flow 为条件生成的视频在代表感知一致性的 DreamSim 以及 PSNR、SSIM、LPIPS 上,均显著优于以全量机器人点云作为条件的 Kinema4D。Kinema4D 由于把施动者全身体积的 4D 点云作为输入,模型极易陷入重构机械臂连杆外形的捷径,而在物体被碰触的核心物理区域发生形变模糊;而 Contact Flow 迫使视频骨干网络把注意力完全聚焦在接触边界上的力学演化,预测出的物体移动轨迹与现实真值展现出了高度的几何对齐。

更为关键的突破体现在真实物理实机实验中。团队在配备单个外部固定视角的 Franka Panda 机械臂上设置了 10 组在训练集中完全未见过的桌面抓取放置(Pick-and-Place)任务。直接将当前业界前沿的通用具身策略 $\pi_{0.5}$ 部署至该实体环境中时,由于光照漂移、背景新颖性以及深度测量微小误差,直接开环执行的成功率为零——策略提出的轨迹频繁出现由于微小距离误判导致的滑脱、碰倒其他物体或抓空。

然而,一旦接入了基于 Wan 2.2 14B 的 Contact Flow 世界模型进行事前预演,世界模型在 10 个场景中成功预测对了 8 个动作的实际执行后果(预测准确率达 80%)。当 $\pi_{0.5}$ 提出的劣质轨迹会导致杯子倾倒或抓取脱手时,视频世界模型在脑海中生成的画面同样展现出了滑落和撞击的物理后果,Gemini 验证器据此迅速否决了该轨迹,避免了实体机上的破坏性执行;而当策略给出合理的抓握与移动规划时,推演视频准确复现了平稳放置的结局,促成了实机执行的顺利收敛。这种利用视频世界模型充当高阶策略安全阀与验证器的能力,证明了纯视觉物理预测在实体具身闭环中的不可替代性。

走向更坚固的具身物理引擎

Contact Flow 的提出,为视频生成模型融入机器人规划打通了一条优雅的中间通道。它没有强求通用视频大模型去理解复杂的电机动力学参数,也没有听任无约束的像素扩散在画面里“胡思乱想”,而是以极低的信息维度抓住了经典力学的命门——接触。

这项探索展现出的局限性同样清晰。目前的生成式世界模型更多是在视觉层面捕捉到了宏观的物理交互“结果”(Outcomes),而在微观接触刚度、微小摩擦力滑移等高度接触丰富的复杂力学推演上,依然缺乏底层确定性物理方程级别的解析能力。此外,目前基于大参数量 DiT 扩散模型的视频采样耗时仍然按秒乃至数十秒计算,距离支持高频、闭环反应式控制的实时推演还有较大代差;对外部高精度立体标定相机和 SAM3 几何重建质量的依赖,也限制了该方案即插即用到野外非结构化环境的步调。

即便如此,Contact Flow 验证了一个极具启发性的技术路线:通过在动作空间中摒弃本体的具象外表、剥离无关的被动动力学,海量人类交互的开放视频与机器人高精度的控制数据终于能够并入同一条训练支流。让世界模型以力学接触为锚点来预判物理现实,正将曾经停留在像素幻想层面的视觉生成技术,一步步推向具身智能可信赖的通用规划底座。