具身操作最新综述!五层数据金字塔与大模型训练配方全景解析

Data Pyramid for Embodied Manipulation

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

具身操作最新综述!五层数据金字塔与大模型训练配方全景解析 论文图示

多模态大模型能够“看懂世界”并“出口成章”,本质上是把整个互联网的公开图文与视频语料吞噬殆尽的结果。然而,这条看似通畅的暴力美学捷径,在具身智能(Embodied AI)和机器人操作领域彻底碰了壁。物理世界不存在现成的“互联网级”机器人动作库。具身智能体不能仅仅停留在像素和文本符号的关联上,它必须将高维传感观测精确映射到物理状态转换与可执行的控制动作中。每一个抓取、推拉、扭转的动作,都伴随着不可妥协的动力学接触、力矩变化与延迟反馈。

ArXiv URL:https://arxiv.org/abs/2607.24744v1

面对高昂的真机数据采集成本与严苛的物理落地要求,来自杜克大学、UC伯克利、港科大、清华大学、上海交通大学等多所顶尖高校的研究团队,联合发布了这篇具身操作数据生态长篇综述《Data Pyramid for Embodied Manipulation》。这项工作不再局限于某种特定的模型架构或单一的基准测试,而是将纷繁复杂的具身数据生态抽象为一个由底至顶的五层“数据金字塔”(Data Pyramid),在可扩展性(Scalability)与机器人对齐度(Robot Alignment)这两个核心张力之间,系统梳理了真实机器人数据、UMI手持夹爪数据、人机第一/第三人称视频、仿真数据以及通用图文数据的权衡关系,并进一步剖析了前沿具身大模型在预训练时如何调配这些异质数据源。

系统组织与五层数据金字塔全景架构

数据金字塔的两大张力与六个评价维度

构建具身智能系统时,学者与工程师们往往陷入一种两难境地:越容易低成本无限扩展的数据,往往离真实机器人的控制指令越远;而能够直接在机器人关节上执行的高精度轨迹,采集代价却极其昂贵。这种本质冲突被综述归纳为两大核心设计原则的拉扯:

其一是可扩展性。它衡量的是一个数据源脱离硬件依赖、摆脱人工示教介入、免除场景物理复位、保障安全兜底以及边际生成成本的能力。其二是机器人对齐度,即该数据源记录的观测、状态表征与动作监督信号,能否直接驱动物理机器人并闭环执行。

在这两极之间,作者团队引入了另外四个细粒度的评估维度:数据质量(Quality)(轨迹的一致性、任务相关性与标注精度)、多样性(Diversity)(涵盖物体、环境视点、机体构型以及动作轨迹的分布广度)、可复用性(Reusability)(跨任务、跨本体、跨传感器的迁移能力)以及物理保真度(Physical Fidelity)(触觉、摩擦力、顺应性、执行器延迟与动力学特性的还原程度)。

依据这六个维度的综合考量,具身操作数据被划分为五层,从金字塔尖端向基座逐级延伸:

  1. 真实机器人数据(Real-Robot Data):位于金字塔顶端。它是机器人与真实环境闭环交互的产物,具有无可替代的物理保真度与动作直接可执行性,但采集代价极高,必须为每个工时支付昂贵的硬件与人工成本。

  2. UMI 风格手持夹爪数据(UMI-Style Data):以 Universal Manipulation Interface 为代表,操作员手持便携夹爪传感器在日常环境中演示。它解除了机械臂本体的束缚,大幅提升了环境多样性,保留了末端执行器(End-Effector)的六自由度轨迹,但牺牲了关节层面的本体感知。

  3. 第一/第三人称人体交互视频(Egocentric & Exocentric Data):记录人类在日常生活中双手的真实操作。它拥有自然物理世界的无尽多样性与灵巧动作细节,但缺少显式的机器人动作流,必须依赖算法反推轨迹并跨越人机形态差异。

  4. 仿真合成数据(Simulation Data):在物理引擎与图形渲染器中大规模并行生成。它能在极低边际成本下源源不断地产出含真值标注的可执行轨迹,但横亘在它与现实之间的,始终是难以彻底消除的“仿真到真实”(Sim-to-Real)物理间隙。

  5. 通用视觉-语言互联网数据(General Data):位于金字塔最底层。包含网页级图文、通用网络视频等海量资源。它蕴含着人类世界丰富的常识推理与语义表征,虽然完全脱离了物理动作与接触反馈,却赋予了具身智能体理解复杂指令的“通用大脑”。

不同数据源在近年来的数据规模增长轨迹

从近年来的演进趋势来看,五类数据源的量级均呈现出指数级增长态势。仿真数据借助大规模并行渲染器和自动化策略生成,动辄突破数千万次示教;真实机器人数据集也从早期的单一抓取任务,逐步发展到包含百万轨迹、覆盖数百种复杂长程任务的综合基准(如 AgiBot World、RoboMIND、Open X-Embodiment 等)。这种体量的扩张,促使具身基础模型的预训练范式发生了深刻变革。

金字塔顶的基石:真实机器人数据的采集困境与解法

真实机器人数据始终是验证具身策略的“硬通货”。任何未经物理真机数据校准的策略,在面对真实世界的光照变化、接触摩擦、机构间隙及执行延迟时,都会暴露出难以预测的脆性。但在实际采集过程中,单一机械臂、固定工位和狭窄任务分布的传统模式早已无法满足大模型训练的胃口。

当前真实机器人数据的采集范式主要分化为三条技术路线:

脚本化生成与自主滚动(Scripted & Autonomous Policy Rollouts):通过预先编写的规则逻辑、轨迹回放或者基于先前策略的自主探索来收集交互。大型系统如 QT-Opt、MT-Opt 均借助策略闭环不断积累经验。这种方式将人力抽离出单次示教,使并行采集成为可能。但其局限在于策略探索极易陷入固有分布偏差,在策略尚未成熟时,往往会伴随大量无意义的试错甚至损坏硬件。

人工遥操作示教(Teleoperation):目前获取高质量接触丰富任务数据的首选途径。操作员通过主从机械臂、手持手柄、动捕外骨骼或沉浸式 VR 头显实时控制机器人。为了提高示教精度,力反馈(Force Feedback)与触觉反馈(Tactile Feedback)正被深度集成到遥操作系统中,使得操作人员在执行插孔、装配等微小公差任务时能够清晰感知接触阻力,显著改善了高质量轨迹的示教成功率。

人机协同与闭环纠偏(Human-in-the-Loop Enhancement):单纯采集专家成功轨迹往往导致模型在测试时“一步错、步步错”,因为模型从未在训练中见过偏离预定轨迹的失败状态。基于 DAgger 演变而来的干预纠偏机制(如 ThriftyDAgger、Sirius、CR-DAgger 等)允许机器人在部署中自主运行,仅在发生潜在危险或动作失误的关键帧由人类操作员介入修正。这种范式以极高的数据效率向模型灌输了“容错与恢复能力(Failure and Recovery)”,弥补了纯专家轨迹在状态分布边缘的覆盖盲区。

手持夹爪接口UMI数据与机械臂真机数据的映射与重定向关系

为了平衡真机采集的高昂硬件成本,以 UMI 为代表的手持夹爪采集设备应运而生。如上图所示,UMI 将数据采集从机械臂的动力学与控制束缚中彻底解耦。采集人员只需带着配备了双目鱼眼相机、惯性测量单元(IMU)以及末端力感应的轻量化夹爪,即可在任意真实的厨房、办公室、车间环境中自由演示任务。随后,研究人员再通过运动学重定向(Retargeting)算法,将提取出的末端六自由度相对位姿变化转化为特定机械臂的关节空间或笛卡尔空间指令。这种方式把真实物理场景的多样性扩展到了极致,同时保留了相对精确的端到端动作监督。

轨迹多样性:衡量具身数据集深度的隐形标尺

在以往的视觉大模型中,数据集的丰富程度往往直观体现为图片分辨率、标签种类或词表大小;但在机器人操作中,更为致命却难以量化的指标是轨迹层面的多样性(Trajectory-Level Diversity)。

即使机器人被要求执行同一个名义上的任务(例如“抓取桌上的杯子”),其初始位置微调几厘米、机械臂接近的角度稍有倾斜,亦或是抓取接触点发生偏移,都会产生截然不同的动作轨迹。如果数据集里的轨迹过于单一,策略学到的仅仅是对特定固定路径的过拟合“记忆”,一旦遇到微小扰动便会失效。

代表性数据集在三维笛卡尔工作空间中关键动作帧的分布对比

综述通过对主流代表性数据集中抓取与接触关键帧(Keyframes)在三维笛卡尔空间中的分布进行启发式提取与可视化(如上图所示),揭示了不同采集策略所带来的分布差异:

在部分早期或工位受限的数据集中,动作关键帧紧密聚集成狭小的几何团簇,说明其探索的工作空间严重受限;而在 AgiBot World、RoboMIND 2.0 等最新大规模真机数据集以及第一人称人手操作轨迹中,动作关键帧呈现出更宽广、连续且具有层级分化的高度覆盖。这种广泛的空间分布,保证了策略在面对非标工况时具备内插泛化能力。

具身基础模型的数据调配法则:从 VLA 到统一世界模型

拥有了五层金字塔的数据资产后,具身智能模型究竟是如何消化这些杂食配方的?综述梳理了具身基础模型在过去几年的演变谱系,发现其模型结构与数据消耗机制发生了两次重大跃迁。

早期系统以单一模态的动作克隆为主,而近年来的模型架构迅速分化并演进为三大流派:

具身大脑模型(Embodied Brain Models):以具备空间感知增强的大型视觉-语言模型(VLM)为核心。这类系统主要利用金字塔底部的通用图文数据以及中层的人机视频数据,不直接输出电机的控制量,而是承担场景理解、可操作性(Affordance)预测、3D空间拓扑推理、长程任务规划与子任务拆解的角色。它们是大脑,指导肢体该在何时对何物做出反应。

视觉-语言-动作模型(Vision-Language-Action Models, VLA):以 RT-2、OpenVLA、GR00T 等为代表,直接将视觉图像、语言指令编码后映射为底层的低延迟控制动作。这类模型高度依赖金字塔顶层的真实机器人数据与UMI数据来提供确定性的动作监督,同时引入通用视觉数据来维持语言泛化与语义接地能力。

世界-动作模型(World-Action Models, WAM):代表了当前的最前沿探索。这类模型认识到,纯粹预测下一个动作动作(Next-Token-Prediction for Action)容易丢失环境演化规律。因此,它们利用海量未标注的人体视频与仿真连续帧,学习 action-conditioned 视频预测与物理潜空间动态演进,直接在潜在状态空间中模拟物理动作带来的后果(World Prediction),从而实现先“脑补”后果、再决策行动的高阶智能。

代表性具身基础模型的预训练数据配方与技术路线演变

从上图可以清晰看到,训练配方已经从最初以纯真实机器人轨迹为主,转变为真实数据、第一人称视频、仿真合成数据、通用图文与 UMI 数据的全方位混合预训练(Co-training)。

但在融合异质数据源时,具身模型必须跨越两座技术大山:

具身数据破局的六大开放挑战

在完成系统综述之余,作者团队提炼出了具身数据生态下一阶段亟待攻克的六大核心挑战,为产业界与学界指明了演进方向:

  1. 规模化触觉数据集的缺失:当前绝大部分具身模型严重偏向视觉反馈(Vision-centric),在面对精密插入、柔性物体捏合与滑动抑制等微观物理交互时缺乏感知能力。亟需建立统一阵列式触觉、高分辨率视触觉传感器(如 GelSight)的大规模多模态触觉基准。

  2. 失败与恢复数据的系统化沉淀:网络上充斥着完美的正向示教视频,但“避坑与自愈能力”才是决定物理机器人能否脱离保姆式看护独立作业的关键。如何在保证物理安全的前提下,规模化引诱出故障状态并高质量回放纠偏轨迹,是数据工程的核心壁垒。

  3. 自主可扩展的数据采集流水线:单纯依赖人类佩戴设备进行全时段遥操作,在经济成本和时间尺度上都无法匹敌互联网文本的积累速度。利用高精基础模型驱动机器人进行自监督式常识探索、少人值守的自动复位环境,是迈向数十万小时规模的唯一解。

  4. 跨物理形态的动作空间对齐(Cross-Embodiment Alignment):机械臂构型、减速比、刚度特性的迥异导致相同的空间运动要求完全不同的关节动力学响应。构建一种真正具有物理不变性、且能无缝映射到底层电机的通用动作中间表征,仍然悬而未决。

  5. 从人类灵巧视音频中榨取多指操作技能:第一人称视音频记录了人类二十余个自由度灵巧手的终极操作艺术,但人手肌肉骨骼的顺应性与当下的刚性五指灵巧手存在巨大鸿沟。如何将无动作标签的人类视频直接逆向工程为高精度动力学轨迹,是激活“海量视频宝藏”的钥匙。

  6. 科学化、可复现的数据混合配比(Data Recipes):目前绝大多数具身大模型在混合仿真、真机与通用图文数据时,主要依赖经验主义试错。在什么时候引入仿真、按何种采样权重搭配人机视频、何时在真机下游做特化微调,尚缺乏像 NLP 领域 Scaling Laws 那样严谨且具有预测能力的量化指导法则。

总结与展望

具身操作的本质,是在不确定性的物理世界中进行严谨的因果干预。多模态大模型的蓬勃发展为机器人提供了通晓常识的大脑,但要赋予其同样敏捷、灵巧且可靠的身体,数据基础设施的重构势在必行。

这篇综述所提出的五层数据金字塔,不仅是对现有数据集碎片化现状的分类总结,更为下一代具身大模型指明了研发全景:未来的系统不可能依赖单一数据源取得成功,而是必然走向以通用图文铸造通用认知、以合成仿真扩张探索广度、以手持人机视频汲取多样技巧,并最终以高保真真机触视觉数据完成严苛物理接地的混合共融之路。对于致力于具身智能与人形机器人落地的研究者和产业开发者而言,这份数据层面的全景透视,无疑是一份不可多得的技术路线指南。