打破“专机专用”魔咒:基础大模型重塑通用机器人的核心机制与局限

Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis

长期以来,人工智能在物理世界面临着一个尴尬的困境:机器人在工厂里极其精准,但只要光线微调或零件偏移,它们就会立刻宕机。 这种“专机专用”的模式,要求开发者为每一个特定任务收集数据、定制算法并在受限环境中部署。 然而,自然语言处理和计算机视觉领域的基础大模型,却展现出了惊人的开放世界泛化能力。 本文将深度解读由博世、CMU、谷歌DeepMind等顶尖机构联合发布的权威综述。 我们将跳出空泛的背景,直接剖析基础模型如何攻克通用机器人的五大硬核挑战,并揭示其工程落地的真实局限。

ArXiv URL:http://arxiv.org/abs/2312.08782v3

Figure 1

统一视角的数学抽象与核心难题

要理解大模型如何赋能机器人,我们首先需要建立一个统一的数学表述。 在机器人语境下,基础模型可以被定义为一个极其复杂的函数 $f$。 它接收来自物理世界的传感器输入 $\mathbf{x_{t}}$,以及任务上下文 $\mathbf{c}$。 最终,它需要输出对应的决策或动作 $\mathbf{y_{t}}$,以完成下游任务:

\[f(\mathbf{x_{t}, c}) \rightarrow \mathbf{y_{t}}\]

这个看似优雅的公式,在物理世界却举步维艰。 通用机器人面临着五大核心挑战:模型极难跨环境泛化Generalization); 真实世界的高质量交互数据稀缺Data Scarcity); 经典控制论高度依赖精确的环境模型与基元Requirements of Models and Primitives); 机器人难以理解人类模糊的任务规范Task Specifications); 以及在复杂环境下面临致命的不确定性与安全Uncertainty and Safety)风险。

外挂大脑:视觉与语言大模型的感知降维打击

为了解决上述问题,研究者的第一步策略是给机器人外挂一个“超级大脑”。 这个大脑(现有的大型视觉和语言模型)读遍了人类知识,具备强大的常识,但它没有真实的物理肌肉。 在感知层面,大脑展现出了降维打击般的威力。

从二维到三维的语义蒸馏:传统的机器人视觉需要针对每一个新杯子训练识别模型。 而视觉语言模型Vision-Language Models, VLMs)直接提供了开放词汇的物体识别。 更精妙的是,像F3RM和GNFactor这样的前沿方法,不仅停留在二维图像。 它们将基础模型的二维特征,直接蒸馏到神经辐射场NeRF)的三维空间中。 这让机器人在极其杂乱的厨房里,也能拥有深刻的三维几何与语义理解力。

交互式感知消除物理歧义:大脑虽然能“看懂”物体,但无法单凭视觉知道物体的重量或硬度。 UncOS等算法巧妙地利用了大模型生成物体边界假设分布的能力。 当视觉存在歧义时,大脑会指挥机器人去主动推拉物体。 就像婴儿一样,通过真实的物理触碰反馈,来动态修正对环境的世界模型。

动作接地:跨越语义指令到电机扭矩的鸿沟

拥有了大脑的机器人,如何将高级别的语义指令转化为底层的关节运动? 这就是整个领域最难的动作接地Action Grounding)问题。 大模型无法直接输出精确的电机扭矩,研究者们必须为其设计精巧的转换接口。

三维场景图与空间评估:在长视野任务规划中,直接让大模型输出数百个动作会导致上下文溢出。 SayPlan算法引入了三维场景图3D Scene Graph, 3DSG)作为外部记忆。 大模型只需在多层建筑中进行语义图搜索,从而极大缩短了规划视野。 而在运动规划层面,ReasonedExplorer和VoxPoser不再要求模型直接输出轨迹。 而是让大模型作为一个“空间评估器”,为机器人前方的可行空间生成三维价值地图。

从语言到奖励函数:对于更加底层的四足机器人控制,Saytap算法独辟蹊径。 它将输出抽象为脚部接触模式(输出 0 代表悬空,1 代表触地)。 从而让语言模型能零样本生成跳跃或慢跑指令。 更具通用性的是Eureka等算法,大脑完全不干预动作,而是负责编写强化学习的奖励函数代码。 底层策略根据这份代码在仿真中不断试错,最终甚至能学会转笔这种极其复杂的灵巧动作。

原生肌肉:机器人基础模型(RFM)的觉醒

外挂大脑虽好,但机器人终究需要原生的“肌肉记忆”。 近年来,机器人基础模型Robotics Foundation Models, RFMs)开始崛起。 这些模型直接在包含真实状态-动作对的机器人数据集上进行端到端训练。

Figure 6

大规模模仿学习:RT系列模型和RoboCat是该路线的代表。 它们将几十万条带有语言标注的真实机器人轨迹,输入到庞大的Transformer架构中进行行为克隆。 实验证明,只要数据规模足够大,单一网络就能在未见过的指令下完成抓取与放置任务。 离线强化学习的潜力:除了模仿,QT-OPT等算法在庞大的历史废弃数据中寻找最优策略。 近期,基于Transformer的Q学习架构(Q-Transformer)也展示了其在处理大规模离线数据时的优势。 这让机器人能够从失败的经验中自我进化。

冰冷的现实:数据分布的致命偏差

尽管算法日新月异,但本文对Open-X Embodiment等大规模数据集的元分析,揭露了一个极其残酷的物理现实: 我们极其缺乏高质量且多样化的真实物理数据。

Figure 4

如上图所示,当前的机器人数据分布存在着灾难性的倾斜。 首先是形态偏差:在73个子数据集中,竟有55个完全局限于单臂机械狗操作。 双臂协作任务仅占极小比例。 其次是场景与物理属性偏差:绝大多数任务发生在干净的桌面上,操作对象多为塑料玩具厨具。 这些数据隐含了“绝对刚体”和“重量可忽略”的致命物理假设,导致模型在车间面对沉重钢铁时瞬间崩溃。 最后是采集成本高昂:当前数据高度依赖人类专家通过VR或触觉设备进行遥操作。 例如著名的RT-1数据集,耗费了长达17个月才采集完成,这严重制约了模型的缩放定律。

工程启示与安全局限

面对数据的极度匮乏,工程界开始探索利用大模型进行数据合成。 RoboGen和ROSIE等框架,能够根据自然语言指令,在物理仿真器中自动生成带有成功条件的机器人轨迹,或是利用图像生成模型对视觉观察进行数据增强。 这为突破数据瓶颈提供了极具价值的解法。

然而,大模型应用于物理实体仍有深层的局限。 思维链Chain-of-Thought, CoT)虽然能提升任务规划的逻辑性,但在自回归解码的机制下,只要中间某一步规划出错,就会导致物理执行的指数级发散。 此外,物理世界容不下“模型幻觉”。 当前的视觉语言大模型极度缺乏不确定性量化Uncertainty Quantification, UQ)能力。 如何利用保角预测等无分布统计方法,让机器人在感到迷茫时能及时停机并主动向人类求助? 这不仅是安全部署的底线要求,也是通用机器人从实验室走向现实世界必须跨越的最后一道天堑。