CoRe:具身VLA无需微调,靠“脑中推演”将扰动恢复成功率提升85%

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

CoRe:具身VLA无需微调,靠“脑中推演”将扰动恢复成功率提升85% 论文图示

当前的具身视觉-语言-动作(Vision-Language-Action, VLA)模型正面临一个极为尴尬的工程瓶颈:它们在理想演示数据里表现得极度聪慧,能在厨房或工作台上流畅地抓取并放置各类物体;但只要运行过程中稍微出现一点意料之外的扰动——比如人类中途修改了口令、桌上的工件被碰偏了十几厘米,或是机械臂意外脱手——被冻结的策略往往立刻陷入“认知失调”,在分布外(OOD)状态下不断累积动作误差,最终走向任务彻底失败。

ArXiv URL:https://arxiv.org/abs/2608.14822v1

之所以出现这种脆弱性,本质原因在于现有的主流 VLA 模型几乎全部训练于“从成功走向成功”的单向正向示范轨迹上。策略在训练中从未见过失败状态,自然无法习得自发的纠错行为。以往学界解决这一困境的思路通常走两个极端:要么通过人为注入扰动或人类接管去大量采集失败数据,对策略进行昂贵的二次微调与后训练;要么在外部强行挂载一个庞大的大语言模型(LLM/VLM)智能体或残差策略充当“保姆”,实时诊断并强行纠偏。前者成本高昂且无法穷尽千奇百怪的现实扰动,后者则引入了极大的推理延迟与次生控制风险。

凯斯西储大学(Case Western Reserve University)的研究团队提出了一种截然不同的解法:CoRe(Counterfactual Realignment,反事实重整)。该框架的核心洞察在于,机械臂遭遇物理碰撞或指令突变时,既不需要退回到起点重新执行,也不需要在现实中通过笨拙的物理试错去碰运气;它可以利用自己记忆中的环境点云与运动学模型,在“脑海”中提前虚拟推演一段如果从最近的正常状态执行新目标会发生什么(反事实续写),进而只物理复位极少数关键物体,让机械臂平滑重归原本的掌控轨道。这项无需微调、无需失败数据、无需辅助推理大模型的方法,在多项仿真与真实物理机械臂任务中,将策略在遭受扰动后的成功率最高提升了 85 个百分点,同时砍掉了 42.2% 的冗余物理干预动作。

OOD恢复范式对比与CoRe整体流程图

从“物理硬碰”到“虚拟推演”:具身恢复的第三种范式

为了讲透 CoRe 的精妙之处,首先需要看清它所颠覆的传统范式。如上图上部所示,此前业界在应对分布外执行异常时,主要依赖两种路径:

第一种是失败数据微调(Post-training on failure data)。通过在物理环境或高保真仿真器中人为打乱轨迹,记录机械臂失误后的纠错过程,再以行为克隆(BC)或偏好对齐(DPO)将这部分数据注入原策略。这种做法不仅极其费时费力,更致命的是,现实世界的长尾失效形态几乎无法被预先覆盖,新环境里的一记意外碰撞往往就会让昂贵的微调数据彻底失效。

第二种是外部智能体托管(External corrective agent)。通过引入额外的 VLM 充当监工,或者训练一个小型的残差网络在底层修正坐标。但这也意味着原本极简的推理链条被硬生生插入了一个可能同样不可靠的外部决策者,尤其在多步接触控制中,LLM 很难给出毫秒级精确的笛卡尔空间连续微调量。

CoRe 选择了一条近乎纯几何与控制先验支撑的推理期方案(Inference-time Framework)。它严格保持下游 VLA 策略本身的参数完全冻结(Frozen),当扰动发生导致策略“脱轨”时,CoRe 并不强求被搞砸的机械臂立刻在当前混乱现场继续乱抓,而是将任务解构为一个优化问题:寻找一个目标重整状态 $c^* = (q^, p^)$,其中 $q^$ 为机械臂关节点位,$p^$ 为场景物体的空间位姿,使得重整代价最小:

\[\begin{gathered}c^{*}=\arg\min_{c\in\mathcal{C}}\;\vert{}\mathcal{R}(c)\vert{}\\ \text{s.t.}\quad\pi(\cdot\mid c,\ell^{\prime})\in\mathcal{D}_{\ell^{\prime}},\quad\mathcal{P}(c_{\text{now}})\subseteq\mathcal{P}(c)\end{gathered}\]

这个公式定义了恢复的三大硬指标:首先,$\lvert \mathcal{R}(c) \rvert$ 代表机械臂为了回到正常状态所需搬移物体的物理操作次数,目标是将其最小化;其次,在配置 $c$ 与新指令 $\ell’$ 下,原本冻结的策略 $\pi$ 输出的动作必须重回其熟练的内部数据分布流形 $\mathcal{D}{\ell’}$ 之内;最后,机械臂在此前已经辛辛苦苦完成的子阶段任务 $\mathcal{P}(c{\text{now}})$ 必须被完整保留,绝不推倒重来。

这一整套复杂的推演,完全在策略的“脑海”里通过空间合成视觉得以完成,只有在敲定最终的极简重整方案后,机械臂才会真正执行物理动作。

异常感知与锚点回溯:何时叫停,退到哪里?

要实现无感恢复,系统必须具备敏锐的“自我怀疑”能力。当外部环境出现扰动(例如人类突然把指令从“拿红苹果”改成“拿绿香蕉”,或者有外力推了机械臂一下),被冻结的策略本身并不知道自己已经偏航。

CoRe 采用了一种极其轻量的动作专家后缀潜空间监控机制(Suffix OOD Detection)。在主流具身模型(如 $\pi_{0.5}$ 等 Flow Matching 或扩散架构)中,在最后将隐向量解码为实际马达运动之前,动作头都会输出一个高维表征。研究团队发现,该动作专家后缀隐向量对分布外异常具有极其敏感的分离度。CoRe 在每个控制步上对该特征进行标准化处理,并计算其相对于正常执行轨迹的马氏距离(Mahalanobis score):

\[s_{t}=\sqrt{(z_{t}-\bar{z}_{k})^{\top}\widetilde{\Sigma}_{k}^{-1}(z_{t}-\bar{z}_{k})}\]

与以往需要额外训练分类器且一旦报警只能直接让系统停机的方案不同,CoRe 的报警阈值完全来自离线成功轨迹的置信区间分位数,不需要任何负样本训练。一旦连续 $n_{\text{consec}}$ 个时间步的评分超出界限,系统便会判定当前已进入分布外异常,并主动截断控制权。

紧接着的关键问题是:该从哪个时间点重新开始?

盲目回退到原点会前功尽弃,原地硬扛又已经失控。CoRe 引入了阶段感知恢复锚点定位(Phase-Aware Recovery Anchoring)。系统会在内存中回溯近期记录的历史轨迹 $\mathcal{T}={(o_t, a_t, q_t, p_t)}$。如果是由语言指令改变引起的偏航($\ell \to \ell’$),CoRe 会用同一个历史状态同时向模型查询旧指令与新指令下的动作预测向量,通过衡量两者的位移差异来寻找分叉点;如果是物理碰撞,则对比理论状态与真实位姿的偏离度:

\[d_{t}=\begin{cases} \big\|\big(a_{t,0}^{\ell}-a_{t,0}^{\ell^{\prime}}\big)\oslash\sigma\big\|_{2} &\text{if }\ell\neq\ell^{\prime}\\[4pt] \big\|q_{t}^{\text{clean}}-q_{t}^{\text{trace}}\big\|_{2} &\text{if }\ell=\ell^{\prime} \end{cases}\]

从当前时间点向前逆向扫描,找到累计分歧超过阈值的最小时间窗,以此精准锁死“恢复锚点”(Recovery Anchor)。该锚点是系统在保持已有成功进度前提下,与新目标逻辑相符的最近合法状态。

合成观测示例:多视角几何合成与补全

脑内推演:无需真实交互的闭环反事实续写

锁定了锚点后,最精彩的一步随之展开——策略如何在不碰触物理世界的条件下,闭环推演未来的行动?

很多人下意识认为这必须依赖高精度的神经世界模型(World Model)或者昂贵的物理仿真器。但 CoRe 证明了一个极有价值的结论:具身策略在空间接近阶段,对由传统几何重投影合成的视觉图像具备令人惊讶的鲁棒性

CoRe 并不使用计算昂贵的端到端生成式大模型来画图,而是利用此前执行过程中机械臂自带的 RGB-D 深度相机积累的点云,构建局部的对象级体素存储(Voxel Stores)。对于第三人称固定相机视角,CoRe 直接在历史图像上扣掉机械臂和位移物体的像素,用背板体素填补空缺,再根据正向运动学(Forward Kinematics, FK)将机械臂在脑海中的新姿态渲染进去,辅以轻量级的图像修复(Inpainting)弥补孔洞;对于装在腕部的第一人称视角,则完全依据设想中的空间位姿重新投影渲染。

如上图所示,在合成出下一帧的虚构画面 $\hat{o}_{t+1}$ 之后,CoRe 直接将其喂给被冻结的 VLA 策略:

\[q_{t+1}=\textsc{FK}(q_{t},a_{t}),\quad\hat{o}_{t+1}=\textsc{Synth}(q_{t+1},p_{t})\]

这就构成了一个纯粹发生在内存里的虚拟闭环:合成图像输入给策略 $\to$ 策略吐出动作块(Action Chunk) $\to$ 正向运动学推演下一刻关节位置并重绘图像 $\to$ 再次输入。

这个“脑内推演”会一直执行,直到机械臂末端执行器进入与场景物体的安全接触临界距离 $d_{\text{prox}}$ 为止。之所以在接触前戛然而止,是因为未接触的自由空间运动仅靠几何运动学就能绝对精确模拟,而复杂的物理接触动力学(如摩擦力、碰撞弹性)在无仿真器时难以凭空推测。这个停顿点,就是物理系统接下来需要赶赴的“重聚点”(Rejoin State $c^*$)。

真实环境下的多样化扰动测试场景

虚拟探针:精准剪枝,只搬必须搬的物体

既然找到了理想的重聚点,物理世界是不是必须把桌上所有被碰歪的积木、盘子、工具全部摆回锚点时刻的原位?答案是否定的。如果一个物体虽然被碰歪了,但它处于当前新任务工作空间之外、根本不妨碍接下来的操作,花费宝贵的机械臂时间去把它摆正完全是浪费。

CoRe 由此设计了基于虚拟探针的最小干预剪枝(Probe-Based Minimal Restoration)。

系统首先圈定必须归位的“强制集合” $\mathcal{F}$(例如当前语言指令明确指明的目标物体、在运动轨迹安全禁区内的物体、或挡在最终放置区域的物体)。对于其他所有被碰移位的杂乱候选物体,CoRe 开始在脑海中运行“虚拟探针”:它生成一组混合状态(Hybrid Seed),强制集合内的物体摆在理想位置,而候选物体依然留在当前乱七八糟的现场位置,然后让冻结的 VLA 在虚拟脑海中再跑一次短程推演,测量其产生的轨迹与“将所有物体完美复位”的标准参考轨迹之间的关节偏差:

\[d_{\text{arm}}(S)=\frac{1}{L}\sum_{t=1}^{L}\|q_{t}^{S}-q_{t}^{\text{ref}}\|_{2}\]

如果探针推演表明,不还原某个物体完全不影响机械臂动作的连贯性和安全性,该物体就会被立即从物理搬运清单中剔除。

只有当这套在脑海中精挑细选出的最小物体子集 $S^$ 和重聚目标 $q^$ 最终敲定后,真实的机械臂马达才会通电运作:调用标准的无碰撞运动规划算法,自上而下将必须复位的极少数物体精准摆回,机械臂随后直接滑行至预定好的重聚点,将后续的端到端控制权重新交还给被冻结的 VLA。

实验与实测:抗扰成功率的大幅反弹

为了全面检验这套机制的实际效能,研究团队在仿真与真实场景下设计了极其严苛的对照实验。

在仿真实验中,研究团队选用了 ManiSkill 平台上的 LangSwitch 任务集(基于 xArm6 机械臂,针对指令突变)以及 robosuite 上的 LIBERO-Long 任务集(基于 Franka Panda 机械臂,针对物理扰动)。扰动形态涵盖了技能变更(Re-skilling)、目标冲突(Conflict)、外部关节碰撞(Arm Collision)、运输途中强行松爪滑落(Grasp Failure)以及工件倾倒(Object Tip)等,并在轨迹浅层、中层和深层分层注入。

下表呈现了三种不同代表性 VLA 骨干模型在物理扰动最为剧烈的 LIBERO-Long 场景中的恢复表现。由于裸模型(Bare)在遭遇意外掉落或撞击后完全失去纠错航向,基线成功率跌落至惨淡的 12.8%–43.5%。而配备了 CoRe 之后,成功率实现了全面反弹:

模型骨干 扰动下的裸策略成功率 (Bare) CoRe 介入后成功率 充分自主 Arm-Only 成功率
OpenVLA $12.8 \pm 2.0\%$ $69.8 \pm 3.1\%$ $65.0 \pm 2.8\%$
GR00T $27.0 \pm 2.5\%$ $88.2 \pm 2.6\%$ $81.9 \pm 2.1\%$
$\pi_{0.5}$ $43.5 \pm 2.7\%$ $85.5 \pm 2.1\%$ $80.2 \pm 1.8\%$

在语言指令突变的 LangSwitch 基准上,CoRe 同样将各骨干模型的平均成功率从 18.3%–35.5% 暴力拉升到 82.6%–92.7%。即便是在完全不切换指令的 1500 次正常控制测试中,CoRe 的轻量异常检测器也保持了 0 次误报触发,证明其在系统正常运转时拥有极佳的无侵入性。

而在上图所示的真实环境 xArm6 实体测试中,团队设置了包括人类操作员半途强行重新打乱所有桌面物品、以及向机械臂施加随机关节冲激在内的多重现实考验。在搭配 $\pi_{0.5}$ 模型的实机对比中,裸基线在受到物理撞击或重新排布时几乎全军覆没(成功率仅为 0% 到 20%),而 CoRe 直接将各类场景的成功率拉升到 60% 至 85%,在物理场景重排任务中取得了整整 85 个百分点的绝对提升(从 0% 提升至 85%)。

机制消融与技术启示:虚拟比物理便宜得多

CoRe 之所以能在系统工程层面跑通,核心在于它在“虚拟计算”与“物理动作”之间建立了一道巨大的成本剪刀差。

在真实实机测试的 165 次故障恢复统计中,一次完整的虚拟推演规划周期耗时中位数仅为 9.7 秒,分摊到推演中规划的每个动作块上仅需 1.2 秒。与此形成刺眼对比的是,机械臂在真实世界中每做一次实体动作——去桌上抓起一个被弄乱的物体再摆放回原位——中位数运动时间需要 20.5 秒,若算上底层重新感知和运动重规划,实际耗时高达 46.6 秒。

换言之,在内存中推演一次假设的代价,比机械臂伸出爪子在现实中物理验证便宜 2 到 5 倍

更重要的是实体层面的安全性。在 100 轮配对对比的真实机械臂破坏测试中,缺乏恢复机制的裸策略由于在分布外状态下胡乱输出大范围关节力矩,有 21 次直接导致了严重的硬件物理碰撞或迫使操作员拍下急停按钮(E-Stop),占其总失败案例的 27%。而在开启 CoRe 后,危险碰撞与急停骤降到了 5 次。所有的试错与边界探索都被转移到了没有物理破坏风险的虚拟投影空间中完成,机械臂在接触物体前就已经拿到了经过脑内验证的可行路径。

通过在真实混乱场景中进行剪枝测试,CoRe 平均在每轮恢复中削减了 58% 的无效摆放动作,只精准归位那 1.15 个真正阻碍任务前进的核心目标。

这项工作给目前正处于狂热军备竞赛中的具身智能领域带来了一记极具价值的清醒剂:解决端到端大模型的脆弱性,未必只有无休止地堆砌数据规模、或者在外挂大模型上叠床架屋这一条路。利用经典的局部几何建图、正向运动学与端到端策略本身的隐空间感知相结合,让冰冻的神经网络在“脑海”中提前做推演,同样能让原本脆弱的机械臂在复杂的现实世界中具备极强的自愈力。