FACT:攻克具身大模型接触难题,2500次真机评测成功率达66%

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

当前的视觉-语言-动作(Vision-Language-Action, VLA)模型已经在抓取物体、折叠衣物等自由空间操作任务中展现出惊人的泛化能力。然而,一旦面对插拔插头、装配精密零件、按压按钮等“富接触”(Contact-Rich)任务,这些大模型往往显得力不从心。传统的做法通常认为问题出在“缺乏力觉感知”,于是研究者们倾向于给大模型拼接入六维力/力矩传感器的数据,或者增加辅助监督损失函数。

ArXiv URL:https://arxiv.org/abs/2608.01402

最新研究表明,VLA 在富接触任务中的溃败并不仅仅是“缺感知”这么简单。来自具身智能领域的研究团队在论文中明确指出:富接触操作的失败存在两个因果独立的根本原因——精度失效(Precision Failures)力觉失效(Force Failures)。前者实际上源于 Flow-Matching(流匹配)动作生成策略在训练阶段的机制缺陷,而后者则源于力信号独特的动态时序特性被粗暴抹平。针对这两个根因,研究团队提出了名为 FACT(Force-Aware Contact-Rich Manipulation via Timestep Modulation)的框架,无需修改网络骨干或增加数据,仅凭噪声调度重分配与时间感知力注入,就在近 2500 次真实机器人测试中将平均成功率从最强基线的 41% 提升至 66%。

双重失效归因:不是传感器不够,而是训练与表征出了错

在插头插入、钥匙开锁这类操作中,机械臂不仅需要毫米级的对准,还需要根据接触力实时做出微调,并在完全到位时感知硬碰撞的阻力停止下压。

任务执行中的成功与失败对比

钥匙插入任务中的力特征与动作终结对比

通过对大量失败样本的力曲线与视觉轨迹进行诊断,研究团队发现现有的多模态架构在两类物理机制上同时触碰了天花板。

第一类是精度失效。在插座装配的最后阶段,哪怕有 0.5 毫米的位置误差,插头都会顶死在插座边缘,产生急剧上升并饱和的破坏力。传统观点可能认为这是视觉遮挡导致的,但即便给模型提供无遮挡视角,基于 Flow-Matching 的 VLA 策略仍然难以执行微米级的微调。深层原因在于流匹配策略的去噪训练机制:常用策略(如 $\pi_{0.5}$)默认采用 Beta 分布对噪声时间步 $\tau \in [0, 1]$ 进行采样。该分布将绝大部分采样权重压在了大噪声区域($\tau$ 接近 1),而决定动作细节、生成近乎无噪声微调动作的低噪声区间($\tau < 0.2$)在微调阶段长期处于“梯度饥饿”状态。大模型根本没有在关键的低噪阶段受到充分训练,自然无法在接触面边缘生成亚毫米级的修正动作。

第二类是力觉失效。即使引入了外接传感器,模型也常常在钥匙已经插到底时继续野蛮施力,或者在刚刚触碰边缘时就误以为完成而提前停滞。这种现象源于粗暴的力特征输入方式:力信号是高度稀疏、具有极强时序累积效应和敏感度突变的物理量。普通的 VLA 模型要么像对待文本或图像一样,把瞬时力向量简单拼接到输入层,要么当作辅助 token 处理。这导致三个严重脱节:在接触发生前,传感器测得的大量零值背景噪声严重冲淡了网络权重(接触稀疏性);微小的接触阻力本应迅速放大机械臂对位移控制的灵敏度,平铺直叙的网络架构却无法动态调节这种刚度(敏感度调制);更重要的是,单纯的瞬时力值无法区分“是在平稳滑入”还是“遇到了硬接触面停滞”,只有结合过去的力历史时序,模型才能判断物体的物理接触状态。

FACT 的破局点:极简噪声重排与时间感知力注入

既然病因已经解构为“低噪训练不足”和“力特征时序失配”,FACT 的解法体现了极强的针对性,且完全没有引入臃肿的网络结构。

用 Logit-Normal 噪声调度拯救精度

针对精度失效,FACT 彻底摒弃了常规的 Beta 调度,转而在后训练(Post-training)阶段引入改进的 Logit-Normal(LN)调度策略。其时间步概率密度定义为:

\[f_{\mathcal{T}}(\tau)=\frac{1}{s\sqrt{2\pi}}\frac{1}{\tau(1-\tau)}\exp{\left(-\frac{\left(\text{logit}(\tau)+m\right)^{2}}{2s^{2}}\right)},\quad\text{logit}(\tau)=\ln\left(\frac{\tau}{1-\tau}\right)\]

研究团队通过调整位置参数 $m=1.5$,使得采样重参数化公式 $\tau=\sigma(s\cdot z-m)$(其中 $z\sim\mathcal{N}(0,1)$)显著向低时间步偏移。这种看似简单的改动,直接将分配给 $\tau < 0.2$ 关键去噪区间的梯度信号提升了整整 6 倍。

这一改进的关键优势在于:不修改模型骨干、不增加额外参数、不需要采集新数据,只要在微调阶段替换采样公式,就能让策略集中攻克高精度微调动作的去噪生成,从而跨越了微米级修正的精度门槛。

面向接触特性的时间感知力注入

针对力觉失效,FACT 围绕接触态(State)、接触历史(History)和接触门控(Gating)三大物理维度,设计了一套时间感知力注入机制:

  1. 瞬时状态调节灵敏度:将传感器最新的力读数窗口 $\mathbf{f}_t$ 进行平均池化,得到 6 维瞬时力表征 $\bar{f}_t$。该表征经过轻量 MLP 映射后,生成层级缩放调制量 $\Delta\gamma(\bar{f}_t)$,直接叠加到动作生成 Transformer 的自适应归一化层(AdaRMS)中:

    \[h_l = \bigl(\gamma_l(\tau)+\Delta\gamma(\bar{f}_t)\bigr)\cdot\mathrm{RMSNorm}(h_{l-1})+\beta_l(\tau)+h_{l-1}g_l(\tau)\]

    通过在单次前向传播中全局调整归一化尺度,模型在感受到外力阻碍的瞬间能够动态改变网络内部特征的响应幅度,模拟出类似阻抗控制的自适应柔顺效果。

  2. 时序历史捕获物理接触轨迹:保留过去 30 步(覆盖 2 秒区间)的力矩历史序列,利用共享因果编码器进行编码,转化为时序 token 并拼接到动作生成模块的输入端。这使得策略能够区分滑移阻力与刚性阻挡的特征差异。

  3. 梯度门控阻断无效信息:设置梯度阈值 $\delta$。当未检测到有效物理接触时,力编码分支的梯度更新被强制阻断。这一设计有效避免了机械臂在自由空间运动时,传感器微小的零漂噪声对特征表示产生污染。

2500次真机评测:全面超越传统力觉融合基线

评估并非基于仿真,研究人员使用配备腕部 Bota SensONE 六维力传感器的 Franka Research 3 机械臂,在近 2500 次真实世界运行轨迹(Rollouts)中对各项策略进行了严苛检验。基准任务包括两项精度主导任务(插头插入、微型 USB 插入)以及三项力觉主导任务(带触觉反馈的按钮按压、白板擦拭、完全遮挡下的钥匙插入)。

测试结果展示了清晰的机制分工与性能跨越:

在精度主导任务中,常规力反馈模型(如 ForceVLA 和 TA-VLA)由于受困于 Beta 调度的精度缺陷,成功率甚至难以突破 30%。而仅仅在基线 $\pi_{0.5}$ 上替换使用 Logit-Normal 噪声调度,插头插入任务的成功率就直接提升了 20 个百分点,USB 插入提升约 10 个百分点。此时引入额外的力反馈并未带来显著收益,这一消融结果极其有力地佐证了论文的判断:插头对准失败的核心瓶颈在于策略去噪时间步的分配失调,而非缺少力传感器

在力觉主导任务中,时间感知力注入机制则展现了不可替代的作用。在操作人员完全看不见锁孔、仅凭手感的盲插钥匙任务中,标准基线几乎全军覆没,而结合了历史时序与状态调制的 FACT 策略实现了 22.5 个百分点的额外绝对提升;按钮按压任务更是迎来了质变,较基线提升了 17.5 个百分点。而在白板擦拭这类依赖低层柔顺控制器(Operational-Space Controller)即可吸收垂直压力的任务中,各方法均达到了近乎完美的表现,进一步证明了不同任务对高层策略力觉推理需求的边界差异。

消融实验进一步剖析了时间感知力注入内部的贡献。去除 2 秒的接触历史编码后,按钮按压的成功率骤降 62.5 个百分点,钥匙插入骤降 40 个百分点;去除瞬时力状态调节后,钥匙插入成功率同样下滑 25 个百分点。这些数据充分说明,要想让神经网络真正理解“力”,既不能失去历史的演化脉络,也不能丢掉触碰瞬间的自适应增益。

跨架构迁移与具身操作范式思考

为了验证该机制的通用性,研究人员将 Logit-Normal 调度和时间感知力注入分别移植到旧版 $\pi_0$ 架构以及 ForceVLA、TA-VLA 等同类方法中。实验表明,LN 调度同样能够使现有的力控 VLA 基线在精度任务上获得持续反弹。在以 $\pi_0$ 为主干的测试中,FACT 依然分别在插头、钥匙和按钮任务上斩获了 70%、50% 和 60% 的成功率,大幅甩开了原版 baseline。

这项研究为具身智能大模型领域带来了一次清晰的“降噪”思考:当端到端策略在物理交互中受阻时,粗暴地把更多传感器模态拼接到 Transformer 中,往往只是在用模型容量掩盖物理机制的不匹配。

FACT 证明了两个关键事实:其一,扩散模型与流匹配策略在机器人高精度控制中的瓶颈,可能仅仅源于一个不合理的去噪调度超参数;其二,物理接触信号的本质是动态的、稀疏的,必须通过时序特征和自适应缩放机制予以映射,才能转化为策略对环境阻抗的真实理解。这套低成本、即插即用的训练与特征注入范式,为下一代通用接触操作策略提供了一条兼顾计算效率与物理规律的落地路径。