DexMani:把人类经验转化为可操作度演化,四种机械手旋转成功率达57.5%

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

用多指灵巧手旋转一个物体,比如拧松瓶盖、旋转阀门或者在指尖把玩魔方,是机器人操作领域最经典也最棘手的难题之一。人类在完成这类动作时显得轻而易举,手指在物体表面不断经历“支撑、脱开、再次接触”的交替循环。这个过程在机器人学中被称为序列接触问题(sequential contact problem)。它的核心挑战在于:指尖每一次施力、滑动或抬起,不仅要产生当前所需的物体瞬时转动,还必须同时调整整只手的构型,为后续的持续转动留出运动空间。一旦某一次接触转换让手指陷入关节死锁或接触奇异点,旋转就会瞬间中断。

ArXiv URL:https://arxiv.org/abs/2608.00554

以往基于强化学习(Reinforcement Learning, RL)的方法往往把这个过程完全交给特定构型的机械手在仿真中暴力试错。智能体在庞大的动作空间中四处碰壁,常常学出极其怪异、剧烈抖动且极易掉落的步态。而另一条技术路线——从人类动作捕捉中做动作重定向(Motion Retargeting),则受困于人体与机械手在连杆长度、自由度分布以及抓握几何上的巨大差异。一旦换了另一款机械手,整套轨迹重定向和模仿策略就必须推倒重来。

DexMani 框架总览

针对这一根本矛盾,这项研究提出了 DexMani。它的核心洞察在于:向机械手传授人类多指操作经验时,机器人真正需要学习的不是人类手指在关节空间的几何轨迹,而是物体旋转过程中“可操作度如何随接触状态演化”的通用规律。

DexMani 首次将多指接触约束引入任务空间的旋转可操作度度量中,并基于人类多模态交互数据训练了一个基于能量的先验模型(Energy-Based Prior)。这个先验能够评估当前机械手的可操作度变化方向是否符合人类在完成旋转时的运动趋势。随后,该模型被冻结并作为残差动作指导,接入下游强化学习策略中。实验表明,借助同一套从人类示范中提取的演化先验,DexMani 在 LEAP Hand 上的三大复杂旋转任务中取得了 57.5% 的平均成功率,并在 Shadow Hand、Allegro Hand 和 XHand 三种完全不同构型的多指手平台上均超越了现有强基线,成功实现了真机上的闭环稳定旋转。

难点所在:为什么传统的灵巧旋转学不好?

要理解 DexMani 的突破,首先需要剖析多指在手旋转为何如此难以建模。物体旋转不是简单的抓取与搬运,它要求机器人手指在维持物体动力学平衡的同时,不断调整各指尖在物体表面的分布,也就是通常所说的“指步走”(finger gaiting)。

纯强化学习方法在面对这类高维接触任务时,奖励函数很难兼顾全局。如果奖励只关注物体是否转动,策略往往会贪婪地用指尖死死卡住物体强行拧动,很快达到关节极限;如果引入复杂的构型奖励或正则化项,调参成本极高,且学出来的策略在面对未见过的物体形状时泛化能力骤降。

人类示范指导原本是一剂良药,但现有的示范迁移方法通常聚焦于“轨迹对齐”。例如,先用手套记录人类手指关节角,再通过逆运动学或优化算法映射到四指或五指机械手上。这种方法在自由空间运动中效果尚可,但在接触丰富的交互场景下极其脆弱:人类手掌柔软且拥有极多自由度,机械手则多为硬质连杆、自由度受限且触觉分布各异。微小的运动学映射误差就会导致指尖与物体间产生虚空脱触或过载挤压,根本无法直接复现人类的精细运指。

机械手真正需要的不是一模一样的关节轨迹,而是一种更高层、独立于特定机械手构型的“手感”表征:在什么接触状态下,手应当往哪个方向调整自己的运动空间,才能保证物体转得顺畅且可持续。

接触条件可操作度:把人类触觉与运动学解耦

传统机器人学中,可操作度(Manipulability)通常由运动学雅可比矩阵衍生而来,用于描述末端在当前关节构型下向各个方向加速或产生速度的能力椭球。然而,传统的可操作度指标仅由机械手的本体构型决定,完全忽略了与环境和物体的物理接触约束。在多指旋转中,脱开接触的手指即使本体可操作度再大,也无法对物体施加转矩;而死死压在物体上的手指,其瞬时运动空间又被摩擦锥和法向约束严重限制。

多模态数据采集系统

为了解决这一问题,研究团队设计了一套结合虚拟现实控制器、关节捕捉手套(Manus Quantum MetaGlove)与高密度压阻式触觉手套(JQ-Industries)的多模态数据采集系统,采集了超过 10 万帧人类旋转物体的同步视觉、运动学与指尖触觉压力数据。

基于这些数据,作者形式化定义了接触条件旋转可操作度(Contact-Conditioned Rotational Manipulability)。设定 $J_{c,t}^{\mathrm{hum}}$ 为当前处于激活接触状态的指尖堆叠雅可比矩阵,$W_t$ 为触觉置信度对角权重矩阵,$G_t^+$ 为抓握矩阵(Grasp Matrix)的阻尼伪逆,则接触能力矩阵与旋转可操作度矩阵分别定义为:

\[C_{c,t}^{\mathrm{hum}} = W_{t}^{1/2} J_{c,t}^{\mathrm{hum}} H_{h} (J_{c,t}^{\mathrm{hum}})^{\top} W_{t}^{1/2}\] \[M_{\omega,t}^{\mathrm{hum}} = P_{\omega} (G_{t}^{+})^{\top} C_{c,t}^{\mathrm{hum}} G_{t}^{+} P_{\omega}^{\top} + \epsilon_{m} I_{3}\]

其中 $P_{\omega}$ 为提取任务空间旋转分量的投影矩阵,$\epsilon_m I_3$ 保证矩阵正定。为了消除流形曲率对后续计算的影响,研究团队采用对数欧几里得坐标将该度量映射为 6 维向量:

\[m_{t}^{\mathrm{hum}} = \operatorname{vech}\left(\log M_{\omega,t}^{\mathrm{hum}}\right) \in \mathbb{R}^{6}\]

这一设计的精妙之处在于:各个机械手乃至人类手掌的接触点位置,均以触觉检测到的接触中心加权计算,无需实时估计未知的物体几何中心;同时,所有可操作度矩阵的基准坐标轴在手腕系下统一定义。这意味着,$m_t$ 直接度量了手–物系统在笛卡尔任务空间绕 $x$、$y$、$z$ 轴的等效转动能力。尽管不同机械手的内部雅可比矩阵千差万别,但通过这一层数学转化,它们在任务空间的旋转能力演化被拉平到了同一个物理空间中。

能量先验:评估可操作度变化的“合理性”

有了任务空间的统一表征后,接下来的核心问题是:如何刻画人类在旋转物体时可操作度的演化趋势?

DexMani 算法框架全流程

DexMani 并没有采用传统的回归网络去强行预测下一步的绝对可操作度数值,而是训练了一个基于能量的模型(Energy-Based Model, EBM)$E_{\theta}(\hat{v} \mid c_t)$。该模型的目标是评估一个候选的可操作度变化方向 $\hat{v}$ 在当前交互上下文 $c_t = [z_t^{VT}, m_t, d_t]$ 下的相容性。其中,$z_t^{VT}$ 是由 Transformer 融合当前视觉与触觉历史得到的交互特征,$m_t$ 是当前可操作度,$d_t$ 为目标旋转轴向。

人类示范中提取出的真实可操作度变化方向被归一化为单位向量:

\[\hat{v}_{t}^{+} = \frac{m_{t+\Delta} - m_{t}}{\lVert m_{t+\Delta} - m_{t}\rVert_{2} + \epsilon_{\mathrm{num}}}\]

为了让模型学会区分“好”与“坏”的演化趋势,研究团队引入了结构化负采样机制,结合随机扰动方向、反向运动方向以及坐标系错位的方向构成负样本集合 $\mathcal{V}_t$,并通过对比隐式能量损失函数进行训练:

\[\mathcal{L}_{E} = -\log \frac{\exp\!\left[-E_{\theta}(\hat{v}_{t}^{+} \mid c_{t})/\tau\right]}{\sum_{\hat{v} \in \mathcal{V}_{t}} \exp\!\left[-E_{\theta}(\hat{v} \mid c_{t})/\tau\right]}\]

再辅以变化幅值的预测损失 $\mathcal{L}_\alpha$ 以及辅助重构损失,模型最终构建出一个平滑的能量曲面:如果某个动作能让机械手的接触状态和构型朝着符合人类经验的方向演化,该方向在能量曲面上就处于低谷;反之,若动作会导致构型死锁或丧失旋转能力,则处于能量高峰。

残差强化学习:能量模型在线“指路”

在下游控制阶段,经过预训练的视觉–触觉编码器与能量先验模型被完全冻结。DexMani 没有强行用能量模型取代控制器,而是设计了一套精细的残差强化学习架构(Residual RL)。

在控制循环的每一步 $t$:

  1. 底层基础策略 $\pi_{\mathrm{base}}$ 先根据当前本体感知和视觉触觉特征输出一个基础动作 $a_t^0$;

  2. 系统在 $a_t^0$ 附近采样一组候选动作 $\mathcal{A}_t$,并利用机械手自身的正运动学和接触状态,快速计算出每个候选动作引发的机械手可操作度变化方向 $\hat{v}_t^r(a)$;

  3. 冻结的能量先验模型对这些候选方向进行打分,挑出能量最低的动作 $a_t^\star$,并计算出能量引导偏移量 $b_t^E = \operatorname{clip}{b{\max}}(a_t^\star - a_t^0)$;

  4. 残差策略 $\pi_{\mathrm{res}}$ 接收当前的全局观测、基础动作以及能量指引信号 $b_t^E$,最终输出叠加后的执行动作 $a_t = \operatorname{clip}(a_t^0 + \lambda_R \Delta a_t)$。

这种残差设计的权衡非常讲究:能量模型提供的是高阶几何演化的宏观“手感提示”(Hints),告诉机械手“往这个构型方向走更容易维持旋转”;而具体的低阶力矩平衡、避障与动力学补偿,则依然交由残差策略在仿真环境中自由探索。这既避免了纯 RL 早期无头苍蝇般的盲目搜寻,又防止了机械模仿导致策略丧失鲁棒性。

跨构型、跨任务的实验验证

研究团队在仿真环境中构建了三个高度依赖连续多指接触的挑战性任务:拧瓶盖(Unscrew Cap)、旋转物体(Rotate Object) 和 旋转水龙头(Turn Faucet),目标均要求被操作物体绕目标轴连续旋转至少 $2\pi$(一整圈)。

水龙头任务训练曲线与动作能量曲面分析

1. 全构型泛化能力

研究团队不仅在拥有 16 个自由度的 LEAP Hand 上展开评测,更将这套完全相同、参数完全冻结的人类能量先验,直接迁移至另外三款运动学结构完全不同的机械手上:拥有 24 个自由度且连杆极度仿生的 Shadow Hand、工业界广泛使用的四指 Allegro Hand,以及具有欠驱动连杆特性的 XHand。

在所有测试平台与任务设置下,DexMani 均大幅刷新了现有水平。在 LEAP Hand 的三项综合任务中,DexMani 达到了 57.5% 的平均成功率;而在跨机械手的拧瓶盖任务中,DexMani 在 Shadow Hand 上实现了 70.0% 的成功率(对未见物体的泛化成功率达 48.2%),在 Allegro Hand 和 XHand 上也分别取得了 34.6% 与 63.4% 的显著领先。对比基线中,不论是直接基于强化学习的 PPO,还是引入动作重定向模仿的 VTA 和能量动作基线 VTA-E,均因无法适应跨机械手的构型形变而表现低迷。

2. 消融分析:贪婪优化可操作度为什么行不通?

一个极其关键的科学问题在于:性能的提升究竟是因为模型学会了“演化趋势”,还是仅仅因为可操作度数值本身变大了?

为了回答这一疑问,作者设立了消融对照组 Greedy-M——即不在意人类先验,在每一步贪婪地选择能让瞬时旋转可操作度最大化的动作。实验给出了极其清晰的结论:Greedy-M 的表现远落后于 DexMani。从图 4 的能量曲面与动作投影可以直观看出,贪婪优化可操作度往往会导致手指在某一瞬间摆出极度舒展的姿势,看似能力很大,但下一步却彻底失去了重新接触物体的几何余量;而 DexMani 选取的动作完美落入人类先验的低能量区,说明人类在旋转时并不追求某一瞬间的能力极值,而是追求能力在时间轴上的可持续性。

3. 运功平滑度与真机闭环部署

在运动质量的定量指标上,研究团队通过任务相容性指数(TCI)、无量纲抖动对数(LDLJ)以及频域谱弧长(SPARC)评估了旋转表现。DexMani 在平滑度指标上全面领先,彻底摆脱了传统 RL 策略中高频颤搐、指尖反复猛烈拍击物体的非自然现象。

真机闭环操作部署展示

在最后的 Sim2Real 阶段,研究人员将仿真中训练的策略直接部署到了搭载 TwinTac 触觉传感器的 16 自由度 LEAP Hand 与 6 自由度 xArm 机械臂物理平台上。通过在仿真中对连杆质量、接触摩擦系数、传感器噪声等参数施加域随机化(Domain Randomization),策略无需复杂的真机微调,即在实体物理环境下稳定实现了对真实水龙头和瓶盖的连续平稳旋转。

总结与未来启示

DexMani 提供了一种全新的具身智能技能迁移思路。过去,具身智能领域在利用人类示范数据时,常常在“端到端像素模仿”的不可控与“显式关节映射”的脆弱性之间左右摇摆。DexMani 证明:任务空间的接触微分几何特性(如接触条件可操作度)是连接人类高维示范与异构多指本体之间极其优越的桥梁。

它不强求机器人的“肉身”与人类一模一样,而是通过能量模型抽象出人类在面对接触丰富型物理世界时的动力学意图与几何演化直觉。尽管当前的 DexMani 在换用不同机械手时仍需针对特定动作空间训练独立的残差下游网络,但统一的能量先验已经展现出强大的跨平台通用性。沿着这条路径,未来的通用具身基座模型或许不再需要为每一种新型硬件机械臂重新对齐动作语义,而是可以通过几何与能量的中间表征,真正实现一套通用先验、万种机械本体自由适配的高泛化控制。