RynnValue:告别偏好标注!用时间距离撬动300万具身片段,真机成功率升至72.5%

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

RynnValue:告别偏好标注!用时间距离撬动300万具身片段,真机成功率升至72.5% 论文图示

在具身智能走向通用泛化的道路上,策略模型的容量正随着多模态大模型的融入而急剧膨胀,但强化学习与自主进化的闭环却被另一道无形的屏障卡死了——通用的奖励与价值模型(Reward / Value Foundation Models)。

ArXiv URL:https://arxiv.org/abs/2608.09853v1

缺乏鲁棒的通用价值模型,机器人策略就无法在大规模无监督或弱监督的交互环境中判断自身状态的优劣,更难以进行高效的在线试错与自我提升。学术界与工业界以往的主流解法,往往直接套用大语言模型对齐的旧经验:要么依赖极其耗费人力的人类偏好对齐(Preference Ranking),要么强制将轨迹标定为从 0 到 1 的“归一化进度”(Normalized Progress)。然而,这两种范式在具身领域都遇到了严重的水土不服——不同构型、不同视点、不同动作节奏的机器人数据,根本无法统一在同一种人为定义的偏好或绝对进度坐标系下。

来自阿里巴巴达摩院与湖畔实验室的研究团队提出了具身价值基石模型 RynnValue。该工作放弃了主观的偏好标注与归一化的虚拟进度,直接回归最优控制理论中最本质的物理物理量:时间距离(Temporal Distance),即当前视觉观测距离达成语言指定目标所需的剩余时间代价(Directed Cost-to-go)

依托这一近乎“自监督”的目标,RynnValue 在无需任何人工偏好或逐帧进度标注的前提下,利用时间戳直接吞吐了超过 7,000 小时、近 300 万条异构机器人视频片段。在极具挑战的具身奖励评测基准 RBM-EVAL-OOD 上,RynnValue-8B 取得了 0.675 的平均 Kendall’s $\tau_a$ 排序相关度,不仅碾压了纯进度监督方案(0.292),更击败了完全由高质量偏好数据重度监督的当前 SOTA 模型(0.655)。将其转化为密集奖励后,真机机械臂在线强化学到的策略成功率从 52.5% 跃升至 72.5%,离线场景更从 63.8% 攀升至 82.5%。

这项工作为通用具身智能的自我进化补上了关键的一块拼图:真正可扩展的价值模型,不需要昂贵的主观标注,而是潜藏在物理世界的时序流转之中。

RynnValue整体架构

为什么偏好与归一化进度卡死了具身价值扩展?

在大模型强化学习(RLHF)中,人类偏好标注行之有效,是因为人类对两段文字回复的优劣有着高度一致的主观语义裁决。但在机器人操控领域,轨迹偏好配对面临着巨大的组合爆炸与标注歧义。同一段插拔插头的动作,手臂抬起角度稍微偏差两厘米究竟该算好还是算坏?不同的人类标注者往往给出互相冲突的打分。这种高昂且脆弱的监督信号,使得偏好奖励模型很难低成本吞吐百万级异构机器人轨迹。

退而求其次的“归一化进度(0 到 1)”同样暗藏陷阱。将整段任务的推进程度强行映射到 $[0, 1]$,在数学上只是单条轨迹内部的相对坐标,并不具备控制理论中“剩余代价”(Cost-to-go)的物理连续性。例如,快速挥动机械臂 1 秒完成的任务,与缓慢谨慎移动 30 秒完成的同类任务,其中间状态的进度值可能相同,但所代表的状态价值完全不可比。更致命的是,真实机器人操作充满了回退、试探、掉落重试等非单调事件;一旦系统发生滑落或失败,归一化进度模型很难对这类“倒退”做出合理的数值响应,反而往往陷入平滑预测的幻觉中。

与其在人为生造的坐标系里缝缝补补,不如回归到控制论中最朴素的“击中时间”(Hitting Time)问题:给定当前状态和语言目标,假设后续采取合理路径,机器人在物理世界中还需要多少秒才能抵达终点?

时间距离具有三个关键优势:

正是这一视角的切换,将原本受制于昂贵标注的奖励建模,彻底释放成了可以吞噬海量异构轨迹的自监督基础模型任务。

7000 小时多源异构轨迹的“免费”数据飞轮

一旦确立了以时间戳为监督源头,整个具身智能领域数年间积累的公开数据与仿真资源瞬间被激活。RynnValue 团队构建了一个庞大的异构具身混合数据集,累计时长突破 7,000 小时。

这个混合体囊括了真实机器人操作(单臂工业机器人、双臂桌面机械臂、移动双臂协作机器人、甚至灵巧手系统)、多物理引擎的仿真轨迹,以及大量的以第一人称(Egocentric)视角记录的人类操作演示。这些数据覆盖了完全不同的相机视点、控制频率、执行节拍与语言描述粒度。

不过,原始机器人轨迹并不能拿来直接计算时间距离,因为许多录制视频在动作执行完毕后仍有数秒的静态停顿或空转,直接取视频最后一帧作为终点会导致严重的时间标签噪声。研究团队对原始的 167 万条完整演示进行了两步清洗重构:

  1. 子任务拆分:利用数据集中原生的动作阶段或语言标注,将长程复杂操作精准拆解为具有明确语义阶段的子任务片段。

  2. 截断点重标注(Cutoff Relabeling):对于缺乏阶段标注的数据,采用语义动作识别与基于比例、时长的自适应裁剪策略,精准定位到动作真正“语义完成”的瞬时时间戳 $t_G$。

经过这套标准化处理,庞大的原始视频被转化为超过 300 万条带有明确语言目标与精确完成截断点的轨迹片段。对于任意采样帧 $I_{t_i}$,其绝对时间距离目标直接被定义为:

\[v_i^\star = \max(0, t_G - t_i)\]

无需构造繁琐的正负样本对,也无需专家评估两段轨迹孰优孰劣,300 万对“视觉状态—语言指令—时间距离”的高质量监督信号在流水线上自动化生成。

破除作弊捷径:时序打乱与价值隔离注意力

如果直接把多帧连续图像输入多模态模型来预测时间距离,模型极易产生严峻的“偷懒捷径”(Shortcuts)。在大规模自注意力机制下,模型往往不会深究图像细节中机械臂与物体的细微接触状态,而是直接根据输入帧在序列中的固定顺序(第 1 帧、第 2 帧……第 8 帧)进行简单的线性插值;或者直接通过自注意力偷看前面时间步的价值预测,机械地输出平滑下降的数值。

一旦模型学会了这种“作弊”,它就会对现实世界中的动作倒退、物体滑脱、机械臂卡死等异常完全失去敏感度——即使机器人把桌上的杯子撞翻导致局面彻底恶化,模型依然会因为“当前处于第 7 帧”而笃定地预测即将完成。

为了彻底粉碎模型的作弊通道,RynnValue 在视觉输入端和多模态注意力底层实施了双重硬约束。

RynnValue训练策略与价值隔离注意力机制

视觉端的扰乱机制

在训练阶段,模型从轨迹中非均匀地随机采样 $K=8$ 帧图像,打碎等间隔采样的算术规律。更关键的是,研究团队对输入帧的呈现顺序进行了时序打乱(Temporal-Order Shuffling)。在半数训练样本中,帧序列被完全打乱抛弃时间序;在另一半样本中,则采用带有随机回退概率的前向随机游走。这意味着输入给模型的序列可能是“第 1 秒、第 5 秒、第 3 秒、第 6 秒”。此时,模型必须抛弃“位置越靠后越接近成功”的先验偏见,唯一能依赖的依据只有图像中的真实物理构型。

此外,为了防止模型在遇到无关指令时强行输出进度,架构中引入了 10% 的指令失配增强(Instruction-Mismatch Augmentation)。当视频与指令被随机错配时,模型被强制要求识别出错误,同时屏蔽绝对时间损失,迫使其将视觉动态与指令语义深度绑定。

注意力底层的价值隔离机制

在 Transformer 结构内部,RynnValue 基于 RynnBrain 具身大模型底座进行特征交互。为了容纳多尺度的操作线索(夹爪开合度、物体空间距离、任务完成标志等),模型不再使用单一 Token 承载价值预测,而是引入了一组重复的查询 Token(Grouped Temporal Queries),最终拼接形成高维表征。

然而,如果允许不同时间步的查询 Token 互相做自注意力计算,模型仍能隐蔽地实现“跨时间步外推”。为此,研究团队设计了价值隔离注意力(Value-Isolation Attention)

这一设计在模型计算层面建立起严格的防火墙:每一个时间步的距离评估,必须独立、且仅能依赖当前的视觉画面与目标指令。正因如此,即使面对非单调的失败重试或环境突变,RynnValue 也具备敏锐的价值回退响应能力。

连续时间的双分布预测头

在数值输出层面,常规的 L1/L2 回归容易在长程尾部产生梯度爆炸,且对微小的目标变化不够敏感。RynnValue 将时间预测重构为一种极具鲁棒性的分类问题。

模型配备了两个专门的分布预测头(Distributional Heads):

数值轴被划分为 256 个对数对称间隔(symlog-spaced)的区间桶。在零点附近,分桶高度密集,保证接近完成时的精确度;在远离终点的长程尾部,分桶逐渐对数稀疏,平滑吸收长程误差。训练时采用两热编码(Two-Hot Target),将任意连续的实际时间距离无损转化为最近两个桶的概率目标;推理时,通过期望值解码并经过反向 symlog 变换,重新还原为极度平滑且精准的连续时间数值 $v_i$。

与时间预测并行,底座多模态模型的自回归语言头被完整保留,用于在推理的最后一步输出长文本视频动作描述以及“任务是否匹配”“动作是否成功”的离散语义判定,实现了连续控制代价与高级离散语义的统一表征。

势能塑形:无缝切入强化学习的奖励接口

评估出精确的剩余时间后,该如何指导下游机器人策略学习?

在强化学习的常规定义中,目标是寻找最优策略以最大化累积折扣回报,状态价值通常满足“越接近成功数值越大”。但时间距离 $v_t$ 恰好相反:离成功越近,剩余秒数越小;当任务达成时,$v_t = 0$。

为了弥合这一语义反差,RynnValue 采用极其简洁的符号翻转,将绝对时间距离转化为状态势能(Potential):

\[\Phi_t = \Phi_\theta(I_t, \ell, m) = -v_t\]

在这个定义下,任务未完成时的状态势能天然为负,随着机器人逐步逼近目标,势能逐步趋向于 0。借助经典的最优控制势能奖励塑形(Potential-Based Reward Shaping, PBRS),下游强化学习环境可以以纯粹的时间差分形式获得单步密集奖励:

\[R_t = r_{\mathrm{env}} + \gamma \Phi_{t+1} - \Phi_t\]

这一数学变换极其精妙:它不仅将原本稀疏的成功判定转化为了连续、平滑、具有强向导性的密集引导信号,而且在理论上严格证明了不会改变原 MDP 的最优策略收敛点。机器人既不会学会为了刷分而原地打转的“作弊小动作”,也彻底摆脱了人工手动微调距离权重常数的烦恼。

实验与真机验证:零样本跨本体的降维打击

为了检验 RynnValue 是否真正掌握了跨场景的通用具身价值判断,研究团队在标准评测基准与严苛的真机闭环上进行了双重考验。

在具身奖励模型核心评测基准 RBM-EVAL-OOD(跨构型、跨视点、跨未见任务的完全分布外评测)中,核心指标是衡量时序排序准确率的 Kendall’s $\tau_a$。实验结果展现出了压倒性的优势:

消融实验进一步印证了技术路径的有效性:当撤掉价值隔离注意力与时序打乱机制后,模型在分布外场景下的价值一致性急剧下滑,证明了防作弊机制确实逼迫大模型将感知注意力死死钉在物理场景的因果特征上。

在真机策略学习实验中,研究人员在真实机械臂上测试了多项涉及灵巧接触的复杂操作(包括机械臂插拔充电头、复杂工具抓取摆放等)。无论是通过在线强化学习(Online RL)进行实时策略优化,还是在固定经验池上进行离线强化学习(Offline RL),RynnValue 驱动的智能体均展现出惊人的稳定性:

这一结果极富启发性:在缺乏优秀价值模型时,强化学习经常因为偶发的探索失败而陷入策略退化;而 RynnValue 赋予了智能体极度敏锐的“知难而退”能力——当机械臂发现当前动作导致时间距离不降反增(即势能暴跌)时,算法会迅速抑制该动作分布,转向更具物理收敛性的轨迹分支。

具身价值模型的新范式

长期以来,具身智能领域的价值与奖励建模一直摇摆在两个极端之间:一端是依赖人工逐个环境设计几何距离与夹爪状态的微观启发式奖励,脆弱且不可迁移;另一端则是强行套用语言大模型的偏好学习,昂贵且充满主观噪声。

RynnValue 用扎实的实验证明,物理世界本身就蕴藏着最具泛化力的度量标准——时间。将价值基础模型的目标牢牢锚定在“时间距离”这一客观物理代价上,不仅打破了数据吞吐上的标注枷锁,让数千小时的多源沉淀数据化为随时可用的监督养料,更在控制理论与视觉表征之间搭建起一座优雅的数学桥梁。

随着通用价值基石模型的成熟,未来的机器人自主演进或许将不再依赖于人类在旁亦步亦趋的打分干预。面对浩瀚未知的物理世界,只要给定一句自然语言目标,大模型就能凭借眼前的时钟与画面,感知每一步操作离终点是近还是远——这正是通用具身智能迈向自主学习与大规模规模化(Scaling)所不可或缺的关键跃迁。