GigaBrain-WBC-0.5:首个行为世界模型,人形机器人地形交互成功率提升4.3倍
GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction

让双足人形机器人像人一样在非平整地面上运动,一直是具身智能领域最棘手的瓶颈之一。近两年,基于大规模物理动捕数据驱动的全身运动追踪策略(Whole-Body Tracking Control)取得了显著进展,它把机器人变成了极其健壮的执行接口:上层的大语言模型、视觉-语言-动作模型(VLA)或人类遥操作员只需提供粗糙的运动意图,低层策略便会自动吸纳动力学不可行性,实时维持机器人的平衡与步态。
ArXiv URL:https://arxiv.org/abs/2608.18234v1
但这种优雅的控制接口此前几乎完全建立在“平地”假设之上。现有的主流追踪器均在空旷平整的地面上训练,导致模型从未体验过环境接触如何改变自身动力学约束。一旦机器人踏上楼梯、坐上椅子或跨过障碍,反作用力位置与重心分布发生剧烈突变,原本行之有效的平地策略便会迅速崩溃。更关键的是,研究界常用的“通过无限扩大参考动作库来提升鲁棒性”的传统路线在非平整地形中失效了——一个动作是否物理可行,高度取决于当前环境的几何约束,平地上的正常跨步在窄台阶上就是致命失误。

针对该痛点,来自清华大学、中国科学院、北京交通大学、上海理工大学及 GigaAI 等机构的研究团队提出了 GigaBrain-WBC-0.5,这是业内首个面向人形机器人全身控制的“行为世界模型”(Behavior World Model, BWM)。它打破了过去纯反应式追踪器的思路,不仅学会执行当前动作,更能联合预测自身未来的本体感知状态以及下一刻可行行为指令的概率分布。在 MuJoCo 仿真基准与 Unitree G1 实机评测中,GigaBrain-WBC-0.5 在地形交互场景下的成功率达到 $81.3\%$(为当前最强基线模型的 4.3 倍),在面对物理不可行指令时保持了 $83.1\%$ 的存活率,并将跌倒后自主起立恢复的成功率提升至 $99.3\%$。这项工作证明,只有让低层控制器同时具备理解环境约束与预测未来状态的世界模型能力,人形机器人才能真正走出平地实验室。
为什么平地追踪器的“规模化路线”在地形交互中撞了墙?
近年来,诸如 SONIC、HoloMotion-1 和 Humanoid-GPT 等工作,将强化学习与大规模动捕数据相结合,展示了人形机器人奔跑、跳跃、下蹲甚至跳舞的惊人敏捷度。这些系统的工作逻辑是将复杂的动力学校准工作下沉到底层网络中,上层系统甚至无需计算高频的接触力,只要给出一个运动意图窗口即可。
然而,这类控制器一旦被置入非结构化真实环境,就会面临双重阻碍:
其一是数据维度的“几何缺失”。要让策略学会跨越障碍或利用支撑面,必须有海量“非平整地形几何与对应全身动作完美对齐”的高质量数据。以往的方法要么依赖人工搭建地形,成本高昂且多样性极差;要么仅能从动捕数据反推 2.5D 的高度图(Elevation Map)。但 2.5D 高度图无法表达椅子下方的净空、桌沿边缘、扶手或悬空台阶等真三维几何特征,导致模型根本无法学习抓扶、坐下或倚靠等接触丰富的行为。
其二是可行域的“环境条件化悖论”。在平坦地面上,策略只要见过足够多的动作变体,就能在面对未见过的指令时凭借强大的反应能力“强行平衡”。但在复杂地形中,动作的可行集(Feasible Set)是由接触几何严格决定的。在平地上做大跨步是安全的,在宽度仅有 20 厘米的楼梯踏板上做同样动作就会踩空翻滚;在平地上向后仰是摔倒,在椅子前向后仰则是正确的就座动作。既然可行集变成了以环境为条件的函数,那么单纯在平地数据上堆砌样本量,就永远无法覆盖条件分布的边缘。当操作员或上层模型给出一个超出现实可行域的指令(OOD Command)时,常规强化学习策略极易输出异常力矩,进而损坏硬件。
行为世界模型:让负责控制的同一套网络学会“推演未来”
为了在统一框架中解决环境感知、动作执行与极端条件下的鲁棒性,GigaBrain-WBC-0.5 将底层控制器重构为了一个因果 Transformer(Causal Transformer)。
与传统的反应式策略(输入当前状态与目标指令,输出关节动作)截然不同,行为世界模型要求网络在给出控制动作的同时,对其所处环境的物理规律和未来演化展开自监督建模。

系统的控制周期为 50 Hz,被控对象为拥有 29 个主动自由度的 Unitree G1 人形机器人。每个控制步长 $t$ 下,网络接收当前机器人的 67 维本体感知状态 $\mathbf{s}t$(包含重力投影、机身角速度、躯干线加速度、关节位置与速度)、上一时刻动作 $\mathbf{a}{t-1}$ 以及未来 10 帧的参考运动窗口 $\mathbf{c}_t \in \mathbb{R}^{440}$。
参考窗口通过一个多层感知机编码器被映射为连续的行为隐变量 $\mathbf{z}^{\mathrm{raw}}_t \in \mathbb{R}^{64}$。这个隐变量与历史本体感知、动作序列一起,被送入一个 6 层的因果 Transformer 主干网络中。随后,网络的三条分支头在当前步长同步预测三个关键目标:
\[\mathbf{a}_t \in \mathbb{R}^{29},\qquad\hat{\mathbf{s}}_{t+1} \in \mathbb{R}^{67},\qquad\mathcal{G}_t = \{\pi_k, \mathbf{\mu}_k, \log\mathbf{\sigma}_k\}_{k=1}^K \in \mathbb{R}^{516}\]这一联合输出机制深刻改变了网络隐层特征所沉淀的物理意义:
-
控制分支输出当前关节的 PD 目标位置 $\mathbf{a}_t$。
-
状态预测分支预测机器人下一帧的本体感知状态 $\hat{\mathbf{s}}_{t+1}$,并在训练时与并行仿真器的真实演进状态做均方误差监督。如果机器人没有内化当前环境对其施加的接触外力与动力学改变,它就绝对无法准确预测自己的下一帧加速度和关节速度。这一损失强制网络构建自身与外界接触的内部动力学表征。
-
指令分布分支输出一个高斯混合模型(GMM,包含 $K$ 个高斯分量)$\mathcal{G}_t$,用于建模在当前接触状态和运动历史下,下一时刻合理行为隐变量的先验分布。网络在这里模拟的是“当前所处物理情境究竟允许我接下来做什么”,直接对环境允许的可行域进行了建模。
通过共享底层 Transformer 权重,GigaBrain-WBC-0.5 使得负责采取行动的网络,正是内部推演环境物理因果的网络。
自动化三维地形重构:低成本打通万小时空间几何数据
数据瓶颈是制约地形交互策略训练的首要障碍。研究团队并未选择从零在仿真环境中费时费力地手工摆放模型,而是开发了一套全自动的空间地形几何标注流水线,其核心思想是:人之所以能做出特定的全身动作,是因为脚下和身周必然存在承受相应反作用力的物理实体。

该流程直接作用于重定向后的人体动捕轨迹:
-
运动学重放与接触检测:系统在空间中重放动作,对机器人表面采样的接触点进行连续追踪。当某个表面点的法向和切向线速度跌落至预设阈值以下,且维持一定时长时,该位置即被判定为发生有效物理接触。
-
3D 点云聚类与穿透过滤:所有被触发的接触帧空间坐标在时间轴上持续累加,形成机器人与环境交互的局部三维点云。随后,算法利用全身碰撞几何体过滤掉因动捕噪声或模型形变导致的异常穿透点。
-
参数化几何基元拟合:保留下来的安全点云簇被送入几何拟合器,自动拟合出包围盒、长方体、台阶踏板等标准三维实体图元(Primitives)。
与以往只能生成 2.5D 高度场的方案相比,该算法生成的是货真价实的 3D 几何体——带有悬空下部空间的餐椅、桌子边缘、悬挑台阶和不同高度的箱体均能得到高精度的解析。
借助这一自动化管线,团队对 Bones-Seed(288 小时)、MotionMillion(900 小时)和 MotionDecode(1000 小时)三大开源动捕库展开了深度扫描,成功清洗并标注出包含复杂地形交互的高保真动作数据(分别提取出 12.50 小时、22.22 小时和 37.85 小时),并让地形动作与平地动作按 $0.2$ 的受控比例混合训练。这种方式既保全了空旷平地上的多模态灵巧度,又让低层策略第一次低成本、大规模地见识到了真实世界的空间接触。
预测驱动的在线指令过滤:“尽力而为”的优雅降级
在实际部署中,操作员使用 VR 设备手柄、或者上层视觉大模型通过离散规划给出的指令,经常会超出机器人的物理能力范围,这种现象在起伏地形上尤为致命。
常规机器人在面临 OOD 指令时通常有两种策略:一种是硬扛着执行,直到产生动力学奇异点失稳倒地;另一种是检测到风险后触发急停(E-stop)或切换为站立锁定。但在楼梯或狭窄台阶上,急停或直接定在原地往往比顺势调整重心更容易直接滚落。
GigaBrain-WBC-0.5 提出了一种优雅的闭式回缩机制,其精妙之处在于直接复用世界模型在上一步预测的高斯混合分布,无需额外训练任何判别网络。
具体的过滤机制体现为严格的时序闭环:在时间步 $t$,外部输入参考窗口 $\mathbf{c}t$ 并编码为原始意图 $\mathbf{z}^{\mathrm{raw}}_t$。系统不会使用当前步尚未生成的分布,而是提取机器人在上一时刻 $t-1$ 预测出的行为分布 $\mathcal{G}{t-1}$。这个分布是模型在还未看到当前指令时,纯粹基于过往动力学推演出的“这一步合理的行为空间”。
算法首先计算该指令与各高斯分量的对数后验,选出最契合的模式 $k^{\star}$:
\[k^{\star} = \arg\max_{k} \Big[ \log(\pi_k + 10^{-10}) - \frac{1}{2D}\sum_{i=1}^{D}\big[ ((z_i - \mu_{k,i})/\sigma_{k,i})^2 + 2\log\sigma_{k,i} + \log 2\pi \big] \Big]\]随后,在选定分量所构成的马氏距离空间中检测偏离度。如果马氏距离 $M_{k^{\star}}(\mathbf{z}^{\mathrm{raw}}t)$ 超出了预设的安全半径 $R{\mathrm{safe}}$,算法不会将该指令直接丢弃,而是沿着椭球径向将其平滑投影回安全椭球面内:
\[\mathbf{z}^{\star}_t = \mathbf{\mu}_{k^{\star}} + \sqrt{\frac{R_{\mathrm{safe}}^2}{M^2_{k^{\star}}(\mathbf{z}^{\mathrm{raw}}_t)}} (\mathbf{z}^{\mathrm{raw}}_t - \mathbf{\mu}_{k^{\star}})\]修正后的 $\mathbf{z}^{\star}_t$ 随后被送入 Transformer 主干网络生成力矩并推演下一步。
这种设计的优势十分突出:它完全无状态(Stateless),只涉及两次简单的解析运算,单步耗时远远小于 1 毫秒,在 20 毫秒的控制周期内开销几乎可以忽略不计;更重要的是,它为部署人员提供了一个唯一的物理调节旋钮——安全半径 $R_{\mathrm{safe}}$。操作员在实机运行时无需重新训练模型,就能根据任务场景对“追踪精度”与“防倒鲁棒性”进行平滑权衡。当指令超出物理限制时,机器人会执行最贴合意图且自身能承受的“尽力而为(Best-effort)”动作,大幅规避突兀的急停冲击。
策略内化跌倒起立:告别脆弱的模式切换
机器人的鲁棒性不仅仅体现在被动防摔,还体现在摔倒后能否保留任务的上下文继续运行。
业内处理跌倒的传统做法是设定离散的状态机:检测到机身倾角过大即判定为跌倒,切断主控制流,转交由专门训练的“起立专家模型”接管,起身站立稳定后再切回主追踪控制器。然而,在复杂地形中,专用的起立控制器往往因为未经历过局部几何碰撞而无法生效;即便成功站起,由于控制器上下文被重置,上层任务早已中断,操作员必须手动介入重构序列。
GigaBrain-WBC-0.5 将“起立恢复”视作全身运动追踪策略内部自带的固有行为,而非独立的外挂子模块。
在强化学习训练阶段,研究团队不仅在地形上引入基座线性推力(最高达 $\pm 50\,\text{N}$)、角速度冲击和关节阻尼扰动,更直接将一部分机器人的初始姿态初始化为随机翻倒在地。此时,参考轨迹依然在正常向前流动,躺在地面的策略必须自行学会在追踪全身误差的驱动下迅速爬起,并无缝衔接上后续步态。
这种设计使得摔倒并站起来的过程完全包含在统一的端到端权重中。机器人在跌倒后既不需要人类手动复位,也不存在控制器切换带来的力矩跳变与通信延迟。
极端场景性能跃升:横跨四种工况的全面检验
为了严密评估各模块的真实有效性,研究团队设立了四组性质迥异的基准测试集,并在与训练环境完全隔离的 MuJoCo 仿真器中,将 GigaBrain-WBC-0.5 与当前开源的三大顶级平地全身追踪器——SONIC、HoloMotion-1 和 Humanoid-GPT 展开了严格的对齐测评:
-
Standard(平地常规追踪):AMASS 测试集,包含 136 个日常动作片段,用于考察是否因追求鲁棒性而牺牲平地机敏度。
-
Terrain(地形交互):Bones-Seed 测试集中的 150 个真实台阶、平台和坐立交互片段,场景中均加载严格对应的三维环境障碍几何体。
-
OOD(超分布不可行指令):MotionMillion 中筛选出的 136 个存在人体自穿透、极端关节超限或重定向病态形变的动捕片段,测试极限指令下的防崩溃能力。
-
Fall(跌倒恢复能力):将 Standard 数据集中的动作均在躺姿或趴姿状态下进行强行初始化,考验策略是否具备自主爬起并复原追踪的能力。
值得注意的是,在评测中所有模型使用的观测输入均与真实硬件严格匹配:机器人的世界绝对位移被强制遮蔽,仅凭纯本体感知和相对窗口进行决策。
在 Terrain 地形交互测试中,缺乏环境动力学建模的平地策略几乎全军覆没。即使是基线中表现最好的模型,其成功率也仅有 $18.7\%$,主要失误来自于脚掌刮蹭台阶边沿、无法承受坐姿下突变的反作用力而向后倾翻。而 GigaBrain-WBC-0.5 凭借空间几何训练与内部动力学推演,取得了 $81.3\%$ 的高成功率,超出最强基线 4.3 倍,根节点位置误差(RootPos)控制在 166.4 mm 以内。
在 OOD 物理不可能指令测试中,常规追踪器因过度拟合训练分布的动作流形,强行模仿畸变姿态导致机体撕扯失衡,成功率最高仅为 $44.9\%$。而开启了在线 GMM 径向回缩过滤的 GigaBrain-WBC-0.5 展现出极高韧性,达到了 $83.1\%$ 的稳定运行率。机器人在过滤机制保护下忽略了不可行的肢体折叠,平顺过滤并持续前行。
在 Fall 跌倒恢复测试中,统一策略架构的优势展现得更为彻底。三大主流基线在摔倒初始化后成功站立恢复追踪的比率最高不超过 $5.9\%$。GigaBrain-WBC-0.5 则达到了惊人的 $99.3\%$ 恢复成功率(相较最强基线提升达 16.8 倍),且关节加加速度(Jerk)保持在平滑安全的 $0.46 \times 10^5\,\text{rad/s}^3$,这意味着它在实机展开爬起动作时不会产生破坏减速器与电机的冲击电流峰值。
在平地测试集 Standard 上,GigaBrain-WBC-0.5 的全身关节点平均位置误差(MPKPE)仅为 48.7 mm,根节点速度误差仅 119.8 mm/s,证明引入地形世界模型预测完全没有稀释机器人在传统平地工况下的追踪敏锐度。
实机验证与跨本体迁移能力
除了仿真数据,研究人员在真实的 Unitree G1 硬件平台(配备 29 个执行器)上部署了 GigaBrain-WBC-0.5。实机测试包含了现场放置突发障碍台阶、突发脚底支撑面悬空踩空、甚至在机器人坐上软凳瞬间外力强行撤除凳子等苛刻工况。
在硬件测试中,在线过滤器展现了核心价值:当踩空导致动力学突变时,上一帧的世界模型先验使模型拒绝了突兀的足部硬踩指令,机器人顺势收腿重踩以重新调整支撑多边形;即使受到操作员大幅度的人工推搡,系统依然能保持机体不倾覆并快速归中平衡。
更有价值的是模型的跨形态迁移泛化性。研究团队尝试将基于 Unitree G1 预训练好的 GigaBrain-WBC-0.5 模型检查点迁移至完全不同运动学尺寸与连杆惯量的 Maker L01 人形机器人上。在保持 Transformer 主干大部分权重冻结的前提下,仅利用目标机器人的少量数据微调关节头,策略便迅速在 Maker L01 上重现了类似的高鲁棒姿态平衡与障碍踏步表现,展示了行为世界模型作为具身通用底层底座的巨大潜力。
具身控制底层正在走向“端到端物理理解”
GigaBrain-WBC-0.5 的突破给人形机器人的控制技术栈带来了深层次的启发。过去,人们倾向于把“环境交互与世界感知”留给上层百亿参数的大视觉模型,而底层的全身控制器(WBC)被当做无脑、高频、纯反应式的执行器,两者的割裂导致机器人稍遇复杂地形便步履维艰。
这项工作用极具说服力的实验证明:低层运动控制同样需要属于自己的“微型世界模型”。当一个 6 层的 Transformer 开始在控制循环中同步推演接触力学对自身本体状态的影响,并在潜空间刻画可行意图的流形时,环境适应性与鲁棒性就不再是打在系统上的外挂补丁,而是作为网络理解物理世界的副产物自然涌现。
随着全自动 3D 地形拟合管线的开源与这类行为世界模型的演进,人形机器人正在从“只能在平滑地板上跳芭蕾的展品”,加速蜕变为真正能够跨越废墟、攀爬台阶、倚坐作业的实用劳动力。这种具备自我约束判断与“尽力而为”降级能力的控制接口,也为上层通用具身智能大模型铺平了更为安全可靠的落地通道。