Capek 0.5:小鹏机器人具身大模型,四大专家融合提质28项评测
Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence
大语言模型与多模态视觉模型(VLM)正在迅速成为具身智能体的“推理大脑”。然而,真正将视觉语言模型置于物理机器人中时,研究者往往会遭遇一个尖锐的矛盾:机器人的真实执行过程本质上是高频迭代的动态闭环,机器人的每一次机械臂抬起、每一次底盘移动,都会立即重构周围的几何场景与物理状态,从而不断产生全新的感知、推理与验证需求。
ArXiv URL:https://arxiv.org/abs/2608.06756v1
以往构建具身大模型的主流做法,往往是“按任务堆数据集”:把抓取点预测、空间问答、动作轨迹、视频描述等异构任务直接打包,塞进同一个骨干网络进行多任务联合监督微调或混合强化学习。这种做法忽略了执行过程的内在结构,不同任务在监督信号、输出格式以及验证标准上的巨大差异,极易引发模型参数层面的优化冲突与灾难性遗忘。最终得到的往往是一个既丧失了通用语言能力、在复杂物理执行中又漏洞百出的脆弱系统。
针对这一瓶颈,小鹏机器人(XPENG Robotics)提出了全新的具身视觉语言模型 Capek 0.5。该研究放弃了基于任务或数据集的粗放式组合,首次确立了以机器人执行全周期为核心的能力分类体系(Execution-Centric Taxonomy),划分为空间推理、时序理解、动作引导、状态验证四大能力家族。在训练策略上,小鹏团队提出了一种“先专业化后整合”(Specialist-to-Unified)的双阶段范式:先在共享底模上利用强化学习分别训练四大能力的独立专家,再通过参数空间合并(TIES)与路由式多教师策略空间蒸馏(Routed MOPD)将其无损凝聚为一个单一体积的推理模型。在与原底模的严格对齐评测中,Capek 0.5 在数十项基准上展现了压倒性优势,其中 35B 规模版本在 34 项评测中提升了 28 项,2B 版本则在 34 项中提升了 30 项,为统一具身大模型的设计提供了清晰的工程范式。

重构认知框架:从任务堆叠到“以执行为中心”
机器人完成真实世界的家务或工业操作时,各项能力从来不是割裂出现的。以经典的家庭整理任务为例,机器人在进入房间时需要感知空间拓扑,接近目标时需要识别物体三维边界与可抓取部位(Affordance),运动过程中需要解析连续图像流中的时间序列,而在机械臂松开抓夹后,它必须立刻判断物体是否平稳放置、目标物理谓词是否达成。
Capek 0.5 将这一观察提炼为执行中心分类学,将原本松散的数据形式规约到四大约束明确的家族中:
第一项是空间推理(Spatial Reasoning)。空间推理关注三维物理场景的几何特征与相对关系,包括物体与机器人视角的相对方向、深度与绝对距离估算、尺度比例判断,以及跨多视角的一致性对应。在这类数据构造中,研究人员引入了 SenseNova-SI-8M、VSI-590K、MindCube 等数据源,过滤出严格具有视觉证据支撑的几何标注,确保模型在生成文本描述时能够精确推断隐式的空间拓扑。
第二项是时序理解(Temporal Understanding)。物理操作是时间维度上的连续演变。模型不仅要回答静态画面“有什么”,更要回答“什么时候发生”、“动作先后顺序是什么”以及“物理因果如何传递”。Capek 0.5 覆盖了视频推理与精准时间定位(Temporal Grounding),要求模型不仅能分析长短视频中物体的交互次序,还能直接输出形如 $[t_{\mathrm{start}}, t_{\mathrm{end}}]$ 的标准化连续时间戳,从而让机器人具备理解动作阶段切换的能力。

第三项是动作引导(Action Guidance)。动作引导将抽象的高层自然语言意图转化为机器人下游底盘或机械臂控制器可以直接解析的显式几何线索。这涵盖了目标实体定位(Bounding Box)、可操作点(Pointing)、交互区域(Affordance Region)以及空间中的规划轨迹点列(Waypoints)。所有几何输出均被无缝投影并归一化到图像坐标空间中,完全摆脱了对特定任务额外预测头(Head)的依赖。
第四项是状态验证(State Verification)。这在以往具身大模型的研究中经常被严重忽视。如果机器人无法自主闭环验证“刚才的动作到底有没有成功”,所谓的自主规划就只能是盲目开环。Capek 0.5 将状态验证细分为两个层次:微观层面的“物理状态”,用于验证局部动作执行后的物理谓词(例如门把手是否被拉下、杯子是否装满水);宏观层面的“任务状态”,则基于当前为止的全部历史因果观测,输出对全局目标完成度(0 至 100 的数值进度估算)以及下一步建议动作。

为了支撑严密的状态验证评估,小鹏团队利用 BEHAVIOR-1K 仿真环境的精细物理轨迹,构建了全新的验证基准 Capek-StateBench,并设计了截断近似分数来衡量模型对执行进度的把控。通过将所有任务输出统一为格式严格的标准化文本接口,Capek 0.5 为具身数据立下了严密的协议,模型完全在自回归序列生成框架内输出连续坐标、时间区间与结构化 JSON 字典。
解耦训练范式:GRPO 单独培育,TIES 与 MOPD 无损融合
具备了清晰的数据分类,接下来的核心挑战在于:如何在不发生灾难性负迁移的前提下,把四大差异极大的能力统一进同一个权重?
如果将轨迹预测、时间定位、空间问答与常识对话混杂在一起直接微调,不同损失函数所激发的梯度方向极易发生相消或干扰。Capek 0.5 团队采取的核心思路是解耦能力的获取(Acquisition)与整合(Consolidation)。

第一阶段:基于可验证奖励的专家独立强化学习
四个专家模型均从同一个底座大模型初始化。在 Capek 0.5 的设计中,主干模型采用了稀疏混合专家架构的 Qwen3.6-35B-A3B(总参数 35B,每个 Token 仅激活约 3B 参数),兼顾了容量与端侧推理速度;轻量化分支则基于 Qwen3.5-2B 密集模型。
由于四大能力均具备可验证的几何或逻辑真值,团队放弃了纯静态的监督微调(SFT),全面采用组相对策略优化(GRPO)算法。对于多模态输入 $x$,策略网络 $\pi_{\theta_{\mathrm{old}}}$ 生成一组候选输出 ${y_{i}}_{i=1}^{G}$,并计算组内归一化优势值:
\[\hat{A}_{i}=\frac{r_{i}-\bar{r}}{\sigma_{r}+\delta}\]优化目标结合了 PPO 风格的裁剪机制与 KL 散度惩罚:
\[\mathcal{L}_{\mathrm{RL}}(\theta)=-\frac{1}{\sum_{i=1}^{G}|y_{i}|}\sum_{i=1}^{G}\sum_{t=1}^{|y_{i}|}\Big[\min\!\big(\rho_{i,t}\,\hat{A}_{i},\;\operatorname{clip}(\rho_{i,t},1-\epsilon,1+\epsilon)\,\hat{A}_{i}\big)-\beta\,\widehat{D}_{\mathrm{KL},i,t}\Big]\]各专家设计了针对性的复合奖励函数,统一形式为格式解析奖励与任务准确度奖励的加权组合:
\[R(\hat{y},y^{\star})=\lambda_{\mathrm{fmt}}\,R_{\mathrm{fmt}}(\hat{y})+\lambda_{\mathrm{acc}}\,R_{\mathrm{acc}}(\hat{y},y^{\star})\]对于时间定位,模型必须输出合法的区间格式,并依据预测区间与真实区间的交并比(tIoU)获得奖励:
\[R_{\mathrm{tIoU}}(I_{p},I_{g})=\frac{\max\!\left(0,\min(e_{p},e_{g})-\max(s_{p},s_{g})\right)}{\max(e_{p},e_{g})-\min(s_{p},s_{g})}\]对于动作轨迹,团队引入了离散弗雷歇距离(Discrete Fréchet Distance, $D_{\mathrm{DFD}}$)来衡量轨迹几何曲线的匹配度,将其转化为指数衰减奖励:
\[C_{\mathrm{traj}}(\bar{P},\bar{Q})=D_{\mathrm{DFD}}(\bar{P},\bar{Q}),\qquad R_{\mathrm{traj}}(\bar{P},\bar{Q})=\exp\!\left(-\lambda_{\mathrm{traj}}C_{\mathrm{traj}}(\bar{P},\bar{Q})\right)\]在状态验证领域,模型对整体进度百分比的预估则通过 25% 容忍窗口的截断线性奖励进行约束:
\[r_{\mathrm{value}}=\max\!\left(0,1-\frac{|\hat{p}-p|}{25}\right)\]通过格式约束与严格可计算的物理指标驱动,四个专家的参数更新在各自的领域内完成了深度特化。
第二阶段:权重空间合并与路由式策略蒸馏
在独立训练完成后,系统获得了四个同源但权值发生分歧的专家检查点 $\theta_{e}$,其参数偏移量为 $\Delta_{e} = \theta_{e} - \theta_{0}$。直接对四个专家做算术平均必然会导致严重的权重冲突。Capek 0.5 团队设计了“两步走”的融合机制:
首先是基于 TIES 的权重空间初始化。TIES 算法首先剔除每个专家任务向量中幅度处于底部的 80% 的冗余参数微调,随后在坐标维度上统计各专家参数更新符号的方向一致性,仅对符合多数符号的有效更新进行对齐平均:
\[\theta_{\mathrm{TIES}}=\theta_{0}+\lambda\,\operatorname{TIES}_{\tau}\!\left(\{\Delta_{e}\}_{e=1}^{E}\right)\]这一步为后续的学生模型提供了一个消除了显著符号对抗的优质初始起点。
紧接着是路由式多教师在策略蒸馏(Routed MOPD)。仅仅依靠权重合并,模型依然会丢失部分专家边界上的细粒度行为。团队将 TIES 合并后的模型作为学生网络 $\pi_{\theta}$,在输入特定能力族的数据样本时,将该样本的前缀条件动态路由到对应的专家教师 $q_{r}$ 下。蒸馏过程并非离线拟合教师的静态数据,而是在学生网络自主采样生成的 Token 轨迹上计算教师与学生之间的策略散度:
\[\mathcal{L}_{\mathrm{MOPD}}(\theta)=\mathbb{E}\!\left[\frac{1}{|y|}\sum_{t}D_{\mathrm{KL}}\!\left(\pi_{\theta}(\cdot\mid h_{t})\,\|\,q_{r}(\cdot\mid h_{t})\right)\right]\]在这一阶段,四个专家教师只在反向传播计算梯度时充当监督者;一旦蒸馏收敛,所有专家分支全部卸载,最终部署阶段只需要运行一个完全统一的自回归权重。
评测印证:全能进阶与具身闭环落地
为了验证这种“分步特化后再合并”范式的真实表现,研究团队构建了极为严苛的多层级评估体系。
在涵盖空间、时序、动作引导与状态验证的全面基准评测中,Capek 0.5 展现了极其出色的能力平衡性。以 35B-A3B 规模为例,Capek 0.5 在保持 MMMU、RealWorldQA、MMLU-Pro 等通用视觉-语言基准高水准的前提下,在 34 个横向对齐的具身与通用评测维度中赢下了 28 项;而 2B 规模模型同样在 34 项评测中赢下 30 项。这一现象强有力地证明:只要架构与整合机制得当,具身能力的注入不仅不需要以牺牲大模型的通用推理与语言常识为代价,反而能通过强约束的物理逻辑推理反哺通识认知。
在消融实验中,团队将 TIES+MOPD 方案与常规的混合数据强化学习(Mix-RL)、纯 TIES 权重合并、以及无 TIES 初值的直接 MOPD 蒸馏进行了细致比对。实验表明,常规 Mix-RL 往往在某几个特定指标上出现严重性能塌陷,无法平衡空间与动作引导的优化步调;而纯 TIES 合并在复杂的长文本时序推理中仍有明显损失。只有在先经 TIES 消除参数冲突、再由 Routed MOPD 沿着学生自采样分布进行精细行为对齐后,统一模型才能无限逼近各个独立专家的峰值表现,保留率达到 95% 以上。
更进一步,在 EmbodiedBench 与 VIGIL 等复杂的连续仿真环境中,Capek 0.5 被直接接入闭环决策系统。模型不再只是面对单张静态图片做选择题,而是根据相机视角的实时画面连续输出预测轨迹、交互点并核验物体状态。实验显示,具备严密状态验证与空间推理能力的 Capek 0.5 显著降低了机械臂盲目空抓、误判完成状态导致的死锁现象,闭环执行成功率大幅领先基线模型。
总结与展望:具身大脑的工程化范式
小鹏机器人在这项工作中展现出的学术与工程敏锐度值得关注。很长一段时间以来,学界在研发具身视觉语言模型时,普遍沉浸于收集更多样化的机器人轨迹、或者设计更复杂的微调 Prompt,却甚少审视底层优化的本质矛盾。
Capek 0.5 给出的答案非常清晰:
-
执行本身就是逻辑:不能按静态任务划分具身智能,必须将其解构为空间、时间、引导、验证四大在物理执行流中不断交织的自洽环流。
-
专业化与泛化不必二选一:通过基于环境闭环奖赏的 GRPO 培育专家,再利用参数剪枝合并与在线蒸馏进行统合,能够系统性解决多任务异构优化的冲突死结。
这种“先分后合”的流水线,不仅大幅降低了不同具身子团队协作开发时的耦合风险——每个模块可以根据新的验证工具独立升级自己的专家分支,更证明了自回归架构在处理复杂几何与动作推理时的充沛潜力。对于正在探索大模型如何落地物理世界的产业界与学术界而言,Capek 0.5 提供了一份极具参考价值的标准化施工蓝图。