CoTinyVLA:0.9B小模型逆袭7B巨头,结构化监督跑赢机器人鲁棒性基准
CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
在具身智能(Embodied AI)与机器人控制领域,视觉-语言-动作(VLA, Vision-Language-Action)模型正在成为将自然语言指令转化为机械臂末端动作的主流范式。过去一年多里,从 OpenVLA、$\pi_0$ 到 UniVLA、RIPT-VLA,社区几乎形成了一种技术共识:只有使用 3B 到 7B 甚至更大体量的多模态大模型底座,机器人才能在面对复杂环境扰动时保持足够的泛化性与鲁棒性。
ArXiv URL:https://arxiv.org/abs/2607.25487v1
然而,大模型在机器人端侧落地时面临着非常苛刻的显存墙。一个采用 bfloat16 精度的 7B 规模 VLA,在运行时往往需要消耗超过 20 GB 的显存。这让算力受限的移动底盘、双足人形机器人或低成本机械臂平台难以承受。为了压缩模型体积,社区此前探索过 TinyVLA、SmolVLA 等亚十亿(Sub-Billion)参数小模型,但往往需要在鲁棒性上做出巨大妥协。
来自韩国中央大学(Chung-Ang University)的研究团队发表了新研究 CoTinyVLA,给出了一种反直觉的解题思路:小模型的鲁棒性瓶颈并不完全在于参数量本身,而在于缺乏与真实物理控制相匹配的结构化监督。
研究团队基于 Qwen3.5-0.8B 底座构建了一个实际参数量仅为 0.9B 的小模型。在涵盖 10,030 个扰动任务的严苛鲁棒性基准 LIBERO-Plus 上,CoTinyVLA 不仅刷新了亚十亿级模型的上限,更全面超越了所有 7B 规模的主流 VLA 基线。在推理显存峰值仅为 2.25 GiB 的前提下,该模型在四大评测套件上领先最强 7B 基线多达 4.7 到 15.9 个百分点。

为什么大模型能防扰动,而小模型容易崩溃?
为了量化机器人在物理世界中面临的各种不确定性,评估基准 LIBERO-Plus 在原版 LIBERO 的基础上引入了 7 个维度的系统性扰动,包括相机视角、光照条件、背景纹理、传感器噪声、物体布局、机械臂初始位姿(Robot Initial States)以及自然语言指令变体。
过去 7B 级别的模型之所以在这些扰动下表现更好,主要是因为海量预训练赋予了它们更平滑的多模态表征,在面对视觉突变或指令换词时不易“脱轨”。相比之下,小模型在标准演示数据上极易过拟合到表面特征。一旦机械臂初始位姿发生轻微偏移,或者人类把“拿起黑碗”换成“抓取深色碗”,小模型就会因为运动学信息缺失或词汇不匹配而彻底失效。
CoTinyVLA 的核心观点在于:与其通过不断堆叠参数来被动获得鲁棒性,不如针对不同维度的物理扰动,针对性地注入三种维度的结构化监督(Structured Supervision):
-
时间与空间维度的输入结构化:用紧凑的双视角时序帧替代单帧观察,直接补足运动学推断能力;
-
推理维度的思维链蒸馏(CoT Distillation):从 35B 教师模型中蒸馏两级分层的结构化思维,显式约束任务意图与当前控制状态;
-
语义维度的指令数据增强:打破窄域指令的表面形式过拟合。
三重结构化设计:把 0.9B 模型的潜力榨干
1. 双视角多帧时序输入:给控制系统注入“速度感”
许多端到端 VLA 往往只输入单步图像或单相机画面。但对于一个 0.9B 的紧凑骨干网络来说,仅凭单帧画面推断机械臂末端与目标物体的相对运动速度和朝向极其困难。
CoTinyVLA 设计了双视角时序窗口:在每个控制步,模型同时接收来自第三人称相机和机械臂手腕(Wrist)相机的各 8 帧历史图像,总计 16 帧画面。在 20 Hz 的控制频率下,8 帧正好覆盖约 0.4 秒的运动历史,足以完整记录一次抓取发起的关键动态。两个视角互为补充:第三人称视角提供全局场景布局,手腕视角提供夹爪与物体接触面的特写。
值得注意的是,团队没有引入复杂的 3D 卷积或额外的时序位置编码,而是在 Token 流中为每张图像添加了显式的文本标记(Camera 和 Time 标记),将图像顺序直接编入线性输入流中。在 $224 \times 224$ 的分辨率下,多输入一幅图像仅增加约 32 MiB 的激活显存和 6.5 ms 的前向耗时,整个 16 帧图像输入使峰值显存仅从 1.76 GiB 增加到 2.20 GiB,以极小的计算代价赋予了小模型推断运动学状态的能力。
2. 分层思维链蒸馏:从 35B 教师模型中提取物理意图
在自然语言推理中,思维链(Chain-of-Thought, CoT)已被证明能极大改善小模型的逻辑推理。CoTinyVLA 将这一思路搬到了具身控制领域,但做了一个关键的时间尺度解耦:将推理划分为“任务级意图”与“动作块级状态”。
模型在词表中扩展了 <plan>, </plan>, <think>, </think> 四个特殊标记,并由一个 35B 参数的混合专家(MoE)视觉语言模型(Qwen3.5-35B-A3B,采用 4-bit 量化运行)在离线阶段生成监督标签:
-
Episode 级 Plan(全局规划):在任务开始时,基于指令和初始帧生成一次,将人类长指令拆解为有序的子目标。这一规划在整个任务执行期间保持稳定;
-
Chunk 级 Think(局部思考):在执行每个 8 步动作块(Action Chunk)时自回归生成,固定包含三个离散属性:当前操作阶段(Phase)、夹爪状态(Gripper)以及下一步子动作(Next)。
在学生模型训练阶段,联合损失函数为:
\[\mathcal{L} = \alpha\,\mathcal{L}_{\text{act}}(\hat{\mathbf{a}},\mathbf{a}) + \beta\,\mathcal{L}_{\text{lm}}(\hat{\mathbf{y}}_{\text{cot}},\mathbf{y}_{\text{cot}})\]其中 $\alpha=1.0$,$\beta=0.1$。这种加权确保了低层连续轨迹控制依然是主优化目标,而思维链输出则作为强有力的结构化辅助预测目标。
这种分层设计的精妙之处在于推理期可缓存。由于全局 Plan 代表的是高层意图,在整条轨迹中无需变动,推理时只需在任务第一步生成一次并缓存 KV Cache,后续控制步骤仅需生成局部的 Think 和动作块。这一优化直接将每次前向传播的自回归生成长度从 70 个 Token 骤降至 26 个 Token,稳态推理延迟降低了一半。
3. 释义数据增强:消除小模型的文本“刻板印象”
LIBERO 基准的原生训练集中总共只有 40 个基础指令模板。大模型依靠通用语义底座尚能理解同义改写,而 0.9B 规模的小模型很容易将动作轨迹死死绑定在这 40 个句式上。
为了解决这一问题,研究人员通过动词替换(如 pick up $\to$ grab, lift, fetch)、物体同义词替换(如 black bowl $\to$ dark bowl, dark-coloured bowl)和语气多态化(如直接祈使句与“could you…”、“would you mind…”互换),将 40 个基础任务指令扩充至 800 个变体。在训练过程中,模型以 0.8 的高概率随机将原始指令替换为改写指令,迫使模型建立从几何空间到语义意图的深层关联,而不是死记硬背文本 Token。
实验评测:0.9B 全面领跑四大严苛套件
为了验证模型性能,CoTinyVLA 在 LIBERO-Plus 评测集(包含 10,030 个扰动任务)和标准 LIBERO 上进行了全量测试。所有基准模型均为当前具身领域的代表作,参数量集中在 3B 到 7B,包括 OpenVLA、OpenVLA-OFT、UniVLA、$\pi_0$、WorldVLA 和 RIPT-VLA 等。
1. 突破物理扰动瓶颈
在 LIBERO-Plus 的 Spatial 套件上,CoTinyVLA 取得了 90.8% 的总成功率,以 4.7 个百分点的绝对优势击败了此前表现最好的 7B 模型 OpenVLA-OFT+(86.1%)。
最引人注目的是其在机械臂初始位姿扰动(Robot Initial States)上的表现。这一轴向直接给机器人机械臂起始关节角度注入运动学偏移,属于整个基准中最残酷的维度——在全部 11 个已发表的 3B-7B 强基线中,没有任何一个模型在该轴向上的成功率能超过 53.2%(大部分处于 30%~50% 区间,而它们在无扰动视觉任务上通常能拿 90% 以上)。CoTinyVLA 在 Spatial 套件的该轴向上直接拉升至 58.3%;而在 Goal 套件上,最强 7B 基线仅有 39.9%,CoTinyVLA 则取得了 73.6% 的断层式领先。
在全部四个套件的总成功率对比中,CoTinyVLA 均位居榜首:
-
Spatial(空间操作):90.8%(领先最强 7B 基线 4.7 个百分点)
-
Object(物体交互):87.3%(领先最强 7B 基线 2.8 个百分点)
-
Goal(目标导向):86.6%(领先最强 7B 基线 15.9 个百分点)
-
Long(长程时序任务):80.7%(领先最强 7B 基线 3.0 个百分点)
2. 无扰动标准任务下的表现
在未添加扰动的标准 LIBERO 测试中,CoTinyVLA 在 Spatial、Object、Goal、Long 四大套件的成功率分别为 99.4%、100.0%、98.6% 和 92.0%,平均成功率达到 97.5%。这一成绩直接持平了当前 7B 规模的最强纪录(RIPT-VLA 的 97.5%),并将亚十亿级此前的最佳纪录(Evo-1 的 94.8%)提升了 2.7 个百分点。这证明结构化监督带来的鲁棒性并不是通过牺牲原始场景下的控制精度换来的。
机制消融:三大组件如何正交解耦?
CoTinyVLA 提出的三个组件到底各自发挥了什么作用?作者在 Spatial 套件上进行了细致的因果消融与测试期干预,结果展示出清晰的正交性:
-
时序输入决定运动学抗扰度:当把双视角 8 帧历史缩减为单帧时,模型在机械臂初始位姿扰动(Robot Initial States)维度的得分直接断崖式下跌 16.0 个百分点。更进一步的测试期干预实验显示,如果在推理时保持输入 Token 数量不变,但把历史 8 帧强制替换为“最后一帧的 8 次机械重复”,标准 LIBERO 任务成功率会从 100% 暴跌至 60%。同时,Phase 阶段判断的退行错误率从 0.8% 飙升至 15.2%。这实锤了模型并非把时序帧当作静态冗余,而是切实从中提取了速度与相对位移等物理动态。
-
两级思维链是承重结构:高层 Plan 到底有没有起作用,还是仅仅是模型自言自语的“副产物”?研究团队在推理测试时进行了强干预:人为将模型生成的 Plan 替换为空白或者互相矛盾的假规划。干预后,任务成功率瞬间蒸发 40 到 45 个百分点。这证明低层动作生成是深度条件化于全局规划表征之上的,两级推理体系形成了强耦合的因果链条。
-
图像预算的分配艺术:在固定总共输入 16 张图片的显存与计算预算下,如何分配这些图片至关重要。消融表明,同时提供双视角时序(8 帧第三人称 + 8 帧手腕视角)相比于将全部 16 张额度单押在某一相机或纯单帧配置上,性能净增 8.6 个百分点。输入结构的合理配置本身就是一个高收益的设计变量。
-
指令增强的专属贡献:移除文本释义增强后,模型在语言指令扰动(Language Instructions)轴向上的得分下降了 12.3 个百分点,而其余六个物理视觉维度的表现几乎完全不受影响。这表明针对语言表征过拟合的干预具有高度的特异性,不会干扰底层物理轨迹的学习。
对具身智能端侧落地的启示
CoTinyVLA 的技术路线对于具身智能工程落地具有很现实的启发意义。
长期以来,具身智能领域受多模态大语言模型 scaling law 的惯性影响,倾向于直接调用通用的大型 VLM 底座来“暴力”提升泛化能力。然而,机械臂控制本质上是一个高度依赖高频局部反馈、精确几何相对位置与多时间尺度意图规划的物理交互任务。
该研究证明:通过合理的输入拓扑设计(双视角多帧时序)、从离线大模型中提炼结构化物理思考(分层思维链蒸馏)以及精准打破窄域偏置(指令释义扩充),一个参数量仅 0.9B 的小模型完全可以击败参数量大其 8 倍、计算与显存开销高出近一个数量级的 7B 大模型。
在闭环控制实际部署中,CoTinyVLA 的显存占用峰值稳定在 2.25 GiB,这意味着即便是主流的低功耗端侧嵌入式计算板卡(如 Jetson 系列),也能在不损失控制鲁棒性的前提下,实现纯本地端到端自主决策。对于致力于让人形机器人与移动操作平台走出实验室、进入真实工作场景的开发者而言,这种通过精细化结构监督来“平替”大模型体量的设计路径,或许是一条更具性价比和可落地性的技术选型。