TurboVLA:V+L直接映射,0.9G显存达成32Hz实时控制!

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

在具身智能与机器人控制领域,视觉-语言-动作模型(Vision-Language-Action, VLA)在过去两年中确立了统治地位。从 RT-2 到 OpenVLA,主流的研究范式几乎全部围绕着一个核心思路展开:将庞大的大语言模型(LLM)作为感知与动作之间的中央处理器。这种被称为 $V \to L \to A$ 的间接映射路径,虽然赋予了机器人强大的语义泛化和推理能力,但也带来了一个致命的副作用——极高的计算延迟和显存开销。

ArXiv URL:https://arxiv.org/abs/2607.27205v1

对于需要高频响应、且往往只能搭载边缘计算设备的机器人系统而言,每次执行动作都要进行几十亿甚至上百亿参数的深度前向传播,无疑构成了落地应用的最大瓶颈。

面对这一行业痛点,华为与华中科技大学的研究团队提出了一种全新的实时控制架构——TurboVLA。该研究打破了“一切控制皆需经过大模型”的思维定势,将传统的 $V \to L \to A$ 路径重构为更加直接的 $V+L \to A$ 映射。通过剥离冗重的大模型底座,采用轻量级文本编码器与双向跨模态交互,TurboVLA 在保持顶尖操作成功率的同时,将硬件需求降到了极低的水平。

在主流基准测试 LIBERO 上,TurboVLA 仅凭 0.2B(两亿)的参数量,就取得了 97.7% 的平均成功率,不仅匹敌甚至超越了比其大十倍以上的 VLA 模型。更关键的是,在一张消费级 RTX 4090 显卡上,其在线推理显存占用不到 1 GB,端到端策略延迟仅为 31.2 毫秒,实现了真正的 32 Hz 实时控制。

这项工作为高效机器人操作提供了一个极具参考价值的全新视角:在执行层面的连续控制中,我们或许根本不需要一个通用的大型语言模型。

现有 VLA 模型的致命瓶颈:LLM 中枢之重

要理解 TurboVLA 带来的架构革新,必须先审视当前 LLM 中心化 VLA 模型面临的结构性困境。

现有的 VLA 模型通常将大语言模型置于视觉到动作路径的绝对中心。在执行任务时,系统首先通过视觉编码器提取当前环境的图像特征,并将这些特征投影到大模型的词元(Token)空间中。随后,这些视觉词元与经过分词的任务指令拼接在一起,共同输入到大语言模型中进行处理。最终的动作预测,要么像 RT-2 和 OpenVLA 那样通过自回归方式逐个生成动作词元,要么像 $\pi_0$ 那样通过并行的连续动作头输出。

这种 $V \to L \to A$ 的设计初衷是好的:它能够无缝继承大语言模型在海量预训练中获得的丰富世界知识、常识推理能力以及开放词汇理解能力。

然而,当我们将目光从“任务规划”转移到“底层动作执行”时,这种设计的局限性就彻底暴露出来了。研究团队敏锐地指出,在大多数执行层面的操作中,人类给出的语言指令已经明确指定了目标技能(例如“抓取红色的苹果”)。此时,执行策略并不需要进行开放式的语言生成,也不需要进行复杂的长逻辑链任务分解;它真正需要做的,仅仅是利用语言指令来确定当前的视觉特征应该如何引导末端执行器进行三维空间中的连续运动。

TurboVLA与传统LLM中心化架构的对比

在传统的 LLM 中心化架构中,这种相对直接的视觉-语言对应关系,却被迫要经过一个拥有数十亿参数的通用语言表征空间的“中转”。这种过度杀鸡用牛刀的设计,引入了巨大的计算和内存开销。即使是采用了并行动作解码技术的最新模型,虽然规避了逐词元生成的顺序解码成本,但高维度的多模态特征输入依然要完整穿过整个庞大的语言模型主干,导致极高的推理延迟,严重限制了机器人的控制频率。

高延迟对于动态环境下的机器人操作是灾难性的。它不仅会导致机器人在快速变化的场景中反应迟钝,还会引发控制系统的震荡,降低抓取和操作的成功率。此外,高达数 GB 甚至十几 GB 的显存需求,也使得这些模型极难部署在算力受限的真实机器人平台上。

核心重构:从间接转换到 V+L 直接映射

基于上述观察,研究团队提出了一个更加简单、优雅且高效的替代方案:TurboVLA。该模型的核心理念是,既然语言对于指令条件下的操作是必要的,但执行控制又不需要通用的大模型推理,那么我们完全可以让视觉和语言直接进行轻量级交互,从而形成专为动作预测定制的表征。

TurboVLA 彻底摒弃了中心化的 LLM,转而采用独立编码、直接交互、并行解码的 $V+L \to A$ 流水线架构。

TurboVLA架构总览

多模态特征的独立轻量级编码

为了在降低系统开销的同时保留足够的指令理解能力,TurboVLA 为不同的模态选用了最合适的紧凑型编码器。

在语言端,执行级别的指令通常只涉及物体、属性和空间关系,而不涉及需要大语言模型才能理解的复杂因果推导。因此,研究团队采用了一个轻量级的文本编码器(如 BERT)来提取指令的词元级特征。给定任务指令,文本编码器会将其映射为维度适中的特征序列 $Z^l$。

在视觉端,TurboVLA 使用了 DINOv3 等视觉编码器提取多视角图像的特征,并在加入位置编码和视角编码后,整合为视觉特征序列 $Z^v$。

值得注意的是,无论视觉还是语言,提取出的特征都会被投影到一个相对低维的共享隐藏空间(维度 $d$ 仅为 256)。这与传统 VLA 模型动辄几千维的大模型隐藏层相比,极大地减少了中间激活的内存占用和后续的注意力计算成本。同时,机器人的本体状态特征 $Z^s$ 也通过一个轻量级网络进行投影,但它并没有参与早期的跨模态交互,而是被直接保留到最终的动作解码阶段。这种设计确保了视觉-语言交互过程能够完全聚焦于对当前场景的“任务条件理解”,而不被底层运动学状态所干扰。

轻量级双向视觉-语言交互

独立编码后的视觉和文本特征本身并未建立联系,系统此时还不知道视野中的哪块区域对应指令中的目标。传统 VLA 将这个对齐过程交给了大模型的深层 Transformer 结构来隐式完成。

TurboVLA 则从先进的视觉定位(Visual Grounding)模型(如 Grounding DINO)中汲取灵感,设计了一个极其紧凑的双向视觉-语言交互模块。该模块由 6 层双向交叉注意力(Cross-Attention)层堆叠而成。

在每一层中,视觉特征和语言特征直接且平等地交换信息。一方面,指令中的目标物体、属性和空间关系信息被用来调制视觉特征,使得网络能够对与任务相关的图像区域“施加更多注意力”;另一方面,语言指令的表征也根据当前的视觉场景进行自适应更新。经过多层交织处理后,最终输出拼接后的多模态特征 $Z^{vl}$。

这种直接交互机制的高明之处在于:它摒弃了将所有模态强制拉伸到通用语言空间的做法,仅通过简单的注意力机制就完成了针对具体操作任务的特征融合,彻底摆脱了对大模型泛化表征的依赖。

连续动作块的并行解码

在获得高度融合的跨模态特征 $Z^{vl}$ 后,TurboVLA 采用了一个类似 ACT(Action Chunking with Transformers)的轻量级 Transformer 解码器来进行动作预测。

解码器以动作查询(Action Queries)为主体,结合跨模态特征和当前机器人的本体状态特征,在单次前向传播中直接预测出一个完整的包含 $H$ 步的连续动作块(Action Chunk)。由于所有的动作查询都是并行解码的,这种方式完全避免了自回归动作词元生成的顺序耗时。

在训练阶段,TurboVLA 仅使用专家示范轨迹进行行为克隆(Behavior Cloning),直接优化预测动作序列与真实动作序列之间的 $L_1$ 损失。整个框架内不存在任何辅助的语言建模目标(如预测下一个词),真正做到了为“执行动作”而生。

实验结果:以极小代价换取顶尖性能

为了验证这种极简架构的实际效能,研究团队在单臂操作基准 LIBERO、双臂操作基准 RoboTwin 2.0 以及真实机器人部署上进行了全面而严格的测试。结果表明,TurboVLA 在性能与效率的权衡上,达到了当前领域的最前沿水平。

TurboVLA在性能与资源开销上的综合对比

LIBERO 仿真环境中的绝对统治力

在极具挑战性的 LIBERO 包含多种子任务的基准测试中,TurboVLA 展现出了惊人的任务完成度。总体平均成功率达到了 97.7%,不仅大幅超越了早期的 LLM 中心化模型,甚至与目前最先进的参数量达到 30 亿级别的 $\pi_{0.5}$ 相比也毫不逊色,在很多细分任务中甚至实现了反超。

取得这一顶尖成绩的背后,是极为悬殊的资源消耗对比。如研究数据所示,大部分高性能 VLA 模型都处于数十亿参数级别,这导致它们在执行时的显存开销动辄达到几个 GB,并且推理延迟居高不下。相反,完整的 TurboVLA 策略仅包含 0.2B 的参数,大约只有 $\pi_{0.5}$ 参数量的 6%。

打破延迟与显存壁垒的 32 Hz 控制

在硬件效率指标上,TurboVLA 提供了一组让机器人工程师感到兴奋的数据。在进行端到端策略推理时(即从接收到多模态输入,到完整输出一个动作块所需的时间),TurboVLA 在 RTX 4090 上仅耗时 31.2 毫秒。这意味着模型每秒可以输出超过 30 个动作块预测,实现 32 Hz 的超高在线控制频率。相比之下,传统的 LLM 中心化模型往往只能在个位数的频率下挣扎。

与此同时,TurboVLA 的峰值推理显存(VRAM)被极其严格地压缩在了 0.9 GB 以下。不到 1 GB 的显存需求意味着什么?这意味着在实际的机器人计算平台上,工程师不仅可以轻松部署这一高频控制策略,还能腾出大量的 GPU 资源用于运行 SLAM 建图、目标跟踪、或是更高层面的任务规划算法。这种极佳的系统共存能力,为复杂机器人的系统级集成扫清了障碍。

真实环境的稳健部署

架构的理论高效性最终需要转化为实际物理世界的可用性。研究团队将 TurboVLA 直接部署到了真实的 AgileX Piper 机械臂平台上,测试了四个不同难度的日常操作任务。

TurboVLA在真实机器人上的部署与表现

在真实世界的测试中,TurboVLA 分别取得了 92.5%、80%、90% 和 87.5% 的极高操作成功率。在直接对比中,它的表现始终优于参数量大得多的 $\pi_{0.5}$。真实环境存在着光照变化、标定误差、物理摩擦等大量在仿真中难以完全复刻的噪声,而 TurboVLA 的成功充分证明,其直接的 $V+L \to A$ 路径提取的特征不仅足够指导精确控制,而且具备极强的鲁棒性。

核心机制的消融分析

为了进一步论证设计的合理性,研究团队对 TurboVLA 的各个组件进行了细致的消融实验(Ablation Study)。

首先是语言条件的重要性。实验证实,如果移除语义语言条件(即剥离文本编码器,不将指令信息输入网络),模型在具有相似视觉场景但指令不同的任务中会彻底迷失方向,导致成功率断崖式下跌。这说明轻量级编码器配合交互模块,确实成功地将任务语义注入了控制环路中。

其次是双向交互的深度。研究团队探讨了改变交叉注意力层数 $N$ 的影响。结果发现,如果仅使用一层交互或完全使用简单的特征拼接,性能会受到明显影响;但当 $N=6$ 时,视觉与语言的特征对齐已达到饱和,能够提供最稳定可靠的操作指令,继续增加深度徒增计算成本而无明显收益。

最后是关于动作块预测步长 $H$ 的选择。动作块(Action Chunking)是缓解时间相关性和平滑运动轨迹的关键技术。

动作预测步长对性能的影响

如图表所示,较长的动作块能够为机器人提供更具前瞻性的局部轨迹指导。当改变 $H$ 的大小时,模型的表现呈现出先上升后平稳的趋势。合理设置步长结合高频的重规划,使得机器人在执行复杂装配和抓取时能保持极高的丝滑度。

总结与展望:让执行归执行,让规划归规划

华为与华中科大联合推出的 TurboVLA,不仅是一个性能卓越的机器人控制模型,更是对当前具身智能界“唯规模论”和“唯 LLM 论”的一次有力反思。

长久以来,研究界倾向于用一个无所不能的大模型去包揽所有层级的工作。然而,机器人的行为控制本质上存在着明显的分层逻辑:高层的任务规划需要广泛的常识、复杂的因果推理和纠错能力;而底层的动作执行则更强调视觉反馈的实时性、空间几何的精确对应以及极低延迟的连续输出。

TurboVLA 的实验结果清晰地表明:对于底层的执行级控制,通用大语言模型作为感知与动作之间的中心接口并非不可或缺。通过剥离冗余的语言生成与推理结构,代之以轻量级的特征编码与直接的跨模态注意力交互,不仅能够大幅削减模型体积、降低延迟和显存消耗,还能完全保留甚至增强任务导向下的操作能力。

当然,正如作者在文中所坦诚的,TurboVLA 的设计初衷是为了执行明确的具体指令,它缺乏大语言模型那种面对“我把水洒了,该怎么办”这类模糊高级意图进行自主拆解的规划能力。但这种局限性恰恰指明了未来具身智能系统最具潜力的发展方向——分层解耦架构

在未来的机器人系统中,我们完全可以想象一种高效的分工协作模式:在云端或拥有充足算力的主控中心,运行着拥有千亿参数的大语言模型/多模态模型,负责长视角的任务分解与异常处理,并以较低的频率向下发送具体的文本指令;而在边缘端侧,在内存不到 1 GB 的低功耗芯片上,TurboVLA 这类执行模型以 30 Hz 甚至更高的极高频率,将指令精准转化为连续的电机控制信号。

这种让“智能归智能,控制归控制”的务实思路,或许才是具身模型从实验室走向千行百业真正可行的通途。