AtlasVLA:仅凭单腕相机,如何在长程操作中超越多视角基线?

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

在具身智能(Embodied AI)的研究中,视觉-语言-动作(Vision-Language-Action, VLA)模型正逐渐成为通向通用机器人操作的核心范式。从基于自回归离散编码生成的 OpenVLA,到基于连续轨迹去噪扩散的 $\pi_{0}$ 与 CogACT,主流架构都在努力建立“看到什么,就执行什么”的端到端控制回路。然而,这种亮眼表现的背后,往往隐藏着一个严苛的先决条件:机器人通常需要依赖外部固定的第三人称全局视角,或者依赖多视角摄像头组成的环绕观察系统。

ArXiv URL:https://arxiv.org/abs/2608.06729v1

一旦将机器人的感知输入严格限制在“单只机械臂手腕上的移动相机(Wrist-mounted Camera)”,现有的绝大部分 VLA 模型都会迅速失灵。手腕相机的视野极其狭窄且随末端执行器剧烈运动,目标物体一旦离开画面就会彻底在感知中“消失”;更致命的是,面对需要分步实施的长程复杂任务,模型缺乏内在的步序追踪机制,极易陷入动作停滞或无休止的子目标死循环。

来自北京航空航天大学、北京深势科技(Freedo)与中国科学院大学等机构的研究团队提出了全新的 VLA 架构 AtlasVLA。该方案不再将机械臂的操作视为无状态的即时反应(Reactive Reflex),而是构建了一个包含“4D持久世界状态记忆”与“自我工作状态记忆”的双记忆系统,使机械臂在仅靠单只手腕相机的严苛条件下,不仅在仿真与真机评测中全面刷新纪录,更在长程任务成功率上大幅超越了依赖多视角相机的基线模型。

图1:反应式VLA的双重瓶颈与AtlasVLA的双记忆机制

反应式范式的困局:视野受限与时序迷失

当前主流 VLA 模型本质上依然是“反应式系统(Reactive Paradigm)”。模型在时刻 $t$ 接收一帧图像输入与任务指令,随后直接前向预测下一步的动作输出。这种设计预设了一个理想化前提:瞬时摄取的感官输入足以代表当前执行环境的完整状态。但物理世界的真实交互完全不是这样。

首先是空间维度的感知遗忘(Perception Forgetting)。对于手腕相机而言,视野(Field of View, FoV)时刻跟随夹爪动态切换。当机械臂俯身抓取零件 A 时,原本置于操作台侧面的容器 B 或障碍物 C 就会瞬间滑出视野范围。反应式系统不具备对未见区域的持久表征能力,一旦关键物体离开画面,模型就不知道目标物体究竟位于何处,空间定位随即崩溃。以往的解决方案往往是强行在机器人工作台四周架设固定的全局全景相机,但这极大削弱了机器人在开放、非结构化场景中的部署可行性。

其次是时间维度的任务进度遗忘(Task-Progress Forgetting)。在需要多个阶段依次推进的长程(Long-horizon)任务中,机器人不仅要了解环境的几何布局,还必须清晰知道“自己已经完成了什么”以及“下一步该做什么”。如果任务是“先打开抽屉,再拿出里面的红色积木,最后关上抽屉”,一个缺乏时序工作记忆的系统,在拿起积木后重新看到半开的抽屉时,很容易产生认知漂移,重复去拉抽屉把手,甚至完全漏掉收尾步骤。

人类在执行类似操作时,并不需要头顶悬挂一台全知全能的上帝视角相机,大脑会自发建立并维护一个连续演化的认知地图(Cognitive Map)。为了打破无记忆反应系统的天花板,机器人必须建立一套连续循环机制:局部瞬态观测 $\rightarrow$ 隐状态更新 $\rightarrow$ 持久世界状态维持 $\rightarrow$ 引导未来动作规划。这正是 AtlasVLA 核心架构的设计哲学。

图2:AtlasVLA模型整体架构图

双记忆协同:4D持久世界状态与自我工作记忆

为了在单视角输入下同时补全丢失的空间几何与时序进度,AtlasVLA 构筑了包含物理空间与认知状态的双记忆流架构(Dual-Memory Architecture)。整个处理流线分为世界状态重构、工作意图追踪与动作去噪引导三个层次。

1. 4D 持久世界状态记忆(Persistent World State Memory)

手腕相机捕捉的 2D 像素本质上是 3D 物理空间在瞬时视角下的投影,要解决视觉盲区,首先必须将瞬态图像恢复为具有连续几何意义的三维表征。

AtlasVLA 并不依赖预设的高精度 CAD 先验,而是通过冻结的视觉编码器抽取当前腕部图像 $I^{w}{t}$ 的语义特征 Token $X^{w}{t}$,同时引入流式深度估计模型(Depth Anything v3)输出具有时序一致性的对齐深度图 $D^{w}{t}$。借助机械臂本体系的本体感知状态 $S{t}$ 与手眼标定矩阵 $\mathbf{T}^{h2e}$,系统实时计算出手腕相机的瞬时外参矩阵:

\[\mathbf{T}^{ex}_{t}=\psi(S_{t})\cdot\mathbf{T}^{h2e}\]

利用相机内参 $\mathbf{T}^{in}$ 和外参 $\mathbf{T}^{ex}{t}$,空间反投影(Spatial Back-Projection)模块把带有丰富视觉语义的 2D Token 投影到机器人的基座三维坐标系空间中,得到带有空间坐标 $P_t$ 的三维点特征 $m_t$。为了赋予模型对物理动态与观测时效的敏感度,系统进一步注入了可学习的 3D 空间位置编码 $\mathcal{E}{spatial}(P_t)$ 与时序编码 $\mathcal{E}_{temporal}(t)$,最终形成 4D 时空特征:

\[\widehat{m}_{t}=m_{t}+\mathcal{E}_{spatial}(P_{t})+\mathcal{E}_{temporal}(t)\]

这些离散的瞬时观测点随后被写入一个基于体素哈希(Voxel-Hashing)构建的全局持久世界地图 $\mathcal{M}_t$。当机械臂扫视工作区时,新旧观测区域会产生重叠。为了避免传感器噪声引发地图畸变,系统设计了加权移动融合更新策略:

\[\mathcal{M}_{t}(v)=\frac{\mathcal{W}_{t-1}(v)\mathcal{M}_{t-1}(v)+w_{t}m_{t}(v)}{\mathcal{W}_{t-1}(v)+w_{t}}\]

其中 $w_t(v)$ 综合了当前投影的置信度权重,$\mathcal{W}_t(v)$ 则是历史累积权重的衰减更新。配合滑动窗口剔除过时噪点,并永久锚定操作初始第一帧的全局感知,AtlasVLA 在隐空间里建立起了一张随着机械臂运动不断被“涂亮”且时刻保真的三维全局工作台。即使机械臂完全移开、物体滑出当前画幅,它在 4D 记忆中的几何与语义槽位依然稳定存在。

2. 自我工作状态记忆(Ego-Working State Memory)

光有三维物理世界的地图还不够,机器人还必须明确自己在时间维度上的“坐标”。为了防止长任务中的意图漂移(Intention Drift),AtlasVLA 引入了意图感知查询机制(Intent-Aware Query)。

研究团队预设了一组可学习的查询向量 $Q^{ego}\in\mathbb{R}^{N\times d}$。在每一个控制决策步骤,这组 Query 都会通过交叉注意力机制与视觉语言主干网络(VLM)中融合了任务文本指令 $L$ 的全部上下文进行交互:

\[Z^{ego}=\text{Softmax}\left(\frac{Q^{ego}K^{T}}{\sqrt{d}}\right)V\]

输出的 $Z^{ego}$ 隐式聚合了“当前执行进展到了哪一步”的高层语义信息。如果把每一帧的意图向量都无条件堆积,记忆库将面临严重的冗余爆炸与计算瓶颈。AtlasVLA 设计了专门的记忆固结机制(Consolidation),自动识别在时间上相邻且语义表征高度相似的意图 Token,将其压缩合并后写入自我工作记忆库 $\mathcal{M}^{ego}_t$。这为后续动作生成提供了紧凑、纯净且抗干扰的历史决策上下文。

动作生成:双路径引导的扩散网络

有了全局三维环境特征与时序工作状态记忆,如何将其真正落地为高精度的低层机械臂动作指令?AtlasVLA 在动作输出端采用了基于连续扩散变换器(Diffusion Transformer, DiT)的动作专家(Action Expert)。

不同于常规方法直接将视觉全局 Token 拼入扩散输入,AtlasVLA 采取了两阶段检索引导策略:

首先,当前时刻的意图 Token 从自我工作记忆库中检索历史时序线索,生成自我状态上下文向量 $C^{ego}_t$;

其次,带着这个自我状态去世界记忆库中进行意图引导注意力(Intent-guided Cross-Attention)检索,抽取出当前阶段任务最关心的空间局部区域,生成全局三维世界上下文向量 $C^{world}_t$:

\[C^{world}_{t}=\text{AddNorm}\left(\text{FFN}\left(\text{IntentAttn}(C^{ego}_{t},\mathcal{M}_{t},\mathcal{M}_{t})\right)\right)\]

最后,这两个上下文向量按顺序作为条件输入注入到 300M 参数量的 DiT 模块中。在 10 步 DDIM 去噪迭代下,网络能够精准输出末端执行器未来一段窗口内的 7 自由度轨迹序列 $A_t = [a_t, a_{t+1}, \dots, a_{t+k-1}]$。这种解耦式引导机制确保了动作网络在面对复杂障碍与精细对齐要求时,既能明确长程目标的大方向,又能依托精确的三维空间几何给出稳健的位姿调整。

图3:AtlasVLA在真实世界各种复杂操作场景中的实机评测

基准实测:单视角逆袭多视角的性能飞跃

为了全面检验 AtlasVLA 的泛化能力与时空鲁棒性,研究团队在标准操作基准 LIBERO、几何高度复杂的 RLBench,以及真实物理机械臂场景中进行了全面测试。

在广泛采用的 LIBERO 模拟套件中,评估涵盖了 Spatial、Object、Goal、Long 以及综合性的 LIBERO-90。在极具考验的 LIBERO-Long 长程测试集上,所有基线模型在只保留手腕相机时都遭遇了严重的性能衰减。即使是具备时序记忆设计的 MemoryVLA,在移除第三人称全景相机后,成功率也大幅跌落 5.8 个百分点。

AtlasVLA 在完全不依赖任何外部相机、仅用单只手腕相机的情况下,在 LIBERO-Long 上取得了 94.6% 的惊人成功率,比同等条件下的先进基准足足高出 7.0%;与没有显式持久状态建模的强基线(如 $\pi_0$ 系列)相比,绝对提升达到了 9.4%。在涵盖 90 个复杂任务的 LIBERO-90 终极考验中,AtlasVLA 的平均成功率稳定在 97.6%

在环境物体更密集、几何结构极其多样的 RLBench 基准上,AtlasVLA 的优势进一步扩大。在严格抹除正面、左侧和右侧全部三路外部相机、仅向网络灌入单路 $128\times 128$ 分辨率手腕画面的极端严苛设定下,AtlasVLA 依然取得了 70.8% 的平均操作成功率。这证明基于流式深度提升的三维体素哈希地图,确实在隐空间中完美复原了机器人周遭的空间几何信息,彻底抹平了物理视角的先天不足。

真机部署与消融:为什么双记忆不可或缺?

为了验证模拟结果在物理世界中的迁移可靠性,研究团队在一台 Franka 机械臂上展开了密集的真机评测。评测包含 6 项通用操作任务与 4 项复杂长程操作任务(涉及多步骤重排、抽屉交互与长距离搬运等),共计进行了数百次真实物理抓取实验。所有真机实验同样坚持完全不架设外部相机,仅依赖末端执行器腕部镜头

真机测试的结果揭示出具身智能从“玩具演示”走向“生产可用”的关键跃迁。在真实的复杂长程操作中,AtlasVLA 的平均成功率达到了惊人的领先幅度,相比于目前具身领域的顶尖开源大模型 $\pi_0$,AtlasVLA 在长程任务中的成功率实现了 +17.5% 的绝对提升。以往多视角 VLA 模型在真机上极度容易受光照阴影、背景视差变化干扰,或者在末端遮挡视野后不知所措,而 AtlasVLA 凭借持续更新的三维世界表征,即便在末端严重自遮挡的瞬间,依然能够自信地完成下探、旋转与平滑抓取。

随后的组件消融实验进一步厘清了系统内各项机制的真实贡献:

具身智能操作范式的新启示

AtlasVLA 的成功不仅仅是一个打榜成绩的突破,更对具身智能系统的系统架构设计带来了深刻的范式启示。

长期以来,业内在提升 VLA 模型长程操作能力时,存在着一种路径依赖:要么粗暴地拉长 Transformer 的时序上下文窗口(Context Window),寄希望于注意力机制自行在大量历史连续图像中梳理出逻辑;要么退回到工业流水线模式,在工作空间周围堆砌多角度固态相机以规避局部可见性问题。然而,这两种做法在真实复杂物理场景中都面临计算开销失控或部署成本过高的死胡同。

AtlasVLA 证明了一条更为优雅且具有生物可解释性的技术路线:不要把未经组织的瞬态高维图像直接当成记忆,而应将瞬时观察主动投射、提炼为紧凑的结构化物理几何(4D 持久世界状态)与精炼的认知进度表征(自我工作记忆)。通过赋予智能体主动构建内在世界模型并追踪自身意图的能力,机器人即便只有一只“视力受限”的腕部眼睛,也能在动态变化的物理世界中做到心中有数、行止自如。这种以轻量化传感输入换取极致部署弹性的技术路径,无疑为工业柔性制造、家用服务机器人等低成本自主操作场景指明了极具潜力的落地演进方向。