GlanceWAM:把未来视觉想象移出控制主路,48ms解码破解机器人两难

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

GlanceWAM:把未来视觉想象移出控制主路,48ms解码破解机器人两难 论文图示

将视频生成模型作为世界模型(World Model)引入机器人学习,一直是具身智能领域最引人注目的路线之一。大视频模型在海量真实世界数据上预训练所积累的物体动力学、接触物理和 3D 场景演化先验,天然能够充当机械臂规划的“物理引擎”。然而,将这一愿景落地的世界-动作模型(World-Action Models, WAMs)长期被困在一个残酷的两难境地:如果在每一个高频控制周期内都同步生成未来视频,扩散去噪的多步迭代会带来高达 1 到 4 秒的致命推理延迟,根本无法满足实时控制;而如果为了降低延迟彻底抛弃测试期的视觉生成、只把视频预测当作离线预训练的表征辅助,机械臂在面对长程复杂任务时又会因为缺少具象的“视觉终点”而频频失败。

ArXiv URL:https://arxiv.org/abs/2608.23927v1

由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉前瞻本身的内在缺陷,而是因为传统方案机械地把庞大的视频生成绑死在毫秒级的高频控制主循环上。GlanceWAM 提出了一种稀疏、异步的测试期视觉想象机制:模型在一个共享的视频 DiT(Diffusion Transformer)主干内,用后台运行的慢时钟偶尔向前“瞄一眼”(Glance),生成数秒后未来某一关键时间节点的单一潜空间前瞻帧;而高频动作头则在快时钟下,以 48 ms 的极短周期完全在潜空间内无阻塞解码动作块。

这一设计在 NVIDIA A100 GPU 上跑出了比同步基线快 24 倍的 48 ms 动作解码速度,并在 24 项任务构成的 RoboCasa 厨房挑战基准上取得了 72.2% 的成功率,显著超越了此前同步生成强基线 Cosmos Policy(67.1%)以及无推理期想象的联合训练模型(64.4%)。这项研究清晰地证明:机器人操作并不需要一帧不落、细致入微的短程连续动画,只要在后台提供恰到好处的远期空间路标,稀疏的异步视觉想象完全能够同时兑现极速与高成功率。

同步想象与稀疏异步前瞻对比

同步生成的死胡同与被误解的“测试期想象”

要理解 GlanceWAM 的突破,首先需要审视此前世界-动作模型的设计死结。

在早期的“先预测再执行”(Predict-then-act)范式中,模型需要先自回归或分步生成整段未来的稠密视频轨迹,再借助逆动力学模型推演动作,其推理延迟在控制回路中几乎是灾难性的。随后,以 Cosmos Policy、LingBot-VA 等为代表的现代 WAM 尝试将视频去噪与动作生成紧密缝合,在同一个序列内联合扩散或交替预测动作块(例如 $0.8$ 到 $1.6$ 秒内的动作轨迹)以及紧随其后的观测帧。然而,这种紧耦合带来了两个无法回避的问题:

第一,控制回路的延迟爆炸。每一次机械臂准备输出动作时,整个系统必须停下来等待扩散模型完成多步去噪采样。一次多步采样往往耗时 $1.1$ 至 $3.8$ 秒,而机械臂底层的执行要求通常在数十毫秒级别。在如此漫长的等待期间,机械臂只能停滞或开环硬抗,无法对环境突发状况做出闭环反应。

第二,预测时间尺度的退化(Horizon Degeneration)。由于视频预测必须配合动作块的时间跨度,模型被强行限定在 $0.8$ 秒以内的极短时间窗内做前瞻。在零点几秒的微小尺度下,物理世界大部分场景几乎是静态的,物体可能刚刚微颤或尚未发生实质接触。这导致强大的视频生成模型退化成了近乎平庸的“临近帧重建”,根本学不到宏观的长程物理因果关系。

为了摆脱延迟噩梦,近期的 Fast-WAM 和 AHA-WAM 等工作走向了另一个极端:主张在推理期彻底“抹除”视觉想象,只把视频预测作为一种离线特征正规化手段,测试时仅靠因果掩码后的历史观测特征来吐出动作。这种做法确实把单步延迟压缩到了极致,但代价值得警惕——策略失去了明确的未来视觉目标。在面对诸如“拉开微波炉门、精准伸手抓取内部碗碟”这类长程复杂操作时,策略如果没有远期视觉终点(“门完全打开后的画面”)的指引,极易在轨迹中途迷失或陷入死循环。

GlanceWAM 的敏锐洞察正在于此:下游控制策略并不关心机械臂在未来几百毫秒内每一寸像素如何蠕动,它真正渴求的是空间上的目的地——“我几秒之后应该到达什么视觉状态”。只要把高价值的远期目标(Where to go)生成从毫秒级动作解码的主线程中拆分出去,世界模型的速度瓶颈便迎刃而解。

双时间尺度解耦:在单个 DiT 中统一世界与动作

GlanceWAM 的核心架构构建在一个参数量为 1.3B 的因果视频扩散模型(SkyReels-V2-DF)之上,配合因果 3D 视频 VAE,并搭载了一个基于流匹配(Flow Matching)的高频动作头。其设计精髓在于:同一个主干网络,通过精巧的注意力机制与时间尺度解耦,同时承载了高算力的世界前瞻与轻量级的动作输出

系统在逻辑上被划分为快慢交织的“双时钟”结构。慢时钟对应前瞻视野(Foresight Horizon $H_f \approx 3.0$ 秒),负责在后台提出宏观视觉假设;快时钟对应控制视野(Control Horizon $H_a = 0.8$ 秒),负责在前端以 48 ms 的极速不断解码动作块。

在传统的单进程循环中,每当模型执行动作前,往往需要先等图像反解码回像素空间,再输入给策略网络。GlanceWAM 彻底打破了这一桎梏,其训练与推理的设计极其考究,主要由以下几项关键机制咬合而成:

三角色训练窗口与两遍因果编码

为了让一个共享网络同时学会“想象未来”和“利用想象执行动作”,GlanceWAM 在训练阶段构造了包含三个角色的特殊时间窗口:

  1. 历史观测 $\mathbf{o}_{\leq t}$:加噪等级 $\tau=0$ 的干净视觉上下文,提供当前环境基准;

  2. 加噪未来目标 $\mathbf{x}_{t+H_f}$:在完整前瞻跨度 $H_f$ 处的未来帧,施加随机噪声 $\tau \sim \mathcal{U}(0,1)$,用来监督视频扩散主干的动力学预测能力;

  3. 干净前瞻条件 $\mathbf{x}_{t+u}$:在随机中间偏移量 $u \sim \mathcal{U}(0, H_f]$ 处的未来帧($\tau=0$),以类似 Teacher-Forcing 的方式作为动作头的视觉指引。

这里隐藏着一个极易被忽视的技术陷阱:标准 3D 因果视频 VAE 在时空压缩时,其时域卷积会跨帧聚合信息。如果将上述三类帧拼接在一起一次性送入 VAE,极远处的 $\mathbf{x}{t+H_f}$ 的信息必然会因卷积时域感受野泄漏到中间的前瞻潜变量 $\mathbf{z}{t+u}$ 中。为了实现严格的因果隔离,GlanceWAM 采用了两遍独立 VAE 编码策略:第一遍将 $[\mathbf{o}{\leq t}, \mathbf{x}{t+H_f}]$ 编码为生成流的监督信号;第二遍独立将 $[\mathbf{o}{\leq t}, \mathbf{x}{t+u}]$ 编码为策略流的潜变量。由此切断了潜空间表示在特征提取阶段的未来信息倒流。

扩散强迫掩码与注意力设计

非干扰前缀掩码(Prefix-LM Mask)

潜变量进入 DiT 内部后,若采用全局全自注意力,生成查询向量(Query)又会直接偷看无噪的前瞻帧潜变量,使原本艰难的物理扩散预测退化为廉价的“跨时间复制粘贴”。

为彻底封死这一捷径,GlanceWAM 借助 FlexAttention 构筑了一个非干扰的三类前缀注意力掩码 $\mathbf{M}$:

由于没有其他任何非前瞻 Token 会去注意前瞻帧,观测和未来目标的骨干特征表示在数学上与纯粹的视频联合训练保持完全一致。这意味着动作策略的性能跃升,完全来自于前瞻条件通道提供的物理目标指引,而非任何信息泄露带来的捷径。

多层潜空间特征抽取

在将视觉信号交给动作头时,传统方案要么直接使用 RGB 像素输入,要么只取网络最后一层的输出。GlanceWAM 选择了更具信息密度的方案:动作头的交叉注意力直接从 DiT 主干第 5、12、19、26 层均匀抽取多尺度特征,并将观测特征与前瞻特征拼接为 $[\mathbf{h}{\text{obs}}; \mathbf{h}{\text{la}}]$。浅层保留的精细局部空间几何,与深层蕴含的宏观语义终点在此完成交融,消融实验证明这一改动带来了极其稳定的性能增益。

驯服前瞻延迟:抗过期训练与全潜空间流转

异步生成的设想虽然美好,但在实际机器人控制中会遭遇一个无法逃避的物理事实:前瞻是会变老的(Lookahead Aging)

设想一下:后台进程在 $t_0$ 时刻花费了一定时间生成了 $3$ 秒后的前瞻帧 $\hat{\mathbf{z}}_{\text{la}}$。此时前线机械臂开始执行第一段 $0.8$ 秒的动作块;到了第二段动作块执行时,距离前瞻目标的真实时间差已经缩水到了大约 $2.2$ 秒;到了第四段动作块时,距离目标只剩不到 $0.6$ 秒。换句话说,同一个前瞻目标被驻留复用期间,其相对机器人的时间偏差 $\Delta$ 处于不断衰减的动态过期状态(Staleness)。

如果模型在训练时只见过“永远位于正前方 3 秒处”的固定前瞻,面对这种衰减必然会产生严重的控制漂移。为此,GlanceWAM 在训练阶段引入了抗过期的时间跨度随机化机制。在构建前瞻条件时,并不固定取 $t+H_f$,而是以均匀分布 $u \sim \mathcal{U}(0, H_f]$ 动态抽取中间帧作为输入,并通过正弦位置编码将当前准确的时差 $\Delta = u$ 直接注入动作头。这样一来,策略从训练的第一天起,就学会了在各种不同的剩余时差下平滑、一致地执行追踪动作。为了保证即便前瞻退化或缺失时系统依然具备底线控制能力,前瞻 Token 在训练时还加入了 10% 概率的丢弃(Dropout)。

到了实际推理阶段,这一整套架构的威力全面释放:

RoboCasa 厨房操作任务场景与前瞻生成效果

实验检验:速度与成功率兼得的真实水准

为了验证 GlanceWAM 是否真正终结了世界-动作模型的速度-成功率权衡,研究团队在最具挑战性的具身操作基准之一——RoboCasa 厨房仿真环境(包含 24 类长程交互任务,涵盖各种门柜开合、按钮、微波炉交互与炊具摆放)以及标准的 LIBERO 基准上展开了高强度评测。

在评测协议上,团队严格对齐了 Cosmos Policy 的严苛设定:在 5 个完全未见过的全新厨房场景与未知物体实例上评估 50 个回合(总计 $n=1200$ 次评估)。值得注意的是,GlanceWAM 仅使用了经过回放过滤的每项任务 50 条专家演示数据(总计 1200 条轨迹),属于极低数据量设定,而对比的标准基线往往采用了多达 300 条演示的配置。

突破厨房长程操作上限

在 RoboCasa 的 24 项任务全集上,GlanceWAM 取得了 72.2% 的全场平均成功率。这一结果具有极高的说服力:

  1. 它以明显的优势超越了同样使用 50 条演示数据的同步世界模型巅峰之作 Cosmos Policy(67.1%),相对绝对值提升达 $+5.1\%$;

  2. 它甚至大幅超越了许多喂了 6 倍数据量(300 条演示)的传统基线模型;

  3. 在 LIBERO 的 4 个任务套件测试中,GlanceWAM 拿到了 99.0% 的平均成功率,在基准接近饱和的区间内依然实现了近乎完美的动作落地。

更为关键的是收敛效率。得益于明确的前瞻引导通道,GlanceWAM 在仅需 1 万步训练时就已经逼近峰值性能(独立复现分别达到 71.4% 和 71.2%);相比之下,那些不带测试期前瞻引导、仅靠视频共训练充当隐式特征正则化的对比模型,在苦苦训练 6 万步后,成功率依然死死被锁死在 64% 左右的平台期。

剖析收益之源:前瞻不是噱头,而是因果关键

针对“到底是不是前瞻在起作用”的技术追问,论文进行了严谨的消融实验隔离分析:

在相同的网络骨干、训练数据和计算配额下,如果完全剥离前瞻条件通道(退化为纯粹的短程视频-动作联合训练),模型成功率瞬间跌落至 $64.4\%$;一旦接入单层前瞻条件注入,成功率直接从 $64.4\%$ 拔升至 $71.5\%$(单项净增 $+7.1\%$);在此基础上,如果进一步启用多层特征抽取融合机制,性能进一步攀升至 $72.2\%$。这一层层递进的数字明确反驳了“测试期无需视觉想象”的悲观论调,有力证明了高质量的未来几何与语义终点,对策略的稳定执行具有不可替代的因果指导价值。

而在推理效率端,GlanceWAM 展现出了惊人的压倒性优势。在 NVIDIA A100 GPU 上,整个潜空间动作解码头每次仅耗时 48 ms 即可吐出一段控制动作,比动辄需要等待 1.1 秒以上的传统同步扩散动作模型快了整整 24 倍,毫无压力地嵌进了真实机械臂闭环交互的时间预算内。

世界模型在具身智能中的角色重构

GlanceWAM 的价值,不仅在于刷出了一组亮眼的基准数字,更在于它为世界模型在机器人领域的定位做了一次极其清晰的“拨乱反正”。

长久以来,许多学者对具身世界模型抱有一种机械化的执念:似乎必须让世界模型充当全知全能的超级摄像机,把未来物理环境的每一毫秒变迁、每一根电线的抖动都高清无误地渲染成 RGB 像素视频,才算发挥了世界模型的作用。但工程现实是无情的——将有限的在线算力耗费在高频密集的像素渲染上,不仅在物理上拖垮了机器人的反应神经,更在信息层面上浪费了宝贵的表征带宽。

GlanceWAM 用极其轻盈的架构给出了新的解题范式:战略上慢思考,战术上快反应

这种将“未来物理预测”与“高频控制执行”从时钟周期上完全解耦、在潜空间中完全融合的思路,不仅有效弥合了通用视频大模型与机器人末端低延迟控制之间的鸿沟,更向所有致力于具身智能与机器人学习的研究者展示了一条极具启发性的实用路径。