Enfold:将世界模型的未来想象折叠进当前表征,控制延迟缩减10倍
Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control
在具身智能与机器人控制领域,让机器人在行动前具备“预见未来”的能力,一直是通向高级自主系统的核心愿景。近年来,视频生成式世界模型(World Generative Models)凭借其展现出的物理世界建模潜力,成为了具身策略研究的焦点。然而,这类模型在现实部署中始终面临着一个不可调和的矛盾:机器人高频闭环控制需要极低的推理延迟,而扩散或流匹配(Flow Matching)架构生成一段逼真的高动态视频,往往需要数秒乃至更长时间。
ArXiv URL:https://arxiv.org/abs/2607.26657
为了解决这一延迟瓶颈,学术界此前主要探索了两条路线:要么采用“先想象后行动”(Imagine-then-act)的范式,但这不可避免地带来巨大的计算开销;要么如近期出现的 Fast–WAM 等方案,在联合训练后于推理阶段跳过显式视频渲染。然而,这些尝试依然没有回答一个根本性的问题:世界模型赋予策略的真正价值,究竟是渲染出来的未来像素,还是其在构建未来过程中所涌现的时空动态组织能力?

名为 Enfold 的研究给出了极具穿透力的解答:世界模型最宝贵的资产不是它生成的具体视频,而是它“计算并构建未来”的过程。研究团队提出了一种全新的具身控制范式,将世界模型在去噪与生成过程中展现的多层级时空计算,完整“折叠”(Enfold)进一个仅依赖当前视觉和语言指令的预测性表征中。在部署阶段,策略完全无需运行沉重的视频生成器,仅靠轻量级编码器即可直接输出动作。
实验表明,Enfold 在 LIBERO 基准测试上取得了 $97.8\%$ 的成功率,在双臂操作基准 RoboTwin2.0 上达到 $91.77\%$;在保持高精度操作的同时,其动作推理延迟相比 Fast–WAM 降低至原来的 $\frac{1}{3.7}$,结合 TensorRT 优化的 Enfold-Flash 更是达到了惊人的 $49$ 毫秒,推理速度提升达 $10.1\times$。
为什么我们不需要“具象化的未来”?
机器人执行操作时,真正需要的是对“物理环境如何因交互而改变”的结构化预期,而不是每一帧的高清纹理细节。传统的视觉-语言-动作(VLA)模型虽然推理敏捷,但通常将环境动态隐式地埋在动作监督信号里,缺乏对长程时空演变的显式推理;而显式渲染未来的世界-动作模型(WAM),虽然具备丰富的物理演化先验,却被高昂的视频生成计算死死卡住了反应速度。
更深层的问题在于,直接预测未来的“像素”往往是对算力的误用。当扩散模型将包含噪声的潜在状态一步步重建成清晰的视频轨迹时,网络的不同深度和不同去噪时间步,实际上正在自组织出从低级纹理、几何布局到复杂交互逻辑的多层级物理理解。直接用最终的未来像素作为监督信号,会迫使编码器去捕捉大量与操作无关的表面纹理扰动;而单纯使用冻结视觉编码器(如 DINO)提取的未来特征,又仅仅是静态特征的端点对比,无法复现生成过程中的动态因果推演。


研究人员在深入剖析视频生成器内部表征时发现了一个关键现象:生成器中并不存在所谓的“黄金单层”。在不同的去噪时间步(Corruption Level)和网络深度下,表征的信息承载各不相同。浅层特征更偏向外观与几何轮廓,对局部扰动更敏感;随着网络加深,模型逐渐抑制外观噪声并凸显全局布局与交互关系,但在大噪声步长下又可能引入更多的生成随机性。
因此,要想将世界模型的想象力提炼为高效的控制表征,既不能简单粗暴地预测未来图像,也不能押注于单一的中间层,必须设计一种能够统筹多层级时空计算的转移机制。
双向耦合:把未来计算折叠进当下
为了在推理时彻底剥离视频生成器的负担,Enfold 构建了一个由预测编码器(Predictive Encoder)与条件视频生成器(World Generative Model)组成的非对称架构。系统在训练期间建立双向的信息通路,而在推理期间则彻底断开生成分支。

整个框架围绕两个互补的核心机制展开:生成到表征学习(G2R, Generation-to-Representation)与表征到生成学习(R2G, Representation-to-Generation)。
首先是 G2R 机制,它负责将世界模型生成未来的动态推演能力“灌注”给当前帧编码器。在训练阶段,输入包含真实未来视频切片的潜在特征 $y_0$,并在特定时间步 $t$ 上混入高斯噪声构造损坏状态 $y_t$。视频生成器 $G_\theta$ 在处理该损坏未来时,在多层隐藏结构中暴露出激活状态 $\mathcal{H}_\theta(y_t, t, c, e)$。研究团队通过拼接不同深度的多层状态,并经过层归一化后构造出监督目标 $r^G_t$:
\[r^G_t = \operatorname{LN}\left[A\left(\mathcal{H}_\theta\bigl(y_t,t,c,e,\bar{z}\bigr)\right)\right]\]与此同时,学生网络——预测编码器 $U_\phi$ 只能观察当前的多视角画面 $c$ 和语言指令 $e$,提取出当下的预测表征 $z = U_\phi(c, e)$。随后,一个以时间步 $t$ 为条件的小型预测头 $F_\omega$ 尝试从仅基于当下的 $z$ 中重构出生成器在处理该时间步下的多层特征 $\hat{r}^G_t$。在此过程中,目标特征 $r^G_t$ 严格截断梯度(Stop-gradient)。
这种设计的巧妙之处在于其非对称性:编码器在没有任何“未来帧”输入的前提下,必须从当前场景中提炼出能够预判未来多层演化趋势的决定性结构;而时间步条件预测头 $F_\omega$ 则负责吸收扩散轨迹中的特定噪声变异。这迫使表征 $z$ 自然沉淀为紧凑、确定性且包含时空转移规则的高阶表征。
其次是 R2G 机制,它充当了一项功能性验证:表征 $z$ 是否真正吸纳了超越当前静态画面的预测性信息?在这一通路上,将截断梯度的表征 $\bar{z} = \operatorname{sg}(z)$ 作为条件反向注入视频生成器。视频生成器采用流匹配(Flow Matching)目标进行优化,学习在给定当前场景、语言和表征 $\bar{z}$ 的条件下,预测未来轨迹的速度场:
\[\mathcal{L}_{\mathrm{R2G}}=\mathbb{E}_{c,e,y_{0},\epsilon,t}\left[\left\|v_{\theta}\bigl(y_{t},t,c,e,\bar{z}\bigr)-u_{t}(y_{0},\epsilon)\right\|_{2}^{2}\right]\]由于 $\bar{z}$ 同样截断了梯度,生成损失不会直接扰动编码器参数。这就建立了一个严格的检验标准:如果 $z$ 中包含有价值的未来动态线索,那么以其为条件的视频生成质量必然显著提升;反之,若表征退化,生成器将无法从中获益。
最后,在控制策略的构建上,下游动作头 $D_\psi$ 完全运行在截断梯度的预测表征 $\bar{z}$ 之上。动作头同样被建模为条件流匹配模型,用于将高斯噪声转换为紧凑的动作切片(Action Chunks)。因为动作梯度绝不反传给编码器 $U_\phi$,所以最终获得的表征完全是基于世界动态理解自组织形成的通用物理先验,而非被特定动作标签过拟合调优的产物。
在进入推理部署阶段时,庞大的视频生成器 $G_\theta$ 被完全置于后台甚至直接裁撤。控制器只需要单次运行编码器 $U_\phi$ 提取 $z$,动作头便能直接读出控制信号。
极致效率与高精度并存的控制性能
为了全面检验该框架的实际效能,评估覆盖了三大具身基准:涵盖 40 个长程语言交互任务的 LIBERO 仿真基准、包含 50 个复杂双臂协同任务的 RoboTwin2.0(包含常规环境与视觉随机化扰动评测),以及搭载在 AgileX 真实双臂机器人上的多阶段操作任务。
在基干配置上,Enfold 采用了 Cosmos-Predict 2.5(2B 参数的先进视频生成器)作为监督导师,编码器则选用 DINOv3 ViT-H+/16,动作头为紧凑的流匹配 MLP。
实验数据显示,在完全没有经过大规模具身动作预训练的情况下,Enfold 在 LIBERO 上的平均成功率达到了 $97.8\%$。作为对比,同等量级的代表性模型 $\pi_0$ 成功率为 $96.8\%$,$\pi_{0.5}$ 为 $98.0\%$,而依赖联合训练视频动作架构的 Fast–WAM 成功率为 $96.5\%$。在双臂控制基准 RoboTwin2.0 评测中,Enfold 在常规环境下取得 $91.77\%$ 的成功率,在加入物体随机摆放与外观扰动的随机测试下依然保持在 $87.81\%$。
更为震撼的是推理延迟的断崖式下降。在相同的 NVIDIA A100 GPU 环境下逐项测试单次动作切片的生成时延:
-
Fast–WAM 由于保留了复杂的协同分支,单次动作预测耗时约为 $500$ 毫秒;
-
标准版 Enfold 仅需运行纯前向的视觉编码器与流匹配动作头,单次动作生成延迟骤降至 $134$ 毫秒,相比 Fast–WAM 实现了 $3.7\times$ 的速度提升;
-
在不改变表征提取接口的前提下,研究团队进一步利用 TensorRT 进行了算子层级的推理优化,打造出 Enfold-Flash。其控制延迟进一步压缩至令人惊叹的 $49$ 毫秒,吞吐速率达到 Fast–WAM 的 $10.1\times$,且在各大测试集上的动作成功率几乎没有任何折损(LIBERO 为 $97.5\%$,RoboTwin2.0 常规评测反超至 $92.02\%$)。
在真实世界双臂机器人任务中,测试包含了分布式内演示与分布外(OOD)扰动两套评测方案。面对未在示教数据中出现过的桌面布局扰动和光照变化,Enfold-Flash 依然取得了 $85.0\%$ 的分布内完成度和 $73.3\%$ 的 OOD 鲁棒得分,超越了 Fast–WAM,展现出极其稳健的现实环境适应性。
并非固定轨迹回放:动态交互下的在线重规划
一个不可回避的质疑是:这种只看当前帧就提取预测表征的模型,会不会只是把过去历史“死记硬背”成了一段固定的动作轨迹,根本无法应对环境突发变化?
为了验证表征是否具备真实的场景感知与重规划能力,研究人员设计了动态人机干预实验。在执行“收纳盘子”(Store Plate)和“折叠毛巾”(Fold Towel)的真实任务流程中,当机械臂运行到特定时间点 $t_2$ 时,实验人员突然介入,强行挪动托盘位置或改变毛巾的几何折叠状态,但保持语言指令与之前的交互历史完全不变。

随后,系统从受到干预的现场重新编码提取表征 $z^+$。结果显示:
-
如果此时调用视频生成器,基于 $z^+$ 展开的后续视频画面立即放弃了原先的运动路径,重新对准了被位移的新托盘和产生形变的毛巾织物;
-
与此同时,底层的物理动作执行端没有出现丝毫犹豫或僵死在旧轨迹上,机械臂协调地偏离原定航线,重新逼近被移动的目标并重新建立接触,顺利完成整个操作流。
这有力地证明了 Enfold 的表征绝非对示教动作序列的生硬检索,而是建立在对当前状态深刻理解基础上的条件化重规划,展现出高度连贯的因果一致性。
机制剖析:多层表征蒸馏到底赢在哪里?
为什么通过生成器隐层状态监督训练出的表征,会明显优于其他形式的预测目标?针对 G2R 监督目标的消融实验给出了直观的答案。
在严格控制下游网络参数与动作头结构的条件下,研究团队对比了不同的监督目标设定:
-
纯动作监督(Action-only):不引入任何未来状态监督,表征在 LIBERO 上的平均成功率为 $94.9\%$;
-
未来像素预测(Future-pixel):强迫表征去重构未来的原始图像像素,成功率微升至 $96.0\%$;
-
单层生成器状态监督(Single-level):仅预测某一固定生成层特征,成功率为 $96.3\%$;
-
多层联合生成器状态监督(Multi-level,即完整版 Enfold):将多深度特征联合构建监督目标,成功率大幅跃升至 $97.8\%$。
数据表明,多层级监督带来的增益主要爆发在任务复杂度高、长程因果推理要求严苛的 LIBERO-Goal(目标驱动)与 LIBERO-10(长序列)子任务中,两个子集分别取得了 $2.8$ 个百分点的明显提升。这证实了不同深度的生成特征具有强烈的互补性——浅层的局部几何线索与深层的交互逻辑结合,才能完整描述长周期的动态转换。
与此同时,R2G 机制的消融同样验证了表征的普适价值。当使用经过训练的表征 $z$ 反向指导视频生成器进行未来推演时,生成的视频质量在 PSNR(从 $25.92$ 提升至 $27.27$)、SSIM(从 $0.885$ 提升至 $0.902$)以及感知损失 LPIPS(从 $0.0550$ 降低至 $0.0483$)上全面压制了无表征注入的原生 Cosmos 基线。这表明表征 $z$ 并没有在下游任务中沦为狭隘的动作专用特征,而是真正沉淀为了通用的时空动力学载体。
隐空间过滤器:去噪与长程动态捕捉
表征探针分析进一步揭示了预测编码器在信息提炼上的独特能力。原生的世界模型生成特征虽然信息丰富,但也伴随着巨大的弊端:由于去噪扩散过程中注入了随机高斯噪声,其隐藏特征对光照、随机扰动极为敏感。

研究人员在受控光照扰动的数据集上测试了特征对无关噪声(Nuisance Variation)的敏感度比率。原始 Cosmos 生成器各层的扰动敏感比率在 $0.157$ 到 $0.208$ 之间,而 Enfold 学习到的预测表征将其大幅削减到了 $0.020$,实现了近 $8$ 到 $10$ 倍的抗噪稳定性提升。
值得注意的是,这种极高的抗噪稳定性并不是由于表征退化崩溃(Feature Collapse)造成的。特征有效秩(Effective Rank)分析显示,原生 Cosmos 各隐藏层的有效秩最高不超过 $10.7$,而 Enfold 预测编码器的特征有效秩高达 $31.8$,同时保留了极高的任务检索精确率(mAP 达到 $0.486$)。
这说明预测编码器在学习过程中扮演了条件过滤器的角色:那些无法从当前场景中合理推断出的生成随机噪声被强力剔除,而与场景转换内在相关的确定性物理规律则被整合重组,形成了更具表达多样性、更稳定的预测基质。通过针对不同时间跨度变化块的线性探针测试也表明,相比静态的 DINO 特征,Enfold 表征在预测远期显著发生物理交互与形变的图像区域时,展现出压倒性的预测优势。
迈向轻快且深刻的具身基座
长期以来,具身智能界在“轻量端到端控制”与“大参数重型世界模型”之间承受着路线分野带来的阵痛。前者虽然反应极快,但缺少常识物理规律的护航,遇到复杂长程任务容易迷航;后者虽然具备宏大的物理想象力,但沉重的自回归或扩散采样计算让真机落地举步维艰。
Enfold 用严密的方法学证明了一条全新的融合路径:世界模型完全不必驻留在机器人决策的每一毫秒控制回路里。只要在训练中把生成模型解析时空的深邃计算巧妙折叠进轻量级表征网络,我们就能在推理阶段以不可思议的超低延迟,享受到大世界模型带来的时空先验红利。
对于具身智能系统的大规模工程化而言,这一思路具有深远的启发意义。未来的端侧机器人或许不再需要搭载昂贵的移动算力去强行渲染肉眼可见的未来,只要在“当下”这一瞬准确把握世界流动的脉搏,极速而敏捷的物理交互便能从容发生。