ABot-World-0:单张5090跑通720P实时世界模型,帧率达16 FPS
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

在生成式 AI 从“生成一段好看的视频片段”向“构建一个可进入、可交互、可无限推演的世界”迈进的过程中,学术界与工业界面临着一道极其苛刻的工程与算法鸿沟。真正的交互式世界模型(Interactive World Model)不仅要保证单帧的视觉逼真度,更必须维持动作与状态转移的精确对应、跨越长时程推演而不崩塌的物理与记忆一致性,以及能够支撑毫秒级操作反馈的端到端吞吐率。此前,像 Genie、GameNGen 或 Cosmos 等代表性系统,要么依赖极高的计算集群进行离线生成,要么在长时间连续自回归推演时迅速陷入画面停滞、身份漂移或模糊退化的泥潭。
ArXiv URL:https://arxiv.org/abs/2607.19191v1
来自阿里高德(AMAP, Alibaba Group)的研究团队推出了全新的交互式视频世界模型——ABot-World-0。该工作最引人注目的突破在于:在单张消费级桌面显卡 NVIDIA RTX 5090 上,实现了 720P 分辨率、最高 16 FPS 的无限长时程交互式流式推演,首帧响应延迟仅 1.2 秒,显存峰值控制在 19 GiB 左右。

这一成果不仅是一个工程调优的展示,更是对“高质量数据闭环、双向到因果蒸馏、抗长程漂移自监督、全栈流式推理”全流程进行系统性协同设计的结果。为了让大模型从业者与具身智能研究者全面理解这项工作,本文将深入拆解其背后的核心瓶颈与破局策略。
交互世界模型的四大系统级死结
构建一个通用的交互式世界模拟器,本质上是一个耦合了四个系统级难题的复杂任务:
互联网公开视频虽然视觉多样,但极少包含精准对齐的操作轨迹;游戏录屏虽然有真实的控制输入,但美术风格单一且场景有限;仿真引擎能够提供绝对真实的几何与相机位姿,但缺乏真实世界的视觉纹理与光照泛化能力。三者之间如何有机融合,而非简单粗暴地堆叠混合,是首要的数据门槛。
用户输入往往涉及宏观视角漫游与微观角色动作控制两种模式。市面上许多方案尝试用连续的 6-DoF 相机外参矩阵或复杂的隐空间动作(Latent Action)来驱动生成,这不仅让普通用户交互变得极其繁琐,且连续位姿在长期积分后极易漂出训练分布,导致画面撕裂。
自回归(Autoregressive)视频生成是实现在线流式交互的必经之路。然而,因果模型生成的每一帧,都会作为下一帧推演的输入历史。只要模型在某一步产生了微小的形变或伪影,这些误差就会在数十步自回归推演后被无限放大,最终导致严重的“自回归漂移”(Autoregressive Drift)——画面要么逐渐融化成色块,要么彻底定格成静态背景,人物角色也极易丢失身份特征。
交互场景对动作到画面的端到端延迟极其敏感。传统 Diffusion 模型的数十步去噪流程,搭配重型自注意力机制与高分辨率 VAE 解码,即便在多卡数据中心集群上也难以维持流畅输出,更不用说在单张桌面级显卡上实时流式输出了。
ABot-World-0 的设计正是围绕破解上述四个死结全面展开。
闭环数据基建:WorldExplorer 与统一动作空间
为了解决高质量交互数据的匮乏问题,研究团队摒弃了“单次离线采集清洗”的传统范式,搭建了一套名为 WorldExplorer 的智能体驱动闭环数据基建。

该数据基础设施融合了三类互补的数据源:
-
AAA 游戏数据:覆盖开放世界探索、城市驾驶、骑行穿越等多种品类,天然囊括第一人称与第三人称视角,提供毫秒级对齐的运行时物理控制信号与 1080P 高清画面;
-
仿真引擎与 3DGS 数据:通过虚幻引擎(Unreal Engine)进行可控场景仿真,并结合高德团队自研的 ABot-3DGS 技术,利用真实街景航拍与街景扫描点云资产,重建出高几何精度的真实世界三维高斯场景,生成包含复杂几何先验的轨迹;
-
公开互联网真实视频:涵盖行车记录仪、城市漫游和航拍视频,虽然缺乏真实动作标注,但团队通过多场景姿态估计算法反推相机的 6-DoF 位移轨迹,并将其量化为伪动作标签,以此引入真实光照与开放域泛化能力。
WorldExplorer 的核心精髓在于其“训练反馈驱动的自适应闭环采集机制”。在传统方案中,自动化探索脚本往往机械地重复固有轨迹,遇到物理碰撞或复杂地形极易产生死循环。而在 WorldExplorer 中,训练监控模块会持续跟踪模型在各类场景与动作组合下的误差分布。一旦诊断组件发现模型在特定场景(例如夜间急转弯或第三人称复杂地形跳跃)表现不佳,策略生成器便会动态重新分配采集配额,驱动自主智能体在游戏与模拟器中针对性地强化采集此类轨迹。这种“发现弱点 $\rightarrow$ 动态重权定向采集 $\rightarrow$ 数据持续补充”的闭环,让数据集的增长具备了智能进化能力。
在控制表征方面,ABot-World-0 放弃了复杂的连续外参矩阵,转而采用直观的原始离散键盘动作接口。整个动作空间被统一压缩为一个 8 维的多热向量(Multi-hot Vector):
\[\mathbf{a}_t \in \{0, 1\}^8\]其中 W/A/S/D 控制角色或相机的平移前进、左移、后退与右移,I/J/K/L 控制视角的俯仰与水平旋转。对于仿真与互联网数据中提取的连续位姿差值,管线直接将其投影至相机局部坐标系基向量并进行阈值二值化;对于游戏数据,则直接映射原生按键。这种将复杂 3D 动力学控制统一归一化至离散键盘按键的做法,不仅契合人类玩家在 PC 端的自然交互直觉,更在数学上将控制信号约束在一个有界的紧凑空间内,避免了连续位姿在长期推演中的数值累积发散。
在送入训练前,所有数据还会经过一个包含 14 项严格确定性检查与视觉语言模型(VLM)评估的三阶段过滤管线,剔除掉掉帧、UI 遮挡、人物死亡结算界面以及动作与光流方向冲突的不良片段,为后续模型训练筑牢了底座。
从双向到因果:渐进式蒸馏与动作注入
在模型架构层面,ABot-World-0 基于成熟的 Wan2.2 基础视频扩散模型进行演化,但将训练过程明确解耦为“动态物理规律学习”与“低延迟因果推理适配”两个独立阶段。

首先,团队构建了一个双向动作条件 Teacher 模型。预训练视频生成模型拥有极佳的视觉先验,但对键盘动作触发的画面状态迁移毫无概念。为了赋予模型动作控制力,研究人员在网络的分块嵌入(PatchEmbed)阶段引入了加性动作注入机制。由于时序 VAE 存在 4 倍的时间轴下采样率,连续 4 帧的 8 维动作被拼接为一个 32 维的组合向量:
\[\tilde{a}_\tau = \mathrm{Concat}(a_{4\tau-3}, a_{4\tau-2}, a_{4\tau-1}, a_{4\tau}) \in \{0, 1\}^{32}\]随后通过一个轻量级多层感知机 $\mathcal{F}_\psi$ 将其投影至与隐空间视觉 Token 一致的通道维度,并以残差加法形式直接叠加到视觉 Patch Embedding 之上:
\[\hat{\mathbf{z}} = \mathrm{PatchEmbed}(\mathbf{z}) + \mathcal{F}_\psi(\tilde{\mathbf{a}}_{1:T/4})\]在此阶段,模型依然使用全序列双向时空注意力机制,在完整的视频时序窗口内通过全参数微调充分理解离散键盘指令与像素动态变化之间的因果对应关系。双向注意力使得模型能够纵观全局前后文,生成物理合理、光影过渡自然的动作视频基准。
然而,双向模型由于存在对未来帧的注意力依赖,根本无法用于在线交互。为此,系统启动第二阶段:渐进式因果 Student 蒸馏。
通过因果掩码(Causal Mask),强制 Student 模型在自回归预测当前帧块时仅能访问历史缓存帧,切断对未来信息的窥探。为了在压缩采样步数的同时保住双向 Teacher 的物理动力学质量,团队采用了 Teacher Forcing 结合常微分方程(ODE)轨迹蒸馏策略。这一步将扩散生成过程大幅压缩至极少的采样步数(Few-step),使在线低延迟推理成为可能。
攻克自回归漂移:LongForcing 与角色参考记忆
从双向蒸馏到因果模型后,交互式世界模型通常会遭遇其最致命的敌人:长程自回归漂移。
在单步或短时程训练时,Student 接收的都是真实数据分布内的历史帧;但在真实推演中,推演到第 100 步时,前 99 步全是由 Student 自己生成的预测内容。自回归生成带来的细微累积误差会不断破坏输入上下文,最终脱离训练分布。
为彻底解决这一问题,ABot-World-0 提出了核心训练创新——LongForcing。
LongForcing 的本质是在更长的时序跨度上,对 Student 自身的长程自推演轨迹(Self-rollouts)施加分布级监督。在这一训练阶段,系统让因果 Student 模型在无真实帧辅助的情况下进行多步连续自回归生成,刻意模拟真实交互中可能出现的长程推演状态;与此同时,利用具备全局时空感知能力的扩展时域双向 Teacher 模型,对 Student 自推演产生的长时序分布进行纠偏监督。通过在自推演链条上反向传播分布对齐梯度,LongForcing 能够让 Student 模型学会“如何在历史信息已经带有轻微退化或扰动的情况下,依然将未来画面拉回正确的物理演化轨迹上”。这种训练范式打破了以往短窗口 Teacher Forcing 无法覆盖长程推理分布的瓶颈,使得长达数分钟甚至无限时长的交互推演不再陷入画面坍缩或冻结。
针对第三人称视角下角色易发生外观漂移、衣着甚至面部突变的问题,模型引入了参考角色记忆(Reference-Character Memory)。在推演启动前,系统不仅接受初始帧,还通过独立的上下文特征通道持久化注入一张或多张高精度的角色外观参考图。在后续的每一轮自回归扩散去噪中,注意力机制均可显式寻址该参考记忆,从而在镜头高速旋转、视角切换或剧烈遮挡后,依然能准确找回主角的服装细节与面部特征,实现了长期交互中身份一致性与场景动态变化的解耦。
软硬件全栈协同:19 GiB 显存如何榨出 16 FPS
即使算法具备了长程生成能力,在消费级硬件上达到 720P 实时交互依然是一项极其苛刻的工程挑战。RTX 5090 拥有强悍的算力,但桌面级单卡环境面临着严格的单卡显存墙与总线带宽瓶颈。ABot-World-0 在推理栈上执行了精密的系统级软硬件协同优化:
-
分块流式生成(Chunk-wise Streaming):系统并非单帧自回归,而是按时序块(Chunk)联合去噪,将多帧的时空注意力和 VAE 解码计算有效平摊。这种设计在维持极低控制延迟(动作到首帧响应 1.2 秒)的同时,将全局吞吐量拉升至 16 FPS。
-
轻量化因果 VAE 解码器:标准视频生成模型的 3D VAE 解码计算极其沉重,往往占据总推理延迟的 40% 以上。团队设计了低延迟、轻量化的专用流式解码网络,并使解码与下一块 DiT 扩散去噪在 GPU 计算流(CUDA Stream)上实现异步重叠,完全掩盖了后处理延迟。
-
低比特 DiT 量化与低精度注意力:对主干 Diffusion Transformer 的权重与键值缓存(KV Cache)实施低比特量化,同时采用适配最新架构的高效低精度注意力和显存优化位置编码,在保证 720P 视觉细节不损失的前提下,将去噪阶段的显存占用大幅压缩。
-
有界上下文 KV Cache 与显存感知调度:针对长程推演显存线性膨胀的问题,推理引擎部署了固定上限的局部滑动窗口 KV 缓存与显存感知调度器,彻底切断了随时间累积的显存泄露,使整机峰值显存严格维持在约 19 GiB,在 24/32 GiB 桌面显卡上留出了宽裕的安全运行余量。
在专为衡量交互世界模型设计的 WorldRoamBench 基准测试与开放式长时程交互评测中,ABot-World-0 展现出了出色的控制遵循度、物理合理性与时空记忆稳定性。无论是第一人称视角的穿街走巷、连续拐弯,还是第三人称视角下的奔跑跳跃与镜头旋转,画面均未出现传统模型常见的自回归撕裂或角色退化。
从静态视频到本地可控世界模拟
ABot-World-0 的核心价值,在于它没有停留在参数规模或离线生成画质的单点军备竞赛上,而是将交互世界模型定义为一个涵盖“数据闭环智能体、因果与长程训练拓扑、单卡实时计算栈”的完整全栈工程。
过去,能够在高分辨率下保持物理自洽的交互式环境模拟往往被视为主流科技巨头服务器集群的专利。而 ABot-World-0 证明了:通过将离散按键作为底层因果控制接口、引入 LongForcing 抵消自回归分布偏移、配合低比特全栈流式推理,单张顶级桌面显卡即可胜任 720P 分辨率下的连续交互推演。这一技术路径不仅极大地降低了生成式游戏世界的硬件门槛,更为机器人具身智能训练、合成数据闭环演进以及未来的开放式虚拟世界模拟,提供了一个极具落地潜力的本地化基础底座。