GameWAM:首个原生游戏与GUI闭环世界-动作模型,看清未来才能精准操作
GameWAM: A World Action Model for Video Games

在开放世界游戏和复杂人机交互环境中,智能体究竟应该如何行动?长久以来,学术界与工业界主要沿着两条割裂的路径前行。一条路径是行为驱动的控制智能体,从传统的行为克隆(Behavioral Cloning)到如今的视觉-语言-动作(VLA)模型,它们尝试直接将当前的第一人称视觉观察和指令映射到底层按键或鼠标位移;但这类模型内部往往缺少对物理或游戏动态演化的显式建模,容易出现“盲目试错”。另一条路径则是以 Sora 时代为代表的交互式视频世界模型,它们能够根据外部给定的按键序列,逼真地推演游戏画面接下来的帧变化,但这类模型本身并不具备决策规划能力,无法充当完成复杂任务的策略大脑。
ArXiv URL:https://arxiv.org/abs/2608.26200v1
控制模型做决策却不理解视觉后果,世界模型能预测后果却不会自主选择行为。来自复旦大学、清华大学与合作团队提出的 GameWAM,打破了这两者之间的界限。作为首个面向原生闭环游戏操作与图形用户界面(GUI)控制的“世界-动作模型”(World–Action Model, WAM),GameWAM 放弃了动作与画面的割裂预测,转而在同一统一框架下,并行生成未来的视觉观察画面与可执行的高精度键鼠轨迹。在包含 800 多个任务的开放世界基准测试 Minecraft Universe(MCU)以及高动态第一人称射击测试 ViZDoom 中,GameWAM 均展现出卓越的闭环控制能力,尤其是在 Minecraft 中,它以明显低于同类智能体的操作步数实现了更高的任务成功率。

原生键鼠控制的“精神分裂”:动作空间的语义鸿沟
将世界模型与动作生成统一(World–Action Model)的思路,此前曾在机械臂抓取等封闭的室内机器人场景中有过初步尝试,但迁移至现代视频游戏时,会遇到完全不同的系统级挑战。在第一人称视角的 3D 游戏中,智能体面对的是瞬息万变的画面更迭、持久的世界状态以及极度异构的原生控制输入。
这种异构性主要体现在物理输入与实际语义之间的强烈脱节。在纯粹的游戏漫游或战斗中,键盘的 W/A/S/D 对应角色的空间位移,鼠标移动控制的是第一人称相机视角的连续旋转角速度;然而在打开背包、操作合成台或调整菜单这类 GUI 模式下,同样的鼠标移动瞬间变成了二维屏幕上的光标位移,左键则变成了点击与拖拽。
如果在生成建模中将这两类动作混为一谈,强行用单一连续分布去拟合,模型在学习流匹配(Flow Matching)时就会混合两种互不相容的统计特性,导致相机视角莫名漂移或光标定位精度崩塌。
GameWAM 对此给出了精细的结构设计。在底层,模型采用基于流匹配架构的动作扩散骨干(Action-DiT),统筹处理包含并发离散按键与连续鼠标运动的动作空间。但在生成输出层,GameWAM 引入了一个轻量化的步级模式路由器(Per-action Router)。在每个动作时间步 $\tau$,路由器基于当前的隐层特征预测一个概率 $\rho_\tau$:
\[\hat{r}_\tau = \mathbf{1}\left[\operatorname{sigmoid}(\rho_\tau) > 0.5\right]\]随后,生成的动作速度场被显式拆解为游戏模式和界面模式两套独立的预测头:
\[\widehat{U}_\tau^a = (1 - \hat{r}_\tau)\widehat{U}_\tau^{\mathrm{game}} + \hat{r}_\tau\widehat{U}_\tau^{\mathrm{gui}}\]伴随这一路由机制,游戏连续动作(如相机角度变化)与 GUI 连续动作(如光标相对位移)采用了独立的统计归一化参数。这使得智能体在保留统一键鼠物理通道的同时,能清晰解耦两种截然不同的控制语义,无需人工预先硬编码当前到底是处于背包界面还是探索画面。

双轨 DiT 与块因果预测:把“看未来”与“定动作”合二为一
要让智能体在决定“按哪个键”时心里清楚“世界会变成什么样”,必须对未来视觉帧与动作轨迹进行联合建模。GameWAM 构建了平行的视频扩散骨干(Video-DiT)与动作扩散骨干(Action-DiT),两者之间通过跨模态注意力紧密协作。
整个时序生成遵循严格的块因果(Block-Causal)结构。假设在周期 $c$ 的第 $k$ 个局部块中,模型需要预测未来的一组块序列 $B_{k:k+R-1}$。模型建立的条件上下文不仅包含当前步骤的最新观测,还纳入了历史记忆与高层任务指令:
\[p_\theta\left(B_{k:k+R-1} \mid \Gamma_{c,k}\right) = \prod_{r=0}^{R-1} p_\theta\left(B_{k+r} \mid \Gamma_{c,k}, B_{k:k+r-1}\right)\]在流匹配的联合训练中,视频噪声速度场 $U^v$ 与动作噪声速度场 $U^a$ 被同时优化。为了让动作预测与视觉动态互相提供强约束,因果可见性集合(Visibility Mask)被设计成块内全可见、跨块向后因果。更重要的是,视频 tokens 和动作 tokens 在各自的层内不仅处理自身的连续流扩散,还在双轨之间频繁进行隐层表征对齐。
这种设计的直接收益在于:视频生成不再是一个悬空的“画画”任务,而是被动作强力约束的物理动态展开;动作生成也不再是盲目的拟合,每一个按键的输出都被强制要求与“预期的视觉画面演变”在隐空间保持因果一致。

预测与执行解耦:为什么长规划必须搭配短执行?
在具身控制与游戏交互中,模型每次到底应该规划多远、又该执行多远?这是长期困扰块自回归生成模型的结构难题。以往很多基于扩散策略(Diffusion Policy)或自回归分块的模型,倾向于规划一段就完整执行一段(即规划步长 $P$ 等于执行步长 $E$)。但如果在高动态游戏中这样操作,会遇到致命的权衡两难:
如果 $P$ 设得太短,智能体缺乏长远目光,遇到跨障碍、持续开火或复杂转弯等连贯行为时容易短视;如果 $P$ 设得很长且模型把这 $P$ 步全部在真实环境中执行完毕,那么中途发生意外(如被怪物突然攻击、视角被遮挡)时,智能体完全无法获得新观测的闭环反馈,导致严重的执行漂移。
GameWAM 的破局点在于将前瞻预测与实际执行解耦(Predict-Long, Execute-Short)。如图 3 所示,在一个规划单元内,模型在隐空间向未来预测长达 $P$ 步的动作序列 $\widehat{\mathbf{A}}_{c,k}^{\mathrm{plan}}$:
\[\widehat{\mathbf{A}}_{c,k}^{\mathrm{plan}} \in \mathbb{R}^{P \times d_a}\]但在真实环境中,智能体只提交并执行该序列最前端的短前缀切片(共 $E$ 步,$E < P$):
\[\widehat{\mathbf{A}}_{c,k}^{\mathrm{exec}} = \widehat{\mathbf{A}}_{c,k}^{\mathrm{plan}}[1:E]\]一旦执行完这 $E$ 步,智能体立刻通过真实环境获取最新的一帧真实视觉画面,重新锚定状态,并开启下一轮 $P$ 步的预测。在训练阶段,这种设计体现为步长为 $E$、跨度为 $P$ 的重叠监督机制。这种机制赋予了智能体更深远的动作前瞻性,却丝毫不牺牲频繁闭环反馈带来的动态敏捷度。
随之而来的第二个工程瓶颈是显存爆炸。如果每一轮重新规划都保留完整的注意力键值缓存(KV Cache),面对高帧率的原生交互,显存瞬间就会见顶;但如果直接丢弃历史,智能体就会患上“瞬间失忆症”,在面对复杂的长程合成任务时连上一步拿了什么材料都记不住。
GameWAM 构筑了一套精巧的分层记忆架构:
-
周期内瞬态局部缓存(Within-cycle KV Cache):在一个规划周期的几个局部微块内,维护高精度的注意力缓存,保留细粒度的近程动态。
-
跨周期持久视觉历史(Hierarchical Cross-cycle History, $H_c$):当局部周期结束时,丢弃昂贵的逐 Token 瞬态缓存,将刚刚执行完毕的视觉片段经由 3D 卷积下采样后推入 FIFO 队列。队列溢出的较早片段,通过多头交叉注意力被压缩提炼进一组固定槽位(Memory Slots)的长程记忆池 $M_c$ 中。
配合专门的跨周期预测正则化损失 $\mathcal{L}_{\mathrm{hist}}$,模型被强制要求从压缩的记忆槽位中还原未来特征,确保即便是在成百上千步的漫长探索后,智能体依然能以极小的计算代价检索到关键的历史线索。
数据构建:事件锚定打破无意义的数据冗余
要训练如此高复杂度的世界-动作模型,数据的质量与时序对齐构成了最核心的基石。很多玩家公开的游戏视频充满了无目的的游荡、单调的向前跑图和冗余的视角晃动,真正的关键交互(例如砍树的一瞬间、打开工作台、完成工具合成)往往高度稀疏。
研究团队重构了包含标准自然交互流、事件锚定交互流以及自动化 GUI 脚本交互流的多轨数据体系。尤其是在构建 Minecraft 训练片段时,引入了“事件锚定采样”(Event-Anchored Sampling)。算法首先通过检测底层状态变化标记出高价值交互事件(如物品获取、破坏方块、菜单确认),随后以非均匀的密度抓取训练片段:在事件锚点邻域内高密度采样视觉与动作帧,而在远离事件的过渡区域稀疏下采样。
消融实验直接证明了这种采样的决定性价值。在针对 Minecraft Mini 子集的消融测试中,如果去掉事件锚定采样,整体成功率直接下滑超过 14 个百分点;模型在漫长的无监督信息中容易迷失,唯有聚焦高密度因果关联处,世界模型才能准确学到“哪个按键引发了哪种画面剧变”。
实验评测:用更少的步数做更准的决策
在 Minecraft Universe(MCU)基准上,GameWAM 经受了超过 800 个多样化长程任务的检验,涵盖基础移动、资源收集、战斗与复杂 GUI 制作。
评测结果揭示出一个极具穿透力的现象:GameWAM 在任务成功率(ASR)上大幅超越了各类通用多模态智能体与基于离散动作抽象的控制模型。在 Mini 评估集上,GameWAM 达到了 50.7% 的平均成功率,并在全量 800+ 任务测试中取得了领先的稳定胜率。
比成功率数字更具说服力的是平均执行动作步数。在所有评测的任务类别中,GameWAM 完成成功任务所需的交互步数均显著低于对比基线。以往的智能体因为缺少对物理演变的内在推演,往往需要通过连续快速尝试、大幅晃动镜头来校准目标,浪费了巨量无意义动作;而 GameWAM 凭借世界模型的隐式推演,表现出极强的“意图确定性”,极少出现多余的盲目操作。在 ViZDoom 的 4 张第一人称射击地图中,面对强烈的瞬态动态变化与血量压制,GameWAM 在平均回合奖励上也全面超越了同类原生按键智能体。
而在消融实验中,如果把 GameWAM 的“生成未来视频观察”这一目标彻底砍掉(退化为单纯的动作生成策略),模型的任务完成率从 50.7% 剧烈下跌至 37.0% 左右。这一断崖式的性能差距,从实证角度铁证如山地回答了一个争议问题:在具身交互中,生成未来的视觉推演绝对不是中看不中用的“副产物”,世界动态监督是高水准生成式控制不可或缺的基础底座。
意外的物理发现:不可忽视的“低频动作源印记”(LASI)
除了模型架构与亮眼分数之外,该论文最具学术洞察力的贡献之一,是作者在长程闭环评估中捕捉到的一个此前鲜有人提及的隐蔽故障模式——低频动作源印记(Low-Frequency Action Source Imprinting, 简称 LASI)。
在基于流匹配或扩散模型的策略生成中,每一步去噪推演通常要从一个标准高斯分布的随机先验源(Noise Source)开始。为了节省推演耗时或维持时序一致性,某些系统实现可能会在相邻的多次重规划步骤中复用同一个采样的噪声源。
然而,研究团队在连续闭环滚转中发现了一个诡异的异常:智能体会毫无缘由地陷入持续的原地原地打转,或者视角不由自主地持续朝某一固定方向偏移,彻底破坏闭环控制。
通过精密的频域干预实验,团队锁定了罪魁祸首:
-
低频主导性:将采样噪声源 $Z$ 投影到频域后,低频分量系统性地主导了最终生成的相机粗粒度运动轨迹,而高频分量仅仅影响局部的细微抖动。
-
偏差累积效应:某一个特定的随机高斯噪声样本,其在低频部分可能偶然带有一种轻微的向右旋转偏置。如果是单次离线推演,这种偏差无伤大雅;但在长程闭环控制中,如果重规划步骤跨周期复用了具有方向偏置的噪声源,或者未充分打破低频相关性,这种低频控制印记就会在物理环境中被无休止地积分累加,演变成致命的原地旋转或不可挽回的视角偏航。
这项发现为所有基于扩散模型/流匹配进行连续闭环控制的具身智能开发者敲响了警钟:在长程交互决策中,生成策略绝不仅仅是做数学采样,必须在每次重规划时主动实施动作源重采样或频域去偏,否则生成式动作先验的低频印记将成为阻碍智能体走出无限循环的幽灵。
结语与启示
GameWAM 的成功落地,向具身智能社区清晰地展示了“世界模型”从被动的视频模拟器迈向主动闭环控制者的可能性。现代游戏所具备的高动态、非结构化输入、长记忆依赖以及混合模式界面,恰好构成了大模型走向通用电脑操作与物理世界行动的最佳虚拟试炼场。
当智能体能够在一套统一的流匹配动力学框架内,既看见几步之后画面的风吹草动,又在指尖精准敲击出对应的按键位移,智能体才算真正拥有了“知行合一”的推演直觉。GameWAM 证明了这一范式的威力,而它所揭示出的预测解耦机制与 LASI 效应,也将成为后续交互式生成控制领域无法绕开的重要技术资产。