MemWM:用外置记忆打破文本世界模型幻觉,下游成功率提升65.4%
MemWM: Memory-Augmented Text-Based World Model

在大模型驱动的智能体(Agent)研究中,让模型具备“预见未来”的能力一直被视为通向高级规划的核心阶梯。如果智能体在采取行动前,能够像人类一样在大脑中构建一个内部模拟器,推演每一步操作会引发怎样的环境变化,它就能在虚拟空间中对比不同方案的优劣,避免盲目试错。这种模拟环境状态演化的机制,就是世界模型(World Model)。然而,当研究者试图用大语言模型直接构建纯文本形式的世界模型时,往往会遭遇一个极其隐蔽却又致命的困境:生成的预测文本看起来语法流畅、合情合理,但在细微却关键的环境事实、物理规则或对象属性上,却频频发生漂移与幻觉。
ArXiv URL:https://arxiv.org/abs/2608.07107v1
针对这一核心瓶颈,来自华为、慕尼黑大学(LMU)、慕尼黑工业大学(TUM)、浙江大学等机构的研究团队提出了 MemWM(Memory-Augmented Text-Based World Model)。这项研究指出,世界模型预测失败的根本原因,并不是语言模型缺乏叙事能力,而是其静态的参数化权重难以稳定锁定长时序中的细粒度事实与严格的状态转移规则。MemWM 通过为世界模型接入精选的“世界记忆”(World Memory),并在执行端为冻结的策略模型注入“世界技能”(World Skill),实现了精准的状态推演。实验表明,在结构化状态保真度(Structured State Fidelity, SSF)评估中,记忆增强训练相比传统有监督微调(SFT)提升最高达 206.3%;而在 ALFWorld、WebShop 与 ScienceWorld 等多项复杂决策基准上,策略模型完全无需微调,仅靠推演与记忆引导便实现了最高 65.4% 的下游任务相对成功率提升。

表面流畅的幻觉:文本世界模型的“保真度瓶颈”
在具身家居、科学实验模拟或复杂的网页导航任务中,智能体每迈出一步,物理世界就会产生不可逆的状态演变。例如,在厨房里把苹果切块、放进冰箱;在实验室中调节仪器温度至指定刻度;在电商网站中选定特定尺码并加入购物车。一个可靠的世界模型必须准确追踪每一个操作带来的确定性变化。
但在现有的纯文本世界模型中,经常出现一种“表面合理、实质崩溃”的现象。语言模型依靠统计概率预测下一个状态,它很容易生成一段读起来挑不出语病的操作后描述,但细看其中的关键事实,破绽百出:智能体明明只是走进了卧室,模型预测的状态却将此前放在客厅桌上的钥匙悄然抹去;在科学推理环境中,操作仪器的文字描述保留完好,但核心的数值读数或通电状态却被颠倒;在购物场景中,用户的核心诉求还在,但商品的具体型号、颜色参数或价格数值已被篡改。
这类细微错误在单步推演中看似无伤大雅,但在需要长链路前瞻规划(Lookahead Planning)的场景下,误差会迅速累积并成倍放大。一旦推演出的虚构状态给出了错误的事实输入,后续的所有决策分支都将建立在空中楼阁之上,导致规划直接失效。更棘手的是,传统的自然语言生成评测指标掩盖了这一致命缺陷。精确匹配(Exact Match)过于严苛,只要模型输出同义改写或标点调整就会被判零分;而词级 F1 值或 BLEU、ROUGE 等指标又过于宽松,哪怕模型把“关门”写成了“开门”,两句话的大部分词汇依然高度重合,能拿到极高的重合分数。
为了击中这个长期被传统指标掩盖的技术痛点,研究团队提出了结构化状态保真度(Structured State Fidelity, SSF)评估体系。SSF 不再纠缠于预测文本在字面上的浅层重合,而是通过规则与结构化解析器,把真实状态与预测状态中的行为关键字段(例如物体位置、容器开闭、数值状态、商品 ID 与属性)提取出来进行精确比对。这一指标的确立,让世界模型的“幻觉”无所遁形,也为解决状态失真问题提供了明确的衡量锚点。
双通道解耦:世界记忆与世界技能的协同
既然纯参数化的语言模型容易遗忘规则和细节,最自然的解决思路便是引入外置记忆。但以往在 Agent 系统中引入记忆往往聚焦在全局知识库(如通用 RAG)或单纯的策略反思反思(如 Reflexion),缺乏针对物理规律与状态演化的专用记忆组织。MemWM 的破局之处,在于将环境推演机制与行为决策机制进行解耦,分别建立了两套相互独立却又协同工作的动态记忆通道:面向世界模型的“世界记忆”(World Memory),以及面向决策策略的“世界技能”(World Skill)。

世界记忆($\mathcal{M}^{\mathrm{wm}}$)专为世界模型的推演服务,充当物理规则与实体状态的高速缓存。它存储的内容高度精炼,主要由三类核心经验构成:
-
严格的环境转换规则(Transition Rules):明确记录操作的前提条件与确定性后果,例如“打开微波炉前必须确保双手未持有其他大型物体”、“容器未打开时无法放入物品”。
-
动态状态缓存(State Caches):显式记录那些容易在长文本上下文中被掩盖或淡化的持久性实体事实,如当前房间内各储物格的实际存留清单。
-
难以预测的特殊事实(Hard-to-predict Facts):记录特定环境下非常规的实体标识、属性约束或边界数值。
世界技能($\mathcal{M}^{\mathrm{skill}}$)则完全服务于策略模型(Policy),旨在不改动模型权重的前提下引导其规范动作。这一通道细分为两种时间尺度的指引:其一是“任务级技能”(World Task Skill),在每个任务回合开始时一次性检索,为智能体提供该类别任务的宏观解决范式与子目标推进顺序;其二是“步进式纠正指导”(World Corrective Guidance),在每一个决策步动态检索,结合当前局部历史与近期失败信号,实时告诫策略避开无效动作、死循环或遗漏前置检查的违规操作。
通过这种显式的责任分离,世界模型专注于“忠实模拟物理后果”,而策略模型专注于“提出合理候选动作”,二者互不干扰,却能在规划循环中形成闭环。
推演循环:从记忆检索到候选动作评估
在实际的推理规划过程中,MemWM 展现了高度模块化的工程灵活性。它并不强制绑定某种特定的搜索算法,无论是简单的贪婪动作选择,还是蒙特卡洛树搜索(MCTS)这类复杂前瞻规划,都可以直接接入。
当智能体处于某个决策步 $t$,观测到当前文本状态 $s_t$ 并持有历史轨迹 $h_t$ 时,系统首先从世界技能库中提取相关的局部纠正经验 $\gamma_t$。结合任务初始阶段检索到的宏观技能 $\tau$,策略模型提出一组具有潜力的候选动作集合 $\mathcal{A}_t$。到这一步,系统并不急于在真实环境中执行任何操作,而是进入前瞻推演阶段。
对于候选集合中的每一个动作 $a \in \mathcal{A}t$,世界模型需要评估其可能带来的后果。此时,检索模块会以当前局部上下文与待评估动作为查询键,从世界记忆库中精准召回最相关的物理规则与状态缓存 $m_t(a)$。世界模型 $f\theta$ 在生成预测的下一个状态 $\hat{s}_{t+1}$ 时,输入端不仅包含当前的上下文与动作,还包含了这些刚刚召回的强约束记忆。这些检索到的条目直接以辅助证据的形式显式插入 Prompt,强制让语言模型在自回归生成时关注这些物理硬约束,从而生成保真度极高的想象状态。
随后,下游规划器根据想象出的状态 $\hat{s}{t+1}$ 对候选动作进行打分,选择综合评分最高的动作提交给真实环境执行。在环境返回真实的下一个状态 $s{t+1}$ 之后,系统还可以将此次真实的转移轨迹提炼并回写至记忆库中。如果检索到的历史记忆与当前窗口中亲眼目睹的轨迹发生冲突,系统始终以当前可见的真实环境轨迹为最高权威,确保记忆库的动态演进不会引入不可逆的错误污染。
状态保真度大幅跨越:SSF 评估见证事实锁定
为了验证外置记忆能否真正阻止状态漂移,研究团队在涵盖日常家居(ALFWorld)、科学实验推演(ScienceWorld)和多属性电商交互(WebShop)三大基准上对世界模型的预测质量进行了全面压力测试。实验选用了 Llama3.2-1B、Qwen3-4B 以及 Qwen2.5-7B 等不同参数量级的大模型作为基座。
在评估指标上,SSF 展现出了对真实状态细节的极端敏感性。在 ALFWorld 中,SSF 严格追踪物体的位置从属与容器开关状态;在 ScienceWorld 中,它关注具体化合物、测量温度与设备通断等科学事实;在 WebShop 中,它精细到每一个产品的唯一识别码、价格浮动和选填配置。
实验结果给出了清晰的技术判断:单纯使用强化学习(RL)优化世界模型,虽然能略微提升推演的合理性,但面对长尾、严苛的属性字段时依然容易力不从心;而一旦引入记忆增强训练(Mem-Aug RL),模型在所有测试基准与模型尺寸下的 SSF 得分均取得了断层式领先。尤其是在字段极其繁杂、对属性匹配要求极高的 WebShop 环境中,基于 Qwen2.5-7B 的世界模型在记忆增强后的 SSF 相比无记忆基线暴涨了 0.135,相对传统 SFT 训练的基线提升幅度高达 206.3%。
这一飞跃背后的机理非常直接:在庞大的状态空间里,单纯靠隐式参数记忆去硬背每一个特定环境的转移矩阵是不现实的;通过外置结构化记忆,推演过程从“凭空想象”转变为“基于严密规则与既往缓存的开卷推演”,模型从根本上克服了对商品标识、环境约束和操作前置条件的遗忘。
冻结策略下的全面突破:下游规划实力验证
世界模型的保真度提升,究竟能否直接转化为复杂智能体任务的成功率?这也是衡量世界模型实用价值的核心试金石。以往许多工作为了刷高下游跑分,往往会对策略模型本身进行大规模的端到端微调或强化学习对齐,这不仅计算成本高昂,而且容易掩盖世界模型本身的真实贡献。
MemWM 采取了一种更为严苛但也更具说服力的实验设定:在下游任务评测中,所有的策略模型(Policy Backbone)完全保持冻结(Frozen)。策略模型不进行任何有监督微调或强化学习更新,所有的动作生成与环境感知能力均直接依托预训练权重。智能体综合能力的提升,完全来自世界模型的推演质量以及检索端提供的技能引导。
对比基线涵盖了当前主流的 Agent 推理与规划框架,包括思维链提示(CoT)、交替行动(ReAct)、前瞻树搜索规划(RAP)、交互式前瞻(ITP)以及使用常规 SFT 训练世界模型的基线 Agent(WM)。
实验数据表明,仅靠引入记忆增强的世界模型(MemWM),在不更新策略权重的条件下,智能体在 ALFWorld 与 WebShop 上的任务完成率便大幅超越了传统的 SFT 世界模型。而当进一步叠加策略端的“世界技能”(MemWM+Skill)后,系统性能达到了顶峰:
-
在 ALFWorld 家居基准中,MemWM 展现出了极强的前瞻纠错能力,成功率实现了断层式领先,相比传统 SFT 世界模型提升显著。
-
在 WebShop 复杂的搜索与属性匹配任务中,策略在世界记忆与纠偏指导的配合下,大幅减少了由于“选错规格直接下单”或“忽视用户价格约束”导致的提前失败,总成功率获得了最高 65.4% 的相对增益。
-
在难度极高的科学推演基准 ScienceWorld 中,无论是可见任务切分还是零样本不可见切分,记忆增强的世界模型同样全面压制了未引入记忆的对照组。
这种在冻结策略前提下取得的显著跃升充分证明:决定一个智能体决策上限的,往往不是语言模型输出行动指令的辞藻是否华丽,而是它在做出动作决断之前,所依赖的推演环境是否绝对忠实于物理现实。一个高保真度的推演系统,本身就是最好的决策过滤器。
稳健性与效率边界:敏感度消融分析
为了进一步探究该机制的鲁棒性,研究团队进行了一系列深入的消融与敏感度实验,重点回答了两个疑问:推演性能的提升究竟是否只是单纯依赖了更大的搜索动作预算?检索机制在推理期是否真的不可或缺?
在动作预算敏感度实验中,研究团队测试了不同候选动作分支数对任务表现的影响。直觉上,允许规划器评估更多的候选动作通常会提高找到最优解的概率,但也伴随着计算耗时的激增。实验数据显示,在不同的候选动作预算下,MemWM 的成功率曲线均稳定运行在所有基线模型上方。更具现实意义的是,在同等成功率下,搭载 MemWM 的智能体在完成任务时的平均执行步数反而保持平稳甚至有所下降。这意味着记忆增强的推演不仅让规划更准,而且通过在虚拟空间中预先排除歧路,避免了在真实环境中的无效试探,切实提升了交互效率。
而在推理期记忆丢弃(Memory Dropout)的敏感度测试中,技术脉络更加清晰。随着在推演阶段人为丢弃世界记忆的比例逐渐增加,世界模型的 SSF 保真度得分在三大基准上均呈现出严格的单调衰减趋势。在下游任务中,当记忆被完全剥离时,尽管底层模型依然经过了强化学习训练,其任务成功率依然出现了显著滑坡。这一对比强有力地隔离了训练阶段优化与推理期检索的贡献,实证了即时、精准的外置经验注入对于维持状态推演精确度的不可替代性。
走向更可靠的 Agent 认知架构
MemWM 的探索为语言智能体世界模型的研究开辟了一条兼具理论洞察与工程落地的路径。长期以来,大模型在复杂决策任务中的“幻觉”屡遭诟病,尤其在涉及环境状态变迁、前置条件约束等确定性逻辑密集的任务中,纯参数化的拟合能力往往会撞上可靠性天花板。
这项研究明确传达了一个信号:我们不应指望单体大模型通过隐式参数去强行内化一切物理细则,解耦与外部化才是解决状态失真的关键钥匙。通过将严格的环境演化规则和细粒度实体状态抽离为外置的世界记忆,并把经验层面的操作避坑指南组织为世界技能,MemWM 在不触动策略核心权重的极其克制的架构下,大幅拉高了 Agent 的规划与执行上限。
随着大模型与物理世界及各类复杂软件环境的交互日益加深,这种由“结构化保真度评估体系 + 外置物理演化记忆 + 解耦推演规划”构成的认知架构,无疑为未来构建更鲁棒、更具确定性、更可解释的高阶自主智能体提供了一个极具参考价值的坚实范式。