PM-Bench:UCLA发布前瞻记忆基准,最强GPT-5.4得分仅65.1%
PM-Bench: Evaluating Prospective Memory in LLM Agents

大语言模型(LLM)驱动的智能体系统正在被赋予越来越长周期的任务期望。如今的模型能够浏览网页、编写代码、制定计划、调用工具,并在多轮对话中采取行动,而不再局限于单次提示词的响应。然而,随着智能体助手变得越发强大,一种新的失效模式开始频繁出现:系统失败往往不是因为缺乏相关知识,或是丢失了上下文,而是因为它没有在“正确的时刻”采取行动。例如,用户要求智能体“在周三收到账单后取消订阅”,智能体可能在周一和周二表现得完美无缺,却在周三真正收到账单时无动于衷,继续执行其他日常指令。
ArXiv URL:https://arxiv.org/abs/2607.12385v1
为了量化和解决这一智能体执行层面的核心缺陷,加州大学洛杉矶分校(UCLA)的研究团队提出了 PM-Bench。这是一个专为测试现代大语言模型智能体“前瞻性记忆”(Prospective Memory)能力而设计的纯文本基准测试。研究人员发现,现有的长文本记忆评测主要关注模型能否回忆起过去的信息,却忽略了智能体能否在持续进行的干扰活动中,在未来的特定触发条件或时间点准确执行既定意图。
PM-Bench 的实验结果揭示了当前前沿大模型在任务执行中的严峻短板。在对包括 GPT-5.4、Llama-3.3-70B、Mistral-Large-3 以及多个参数量级的 Qwen3 在内的 8 款先进大模型,结合 8 种不同的智能体记忆架构进行全面测试后,研究团队发现,所有设置下的表现都充满挑战。即使是表现最好的组合——配备了由智能体自主决定的“心跳机制”(Heartbeat)的 GPT-5.4 智能体,在严格的评估下也仅达到了 65.1% 的 F1 分数。更为关键的是,没有任何一种单一的记忆增强策略能够在所有模型中占据绝对优势。跨日任务、需要主动监测环境变化的任务以及经历过条件变更的任务,依然是当前所有智能体架构无法跨越的鸿沟。
回溯与前瞻:大模型记忆机制的认知盲区
在认知科学领域,记忆被严格区分为不同的维度。当前大模型领域中火热的超长上下文窗口(Long Context)、检索增强生成(RAG)以及外部记忆库技术,本质上都在解决“回溯性记忆”(Retrospective Memory)的问题。这类评测(如“大海捞针”)的核心在于:当系统被明确提问时,它能否从庞大的历史记录中找出对应的信息。
然而,一个可靠的自主智能体不仅需要回答问题,还需要执行延迟的意图。它必须记住在未来的某个时间点完成之前提到的任务,必须能够追踪任务的重新安排或取消,并且在任务已经完成后停止重复执行。在心理学中,这种能力被称为前瞻性记忆:即记住在未来的适当时间或事件发生时执行延迟的意图。
前瞻性记忆与回溯性记忆的根本区别在于,前瞻性记忆的成功不仅取决于系统“记住了什么”,更取决于系统能否在面临分心、干扰以及持续的环境监测压力下“自发地完成任务”。其重要性不仅停留在理论层面:在人类社会中,航空领域的驾驶舱操作遗漏往往与重大飞行事故相关,而医疗领域中患者忘记按时服用降压药则直接导致心血管预后恶化。经典的心理学研究指出,日常生活中大约 50% 的失误都可以归结为前瞻性记忆的失效。
对于大模型智能体而言,这一区别同样致命。现有的长周期基准测试主要强调软件工程、网络浏览或逻辑规划,而涉及记忆的基准测试大多只是通过提取先前的对话经验来进行上下文工程。这些工作没有干净地分离出“意图是否在正确的未来线索下被执行”这一变量。当下的 LLM 智能体在面对需要长期潜伏、适时激活的意图时,依然表现得像一个患有严重健忘症的执行者。
PM-Bench 的核心机制:将“虚拟周”引入智能体评测
为了填补这一空白,UCLA 团队从认知心理学中汲取灵感,将经典的“虚拟周”(Virtual Week)范式改造为适合现代工具调用智能体执行的测试框架。虚拟周最初是一种棋盘游戏式的认知测试,用于研究人类在衰老或临床损伤情况下的记忆衰退。它将多个延迟的意图嵌入到连续的日常活动流中,要求测试者在推进日常流程的同时兼顾未来的承诺。

如上图所示,在 PM-Bench 中,场景在模拟的七天时间表中展开。每天包含 10 到 13 个以时间为锚点的离散步骤。在每一个步骤中,智能体必须继续进行正在进行的日常活动,同时决定是否有任何被推迟的意图需要在当前这一刻被执行。PM-Bench 的核心设计目标是明确分离“智能体记住了什么”和“智能体何时采取行动”。
在数学表达上,基准测试要求智能体在步骤 $t$ 执行的行动集应当尽可能贴合真实的待办集合 $D_t$。该集合的定义为:所有仍然有效,且其执行条件在步骤 $t$ 正好被满足的潜在任务。
为了实现这种复杂的动态决策,PM-Bench 设定了基于事件的任务和基于时间的任务。基于事件的任务要求当相关线索出现在当前的叙事场景或查询的状态频道中时被执行;而基于时间的任务则要求当前步骤的时间与目标时间匹配,或落入允许的执行窗口内。这种设计使得 PM-Bench 彻底脱离了纯粹的记忆检索测试——成功的关键在于智能体能否维持并随时修正其延迟意图。
在具体交互规范上,每个步骤遵循“先查询后行动”(Query-then-Act)的协议。在做出最终决策之前,智能体可以向外部频道(如时钟、邮箱、状态追踪器等)发出零次或多次监控查询。在观察到返回的频道内容后,智能体再提交一个动作元组 $a_t = (c_t, A_t)$,其中 $c_t$ 表示推进剧情所需的正在进行的活动选择,$A_t$ 则代表智能体决定在步骤 $t$ 立即执行的前瞻性动作子集。

为了防止模型仅仅通过硬编码或记忆任务标识符来作弊,PM-Bench 在运行时交互中隐藏了真实的动作标签。每个步骤中,系统会提供一个包含匿名动作句柄的菜单,其中混合了真实的待办任务动作和随机生成的干扰项(Lures)。智能体必须完全根据当前的触发条件来推断应该选择哪个匿名句柄,而不是机械地调用某个固定的任务 ID。此外,基准测试还引入了跨日任务、显式的取消指令和重新安排指令。当任务的时间或触发条件被修改时,模型被迫更新现有的意图,而不是依赖最初编码的上下文。
应对前瞻记忆失效:四种智能体记忆架构的博弈
既然前瞻性记忆如此困难,仅仅向模型提供完整的上下文显然是不够的。研究团队在 PM-Bench 上测试了当前主流的几种智能体记忆支架(Scaffolding)策略,以探究是否有特定的工程方法能够缓解这一缺陷。实验涵盖了 8 种配置,最终被归纳为四种核心的代理架构范式。

第一种是最基础的单智能体基线(Single-agent baseline)。在这种配置下,单个大模型在没有外部记忆工具、没有角色分解、也没有任何专门提示策略的情况下在环境中导航。这构成了所有其他干预方法的参考基准。这种方法完全依赖模型自身的上下文窗口来维持未来的意图,也是目前大多数对话助手的默认状态。
第二种是待办事项账本智能体(Todo-ledger single agent)。这种变体允许智能体维护一个显式的上下文待办事项账本。账本中记录了待处理的意图、预期的触发线索或时间,以及完成状态。这个账本会在步骤之间结转,并在每个回合进行更新。这种设计的初衷是测试一种直观的“记笔记”行为是否能提高执行质量,强制模型在每一步反思当前究竟有哪些任务正在等待触发。
第三种是心跳增强智能体(Heartbeat-augmented single agents)。这是为了解决智能体“忘记去检查环境”这一问题而引入的机制。通过周期性的监控提示(即“心跳”),系统会提醒智能体考虑查询隐藏状态的频道。研究人员设置了三种变体:一种是由智能体自主决定的可选心跳(Optional-heartbeat),智能体可以选择开启或关闭周期性心跳,并设定 30 分钟或 60 分钟的间隔;另外两种则是固定的系统强制心跳,运行时环境会在每天开始时自动启用每 60 分钟或 30 分钟一次的提醒。
第四种是层次化的多智能体架构(Hierarchical multi-agents)。在这个复杂的系统中,主协调者智能体管理着三个子智能体专家。当协调者委托任务时,每个子智能体可以分别追踪环境中不同的信号,并提出对隐藏状态的查询建议。系统首先执行这些查询建议的并集,获取所有潜在的信息,然后协调者智能体再根据这些汇总的信息选择最终的动作集合。为了进一步剖析这种多智能体架构的瓶颈,研究人员还对其引入了多数投票(Majority vote)和一致投票(Unanimous vote)的重放消融实验。
为了科学地衡量这些架构的表现,研究团队没有采用单一的准确率,而是选用了集合级别的 F1 分数(Set-F1)作为主要评价指标。在这个测试中,仅仅追求精确率(Precision)或召回率(Recall)都是不够的。如果只看精确率,系统可以通过极端保守的策略(即什么都不做)来避免出错;而如果只看召回率,系统可能会在每一个时间步疯狂点击所有的待办事项(Spamming),从而偶然命中真实的触发条件。一个强大的智能体必须在准确识别到期意图的同时,克制住执行错误动作的冲动。因此,综合衡量假阳性(FP)和假阴性(FN)的 Set-F1 分数,最能真实反映前瞻性记忆的健康度。
实验结论:没有通用解药,主动监测成为最大死穴
通过对 64 组实验(8 个模型骨干乘以 8 种代理配置)的严格对比,PM-Bench 揭示了当前大模型在复杂任务执行中的一系列深层缺陷。
首先,最令人瞩目的结论是:没有任何一种记忆支架架构能够在所有模型和指标上取得普遍的统治地位。从宏观数据来看,表现最好的组合是采用“可选心跳机制”的单智能体,其宏观 Set-F1 达到了 65.1%。待办事项账本(Todo-ledger)变体是表现最稳定的低噪声替代方案,其宏观 Set-F1 为 62.8%,在所有具有竞争力的设置中拥有最低的假阳性总数。
这种现象深刻地表明,智能体在处理前瞻性记忆时面临的最大困境并非简单的“遗忘”,而是“难以校准执行的激进程度”。那些能够召回更多到期任务的方法,往往付出了变得过度激进和大幅增加误报(False Alarms)的代价;而保守的方法虽然保持了高精确度,却因为行动不足而导致任务大面积逾期。这种在精确率与召回率之间的挣扎,证明当前模型缺乏对“时间”和“条件”的深刻内化理解,它们更像是在依靠模式匹配进行猜测,而不是像人类一样在潜意识中挂起一个随时待命的触发器。

其次,实验暴露了智能体在“主动监测”(Proactive Monitoring)方面的巨大软肋。在现实世界中,许多任务的触发条件并非直接显现在眼前,而是需要主动去检查。例如“如果今天有重要邮件就回复”。在 PM-Bench 中,这类任务要求智能体主动查询隐藏的状态频道。
从上面的图表中可以清晰地看到,即使对于最强的架构设置,除了对时钟(Clock)频道的监测任务能够勉强达到 50% 以上的命中率之外,所有需要监测其他环境信号的任务表现都极其糟糕。在多个非时钟频道上,好几种架构的命中率竟然是绝对的 0%,而最好的频道监测命中率也仅仅停留在 16.7%。这意味着,即使大模型拥有了工具调用能力,如果没有明确的外部刺激强制它们去检查某个状态,它们几乎永远不会自发地意识到“现在可能需要去看看邮箱有没有新消息”。这极大地限制了智能体在无监督环境下的长效自主性。
最后,跨日任务和对状态更新敏感的任务依然处于未解决状态。当一个意图在第一天被设定,但触发条件在第三天或第五天才出现时,模型保持这一意图的能力会出现断崖式下跌。在跨日任务中,可选心跳策略的最高命中率也仅为 50.0%。值得警惕的是,被寄予厚望的层次化多智能体架构,尽管产生了大量的监测行为,其跨日任务的命中率却仅为可怜的 10.7%。这说明,智能体可能会进行盲目而频繁的检查,但依然无法在跨越众多中间步骤后,维持住对原始承诺的忠诚度。
同样的情况也发生在任务更新上。如果一个原本定于周二下午 2 点的任务被临时改到了周三上午 10 点,模型极易陷入混乱,可能会在原定时间错误执行,或者在修改后的时间彻底遗忘。即使在每 30 分钟强制进行心跳检查的最佳设置下,更新敏感任务的命中率也只有 47.2%。这种在长周期和动态干扰下的脆弱性,直接否定了将长文本窗口等同于长周期执行能力的乐观推断。
结语与启示
PM-Bench 的提出为大模型智能体的演进提供了一个极其敏锐的诊断工具。它无情地撕开了当前看似无所不能的 AI 助手在时间感知与动态意图管理上的遮羞布。研究结果明确无误地传递了一个信号:前瞻性记忆不应被仅仅视为更长上下文窗口或通用记忆检索的副产品,它必须作为 LLM 智能体评估的一个独立、核心的维度来对待。
当整个行业都在狂热地追求模型能够“吞下”多少百万级的 Token 时,UCLA 的这项研究提醒我们,如果一个智能体无法在正确的时间点主动醒来并采取适当的行动,那么它脑海中储存的再多历史记忆也只是一座死寂的图书馆。针对前瞻性记忆的训练干预、推理期内存流的重新设计,以及更加智能的环境监测机制,必将成为下一代自主智能体跨越实用性鸿沟的关键战场。在智能体真正学会像人类一样在纷繁复杂的日常活动中兼顾未来的承诺之前,将其无监督地部署在具有安全关键性的工作流中,依然面临着难以估量的风险。