ContextWeave:记忆不是检索问答,真实工作流偏好分从41.5升至70.6
ContextWeave: A Real-World Workflow Benchmark

大语言模型智能体(LLM Agent)的研究重心,正在从做一道数学题、写一段自洽代码等孤立任务,迅速转向跨越数天乃至数月的真实连续工作流。当任务的生命周期被拉长,上下文窗口的物理上限与持续膨胀的信息量之间产生了不可调和的矛盾。为智能体引入外部记忆系统,让其记住以往的决策、用户的隐式偏好和特定项目的工作约定,已经成为业界的共识。
ArXiv URL:https://arxiv.org/abs/2608.04830v1
但长期以来,记忆系统的评测体系存在一个根本性的错位:大部分基准测试把记忆能力等同于“长文本检索”或“多轮对话问答”。评测通常设定一段漫长的聊天记录或虚构文档,再向模型提出一个具体问题,看它能不能把藏在深处的关键信息精准捞出来。这种类似“大海捞针”或事实性问答的协议,完全忽略了真实工作场景的本质——记忆的终极价值从来不是把过去的信息复述一遍,而是在后续执行新任务时指导行动、减少无意义的试错,并延续用户的深层偏好。
来自复旦大学、字节跳动和上海创新研究院的研究团队在论文《ContextWeave: A Real-World Workflow Benchmark》中正式直面这一断层。他们基于 14 位真实参与者跨越数月、脱敏后的真实办公记录,构建了一个包含 1005 个可执行任务的纵向工作流基准 ContextWeave。实验结果表明,在固定底层模型的前提下,引入优秀记忆组件能让工作区执行得分从 68.08 提升到 78.20,而用户工作偏好的对齐得分更是从 41.50 显著跃升至 70.60。这项工作用扎实的实证揭示出:智能体的有效记忆不能再被当作孤立的检索模块来对待,它本质上是支撑工作流延续的执行催化剂。
困在问答中的记忆评测
回顾现有的 Agent 记忆评估,大致可以划分为两类主要路径,但它们都难以映射真实办公场景的复杂性。
第一类是长历史问答或检索型测试,例如 RULER、LoCoMo 或 LongMemEval。这类基准将多轮对话、更新后的用户事实或合成的长文本作为输入,要求模型回答特定问题。这种评估虽然能够测量模型在海量上下文中的事实定位能力,却无法解答一个关键问题:当模型拿到这些历史信息后,它在面对一个需要调用终端、修改代码或更新多份文档的复杂工程任务时,到底能不能做出更合理的行动规划?把记忆简化为检索问答,直接割裂了“回忆”与“执行”之间的因果链条。
第二类则是以 SWE-bench、GAIA 为代表的端到端 Agent 任务,或者通过在同一组任务上反复运行多次的自进化评估。这类任务确实需要调用工具和执行环境,但任务之间往往是完全独立的静态实例;即便是反复试错的多轮迭代,也往往是在高度同质的任务分布上硬刷轮数,缺乏真实人类在多月协作中展现出的那种稀疏、隐式且高度个性化的依赖关系。真实工作里的记忆调用往往具有巨大的时间跨度:你上周定义的一个私有日志规范,可能会在下个月某个不起眼的异常排查任务里成为唯一的破局关键。
神经科学对学习与记忆的定义给出了启发:生命体从环境中获取经验、储存经验,其核心目标是塑造和改善未来的行为。迁移到大模型 Agent 领域,记忆系统是否有效,唯一客观的标准应当是:随着任务流的不断推进,有了历史记忆辅助的智能体,在下游任务中的实际完成质量是否明显高于毫无记忆的基线状态。
ContextWeave 的构建逻辑:如何把真实办公流变成可执行测试
为了还原这种真实的纵向依赖,研究团队没有选择由标注员凭空编写虚拟的多轮任务,而是直接采集了 14 名真实开发者在某开源项目中持续数月的工作文档轨迹。真实工作痕迹虽然具有无与伦比的真实性,但在工程化落地上却存在重重障碍:企业与个人隐私问题如何解决?历史日志里缺失的本地工具调用与外部 API 怎么补全?更棘手的是,若让 Agent 连续跑几个月,早期任务哪怕产生一点微小的执行分歧,会不会引发多米诺骨牌效应,导致后续所有的环境状态彻底崩溃漂移?

为了攻克这些难题,团队设计了一整套标准化的重构流水线。首先是时序任务切分与强约束脱敏。研究者按时间顺序抽取文档修改前后的差异(diff),利用大模型辅助初步切分,再辅以人工核实,把数月的连续修改归纳为 1005 个具有独立目标的任务单元,并从中筛选出 568 个构成主工作流的核心评测任务。在隐私保护方面,流水线不仅对人名、密码、私有路径进行常规脱敏,更采用了全链路保持结构一致性的实体替换策略,确保在不泄露敏感信息的前提下,上下文之间的实体共指与依赖拓扑完好无损。
其次是可执行环境与缺失观测的重建。人类员工在修改文档时,很多上下文停留在本地浏览器或未公开的内部服务中,文档版本库本身并不会保存这些中间过程。ContextWeave 为每个任务配备了独立的 Docker 容器,并设计了专用的模拟代理(Simulator Agent)。如果某项任务依赖原本无法公开的内部接口或本地环境,被测 Agent 可以通过纯文本形式向模拟接口发出请求,模拟代理则基于历史工单和人工标注的资源特性生成一致的反馈。随后,任务指令由模型结合工作目标反向推导生成,并通过一套“执行-校验”循环:由一个验证模型对比 Agent 在容器里的运行产物与真实历史工单,只有当两者在语义与功能上达成一致时,该任务才被正式收入基准。
针对长程评测中最令人头疼的误差累积与环境漂移问题,ContextWeave 提出了精妙的“规范化轨迹对齐”(Trajectory Alignment)机制。如果让 Agent 从第一个任务一路执行到第 500 个任务,一旦前面某个任务产生非标准输出,后面的任务评测就会失去基准一致性。ContextWeave 将每一个测试任务的环境初始状态,精准锚定在前序任务历史所记录的“权威状态”(Canonical Pre-task State)上。这意味着,当评估 Agent 执行第 $i$ 个任务时,它所拥有的记忆输入是前面真实发生过的规范执行轨迹,而它身处的 Docker 容器也是严丝合缝的前置工作区。这种解耦不仅消除了误差级联,让数百个测试任务能够高效并行评测,更排除了前置执行偶然失败带来的干扰,让指标的涨跌百分之百归因于记忆组件本身的检索与利用质量。
工作区与偏好:双维评价打破“表面完成”假象
在评估标准上,ContextWeave 完全抛弃了由模型自言自语总结的“我觉得我做完了”这种汇报式评估,而是引入了深入容器内部的严苛度量:
第一项核心指标是工作区得分(Workspace Score,满分 100 分)。评测模型 Codex 会直接挂载只读权限深入候选环境与标准参考镜像内部,逐一审查生成的代码、文档排版、系统配置文件甚至直接运行可执行检查脚本。基准将完成度划分为三档:60 分代表达到最低可行标准,80 分代表达到人类参考产物的基准质量,而高于 80 分则要求在正确性、覆盖度或代码鲁棒性上展现出超越基准的改进。
第二项核心指标是偏好对齐得分(Preference Score,满分 100 分)。在真实协作中,即使两个员工产出的代码功能完全一致,其命名规范、文件编排、文档注释甚至沟通风格也可能有天壤之别。很多要求用户不会写在每次的 Prompt 提示词里,而是默认模型应当从以往的交互中“心领神会”。团队首先由人工总结每个参与者的根本性偏好,再通过模型挖掘历史信息中的深层惯例,提炼出针对每个用户的个性化评估准则。除了打出 0 到 100 的偏好分,基准还设立了双盲盲测的成对胜率(Pairwise Win Rate),让裁判在抹去来源标识的前提下,直接对比带有记忆辅助与毫无记忆的历史输出。
为了更透彻地分析记忆失效的机理,评测体系还配套了四项诊断维度:
-
相关性(Relevance):衡量检索出的历史信息是否真正击中了解决当前问题所需的关键节点。
-
延续性(Continuity):观察 Agent 是否复用了先前工作中定义的术语、设计模式或已有模块,而非每次都从零造轮子。
-
可解性(Solvability):测试缺少特定记忆碎片时,当前任务是否仍具备被推导解决的可能性。
-
幻觉鲁棒性(Hallucination Robustness):诊断由于召回了表面相似但实际上不适用的旧经验,导致 Agent 误入歧途、产生新执行错误的概率。
实验发现:为什么说具体经验比精致摘要更管用
在实验中,研究人员以 GPT-5.5(搭配 Codex 环境)作为核心执行底座,系统横评了包括无记忆基线、全量上下文、摘要式记忆、图谱结构记忆等六种不同的记忆组件形态,同时横向覆盖了五种主流的基础大模型。汇总核心数据与现象,实验给出了三点极具冲击力的实证结论。
首先,记忆让 Agent 从“表面自洽”走向“真正可用”。在没有上下文记忆的情况下,绝大多数先进模型在面对复杂办公任务时,都会生成一份看起来煞有介事、结构工整但根本无法落地的半成品,例如引用了不存在的内部函数、忽略了团队已经确立的数据格式。在引入最强记忆配置后,不仅工作区可用性得分从 68.08 跃升至 78.20,更惊人的是偏好得分直接从 41.50 暴拉至 70.60。在成对胜率盲测中,带有记忆加持的轨迹以压倒性优势击败无记忆版本。这证明了缺乏记忆的 Agent 充其量只是一个通识工具,只有接入工作流历史,它才能真正融入团队。
其次,在行动指导能力上,富含执行轨迹的具体经验明显击败了紧凑的高层摘要。长期以来,许多 Agent 框架偏好在后台运行一个摘要模型,把昨天的对话或操作精简为几句提纲挈领的“用户画像”或“工作备忘”。但在 ContextWeave 的执行诊断中发现,过于简略的摘要往往丢失了至关重要的操作细节,例如关键命令参数、隐蔽的依赖路径配置和错误规避策略。包含具体执行轨迹、保留了代码修改片段的经验记忆,能够为 Agent 提供直接可套用的操作证据,大幅削减了智能体在终端里盲目探索的步数。
然而,具体经验是一把锋利的双刃剑,它显著放大了误导性召回的破坏力。诊断指标显示,当记忆系统召回了与当前任务场景高度相似但具体逻辑已经过时的旧轨迹时,Agent 表现出了严重的认知惰性:它会盲目复用旧代码中的硬编码变量、废弃接口或特定环境下的临时规避方案,从而在全新的容器中引发毁灭性的执行报错。相比之下,摘要式记忆虽然指导力弱,却因为模糊性较少引发此类精准的“致命翻车”。
从检索命中率走向执行容错
在多模型横向对比中,五款基座模型在接入记忆后无一例外都取得了下游性能提升,但提升幅度却展现出巨大的模型能力梯度。推理和规划能力越强大的基座,越能从杂乱的历史线索中提炼出真正对当下有利的操作,并敏锐地过滤掉可能存在冲突的过时代码;而指令遵循能力偏弱的模型,哪怕检索系统给它送上了完全正确的历史方案,它也会因为无法处理新旧上下文的冲突而败下阵来。
ContextWeave 带来的启示十分明确:在大模型进入长程工作流的时代,继续在孤立的问答数据集上优化向量检索的准确率,对提升 Agent 的端到端生产力已经边际效益递减。优秀的记忆架构必须在系统层解决两个问题:如何在保留足够操作细节的同时控制上下文污染,以及如何在 Agent 规划阶段建立对历史经验的主动求证与纠偏机制。
当记忆不再只是一张供智能体被动查阅的备忘录,而是变成参与每一次工具调用、每一次文件编辑的底层状态引擎时,真正的自主工作流 Agent 才能从演示环境真正走向现实生产力。