TRACE:长程Agent压缩为何频遭退化?配对闭环验证破解执行不稳定性
Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

在需要连续执行数十步甚至上百步的长程智能体(Long-Horizon Agent)任务中,上下文长度始终是一柄双刃剑。随着交互轮数的累积,工具调用的入参、庞大的环境反馈、临时的规划分支以及多轮系统报错不断挤入 Prompt,不仅让大模型的推理开销与时延呈爆炸式增长,更会导致严重的“大海捞针”困境,使得关键决策信息被稀释。为了解决这一痛点,工业界与学术界的主流做法是引入循环上下文压缩(Recurrent Context Compression):一旦上下文长度触碰预设的预算上限,就通过一个压缩模型将早前的交互历史浓缩为结构化的自然语言摘要。
ArXiv URL:https://arxiv.org/abs/2608.06503v1
直觉上,只要保留了核心实体、历史行动与关键环境变量,这个摘要就能无缝替换原始交互历史。然而,在诺基亚贝尔实验室与弗吉尼亚大学联合完成的研究中,作者揭示了一个截然不同且令人警惕的现象:经过压缩的长程智能体不仅成功率显著下滑,还会频繁陷入“动作被拒(Blocked Actions)”与“重复探索(Repeated Exploration)”的死循环。智能体明明手握一份看似详尽的总结,却屡屡在环境里“鬼打墙”。
针对这种执行失真,研究团队提出了 TRACE(Trajectory-Relative Agent Context ComprEssion)框架。该方法抛弃了依靠终局任务成败做逆向归因的粗粒度反馈逻辑,转而在发生压缩的“截断边界”处,通过成对的闭环局部续写来直接度量压缩带来的额外执行退化。在下游模型、压缩模型与工具接口全部冻结的前提下,TRACE 仅通过边界局部偏好来优化自然语言压缩指令,成功将执行步数与多轮稳定性拉回接近甚至超越完整上下文的水平。
替代假设的破产:从信息丢失到执行状态迷失
以往关于上下文压缩的研究,大多建立在一个隐式的“可替代性假设”之上:压缩本质上是静态文本的信息蒸馏。只要提取出的摘要保留了任务所需的事实性内容,下游智能体就能据此推断出下一步行动。这也解释了为何大部分既有工作(如 ReSum 或 ACON)倾向于将整条轨迹的最终胜负作为评估压缩好坏的标准——只要最终完成了任务,中间的压缩就被默认为合格。
但论文针锋相对地指出:交互型 Agent 的上下文绝非静态文档,而是一份具备严格时间流向的执行图谱。原始轨迹中未经删节的“动作-观测”序列,不仅承载了事实,更直接锚定了智能体当下的执行坐标——哪些分支已经探明是死胡同、哪些环境状态已被持久化更改、当前到底处于子任务的推进期还是终局收尾期。
当这段鲜活的因果交互被压缩模型改写为平铺直叙的声明性段落(Declarative Summary)后,执行流程的“方向感”被严重抹平了。作者在 AppWorld 等复杂工具调用基准上的诊断实验发现,压缩之后最显著的病理特征不是智能体“遗忘”了目标,而是执行状态迷失(Execution-State Mislocalization)。
具体而言,最近发生且理应指导后续转向的关键事件——比如某次特定的工具参数报错、临时的变量赋值、或是系统刚刚触发的重试限制——在被吸纳进紧凑的摘要后,其对智能体下一步推理的控制力被大幅稀释。智能体开始忽视刚才碰壁的教训,反复发起已被环境拒绝的操作;或者无法准确断定前序任务是否已真正收口,从而在终局边缘徘徊甚至无休止地发起多余的无效探索。更关键的是,这种行为退化导致模型在多次重复运行同一任务时的方差急剧扩大,单次测试也许偶尔能碰巧成功,但代表确定性落地的指标 $\mathrm{Pass}^2$(连续两次运行均成功)却出现断崖式下跌。这证明,仅仅以静态文本保真度或终局结果去衡量压缩,根本无法捕捉智能体在闭环执行层面的失稳机制。
为什么终局反馈无法指导压缩优化?
如果要针对这种执行退化去调优压缩 Prompt,最直觉的思路或许是沿用类似 ACON 的对比学习范式:对比智能体在完整上下文下成功、而在压缩上下文下失败的轨迹,从中总结压缩模型的缺陷。但这项研究明确指出,这种依赖长轨迹终局结果的归因方式存在根本性的因果混淆。
一方面,智能体在后续执行中可能凭借自身的重试机制或随机探索,偶然修复了由一次低劣压缩所引发的执行偏移。此时整条轨迹最终判定为成功,那个实际上充满误导的压缩摘要反而会被视作正面样本;另一方面,长程任务中后期的大模型幻觉或工具偶发故障,常常会导致任务终局溃败,但这种失败完全可能与几十步之前的某次高质量压缩毫无因果关联。把长链条末端的噪音强行反向分摊给每一个压缩截断点,只会让优化算法无所适从。
正是基于这一判断,TRACE 确立了其核心设计哲学:将评估与监督信号严格收束在发生压缩的物理边界上,只度量压缩事件本身给紧随其后的闭环执行所带来的“局部增量负担”。

TRACE 的核心机制:边界局部验证与免解密式偏好对齐
如上图所示,TRACE 整体流程不改变下游执行模型、压缩模型与环境交互接口的任何权重与解码参数,而是构建了一套高度受控的闭环局部反馈机制,用于迭代改进压缩 Prompt。整个框架由三大核心环节协同驱动:
1. 配对闭环执行验证器(Boundary-Local Execution Verifier)
为了从环境固有随机性与智能体自身的偶发波动中,精确分离出“纯粹由压缩诱发的执行退化”,TRACE 在到达压缩预算阈值 $B$ 的截断点处引入了成对对照试验。
设当前截断边界为 $b$。此时环境状态保持冻结,验证器衍生出两条平行的执行分支:
-
未压缩对照分支(PRE):下游智能体直接基于当前未压缩的历史窗口(保留最近的真实动作与观测)向前封闭试跑固定步数 $K$。
-
压缩干预分支(POST):压缩模型基于候选摘要模板生成简短摘要 $s$,替换掉超额历史,下游智能体基于该摘要在同一环境状态下同样向前试跑 $K$ 步。
在试跑过程中,验证器并不去研判任务最终能否做完,而是统计一种具有高度操作性的物理指标——执行阻碍代价 $G(\tau)$。该指标严格量化了两类可直接观测的劣质行为:被环境直接判定非法的被拒操作(Blocked Actions),以及针对同一接口和参数发起毫无意义的重复工具调用(Repeated Exploration)。
通过计算两条分支的期望差值:
\[\Delta G_b(s) = \mathbb{E}\left[G\left(\tau_b^+(s)\right)\right] - \mathbb{E}\left[G\left(\tau_b^-\right)\right]\]系统即可定义候选摘要的局部质量得分:
\[Q_b(s) = -\Delta G_b(s)\]这一设计的精妙之处在于,未压缩分支 $\tau_b^-$ 并不是一个神圣不可侵犯的“最优参考答案”,它仅仅充当了同一环境起点下的方差控制基线。只要压缩分支诱发了额外的撞墙或死循环,$\Delta G_b(s)$ 就会呈现显著正值,从而直接剥离出该摘要对智能体局部决策产生的负面侵蚀。
2. 分层采样与纯偏好 Prompt 提议
在训练阶段,算法首先在交互轨迹中收集出现阻碍动作的压缩截断点,并根据执行错误的类型进行分层抽样,筛选出具有代表性的 12 个关键边界点。针对每一个边界输入 $I_b$,由当前的基线压缩模板采样生成 3 个不同的候选摘要,并通过上述闭环验证器计算各自的 $Q_b(s)$ 分数,遴选出表现最好(诱发退化最少)的胜者摘要 $s_b^+$ 与表现最差的败者摘要 $s_b^-$,最终构造出仅包含 12 对样本的高质量偏好对齐集 $\mathcal{D}_{\mathrm{pref}}$。
随后,一个负责更新 Prompt 的提议模型(Proposer)介入工作。研究团队在这里设立了一条极其严格的隐私防线:提议模型只能看到哪一份摘要胜出,绝对无法看到下游智能体后续的具体交互轨迹、工具调用细节或报错日志。
这一限制杜绝了提议模型针对特定错误案例去生搬硬套、过度拟合某些局部细节的倾向。更重要的是,TRACE 在生成新 Prompt 时显式注入了下游智能体固有的系统级提示词 $H_{\mathrm{sys}}$。研究者注意到,如果不让提议模型感知下游系统的全局设定,基于错误案例反推的自然语言规则往往会与主系统产生严重冲突(例如,提议模型为了避免变量名错乱,武断地在压缩指南中写下“不要保留前序会话的变量”,但这恰恰摧毁了下游环境允许跨代码块继承上下文的基础设计)。通过引入系统感知约束,提议模型生成的 candidate Prompt 既能纠偏压缩要点,又不会打破下游环境的交互语义公理。
3. 基于多轮一致性的终局门控
尽管局部执行验证器提供了高度纯净的短程监督信号,但局部的无障碍并不完全等价于长程任务的一揽子闭环胜率。为了完成闭环落地,TRACE 在验证集上设立了终局门控:将提议出的若干候选 Prompt 置入完整的长程执行流中,对每一个任务独立运行两次,并以严格的联合成功率 $\mathrm{Pass}^2$ 作为最终筛选标准。唯有既通过了局部无退化检验、又能保障宏观端到端确定性复现的压缩 Prompt $P^\star$,才会被固化并部署到最终评测中。
实验结论:稳定性、效率与惊人的跨模型迁移
团队在涵盖复杂多应用 API 调用的长程智能体基准 AppWorld 上进行了严密评估。实验设定了 4096 tokens 的紧凑压缩窗口,每条轨迹最多允许 50 步工具调用。对比的基线涵盖了当前主流的显式上下文管理范式,包括固定模板提示、选择性过滤以及基于长轨迹终局成功/失败反馈进行优化的代表性工作 ACON。
从测试集评测数据中,可以清晰提炼出以下几个关键结论:
首先,在整体任务完成率上,不进行任何压缩的原始长上下文(Full Context)依然代表着上限,所有压缩方案均在一定程度上带来了性能损耗,且任务越复杂,损耗幅度越惊人。然而,在现有压缩基线中表现最优的方案(Prompting-O 的平均准确率为 $71.4\%$,Pass2 为 $59.5\%$),面对极易诱发多轮偏差的困难任务时,其 Pass2 掉到了十分脆弱的水平。相比之下,经 TRACE 优化的压缩模板展现了极强的韧性:在不同难度梯级上,TRACE 的单次运行成功率(Acc.)、双轮重跑一致成功率(Pass2)以及至少成功一次的覆盖率(Pass@2)均系统性刷新了压缩方法的 SOTA。
更具洞察力的指标体现在上下文-执行效率的帕累托前沿上。通常情况下,人们为了压减 Token 开销而做压缩,但压缩带来的“动作受阻与重复探索”往往会导致智能体需要调用更多轮次的工具去试错,最终导致总推理步数暴增,变相抹杀了压减 Token 带来的经济效益。实验数据表明,基线压缩方法往往伴随着执行步数的显著拖长,而 TRACE 在困难任务中,硬生生把平均交互步数拉回到了接近全上下文基线的水平。换言之,TRACE 使得智能体能够用不到一半的峰值 Token 消耗,走出与读过全部历史几乎同样干净利落的最短执行路径。
最后,这项研究呈现出了极富工业落地价值的跨模型零样本迁移能力。团队使用 MiniMax-M3 作为基线模型,在该模型上依托 TRACE 流程演进出最终的自然语言压缩 Prompt。令人意外的是,当他们直接将这套凝结了“防范状态迷失”先验的 Prompt,在不做任何微调和再优化的情况下,原封不动地迁移给完全不同架构的 Kimi-K2.7-Code 模型使用时,不仅全线击溃了基于 Kimi 本身运行的所有压缩基线,其最终的总体准确率与 Pass2 指标,甚至在数值上略微超越了 Kimi 使用未经压缩的完整上下文的基线表现。
这一反直觉的结果进一步强化了作者的核心论点:当上下文过长时,未经处理的原生全历史同样存在信息过载与注意分散的天然缺陷;而一套经过边界局部行为严格校准的结构化压缩指令,实际上为下游模型充当了“认知降噪滤镜”,在保留精准执行路标的同时卸下了无谓的认知负荷。
总结与未来启示
长期以来,长程 Agent 的上下文工程常常陷入一种割裂:要么将其视作纯粹的文本精简问题,追求极致的压缩比而漠视下游的物理世界反馈;要么将其视作强化学习式的黑盒任务,试图用长程轨迹末端的单一标量信号来指导中间复杂的上下文组织,结果在巨大的归因方差中迷失。
TRACE 证明,对压缩质量最真实、最敏锐的度量,不在于最后的胜负,而在于压缩发生之后智能体跨出的那一步是否走得扎实。通过配对闭环试跑将执行阻碍与模型天生方差剥离,并在 Prompt 层面实现精准对抗优化,为在资源受限场景下部署高度可靠的自主智能体提供了一条极其清晰、工程友好的路径。
当然,正如作者在文末冷静指出的,当前的闭环验证器主要针对“撞墙”和“打转”这类显式、可直接在环境中拦截的物理错误,对于那种没有立刻触发工具报错、但静默篡改了任务长期状态的“隐性状态污染”,目前的信号还难以完全覆盖。但毫无疑问,将上下文管理从“静态摘要”推向“以支持下一步动作为核心的动态状态维护”,正在成为下一代可靠 Agent 系统演进的必由之路。