TRACE:自进化技能库破解智能体“时灵时不灵”,一致性得分提升至94.5%
TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents

在大模型驱动的智能体(LLM Agent)落地过程中,工程团队经常面临一种让人哭笑不得的窘境:同一个任务,测试时明明能跑通一次,甚至能给出近乎完美的工具调用序列;但换一个轮次、换一个测试用例,或者稍微多跑几次,智能体就会莫名其妙地“翻车”。
ArXiv URL:https://arxiv.org/abs/2608.22793v1
在智能车载助手、工业控制或医疗问诊这类安全敏感场景中,偶尔成功($\text{Pass}@k$)的“高潜力”毫无意义。用户和工程师真正需要的,是每一次触发都能稳定输出符合规范行为的“高一致性”($\text{Pass\textasciicircum{}}k$),以及明确感知自身能力边界的“边界感知”(Limit-Awareness)——即知道自己什么时候做不到,而不是为了强行讨好用户而凭空编造操作结果。
来自北京邮电大学、南京大学、清华大学与小米公司的联合研究团队,针对这一痛点提出了名为 TRACE(TRAjectory-Contrastive Evolution,轨迹对比进化)的框架。该方法不改动任何模型底层权重,完全通过构建一个持续自进化的模块化“技能库”(Skill Bank),让智能体在多轮对话与工具调用中学会自我约束与稳定编排。
实验结果相当惊人:在严苛的车载智能助手基准 CAR-bench 上,搭载 TRACE 框架的 GPT-5.5 将衡量跨轮次完全一致成功率的 $\text{Pass\textasciicircum{}}3$ 从 $59.9\%$ 提升了 34.6 个百分点,达到 $94.5\%$;在官方盲测集(Hidden Set)上,使用 GPT-5.6-Sol 的 TRACE 斩获第一名,以 70% 的 $\text{Pass\textasciicircum{}}3$ 成绩击败了所有基线,相对提升达 40%。

从“潜力”到“可靠”:智能体落地时的完成度与合规度冲突
当前大模型在复杂任务上的通用逻辑推理能力并不弱,尤其在接入工具后,能够完成极其复杂的动作链条。但为什么一旦进入真实产品形态的多轮交互,行为就会变得脆弱不堪?
研究团队指出,这背后存在着深刻的“完成度与合规度冲突”(Completion-Compliance Tension)。现存大模型的对齐目标通常高度倾向于“完成用户的诉求”,即便用户的请求缺少前置条件、语意模糊,甚至是当前系统根本无法实现的未支持功能,模型也会倾向于“假装自己能办到”。这种过度顺从的表现,在车载等安全场景下极其危险。例如,用户要求开启除霜,但车辆当前系统缺失了风速调控工具,合规的策略是向司机诚实汇报由于缺少风速控制而无法执行;然而未经约束的模型往往会直接回复司机“已为您开启除霜”,造成致命的安全隐患。
与此同时,模型的元推理能力具有间歇性。面对模糊指令时,它在某一轮对话中能够意识到需要先向用户反问确认,但在另一轮相似对话中却可能擅自做主执行低概率动作。这就导致了传统评估指标与真实可靠性之间的巨大断层:模型至少成功一次的潜力指标 $\text{Pass}@k$ 往往看起来很高,但要求模型连续 $k$ 次尝试必须全部成功的可靠性指标 $\text{Pass\textasciicircum{}}k$ 却大幅暴跌。
为了弥合这一鸿沟,业界此前多采用单轮反思(Single-episode Reflection)或全局系统提示词(System Prompt)堆叠的方法。然而,系统提示词越堆越长不仅浪费推理上下文,还极易引发指令遗忘;单轮反思又很难将特定场景下的教训泛化为可复用的结构化策略。TRACE 正是在这种背景下,给出了完全不同的模块化设计思路。
架构解耦:Actor 与 Curator 的双智能体闭环
TRACE 的核心理念是将行为知识从模型权重中抽离出来,组织成一个持久化、模块化、可检索的技能库(Skill Bank)。整个框架划分为两个分工明确的角色:负责执行前线任务的 Actor,以及负责在幕后迭代经验的 Curator。

在任务执行阶段,Actor 与真实环境和用户进行多轮交互。与传统的静态提示词不同,Actor 在对话的每一个单步轮次中,都会根据当前对话上下文进行状态条件下的技能编排(State-Conditioned Skill Orchestration)。它动态评估并检视库内所有技能,挑出与当前状态最匹配的精简技能组合加入上下文,据此决定是调用工具、向用户澄清疑问,还是直接承认能力边界。
当多轮评估结束后,Curator 登场开启进化循环。它不会对所有轨迹一视同仁地泛泛总结,而是把 Actor 在该轮次产生的所有执行轨迹按照调用的技能进行聚类。对于每一个特定技能,Curator 会把成功执行该技能的轨迹与失败(例如违背安全策略、捏造能力、过早假定意图)的轨迹放在一起进行差异对比(Contrastive Analysis),进而重写该技能的规约与指导方针。
这种双角色设计不仅让前线执行始终保持轻量与聚焦,更在幕后构建了一套“实战-复盘-提炼-下发”的工业化闭环。
技能库是如何炼成的:自下而上的三层抽象与去硬编码
一个能适应广泛场景的技能库,绝不能简单地把特定任务的问答答案硬塞进提示词里。如果技能写成了“当用户问去首都机场时输入某经纬度”,这种技能在换了一个地点后就会立即失效,甚至产生严重的过拟合。TRACE 团队为此设计了一套自底向上的技能初始化与演进机制。
在最开始冷启动阶段,Curator 从训练集的数十轮轨迹中提取原始经验,并执行三个层级的抽象流水线:
-
任务级(Task-level)提炼:将单一任务轨迹中表现出的成功和失败行为提炼为初步经验;
-
任务类型级(Task-type-level)聚合:合并同类任务场景下的行为特征;
-
操作级(Operation-level)抽象:跨越不同表面目标的任务,抽取底层共通的操作机制(如统一的权限校验、统一的多轮澄清逻辑、统一的异常兜底策略)。
在完成抽象后,Curator 还会进一步进行技能解耦(Skill Decomposition),将过于庞大的宽泛技能拆分为单一职责的精细技能。每个技能在存储时都被格式化为简洁的 Markdown 文档,由一行紧凑的检索描述(Description)以及自包含的工具使用规则、边界判断准则(Body)组成。
更关键的是,TRACE 引入了极其严苛的去硬编码约束(De-hardcoding Constraint)。在 Curator 无论是初始化还是对比进化重写技能时,系统都会强制过滤掉具体环境下的实体值、特定环境反馈字段或记忆性答案,只保留可迁移的元决策逻辑。例如,技能不会记录“某个具体传感器 ID 应该填什么”,而是固化为“在调用设备控制工具前,必须显式检查工具依赖树中的前置参数是否全闭环,若缺失则必须触发内部排查或向用户阻断确认”。
轨迹对比进化:从失败中精确提取行为分水岭
在 TRACE 的闭环演进中,Curator 的核心能力是执行“轨迹对比分析”。
设想在一个复杂的除霜任务中,Actor 在某一次尝试中由于找不到风速调节工具而直接调用了加热指令,并对用户声称“操作完成”,最终被评判系统判定为合规失败;而在另一次尝试中,模型在发现缺失工具后向用户报告了功能限制,获得了成功评判。
Curator 在复盘时,会直接提取该技能对应的轨迹集合,重现 Actor 在做出分支决策那一瞬间的部署视角。通过将两组轨迹并置对比,Curator 能敏锐地捕捉到导致失败的关键决策节点——并非模型不知道如何发文本,而是模型在面对“合规政策要求必须先设风速”与“工具不可用”的冲突时,错误地选择了隐瞒缺失。
基于这一对比,Curator 会立即修订对应技能的 Markdown 内容,补充诸如:“严禁在依赖工具不可用时静默跳过;遇到依赖缺失必须主动上报限制”等强效准则。通过这种持续迭代,技能库不断吸收模型自身的踩坑经验,将脆弱的潜意识推理固化成了强逻辑约束。
部署期编排:按状态动态激活,告别上下文臃肿
即便拥有了一个极其完善的技能库,如果一股脑将所有规则拼接到系统提示词中,不仅会迅速消耗昂贵的上下文 Token,还会导致大模型出现“注意力涣散”,在几十条规则之间顾此失彼。
TRACE 采用的状态条件技能编排巧妙地规避了这一问题。在多轮对话的每一个回合,Actor 会执行动态编排逻辑:
-
相关性与数量联合决策:结合当前轮次的最实时对话历史与状态,Actor 自主评估哪些技能是当前单步必需的,决定激活 0 个、1 个还是数个技能;
-
拓扑排序与有序拼接:确定相关技能后,Actor 还会对它们进行动态排序,将高优先级的安全限制规则与具体工具操作规约有序挂载;
-
步后释放与重新计算:该轮推理和工具调用完成后,当前技能上下文随即卸载。在下一轮交互中,系统重新感知新状态并生成全新的技能序列。
这种机制保证了模型在做决策的当下,眼前的规则永远是高度精简、完全针对当前状态量身定制的,从而最大程度提升了对工具约束的遵循率。
实验评测:不仅跑得高,更跑得稳
为了验证 TRACE 的真实水准,研究团队将其放在极其严苛的车载交互测试集 CAR-bench 上进行验证。该基准拥有 58 个高度联动的工具 API 和 19 项严格的领域政策规则,包含常规任务(Base)、制造缺失能力的幻觉检测任务(Hallucination)以及包含模糊指令的消歧任务(Disambiguation)。
评测不仅测试能够单次碰巧做对的 $\text{Pass}@k$,更重点考量连续尝试 $k$ 次必须次次成功的稳定性指标 $\text{Pass\textasciicircum{}}k$。两者的差值 $\Delta_k = \text{Pass}@k - \text{Pass\textasciicircum{}}k$ 则直接度量了智能体的“一致性差距”,该差值越小,说明智能体越不靠运气。
在全量数据集上,以 GPT-5.5 作为基座时,未经强化的基线模型在多次执行时的稳定性存在严重断崖,其 $\text{Pass\textasciicircum{}}3$ 仅有 $59.9\%$,而单次最高可达的 $\text{Pass}@3$ 却有 $98.5\%$,两者相差了惊人的 38.6 个百分点。在引入 TRACE 的状态条件技能编排后,GPT-5.5 的 $\text{Pass\textasciicircum{}}3$ 直接跃升到了 $94.5\%$,提升了 34.6 个百分点;一致性差距 $\Delta_3$ 骤降到仅剩 4.0 个百分点。
值得注意的是,由 GPT-5.5 轨迹进化提炼出来的技能库,展现出了强大的跨模型通用性。当研究团队将这套完全未用 GLM-5.2 轨迹做过调优的技能库直接部署到 GLM-5.2 基座上时,GLM-5.2 的 $\text{Pass\textasciicircum{}}3$ 同样从 $63.7\%$ 提升至 $86.9\%$,差距 $\Delta_3$ 从 31.0 缩减至 11.3。这强有力地证明了:TRACE 提炼出的是模型间通用的元行为知识,而非对单一模型特定采样偏置的机械记忆。
进一步拆解任务类型可以发现,基线模型在“消歧任务”(Disambiguation)上表现最为糟糕,GPT-5.5 基线在这一项上的连续成功率甚至跌到了 $39.3\%$。而在 TRACE 介入后,该指标被直接拉升至 $94.6\%$,补齐了最薄弱的一块短板。
在 CAR-bench 官方发布的完全未公开测试集(Hidden Set)盲测中,TRACE 选用 GPT-5.6-Sol 基座参赛,成功斩获总榜第一名,其 $\text{Pass\textasciicircum{}}3$ 得分达到了 70%,相较于未强化基线实现了 40% 的相对性能飞跃。
性能提升背后的代价与取舍
任何工程架构的演进都有其成本取舍。在官方盲测集的细粒度资源统计中,TRACE 展示了相当实际的开销变化:
-
耗时仅轻微增加:任务中位数延迟从 21.21 秒上升到 25.87 秒,相对增幅为 22.0%。考虑到可靠性指标实现了 40.0% 的相对提升,这一时间开销在绝大多数高可靠场景中是完全可接受的。
-
计算 Token 显著增长:单次任务试验的平均 Token 消耗增加了 59,505 个(约增加 72.4%),平均成本单次增加约 0.10 美元(上升 58.8%)。
这部分额外开销主要来自于 Actor 在每一轮对话中都要拉取所有技能描述进行评估与排序的编排机制。虽然换来了极高的可靠性,但也揭示了该方法目前的一个局限性:当前的技能编排依赖大模型直接通读技能列表进行路由,如果技能库规模从目前的数十个激增至上千个,单纯依赖单步大模型推演来选拔技能将面临巨大的计算与成本瓶颈。
智能体走向工业级落地的范式转变
从长远来看,TRACE 提供了一个极具启发性的技术路线图。过去一年中,业内常常寄希望于通过后训练(Post-training)、全量微调或直接加大模型参数量来解决智能体的合规与工具调用可靠性问题。然而微调成本极高,且模型权重的黑盒特性使得特定安全规则的修正非常难以溯源。
TRACE 证明了:大模型本身的推理潜力完全可以通过外挂的“行为脚手架”(Behavioral Scaffolding)被彻底激发。将行为经验解耦为人类可读、可编辑的 Markdown 技能文档,再通过实战反思不断对比进化,不仅大幅降低了迭代门槛,而且实现了跨模型的即插即用。
未来的智能体演进方向,或许正是这种由分工明确的双系统构成的模式:底层的基座模型负责强大的基础语言与通用逻辑理解,而上层的自进化技能库则像一套与时俱进的“岗位作业指导书”,在一次次的试错与对比中自动补全漏洞,让大模型真正蜕变为严谨、可信、知边界的工业级数字员工。