不是改造Agent,而是进化知识库:大模型自我改进的新范式

Knowledge-Centric Self-Improvement

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

当前大语言模型驱动的自主智能体(Agent)研究,正经历一场关于“自我改进”(Self-Improvement)的探索热潮。为了让系统在面对复杂环境时越来越聪明,主流方法几乎都将智能体本身视为唯一可迭代演化的实体:要么利用算法反复调优提示词(Prompt)与工作流,要么搜索更优的框架结构(Harness Search),甚至让模型自我改写底层运行代码(如 Darwin Gödel Machine 等方案)。

ArXiv URL:https://arxiv.org/abs/2607.19592

然而,这种“以智能体为中心”(Agent-Centric)的演化路线正面临严峻的工程与理论瓶颈。一个持久存活、持续吸纳经验的单一智能体,必须处理成百上千个任务中产生的大量局部技巧、冗余信息乃至相互矛盾的经验规则。随着代码和提示词越来越臃肿,以往积累的有效行为往往会被后续冲突的更新稀释,在旧任务上的能力频繁发生退化,同时每一次针对具体模型的微调也极难迁移到其他架构中。

最新研究提出了一个截然相反的互补范式:以知识为中心的自我改进(Knowledge-Centric Self-Improvement)。在这个架构中,核心假设被彻底颠倒——执行具体任务的 Agent 不再是长期维护、日益臃肿的复杂实体,而是保持通用、无状态、用完即弃的“临时工人”;整个系统中唯一持续沉淀、演化与优化的实体,是一个经过精心策展的共享知识库(Curated Knowledge Base)。实验证明,仅靠极度简化的通用 Agent 搭配这套知识策展机制,就能在抽象推理、代码编写与终端操作等基准测试中击败复杂的智能体演化系统,同时大幅降低运行成本,并展现出优异的跨任务与跨模型家族迁移能力。

智能体中心的瓶颈:越改越重与灾难性遗忘

以往探讨 Agent 自我提升时,研究者通常预设系统应该像一个不断成长的个体。每解决一个问题,Agent 就会往自己的长短期记忆中增加一条规则,或者修改自身的 System Prompt。在更激进的系统进化方案中,Agent 还会递归地优化自己的执行代码或工具调用编排。

这种模式在面对同分布、小范围的任务时往往立竿见影,但随着任务多样性的增加,其维护成本呈指数级上升。最典型的问题在于经验冲突:在任务 A 中有效的试探性假设,移植到任务 B 中可能就是致命的陷阱。如果让单一 Agent 的提示词或代码直接吸收所有教训,这些分散的局部经验会形成高度脆弱的补丁网络。智能体为了兼容过往的历史记录,其上下文空间会被无关经验挤占;而为了适应新场景所做的局部修改,又极易诱发在既有场景上的灾难性遗忘。

此外,智能体中心方案得到的“提升”往往与特定 Agent 的框架、调度机制甚至特定参数规模的底层模型紧密绑定。如果底层大模型发生版本更迭,或者工程架构重构成新的多智能体系统,过往通过漫长演化得到的 Agent 变体几乎无法平滑复用,此前消耗的所有算力成本也随之归零。

知识中心的视角则提出:进化的载体本就不应该是执行者本身,而应该是提炼出来的客观事实、约束与因果规律。人类科学的演进从来不是依赖某个长生不老、大脑不断扩容的单个科学家,而是依靠数代学者通过同行评议,把试错经验沉淀为可被任何人阅读的论文、专著与操作规范。将这一逻辑移植到大模型系统中,便构成了以知识为中心的自我演进基石。

三阶段知识策展协议:如何从杂乱尝试中萃取真理

为了彻底隔离知识与智能体架构的影响,该框架将智能体严格限制为瞬时、无私有记忆、无角色特化、无动态编排的纯净实例。每一个新 Agent 在启动时,只接收当前任务的描述、基础工具接口以及由知识库分发的引导数据包(Seed Bundle)。任务完成后,该 Agent 立即被销毁,只留下其执行轨迹中的事实记录。

让这套机制运转的核心,是一套结构化的三阶段知识策展协议(Three-Stage Curation Protocol)。它不是简单的历史日志检索(RAG),也不是单智能体事后的自我反思(Self-Reflection),而是通过类似学术同行评议的机制,将分散的执行痕迹提炼为高阶认知。

ARC 抽象推理任务上的知识提炼流程示例

首先是任务级论坛(Task-Level Forum)。当多个独立 Agent 分别尝试完成某一项具体任务后,它们会在该任务专属的讨论板块中发帖。每个 Agent 必须将自身的执行过程拆解为基于客观证据的局部主张(Evidence-Grounded Claims),明确陈述哪些操作起到了正面效果、哪些尝试直接报错、哪些环境边界条件得到了确认。同伴 Agent 随后对这些主张展开质询与交叉校验,使用自己环境中的观测数据支持或反驳对方的论点。这一阶段的核心目标是保留存在竞争关系的局部假设,并剔除偶然成功或逻辑错误的虚假归因。

其次是跨任务论坛(Cross-Task Forum)。局部任务中的有效经验往往带有特殊的局部假象,跨任务论坛的作用正是打破孤岛,将各个任务级论坛中幸存的高置信度主张汇集到全局讨论区。在这一层面上,系统开始检验某一任务总结出的约束或方法论在更广泛的同类任务中是否反复出现。如果一个原则在某个任务中被证实、而在另一个任务中直接导致了崩溃,这种显式分歧会被跨任务论坛精准捕获并打上适用范围标签,而非草率地进行平滑处理。

最后是知识提炼(Distillation)。提炼阶段由专门的蒸馏大模型执行,但其目标并非泛泛的文本摘要,而是一次极其严格的定向筛选。蒸馏过程要求丢弃所有缺乏触发条件、语焉不详的宽泛建议,只保留高度可操作、有据可查、边界清晰的结构化知识单元。最终,系统会输出包含六大显式字段的知识数据包:

这些提炼后的知识包会在下一代全新的无状态 Agent 启动前注入其上下文。新 Agent 并不清楚前代同伴的存在,但由于站在了经过多重博弈与蒸馏的知识基座上,它们得以直接规避已知雷区,直奔正确解法。

Terminal-Bench 2 任务上的知识提炼流程示例

多维基准评测:胜率与成本的双重突破

为了全面检验该协议的有效性,研究团队跨越了三个截然不同、极具挑战的真实任务域进行评测:以 ARC-AGI-1 和 ARC-AGI-2 为代表的抽象视觉逻辑推理;以 Polyglot 和 SWE-bench Pro 为代表的多语言代码生成与大型软件工程仓库修复;以及以 Terminal-Bench 2 为代表的真实容器化 Linux 终端系统操作。

对比基准涵盖了两类最强大的现存方法:一类是以 Darwin Gödel Machine(DGM)、HyperAgents 以及 Meta-Harness 为代表的复杂智能体演化系统;另一类则是以优化通用 System Prompt 为核心的提示词自我优化框架。

实验表明,在底层统一采用 Claude 3.5 Haiku 等轻量级模型的前提下,搭载了知识策展协议的无状态 Agent 在 ARC-AGI-1、ARC-AGI-2、Polyglot 以及高难度的 SWE-bench Pro 上均取得了最高的任务解决率(Solve Rates)。而在机制更为严苛、包含真实系统状态与测试验证的 Terminal-Bench 2 中,这一纯粹依靠通用 Agent 的系统也展现出了与最先进的专用代码 Agent 匹敌的强悍表现。

更为关键的收益体现在经济成本上。智能体演化类方法通常需要耗费数倍的计算资源进行昂贵的工作流探索、代码变异与全量重测,其解决单个任务的平均美元成本居高不下。相比之下,知识中心方案通过论坛式的结构化信息交换与高效提炼,避免了后代 Agent 重复探索死胡同的盲目试错。在多数对比基准中,知识策展系统不仅准确率更高,其总体 API 消耗成本还显著低于传统的智能体演化基线。这种“效率与精度双重提升”的表现,在帕累托前沿(Pareto Frontier)上实现了明显的向外推移。

对比提示词优化框架的结果同样发人深省。直接优化宏观提示词的方案在面对高度异构、长程推理的复杂编码和终端任务时收效甚微。原因在于,提示词优化器本质上是在打磨一个泛化的“行动策略”(Policy),它无法向模型注入应对具体工具漏洞、隐藏环境依赖和特定报错特征的“知识资产”。而知识策展提炼出的正是这些微观但致命的环境真相,直接填补了通用策略与落地执行之间的信息鸿沟。

知识资产的独立价值:零样本迁移与跨模型泛化

该研究中最具深远意义的发现,在于经过策展提炼出的知识库本身具有极强的独立存在价值。当系统完成既定轮次的知识沉淀后,脱离原生成流程的知识资产被直接提取出来,测试其在完全未见任务(Held-Out Tasks)以及不同大模型家族之间的通用性。

在针对未见任务的零样本(Zero-Shot)泛化测试中,研究者将历经多代累积的知识包直接挂载给面对全新题目的全新 Agent。结果显示,吸收了既往知识的 Agent 在陌生问题上的初次尝试成功率,大幅超越了没有任何先验知识的裸机表现。从 ARC-AGI 任务中抽象出的网格变换几何规律,以及在 Terminal-Bench 中提炼出的环境变量预置规则与缺失文件侦测手段,被证明具备深刻的跨任务通用性。

更突破传统认知的是跨模型家族迁移实验。以往 Agent 系统优化出来的提示词或微调代码,高度依赖底层模型的特定倾向,换一个模型往往直接失效。研究团队使用 Anthropic 系列模型生成的知识数据包,直接喂给完全不同技术路线与参数体系的模型(如 OpenAI 的 GPT-4o-mini 或新一代推理模型),后者不仅毫无理解障碍,其任务解决率与推理效率也获得了立竿见影的提升。

这一现象提供了强有力的证据:经过多智能体争议、反驳与蒸馏沉淀下来的产物,已经脱离了特定 LLM 的语言偏好或偶然幻觉,逼近了问题领域本身的客观规律与通用解题元逻辑。这种知识形态具备极高的便携性与可审查性,人类工程师可以清晰地打开这些知识数据包,逐条检视哪些假设被证伪、哪些陷阱被标记,而不再面对一个晦涩复杂的演化代码黑盒。

重塑智能体生态的技术演进图景

将自我改进的锚点从“智能体”移向“知识库”,为构建自主复杂系统提供了一个全新且更为务实的架构范式。

长期以来,业界在设计自进化系统时往往陷入“制造全知全能超级 Agent”的思维定势,不断将复杂的规划器、树搜索、递归自我修改模块塞进单个智能体的运行循环中。这种做法使得系统的调试成本极高,任何一次小改动都可能引发蝴蝶效应。而知识中心的范式表明,智能体层面的架构极简并不阻碍系统总体智能的跃升,系统的进化瓶颈或许并不在于执行者代码写得多么繁复,而在于它所调用的信息资产经过了何种质量的沉淀与组织。

这一范式为未来构建开放式、协作型的多模型生态铺平了道路。在工业级应用中,我们不再需要为每一次模型升级重新训练或演化专用 Agent,而是可以维护一个跨任务、长效存活的中央知识底座。性能各异、擅长不同领域的大模型或专用小型模型,都可以作为即插即用的无状态 Worker 接入这一底座:强推理模型可以参与高层次的争议仲裁与知识蒸馏,高性价比的轻量模型则利用提炼好的知识包高效执行落地任务,并源源不断地带回现场观测数据。

随着任务跨度的进一步拉长,知识策展机制同样具备向下解构复杂子任务的扩展潜力。在长程软件开发或科学发现等大型工程中,各子任务模块之间的经验如何通过结构化机制完成沉淀与流转,将成为衡量自治系统成熟度的核心尺度。把繁复与无序留在外部知识的辩论与萃取中,让执行端始终保持轻盈与专注,这或许是大模型系统走向长期自主演化的关键一步。