DisCo:蒸馏千个开源仓库为技能库,科研Agent性能提升134%

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

DisCo:蒸馏千个开源仓库为技能库,科研Agent性能提升134% 论文图示

在机器学习领域,让大语言模型自主承担从构思假设、编写代码、配置环境到复现论文乃至参与竞赛的完整研发流程,即“AI for AI”(AI4AI)或自主科研智能体,正迅速从概念验证演变为前沿工程探索。然而,任何实际部署过科研智能体的团队都会频繁遭遇同一种尴尬:哪怕给智能体配上了当下最强大的前沿模型,并结合了极其复杂的调度与反思脚手架,智能体依然常常卡在极其平庸的技术细节上。它可能清楚知道应当使用某种前沿的微调策略,却在调用第三方开源库时写错了一行 API 参数;或者因为不熟悉底层张量维度的默认对齐方式,在错误的训练循环中耗尽了所有的推理与计算预算。

ArXiv URL:https://arxiv.org/abs/2609.02749

问题的根源不在于模型缺乏通用的逻辑推理能力,也不在于调度脚手架不够严密,而在于当前自主科研系统的结构中缺少了一块关键拼图——领域专属的操作性知识(Operational Knowledge)。北京智源人工智能研究院、香港理工大学、中国人民大学与中国科学技术大学的研究团队在近期工作中指出了这一结构性缺失,并提出了名为 DisCo 的技能驱动型科研智能体框架。该框架将开源社区中庞大但非结构化的代码仓库,自动化提炼为结构化、可复用且经过严格执行验证的技能资产,并构建了包含 5000 多个验证技能的 AREX-Skill 库。在底座模型、调度框架与下游执行预算完全受控的条件下,配备该技能库的科研智能体在机器学习研发基准 MLE-bench 上的综合表现取得了 134.3% 的大幅提升,在复现学术成果的 PaperBench 上亦提升了 34.4%。这一成果表明,决定自主科研上限的关键往往不是漫无目的的试错,而是让智能体在启动任务时就已经拥有可直接调用的成熟工程经验。

自主科研智能体中的可复用技能层

科研智能体缺失的第三块拼图

主流的自主科研系统通常被抽象为双层结构:一层是提供感知、推理、代码生成与规划能力的大模型底座 $M_{\theta}$,另一层则是负责任务编排、环境交互、长短期记忆维护和循环修正的软件脚手架 $H$。大模型底座随着前沿模型的迭代而逐步增强,脚手架工程也在不断吸收软件开发中的最佳实践。但面对高门槛的机器学习研发任务时,这两者之间暴露出明显的断层。

大模型在海量语料上完成预训练,其蕴含的领域知识广泛但固化,对于特定版本代码库的具体函数调用、参数约束和典型报错往往存在大量幻觉;而软件脚手架只定义了任务如何流转与执行,其本身并不包含具体的专业领域知识。这就迫使智能体在面对陌生的框架与数据集时,必须依靠反复的试错来摸索正确的运行方式。在真实的计算环境中,一次错误的超参数设置或数据流水线配置,往往需要在 GPU 上空转数小时甚至耗尽全部计算配额后才暴露出来。这种试错成本对于自动化系统来说是极其昂贵的。

所谓的“操作性知识”,正是填补“知道一种方法”与“把这种方法做成功”之间鸿沟的实践经验。在机器学习研发中,它涵盖了哪种模型结构契合当前数据类型、特定库的 API 该如何正确串联、分布式训练如何避免显存溢出,以及特定评估脚本有哪些隐蔽的陷阱。这类知识在开源代码库的测试用例、示例脚本、文档以及论文的技术附录中随处可见,但它们是以面向人类开发者的叙述方式写就的,不仅篇幅庞大,而且充满了各种隐含假设与版本依赖,根本无法在智能体执行任务时一次性灌入有限的上下文窗口中。

因此,研究团队重新形式化了科研智能体的系统构成,将其定义为包含三元组的系统:

\[\mathcal{A}_{\mathrm{res}} = (M_{\theta}, H, \mathcal{K})\]

其中 $\mathcal{K}$ 即代表独立于底座模型与调度逻辑的操作性知识层。以往获取这层知识的方式极其依赖人工专家:由资深算法工程师研读开源项目、调试代码、手工编写接口文档和调用脚本,再将其注入提示词。这种人工封装方式成本高昂,且无法跟上开源生态快速演进的步伐。DisCo 框架的核心使命,就是将非结构化的陈述性材料,全自动、规模化地蒸馏为智能体随时可加载、可执行的标准操作技能。

模块化技能与渐进式展开图谱

为了让智能体能够轻量、高效地消费操作性知识,DisCo 借鉴了技能(Skill)的标准化表征规范。一个被封装好的技能单元 $S$ 由三个互补的层次组成:

\[S = (\texttt{SKILL.md},\ \texttt{references/},\ \texttt{scripts/})\]

最外层的 SKILL.md 是知识的交互接口,用高度精炼的说明定义了该技能的应用场景、触发条件、核心执行流程以及已知的避坑指南;中间层的 references/ 构成了知识的底层基质,保存着从原始代码库或文档中提炼出的关键证据、底层逻辑和参考上下文;最内层的 scripts/ 则是可执行接口,将原本繁复且容易写错的命令行调用、环境检查或数据预处理流程封装成稳定的可执行脚本。

如果仅仅是将技能打散存储,面对海量的开源项目,智能体依然会在检索阶段迷失方向。DisCo 进一步将单一来源提炼出的一组技能组织为有向图谱形式的技能图 $\mathcal{G} = (\mathcal{S}, \mathcal{L})$。在这个图谱中,入口节点负责概述整个项目的能力范围并承担路由职责,子节点对应于该工具链下的具体功能模块(如数据加载、模型微调、推理加速、评估检查等),边集 $\mathcal{L}$ 则显式刻画了技能之间的调用依赖、前后置顺序与组合关系。

这种结构直接支撑了“渐进式展开”(Progressive Disclosure)机制。在任务初始阶段,智能体只需要阅读最顶层的入口摘要,其占用的上下文极其微小;只有当规划流程推进到需要执行某个具体步骤时,智能体才会沿着图谱边关系展开对应的子技能与参考脚本。这彻底化解了“领域工程细节极其庞杂”与“大模型上下文预算极其宝贵”之间的物理冲突,使系统在维持数千个复杂技能的前提下,在运行时刻仅保持数十到数百个 Token 的必要操作上下文。

DisCo 生成与使用操作性知识的架构图

双向提炼机制与严格闭环验证

DisCo 框架将智能体的行为解耦为两种模式:构建技能的“创建者模式”(Creator Mode),以及消费技能的“研究者模式”(Researcher Mode)。这两种模式共享完全相同的底层模型与脚手架,却通过闭环知识流形成了互补的自进化闭环。

在创建者模式下,无论面对何种输入,DisCo 的技能蒸馏流水线都遵循统一的四阶段范式:

\[z \xrightarrow{\ \mathsf{scope}\ } \mathcal{Q} \xrightarrow{\ \mathsf{ground}\ } \mathcal{X} \xrightarrow{\ \mathsf{construct}\ } \tilde{\mathcal{G}} \xrightarrow{\ \mathsf{verify}\ } (\mathcal{G}, R)\]

其中 $z$ 代表触发蒸馏的初始锚点,$\mathcal{Q}$ 为圈定的能力范围,$\Xcal$ 为从原始来源中抽取的坚实证据,$\tilde{\mathcal{G}}$ 为组装出的候选技能图,而最终被库接纳的图谱 $\mathcal{G}$ 必须伴随完整的构建与验证日志 $R$。根据启动锚点的不同,蒸馏过程分为两类路径:

第一类是任务无关的预先蒸馏(Task-agnostic Distillation)。此时锚点为一个特定的开源代码库或前沿技术论文。系统首先深入解析代码组织架构与核心组件,识别出值得对外暴露的工程能力;随后从源码、官方测试例、文档与配置文件中抽取事实依据;接着将高频执行动作封装为参数化脚本,组装成候选技能图;最后进入至关重要的验证环节。

第二类是面向具体任务的即时蒸馏(Task-oriented Distillation)。此时锚点是智能体当前面临的具体研究难题(例如一个 Kaggle 式的机器学习竞赛题目)。系统会先对目标问题进行解构,分析当前智能体能力图谱中欠缺哪些关键环节,然后定向发起网络检索与代码挖掘,搜集能够填补这些能力鸿沟的第三方实现,将其即时提炼为面向该任务类别的候选技能图。

值得注意的是,DisCo 的蒸馏机制与常规的大模型文本摘要有着本质区别。纯文本摘要无法保证代码与操作建议的有效性,而 DisCo 引入了严格的闭环执行验证机制。系统在将任何候选技能并入正规技能库之前,必须在沙箱环境中利用原生测试集、CLI 接口检查、微型数据集冒烟测试或基于断言的验证用例对其进行全量校验。一旦测试用例触发报错,系统会立即启动局部代码修复机制并重新运行验证。如果某项功能在多次尝试后依然存在无法解决的依赖或环境问题,该瑕疵将被白纸黑字地记录在构建档案 $R$ 中,而绝不向智能体隐瞒。正是这道带有真实运行信号的防线,杜绝了将包含严重幻觉的代码指令伪装成“技能”输入智能体的风险。

AREX-Skill 技能库的体系结构与路由器

AREX-Skill:规模化知识库与分层路由

利用任务无关的自动化蒸馏流水线,研究人员在开源机器学习生态上进行了大规模扩展,最终构建了 AREX-Skill 技能库。在当前公开的基准版本中,该库系统性地涵盖了 1000 个在学术界与工业界被广泛使用的机器学习开源仓库。整个构建过程调用了具备深度推理能力的模型(包括 GPT-5.5 与 GPT-5.6-sol 的高推理档位),平均每个仓库的技能挖掘与验证开销约为 40 美元。

最终沉淀下来的仓库技能库包含 5353 个通过沙箱验证的技能,被组织在一个两层的分类体系中:顶层划分为 20 个主要技术领域(例如大语言模型微调、视觉生成、分布式部署、向量检索等),底层细分为 178 个具体的能力家族。由于复杂的代码仓库往往同时具备多种属性(例如一个框架既提供分布式训练调度,又提供量化评估工具),AREX-Skill 允许一个代码仓库根据功能分别挂载到不同的能力路径下。统计显示,在 1000 个仓库中共有 700 个被归类到了多个能力家族中,形成了 2209 个精确的映射分支。

为了避免智能体在面对海量技能时无从下手,研究团队构建了基于两层索引的全局路由器。当研究者模式下的智能体开始执行任务时,它首先查阅路由器的顶层领域描述,根据当前研发阶段匹配到最相关的一两个能力家族,接着拉取对应代码库的入口图谱,最终仅载入具体任务步骤所需要的一两份 SKILL.md 或底层执行脚本。此外,针对论文复现任务,研究团队还通过相同范式从 153 篇经典前序论文中提炼出了 636 个模块化论文技能,作为方法层面的操作性储备。

基准实测:严格受控下的性能跃升

为了客观衡量这层“操作性知识”的真正威力,研究团队设计了极为严格的对照实验。实验不仅固定了最底层的推理模型(统一采用 GPT-5.5 配合最高档位的推理规划),而且固定了完全一致的执行脚手架(基于 Codex 构建的科研环境)。最为关键的是,智能体在下游执行实际科研任务时的交互轮数、运行时间与计算预算,在“装备技能”与“未装技能”两组对照实验中被严格配准,技能的蒸馏与构建开销完全算作预先投入,不计入运行时的下游预算。

在这种排除了一切底座升级和提示词技巧干扰的纯净设置下,研究团队在四个代表性的前沿基准上检验了 DisCo 的表现:

  1. MLE-bench(机器学习工程全集评测):包含 75 个真实的 Kaggle 式端到端机器学习竞赛任务,涵盖从易到难的三个梯队。在统计算法表现的核心指标“任何奖牌获取率”(Any-Medal)上,配备技能的智能体取得了 134.3% 的跨越式相对增长。仔细分析消融轨迹可以发现,未配备技能的 Baseline 常常在数据加载格式、评估指标计算方式或模型训练初期因为语法与 API 错配陷入长达数小时的报错死循环,最终耗尽预算;而搭载了面向任务技能图谱的 DisCo,从第一轮交互起就能调出规范的数据清洗脚本与基线训练管线,直接跳过探索陷阱,将有限的算力聚焦于特征工程与超参数精调。

  2. PaperBench(顶会论文全流程代码复现):要求智能体根据最新被录用学术论文的文本,从零构建代码并完全复现其核心实验结果。在此类极其严苛的基准下,配备前序论文操作技能的 DisCo 取得了 34.4% 的相对性能提升。这证明了将经典论文的底层网络结构、训练细节与评估流水线固化为可复用模块,能大幅降低前沿方法复现中的断点概率。

  3. FrontierCS(前沿跨领域算法研究)与 PassNet(底层高性能算子优化):在涵盖更广泛计算机科学问题求解的 FrontierCS Agent Track 上,DisCo 录得了 9.2% 的提升;而在专注深度学习编译器 FX 图重写与 Triton 高性能算子编写的 PassNet 基准上,DisCo 取得了 14.0% 的性能增益。在这类对底层代码语义与硬件特性极其敏感的任务中,带有正确语法模式和调试断言的操作技能,有效遏制了大模型在底层代码编写中的幻觉扩散。

各项实验数据一致表明,当大模型的基座推理能力达到相当高度之后,决定自主系统能否完成复杂工程的瓶颈,已经不再是单纯的“智力”或“算力”,而是系统能否在正确的时间点接触到正确的工程操作规范。

对自主科研与软件智能体的长远启示

DisCo 与 AREX-Skill 的提出,为当下正如火如荼的智能体研发提供了一个极具辨识度的技术视角。过去一段时间内,学术界和工业界在提升智能体能力时,往往将精力集中在两个极点:要么寄希望于下一个版本的巨无霸基础模型能够“涌现”出解决一切细节的神奇能力,要么在外部调度脚手架上堆叠无休无止的规划分支、反思机制与自问自答循环。

这项工作清晰地表明,在这两极之间,存在着一个长久被低估、但规模无比巨大的“知识中间层”。软件工程与科学研究之所以在人类社会中能够代际传承并加速演进,并不是因为后来的工程师比前人聪明数倍,而是因为成熟的代码库、标准化的 API、经过验证的最佳实践被沉淀成了即插即用的模块化经验。将这一机制反哺给大模型,让大语言模型自己去研读、提炼、验证开源生态中的海量资产,并将其反向编译为结构化的“AI 技能标准”,正是迈向完全自主科学发现的一条坚实路径。

随着 DisCo 模式的普及,未来的开源项目可能不再仅仅需要编写供人类阅读的 README,还会附带自动生成的标准技能图谱与自检用例;而在更宏大的自主智能体架构中,一个不断自我扩充、自我测试的技能库,或许正是智能体摆脱死记硬背与盲目试错、真正走向专业工程师水准的核心支柱。