SciToolAgent-Evo:让大模型自主“进货”新工具,科学问答准确率提升超12点
SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition
在科学研究场景中,大语言模型(LLM)早已不再只是陪聊助手,而是演化为统筹复杂科研计算的中枢 Agent。从分子性质预测、晶体结构筛选到基因序列分析,Agent 需要规划并调用各式各样的专业计算工具与 API。然而,目前的科学工具调用方案大多预设了一个致命前提:工具箱是“封闭且完整”的。
ArXiv URL:https://arxiv.org/abs/2607.28692
真实世界的科学探索从来不是预设剧本。研究人员经常会遇到全新合成的分子、未曾见过的材料体系,或是此前未收录的特定物性计算脚本。当现有工具箱无法满足需求时,传统 Agent 往往只能在已有的闭集工具空间里“硬凑”,哪怕选错工具导致链条崩溃,也无法主动意识到能力缺口,更谈不上自主寻觅并吸收未知的新工具。
为了攻破这一开放世界瓶颈,最新研究提出了 SciToolAgent-Evo。这是一个具备本体感知(Ontology-Aware)与自演化能力的科学工具获取智能体框架。它不仅能主动判断当前工具库是否够用、借助老虎机(Bandit)算法动态权衡“继续用旧工具”还是“探索新工具”,还能在获取未知工具后将其自动补全本体属性、无缝缝合进现有的工具知识图谱中。
配套提出的还有包含 900 个真实科研任务的新基准 OpenSciToolBench。实验表明,即便在 50% 甚至 70% 的工具属于未知盲区的严苛开放环境里,SciToolAgent-Evo 在回答准确率上比此前最佳方案领先了 9 到 12 个百分点,相比前代固定图谱的 SciToolAgent 更是取得了 17% 到 31% 的大幅飞跃。

为什么现在的科学工具 Agent 总是“死板硬套”?
现有的科学工具调用系统(例如 ChemCrow、GeneGPT、ChatMOF 以及早期的 SciToolAgent)在面对标准任务时表现亮眼,但它们的底层逻辑本质上是“静态目录匹配”。系统维护一张静态的 API 清单,当输入科研问题时,Agent 检索最相似的工具,随后编排成调用链。这种设计在面对开放世界科研场景时暴露了三项根本性短板:
首先是能力断层感知盲区。传统 Agent 缺乏对自身能力边界的自知之明,一旦任务链条缺少某个中间转化工具(例如 SMILES 格式清洗或特定的量子化学积分器),它无法向外发出求助信号,只会从旧工具库中强行挑选一个字面相似的替代品,导致连锁报错。
其次是探索与利用的失衡。在真实环境中,未知的工具往往只暴露极少量的基础属性(比如极其简短的名称或未标准化的接口说明),而已知工具拥有成熟丰富的参数说明。如果单纯依靠语义相似度检索,Agent 永远偏向于复用旧工具,陷入局部最优,无法下定决心去尝试可能正是解题关键的新工具。
最后是缺乏持续沉淀与演化的记忆机制。即便某些交互框架通过外挂搜索引擎搜到了新代码或第三方 API,任务执行完也就随之遗忘。下一次遇到类似化学场景时,Agent 依旧需要从零试错,无法将新工具的适用领域、依赖约束内化为稳定的结构化知识。
为了全面评测 Agent 解决这种开放断层题目的能力,作者团队首先构建了层级化评测基准 OpenSciToolBench。该数据集涵盖生物学、化学和材料科学三大前沿领域,基于收录了约 500 个科学工具的知识图谱 SciToolKG 采样构建,并依据认知严谨度矩阵(Cognitive Rigor Matrix)划分为四个难度级别。从基础的单工具简单验证,到需要跨学科长程组合、面对稀疏工具线索的多步骤推理,该基准包含了问答、多选、填空及判断等四种题型,共计 900 道高质量题目,全部经过代码执行与领域专家的双重核验。

核心架构:知识沉淀与本体感知推理的双轮驱动
面对开放世界,SciToolAgent-Evo 的解法并非暴力微调底层大模型,而是通过一套双阶段自演化循环来驱动共享的“演化记忆”(Evolving Memory)。这套记忆由三大模块组成:技能库(Skill Library)、经验池(Experience Pool)以及本体化工具图(Ontologized Tool Graph)。
整个框架划分为两个彼此交织的阶段:第一阶段负责离线的“知识沉淀”(Knowledge Accumulation),从对比轨迹中蒸馏高阶元知识;第二阶段负责在线的“本体感知推理”(Ontology-Aware Inference),动态平衡决策并持续把新工具落库。
在第一阶段的知识沉淀中,Agent 面对训练任务首先以低温 $T_{\mathrm{base}}=0$ 采样基线轨迹。如果基线轨迹一举成功,系统将其抽象为通用的工作流技能并直接存入技能库;如果基线轨迹失败,系统则在不同温度超参下展开多次探索性采样,直到捕获一条成功的轨迹,从而拼凑出一对“失败-成功”的对比轨迹对。
随后,智能体对这对轨迹进行差分诊断,精准定位导致失败的关键分歧节点,并蒸馏出两类经验:一类是针对特定科学情境的领域专属经验(例如某种光谱解析不可直接输入原始分子式),另一类是不依赖具体学科的通用选工具元规则。为了避免经验库无限膨胀,系统在存入前计算余弦相似度,过滤掉高重合度规则,只保留紧凑且具泛化力的知识。
动态博弈:LinUCB 老虎机与在线本体补全
当 Agent 进入实际推理阶段,它会先通过路由机制识别任务难度。对于超纲或高度复杂的科学难题,系统会启动主动工具获取机制。在构建调用链的每一步,Agent 会根据当前上下文提出明确的工具需求描述,并在已知图谱与未知工具候选集之间进行抉择。
此时,决策核心转移到了基于 LinUCB(线性置信上限)的 Bandit 门控模块。为了不盲目随机探索,门控会抽取一个四维的本体上下文向量:
\[\mathbf{x}_{j} = [f_{j}, m_{j}, s_{j}, p_{j}]^{\top}\]其中,$f_{j}$ 代表排在第一位的已知工具的置信可行度;$m_{j}$ 表示已知工具候选中第一名与第二名之间的置信度差额(Margin);$s_{j}$ 衡量当前需求与候选工具的高阶科学本体匹配度;$p_{j}$ 则记录了该领域下未知工具探索的历史成功率先验。
门控基于该特征向量计算“利用已知工具”与“探索未知工具”两项动作的置信上限估值:
\[a_{j}=\arg\max_{a\in\{\texttt{a1},\texttt{a2}\}}\left(\hat{\boldsymbol{\theta}}_{a}^{\top}\mathbf{x}_{j}+\alpha\sqrt{\mathbf{x}_{j}^{\top}A_{a}^{-1}\mathbf{x}_{j}}\right)\]式中 $\alpha$ 动态控制探索倾向。如果已知候选工具得分悬殊且极其可信,Agent 就倾向于直接利用(Exploitation);一旦已知工具模棱两可或本体特征无法对齐,系统就会果断转向未知工具池(Exploration),挑选即便属性简陋但功能潜在契合的工具进行试探。
最为精妙的是在线本体补全与图谱迁移。一旦 Agent 冒险使用某个未知工具成功跑通了实验流程,系统绝不仅仅是给出最终答案,而是依据本次交互中暴露的输入输出格式、适用的分子或材料类型、实际运行环境等痕迹,在线补齐该工具的高阶科学本体属性。随后,这个“新面孔”被永久迁移并编织进已知工具知识图谱 $G_K$ 中,其对应轨迹也被抽象成新技能落库,Bandit 矩阵同步基于执行奖励完成在线更新。至此,未知工具彻底演化成了成熟的已知工具。
实验印证:严苛开放环境下的断层领先
研究团队在 GPT-5.4-mini 和 Gemini-3-flash 两款主流闭源模型底座上,对 SciToolAgent-Evo 进行了全面测评。评测严格遵循开放世界设定:初始工具库中,50% 的工具被人工设定为“已知”(包含完备本体),其余 50% 均被掩码为“未知”(仅暴露极度精简的基础描述),Agent 必须在摸黑前行中规划路径。
在 OpenSciToolBench 的终极测试中,SciToolAgent-Evo 展现出了统治级优势。以 GPT-5.4-mini 为底座时,其最终答案准确率相比表现第二名的强基线提升了 12.11 个百分点;在 Gemini-3-flash 底座上同样取得了 9.55 个百分点 的显著领先。在另一项经典基准 SciToolEval 上,该框架也分别取得了 6.11 点和 2.89 点的稳定涨幅。
更具说服力的是与前代代表性框架 SciToolAgent 的横向对比。在多个测试集上,SciToolAgent-Evo 的整体表现比 SciToolAgent 超出了 17% 至 31% 不等。这一差距清晰反映出:单纯依赖固定工具图谱的 Agent,一旦走出温室就会寸步难行;而引入了 Bandit 动态门控与自演化记忆的 Agent,能够在未知环境中不断扩展自己的能力半径。
为了验证框架各模块的必要性,消融实验提供了详实的量化依据:
-
剔除“知识沉淀”阶段后,整体性能断崖式下跌了 14.87 个百分点,证明离线对比反思所沉淀的经验是开放世界少走弯路的前提。
-
彻底禁用“未知工具向已知图谱的动态迁移机制”带来了最剧烈的性能退化,这直接证明了把新工具转化为带本体知识的常驻资产是系统持续变强的生命线。
-
分别剥离“技能库”和“细粒度经验池”也导致了 3.23 点和 1.57 点的跌落,说明宏观的工作流链条指导与微观的单步避坑指南缺一不可。
而在极其苛刻的鲁棒性测试中,研究者将未知工具比例一步步推高至 70%(即已知/未知比例为 30/70)。在这种超半数工具完全未知的极端恶劣条件下,大部分基线模型直接瘫痪,而 SciToolAgent-Evo 依靠敏锐的主动请求与稳健的 Bandit 探索策略,依然维持了 59.01% 的高水准任务准确率。
知识沉淀的动态曲线分析进一步揭示,Agent 的规划准确率与未知工具命中率在前 25% 的训练样本积累过程中呈现出最陡峭的爬升,随后转入平缓增长。这意味着该框架无需海量标注样本进行死记硬背,仅需少量对比任务的驱动,就足以让系统建立起应对未知科学环境的高效决策先验。
对未来 AI for Science 智能体的启示
长期以来,AI for Science 领域的工具调用大多聚焦于“怎么把已有的一百个脚本编排好”。但真实科研创新的本质,恰恰是面对未知领域去创造或接入第一百零一个工具。
SciToolAgent-Evo 的价值在于打破了“工具库必须由人类预先精细封装好”的思想钢印。它将强化学习里的探索-利用博弈、知识图谱的本体语义约束以及大语言模型的反思归纳能力紧密耦合,让科学 Agent 第一次具备了类似资深研究员的科研直觉:算不通时敢于质疑工具完备性,拿到冷门的新脚本能快速看懂并归纳出用法,跑通一次便能终身吸收。
这种机制不仅适用于计算化学和材料计算,对未来需要接入物理实验台自动化控制、生物高通量筛选设备等现实接口的具身科学智能体(Embodied Science Agent)而言,同样提供了一种在未知动态物理世界中自主扩张能力版图的高可靠范式。