EviGraph:用有向证据图重构科研智能体,论断支撑率提升40.19%

EviGraph: Evidence-Guided Autonomous Research Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

EviGraph:用有向证据图重构科研智能体,论断支撑率提升40.19% 论文图示

让大语言模型自主做科研,是过去一年多里 AI Agent 领域最受关注的演进方向之一。从自动阅读文献、提炼科学假设,到编写代码、运行实验,再到最终写出结构工整的论文,许多端到端智能体系统已经能够跑通完整的科研闭环。然而,只要仔细审查这些系统产出的论文,往往会发现一个令人尴尬的现实:论文看似行文流畅、图表完备,底层的论证逻辑却漏洞百出。实验可能根本没有严格测试最初的科学假设,后文得出的结论悄悄放大了实验记录支持的边界,甚至许多关键论断在实验数据中完全找不到依据。

ArXiv URL:https://arxiv.org/abs/2608.04738v2

来自中国科学院、香港浸会大学、中国科学院大学和武汉人工智能研究院的研究团队指出,这类问题的根源并不完全是大模型的生成能力不足,而在于现有系统的底层架构缺陷。绝大多数自主科研系统本质上是在运行一条单向线性的“工作流管道”(Sequential Pipeline):从提想法到做实验,再到分析数据和撰写手稿,每个环节只负责把上一级的输出包装传递给下一级。流水线没有一套能显式维护、跨阶段校验“论断与证据”(Claim-Evidence)之间依赖关系的内部状态机。一旦上游产生偏差,这种错误就会顺着管道无声无息地级联放大,直到生成终稿时沦为严重的幻觉。

为了打破这种“只管生成、不保求真”的流水线局限,研究团队提出了名为 EviGraph 的全新自主科研框架。EviGraph 将科研过程从单向的流水线执行,重构成以“有类型证据图”(Typed Evidence Graph)为核心操作状态的闭环系统。论文最终论断的支撑率(Claim Support Rate)相比此前最强的端到端基线提升了 40.19%,实验数据一致性达到了 87.73%,在 ARC-Bench-ML 等基准上全面领先。这项研究给智能体科研领域带来了一个极其关键的认知转变:可靠的科学发现不能依赖流水线的惯性前冲,而必须建立在具备回溯、自愈与门控能力的证据图状态之上。

EviGraph 框架的整体运行流程,划分为三个协同阶段

为什么线性的科研流水线注定频频翻车?

在现有的自动化科研设定中,智能体通常按部就班地扮演不同角色:Idea 生成模块抛出假设,代码模块实现脚本并在沙盒里运行,分析模块读取日志总结结果,最后由写作模块排版成 LaTeX 文档。这种结构虽然直观,但在科学探索的高度不确定性面前显得异常脆弱。

科学研究本质上不是线性的装配流水线,而是一个充满分支、回溯和假设检验的复杂拓扑网。在传统智能体流程中,一个科学假设(Hypothesis)可能随着代码调试过程中的妥协而悄然偏离了初衷;或者实验确实跑通了,但产出的观测数据(Finding)并不足以推导出宽泛的结论;更常见的是,写作模块为了让故事显得更圆满,在论文中写下了超出实验结果支撑范围的论断(Claim)。

因为线性管道缺乏跨阶段的显式依赖约束,系统无法回答几个核心的元问题:这项实验究竟在验证哪一个具体的科学差距?这个结论到底是由哪些运行指标推导出来的?如果中间某次实验的代码修改了变量,原先的推论链条是否依然成立?既然这些依赖关系在系统中是隐式的、不可见的,智能体也就无从在生成过程中实施检验。最终的结果就是,只有当厚厚的一篇论文被完整打印出来时,人类审稿人或者外部评审器才发现整座大厦建在流沙之上。

EviGraph 的突破点在于:它不再把科研记录当成事后整理的备忘录,而是把“证据图”直接作为智能体在整个生命周期中的核心运行状态(Operational Research State)。系统中的每一个动作,都在对这张图进行增删、验证与重构。

把科研过程抽象为六类节点的有向拓扑网

在 EviGraph 中,研究状态被形式化为一个包含特定类型节点与有向边的图结构 $G=(V, E, \tau, \rho, \alpha)$。为了精确刻画一项科研工作的逻辑流转,框架定义了六种具备严格语义约束的核心节点类型:

这些节点之间的连接绝非任意的自由文本关联,而是严格受限于语义模式。例如,一个假设必须由一个或多个实验来“测试”($h \xrightarrow{\textit{tested-by}} e$),实验执行后“产生”客观结果($e \xrightarrow{\textit{produces}} f$),而一系列结果再组合起来共同“支撑”某个论断($f \xrightarrow{\textit{supports}} c$)。

这种拓扑结构允许分支与合并。例如,一个科学假设可以同时设计三组实验从不同角度切入;多组实验 Finding 也可以联合约束、限定某个 Claim 的成立范围。更重要的是,它在系统内部第一次将所谓“证据链”(Evidence Chain)具象化为了图中的一条可计算路径:从最初的 Gap 和 Hypothesis 出发,穿透 Experiment 与 Finding,最终稳固地托起 Claim。任何一个悬空、断裂或语义错位的路径,都会在图结构中以异常状态即时暴露。

假设初筛、跨阶段审查与子图级自愈机制

将科研状态图谱化之后,智能体究竟如何调度科学动作?EviGraph 将整个研究流程划分为三步循环递进的机制。

第一阶段是带假设过滤的初始图构建。面对给定的研究目标,系统在检索文献并生成一批候选假设后,并不会盲目投入大规模算力全量评测。EviGraph 引入了 Hypothesis Filter,先按语义相似度将假设聚类为不同的探索方向,并在低算力消耗下执行快速的小规模试探性实验(Pilot Experiments)。只有那些在试探阶段展现出实证潜力的假设组,才会被保留并进入全规模评估,进而实例化为初始图 $G_0$。这一步极大地压缩了后续在荒谬假设上反复碰壁的算力浪费。值得注意的是,$G_0$ 在生成之初被故意设计为“不完备状态”,框架默认所有的推论链都需要经历后续的严苛检验,而不是盲信初次生成的内容。

第二阶段是核心的跨阶段证据审查与依赖感知修复(Cross-stage Inspection and Repair)。EviGraph 部署了独立的图审查模块(Graph Inspector),它像一个挑剔的科研同行,持续扫描图中的每一条边和每一个节点:实验方案是否真的控制了变量来验证对应的假设?产出的 Finding 是否忠实于沙盒日志中的数值,还是大模型擅自添加了修饰?手稿级别的 Claim 是否过度外推?

一旦发现某条边无法满足语义约束,审查模块并不会把这个问题当成孤立的拼写错误去打文字补丁,而是会定位到链条中最源头的“薄弱节点”(Weak Node),并找出其所有的下属依赖节点(Subordinate Nodes)。修复规划器会将受影响的下游子图一并切除,顺着拓扑依赖顺序驱动专门的 Agent 重新设计实验、重新提取 Finding,并重新调整 Claim。

更为精妙的是框架内置的检查点与回滚机制(Checkpointing and Rollback)。做过科研的人都知道,修改代码或调整推论往往可能“越改越糟”,引入新的逻辑矛盾。EviGraph 在局部修复前会固化当前版本 $G_{\text{base}}$。当修复完成后,审查模块会对比新旧版本:如果修复动作导致薄弱节点数量增加,或者破坏了原先已经验证成立的其他证据链,系统判定修复发生退化(Degrading),立即触发回滚动作,退回到历史最优的检查点版本。这种机制保证了智能体的探索始终在向高质量状态单调收敛,杜绝了无休止的负向震荡。

第三阶段则是严格的证据门控写作(Evidence-gated Manuscript Generation)。在传统的流水线智能体中,时间或者步骤一到,写作模块就必须按格式交出一篇完整的 PDF。而在 EviGraph 中,写作模块被一道严格的“证据就绪”(Evidence Readiness)门禁阻拦。

只有当整张图满足全局 Schema 合法、涵盖所有必需的实证交付物,且每一个被保留的 Claim 都拥有完整的、没有弱节点的证据链支撑时,系统才允许启动论文起草。生成手稿时,Writer 必须严格按照图中的证据路径、事实边界和限制条件进行扩写,杜绝一切脱离实验凭空捏造的宏大叙事;随后的 Reviewer 还会再次对手稿和证据图进行对照审计。如果直到时间预算耗尽,图结构依然无法通过完备性验证,系统宁可返回标记为不完整的状态,也坚决不输出满纸荒唐言的虚假论文。

论断支撑率大幅攀升,实验数据高度一致

为了验证显式证据图对科研可靠性的提升,研究团队在两个具有代表性的端到端科研基准上进行了全面评测:一个是面向经典机器学习课题的 ARC-Bench-ML(包含 25 个课题,涵盖代码、实验和深度结果分析),另一个是跨越 NLP、CV、多模态、图学习等七大领域的 NanoResearch-20。

所有评测均将底层大语言模型统一固定为 qwen-3.6-plus,并在完全相同的沙盒硬件环境和执行时间预算下运行,从而排除了基座模型能力差异带来的干扰。基线系统选取了目前最先进的两款全自动科研框架:具备严苛输出检验的 AutoResearchClaw,以及基于多轮自我演化与模拟科学家反馈的 NanoResearch。

实验结果表明,EviGraph 在两个基准上均刷新了整体性能上限。在 ARC-Bench-ML 上,EviGraph 斩获了 86.45% 的综合得分,在代码执行(Code Execution)与结果分析(Result Analysis)两个对实证逻辑要求极高的维度上显著领跑。在 NanoResearch-20 上,EviGraph 在最终交付物的有效性(Performance 达到 72.84%)、创新性(Novelty)以及论文撰写质量(Writing 达到 7.5)上全线超越了强基线系统。

ARC-Bench-ML 任务上的典型执行轨迹分析:从最初发现薄弱节点到依赖修复、最终达到证据就绪

比综合跑分更具说服力的是科研可靠性指标(Research Reliability)的显著跃升。本文引入了两个直击痛点的度量:

  1. 论断支撑率(Claim Support Rate, CSR):最终论文中,有多少比例的核心主张能够严密追溯到已验证的假设、可执行的实验和真实的观测数据?

  2. 实验数据一致性(Experimental Data Consistency, EDC):论文正文中引用的每一个指标数值,与沙盒里真实运行出的底层产物究竟有多大程度的吻合?

在论断支撑率方面,此前的强基线系统表现堪忧:NanoResearch 的 CSR 仅为 14.4%,AutoResearchClaw 达到 27.0%,意味着论文中绝大多数论述要么是空中楼阁,要么存在逻辑断裂。而 EviGraph 一举将 CSR 推高至 37.85%,相比最强基线实现了 40.19% 的相对增幅。同时,其数据一致性(EDC)高达 87.73%。这项数据给出了极其清晰的信号:显式的证据图状态维护,切实封堵了智能体“凭空编造结果”和“跨阶段逻辑偷换”的漏洞。

典型轨迹透视:系统是如何自愈逻辑断链的?

本文提供了一个针对文本分类校准任务的真实案例追踪,直观展示了 EviGraph 区别于传统系统的运作逻辑。

在冷启动状态下,系统初步探索并构建了初始证据图 $G_0$。如果换作一般的流水线系统,此时代码已经跑过、结果看起来也有模有样,流程就会径直冲向写作阶段,最终把带有逻辑断层的结论写入手稿。

但在 EviGraph 的图审查环节,Graph Inspector 敏锐地捕获到了一个隐蔽的语义脱节:在上游的实验设计中,智能体为了提升小样本效果,悄悄引入了一个新的增强策略;而下游的 Finding 和 Claim 却依然沿用了最初的假设框架,声称性能的提升“纯粹来自于表征维度的校准”,并未对引入的数据增强变量进行消融隔离。这导致实验与假设之间出现了严重的弱关联(Weak Link)。

定位到该根因节点后,Repair Planner 迅速启动依赖修复,直接标记并移除了依赖于该实验的下游 Finding 节点和原本打算保留的过度外推 Claim。随后,专门的 Repair Agent 被唤醒,它重新调整了实验配置以实施严格的对照消融,跑出真实的增量结果并产出新的 Finding。当确认消融数据确实支撑修正后的结论时,更新后的 Claim 被重新挂载回图谱中。

经过这轮拓扑修复,整张图再次接受审查并顺利通过检验,系统状态正式跳转为 $\textsc{Ready}(G)$,最后才将这个无可挑剔的严密证据网移交给 Paper Writer。这个案例清晰地揭示了“流程跑完”(Pipeline Completion)与“证据就绪”(Evidence Readiness)之间的本质区别:表面上的步骤完成并不代表科研的成立,只有经过结构化推敲与自愈的证据链,才具备转化为科学论著的资格。

迈向更严谨的科学发现智能体

回顾近两年 AI for Science 或科研智能体的发展,社区往往将精力集中于两个极端:要么通过更庞大的模型规模追求惊艳的灵感生成,要么设计极其冗长的 Agent 提示词链条来模仿科学家的外在行为。然而,如果底层缺乏对科学推演本质的严谨建模,智能体生成的论文越多,科学共同体需要花费在甄别学术幻觉上的成本就越高。

EviGraph 提供了一种极具启发性的技术路线。它没有停留在“用 LLM 写出一篇像样的论文”这一浅层表象,而是深入到科学哲学的实证内核中,把问题、猜想、实验、数据与结论之间的支撑关系,具象化为一张可计算、可追溯、可回滚的有向图。

从长远来看,这种基于证据图的状态机设计不仅能够显著改善单次研究任务的靠谱程度,更为跨任务的“科研经验沉淀”奠定了基础。论文中提到的长期记忆库 $\mathcal{M}_L$,能够把成功验证过的图结构和修复轨迹持久化保存,让智能体在下一次面对未知课题时,调用先前的严密推演范式来指导新的探索。当科研智能体终于学会像严谨的科学家一样,在没有扎实证据前保持克制、在发现逻辑漏洞时主动重构实验,全自动科学发现的时代,才算真正迈出了可信的第一步。