SciDisco:过程可验证的轮次级RL,14B模型科学发现超越GPT-5 Mini
Scaling Scientific Discovery Environments for Turn-Level Agentic RL
让大语言模型自主分析科学数据并提出可验证的假说,是 AI for Science 最具吸引力的方向之一。然而,现实中的数据驱动型科学发现绝非单轮问答或一次性代码生成,而是一场漫长而脆弱的交互实验:智能体需要理解数据模式、选择恰当的统计方法、在沙盒中执行代码、观察报错与中间统计量、修正假设,并最终提交具有统计学意义的科学结论。
ArXiv URL:https://arxiv.org/abs/2607.28990
面对这种动辄数轮乃至数十轮的长程交互任务,现有基于强化学习(RL)的智能体训练方法遇到了严重阻碍。最核心的矛盾在于“过程黑盒”与“信用分配”:如果只看最终提交的假说是否正确(即结果奖励 Outcome-only Reward),模型根本无法判断究竟是前置的数据清洗起到了决定性作用,还是中途某一步关键的控制变量分析带来了突破,抑或是最后一步撞大运猜中了结论。在缺乏过程监督的真实数据环境中,强化学习往往会陷入无效工具调用、变量误读和盲目试错的泥潭。
近期发表的这项工作提出了 SciDisco 框架,试图彻底改变这一现状。其核心思路不是在推理阶段堆叠复杂的 Prompt 工作流,而是构建了一个原生支持过程验证与多轮信用分配的训练闭环。该框架通过自动化编译隐藏的“科学证据有向无环图”(Hidden Evidence DAG),让环境能够在多轮交互的中间步骤实时验证智能体的分析进展,并据此设计了轮次级强化学习算法 DiscoPO。实验表明,参数量仅为 14B 的 SciDisco-14B 模型,在科学假说发现基准 DiscoveryBench 上取得了 35.2% 的匹配得分,不仅刷新了开源模型的最佳成绩,还一举超越了参数规模与推理成本高昂的 GPT-5 Mini(26.9%)。

科学发现的困境:为什么单靠结果反馈学不好多轮交互?
在深入技术细节之前,有必要理清数据驱动科学发现与常规代码生成的本质差异。常规的编程或数学解题环境通常具有明确的输入输出映射,单元测试可以通过断言快速判断正误。但在科学数据分析场景中,开放数据集往往只有静态表格或未标记的原始文件,既缺乏结构化的科学假说目标,也没有可供程序校验的过程标准。
以往研究普遍依赖两种妥协方案。第一种是依靠极强的通用闭源大模型配合 ReAct 范式、代码解释器或多智能体脚手架。这类系统虽能跑通部分流程,但往往高度依赖昂贵的专有 API,且无法从根本上沉淀可复用的策略优化经验。第二种是将强化学习(如基于规则验证的 RLVR、GRPO 等架构)直接搬到多轮智能体任务中。但在这种方案下,标量奖励只能在最后一步给出,漫长交互链条中的步骤优劣被严重稀释。一旦前期变量筛选发生偏差,后续几十次执行便全盘皆输;反之,若某次偶尔蒙对终局指标,模型又可能错误强化某些低效甚至不合理的探索行为。
要让智能体在无人工干预的情况下稳步学习探索与验证策略,必须让环境具备“看懂分析过程并实时评判证据”的能力。SciDisco 的突破点正是将静态科学数据集改造成可执行、可检验、可给分的过程监督环境。
SciThèque:将真实科学数据编译为“证据图”沙盒
SciDisco 的首要组件是环境编译系统 SciThèque。它彻底重构了科学发现任务的定义方式,不再将任务视作单纯的问答对,而是将其形式化为一个包含假说、数据集和验证器的三元组 $u_j = (h_j, d_j, v_j)$。
为了在保证交互真实性的同时引入客观的过程校验,SciThèque 引入了“任务局部隐式证据图”(Task-local Hidden Evidence DAG)这一核心概念,形式化表示为 $g_j = (\mathcal{V}_j, \mathcal{A}_j)$。其中,顶点集合 $\mathcal{V}_j$ 代表科学探索中必须经历的关键分析状态,例如数据清洗完成、变量分布校验合格、回归分析拟合成功、敏感性分析通过等;有向边集合 $\mathcal{A}_j$ 则规定了分析步骤之间的前置依赖关系。
至关重要的是,这套隐式证据图和内部验证逻辑对智能体完全不可见。智能体在沙盒中只能看到科学假说目标 $h_j$、原始数据文件 $d_j$,以及每一步由 Python 内核返回的实际输出与观测 $o_{j,t}$。底层沙盒提供具有持久化状态的代码执行环境,变量、加载的模型和清洗后的中间文件在多轮交互中得以保留。每当智能体执行完一次代码并产生新的观测时,隐藏在底层的验证器便会动态检查当前状态:只有当代码逻辑和统计结果真正满足某个状态节点的检验条件时,该节点才会被标记为已激活。
这种设计将原本不可捉摸的“探索过程”映射成了可在 DAG 上追踪的状态跃迁,从而在不泄露答案的前提下,让环境拥有了对长程探索进行定量度量的标尺。
从证据轨迹合成到 DiscoPO 轮次级信用分配
有了支持过程验证的沙盒环境,接下来的核心挑战是如何把环境反馈转化为模型能力的跃升。直接从零开始进行多轮强化学习极易崩溃,因为未经初始化的策略很难盲目写出符合统计规范的完整多轮分析链条。为此,SciDisco 设计了从监督微调到策略优化的两阶段路线。
第一阶段是基于 DAG 的多轮轨迹合成(DAG-Grounded Trajectory Synthesis)。系统利用 SciThèque 环境中的证据图作为引导,让启发式规则或辅助模型在图中进行状态遍历,生成覆盖不同分析路径的多轮代码执行记录。所有合成轨迹均需经过底层验证器的严苛过滤,只有严格完成状态跃迁且逻辑自洽的轨迹才会被保留为 SFT 演示样本。这一冷启动阶段并不要求智能体记住固定的标准答案,而是通过多样化的推演链条,让基座模型建立起“提出检验—编写代码—观察统计量—推进下一步”的行为先验。
第二阶段则是该框架的技术精髓——DiscoPO(Discovery Policy Optimization)强化学习算法。在在线交互训练中,智能体在每一轮次可以选择提交一个 <python> 代码块或发起 <submit> 最终结论动作。DiscoPO 彻底抛弃了只在终止状态结算的终局奖励,而是将轮次级奖励与隐式证据图的进展直接挂钩。
具体而言,定义状态集合的覆盖进展函数为 $\Phi_j(C)$,用于衡量当前已验证节点集合在总关键证据路径中的占比:
\[\Phi_j(C) = \frac{\lvert C \cap \mathcal{P}_j \rvert}{\lvert \mathcal{P}_j \rvert}\]在轨迹的第 $t$ 轮,智能体获得的即时轮次奖励 $r_{j,k,t}$,直接取决于该轮行动是否推动了验证图的状态转移,即后一状态与前一状态进展的增量:
\[r_{j,k,t} = \Phi_j(C_{j,k,t+1}) - \Phi_j(C_{j,k,t})\]这意味着,任何一轮代码执行,只要成功计算出了合法的统计检验量、推进了分析图谱,就能即时获得正向奖励;而冗余的打印、无效的语法报错或脱离分析主线的试错操作,其轮次奖励均为零。
在策略梯度的计算上,DiscoPO 将这一轮次级信号嵌入到组相对策略优化(GRPO)范式中。算法在相同的任务环境下采样一组并行的交互轨迹,计算每个时间步的组内基线均值 $b_{j,t}$,进而得出轮次级别的相对优势值 $A_{j,k,t} = \widetilde{r}{j,k,t} - b{j,t}$。这种机制精准地回答了“在第 $t$ 步,当前模型的决策是否优于同组其他探索分支”,从而实现了针对具体动作步骤的细粒度信用分配。
基准表现评测:14B 小模型何以叫板闭源大模型?
研究团队以 Qwen3-14B 为底座训练了 SciDisco-14B,并在三大极具代表性的数据分析基准上进行了系统评测:专注于科学假说生成的 DiscoveryBench、面向复杂多步业务分析的 DABStep,以及考察程序化数据科学工作流的 DataSciBench。
基准测试的对照组涵盖了当前最具竞争力的阵营:以 GPT-5 Mini、Claude Sonnet 4 和 GPT-4o 为代表的顶尖闭源模型;以 DeepSeek-V4-Flash、Intern-S1-Pro 为代表的通用开源大模型;以及 DeepAnalyze-8B、AutoSDT-Coder-14B 等面向数据科学的专用智能体。
在与该研究场景最拟合的科学发现基准 DiscoveryBench 上,SciDisco-14B 展现出了极为强劲的推理与假说发现能力。评测采用 GPT-5 Mini 作为裁判,从上下文理解、变量匹配和因果关联维度计算平均假说匹配分数(HMS)。SciDisco-14B 取得了 35.2% 的高分,位列所有参评模型的榜首。作为对比,闭源模型中最强的 GPT-5 Mini 仅为 26.9%,通用开源模型中最强的 Intern-S1-Pro 为 34.7%,而此前的数据分析专用模型 DeepAnalyze-8B 仅获得 25.9%。
这一结果证明,面对高度专业的科学分析任务,通用基座模型的巨大体量并不能自然转化为稳健的长程假设检验策略。通过在可执行环境中浸润并学习过程验证,14B 级别的模型完全可以掌握比单步强模型更具穿透力的分析交互逻辑。
不过实验同样呈现了真实且值得深思的边界。在针对多步商业数据分析的 DABStep 基准中,SciDisco-14B 的平均准确率仅为 17.8%,未能战胜 DeepAnalyze-8B 的 38.9% 与 Claude Sonnet 4 的 29.7%。分析表明,DABStep 中的高难度切片(Hard Split)对底层模型的复杂逻辑运算有极高要求,该基准上的 Qwen3 全系模型得分均处于低位。这说明 SciDisco 带来的增益主要集中在假说驱动型的科学推理范式上,对于依赖特定业务规则与极端算术逻辑的题目,策略收益仍受制于底座本身的先天结构能力。
消融实验拆解:过程奖励究竟带来了什么?
为了厘清各个模块对最终表现的定量贡献,论文在 DataSciBench 上针对不同的训练阶段进行了详尽的消融对比。DataSciBench 包含粗粒度的整体成功率(Success Rate)、任务完成率(Completion Rate),以及细分到不同数据科学子任务维度的精细评价指标。
消融实验揭示了能力获得的清晰层次:
-
冷启动 SFT 奠定基础动作规范:相比原生 Qwen3-14B,仅使用验证器过滤的合成轨迹进行 SFT,就能带来跨越式的指标提升。这是因为基础模型本身并不熟悉多轮沙盒交互的状态流转,SFT 成功将模型“校准”到了规范的代码编写与统计验证模式中。
-
轨迹级 GRPO 带来有限修正:在 SFT 之后直接引入常规的 GRPO(仅依赖最终是否完成任务给出标量奖励),模型的成功率获得了小幅提升。这表明端到端的结果反馈确实对策略强化有益,但由于中途缺少引导,强化学习的搜索空间依然过于发散。
-
DiscoPO 的轮次级过程分配实现最佳收敛:完整的 SFT + DiscoPO 组合最终斩获了 56.3% 的成功率与 61.0% 的完成率,均刷新了该组测试的最高水平。
对细分维度的进一步分析揭示了 DiscoPO 的深层优势所在:相较于常规 GRPO,DiscoPO 带来的最大增益集中在“数据建模”(Data Modeling)与“数据探索”(Data Exploration)这两个最依赖中间过程判断的子任务上。在探索与建模阶段,一次代码执行往往需要经历多次超参数调优、指标对比与模型诊断。传统的终局奖励无法告诉模型哪一次超参数选择是决定性的,而 DiscoPO 依据状态跃迁给予的即刻信用分配,精准强化了模型在探索阶段的高质量决策,有效遏制了无效冗余代码的生成。
从静态基准到智能体进化的范式转移
长期以来,AI for Science 领域的智能体研究在很大程度上受制于“基准评估与真实训练的割裂”。许多经典的数据科学 Benchmark 往往只能用来做死板的离线评测(打一个单一的分数),却无法直接变成训练交互环境;反之,传统的 RL 训练环境多局限于 Web 导航、游戏模拟或通用的软件工程任务,缺乏贴合真实科研数据的严谨假说验证机制。
SciDisco 的价值在于架起了一座桥梁:它不仅证明了“基于过程监督的轮次级强化学习”在长程复杂交互中的巨大威力,更展示了如何利用隐式证据图将无序的科学数据转化为取之不尽的训练场。通过将环境从单向的考场转变为双向互动的训练沙盒,智能体得以在数以千计的模拟探索中学会像真正的科学家那样去观测、质疑与验证。
当然,该研究在现阶段依然存在明确的边界。目前系统主要处理的是以文本或表格形式呈现的结构化科学数据,尚未覆盖复杂的湿实验(Wet-lab)反馈或多模态科研图表;同时,环境验证器的判定依赖于预先配置的任务合约与模板空间,它能保障分析流程的统计合规性,但“合规”本身并不等同于提出颠覆性的全新科学理论。
尽管如此,SciDisco 所验证的方法学极具生命力:在通往自主科学发现的漫长道路上,比起一味推高模型的单步推理参数量,构建可执行、可检验、具备细粒度信用分配机制的交互环境,或许才是解开长程智能体进化密码的关键钥匙。