Fisher-R1:用可验证强化学习终结大模型统计推断假象,复杂任务提升26%

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Fisher-R1:用可验证强化学习终结大模型统计推断假象,复杂任务提升26% 论文图示

在大语言模型(LLM)驱动的自动化科研流程中,让 AI 自行编写 Python 或 R 脚本清洗表格、拟合模型并撰写实验结论,早已屡见不鲜。表面上看,主流前沿模型生成的代码几乎都能零报错运行,输出的分析报告也头头是道,但其得出的结论是否真正具有统计学意义,往往缺乏严格推敲。

ArXiv URL:https://arxiv.org/abs/2608.07437v1

由斯坦福大学(Stanford University)与威斯康星大学麦迪逊分校(University of Wisconsin–Madison)联合提出的研究指出:当前绝大多数大模型 Coding Agent 在端到端科学推断中,正在频繁制造“看似正确、实则虚假”的统计学发现。模型可能在文字中敏锐指出了离群点的存在,代码实现也无懈可击,却在推断方法上选择了不符合数据分布假设的检验手段,最终算出一个“高度显著”的虚假 $p$ 值并错误地拒绝原假设。

为填补现有评测仅关注代码可执行性与浅层事实匹配、忽视推断严密性的空白,研究团队推出了包含 425 个真实科学任务的基准测试 P-Bench,并发布了开源推断 Agent 模型 Fisher-R1。该模型通过合成任务与基于 $z$ 分数转换的可验证强化学习训练,在单次通过率上相较于 DeepSeek-V4-Pro 实现了平均 21% 的相对提升,在困难推断任务上的涨幅更是达到了 26%,甚至在多项严苛指标上超越了闭源旗舰 GPT-5.4。

代码跑通了,但推断全错了

在真实的实证科学研究中,从一个科学问题出发,研究者需要将其转化为可检验的零假设,依据样本量、异常值、异方差性及变量类型选择恰当的统计方法,计算检验统计量与 $p$ 值,并在给定的显著性水平 $\alpha$ 下做出推断决策。统计检验的底层预设必须严格契合数据特征;一旦检验方法误用,再精确的数值计算也会引导出错误的科学论断。

现有的数据分析评测基准,例如关注表格问答事实的 Factoid 查询,或是衡量预测任务指标的竞赛类工作流,核心打分逻辑大多停留在“代码能否无报错跑通”与“最终数值是否完全匹配”。这种设计掩盖了深层次的推断漏洞。例如在一项癌症基因组学任务中,研究目标是检验基因突变负荷与肿瘤纯度之间是否存在关联。数据集中存在若干高杠杆离群点,线性回归模型受其干扰,报告出极度显著的假阳性关联;而统计学上更稳健的秩相关检验(如 Spearman 检验)则显示两者并没有统计显著性。前沿闭源模型虽然在分析初期识别出了离群值,却依旧固守普通线性回归,从而制造了一次经典的科研假阳性。

这种假象对于追求全自动科学发现的闭源或开源 Agent 来说是致命的隐患。当智能体被赋予在庞大科研数据集中自主探寻模式的权限时,缺乏稳健统计检验的 Agent 会批量生产垃圾结论甚至污染学术文献。

P-Bench:给推断 Agent 设下 425 个统计学陷阱

针对这一痛点,研究团队构建了专门考察端到端假设检验能力的基准 P-Bench。评测不再向 Agent 提供现成的检验方法提示,只给予科学问题 $q$、CSV 格式的数据集 $D$ 以及必要的数据字典说明 $s$。Agent 必须完全自主地在沙箱环境内探索数据、编写并执行 R 语言代码,最终输出结构化的推断报告:选用的统计检验方法、计算出的具体 $p$ 值,以及在 $\alpha=0.05$ 下是否拒绝零假设的二元决策 $\hat{\delta}$。

P-Bench 的 425 个任务全部锚定在已发表的严谨科学研究中,来源涵盖顶级期刊的经济学实证论文(来自 Harvard Dataverse 开放数据)、同行评审的生物学文献(来自 cBioPortal 临床肿瘤数据)以及范德堡大学(Vanderbilt)生物统计学经典教材案例。为了保证参考答案的绝对可靠,基准设立了严苛的构建原则:每一个任务的真实标签并非直接摘录论文文本,而是运行原始代码重现完整推断流,并由具备专业统计学与生物统计学背景的学者进行双盲审计,剔除存在方法歧义的任务。

根据任务难度,P-Bench 被划分为简单集(P-Easy,203 题)与困难集(P-Hard,222 题)。被归类为困难集的任务往往带有现实科研中极易遇到的“数据质量陷阱”:严重的异方差、聚类观测(Clustered Data)、强生存截断(Survival Censoring)或高杠杆值。这些任务要求 Agent 必须具备识别模型假设违背的能力,主动选用如 Cox 比例风险回归、工具变量两阶段最小二乘法(IV/2SLS)或 Tobit 模型等高级推断工具,而非机械套用 $t$ 检验或普通最小二乘法(OLS)。

Fisher-R1:合成演练与 $z$ 空间强化学习

高质量推断任务的稀缺性与昂贵的专家标注成本,使得直接在真实文献数据上微调模型难以规模化。为此,研究团队设计了一套可执行的合成任务生成引擎,并提出了 Fisher-R1 智能体训练范式。

该框架从统计检验方法、应用领域情境、样本规模、效应量大小、提示词风格和随机种子六个正交维度出发,程序化生成了 8,642 个包含可执行数据生成过程(DGP)的合成任务,并人为注入了缺失值与极端异常点。因为数据生成的底层物理规律完全已知,系统可以直接运行标准参考代码,以确定性的方式产出黄金标准 $p^*$ 与理论真实推断。

训练过程分为两阶段展开:

首先是监督微调(SFT)冷启动。研究团队提取了包含 4,611 条轨迹的高质量专家推断流,强约束模型遵循规范的统计学五步工作法:从初步探索性数据分析(EDA)辨识变量类型,到深入探索数据分布与平衡性,再到针对候选方法检验核心统计假设(如正态性、平行趋势假设、工具变量相关性等),随后进行方法选择与代码执行,最终给出结论。

随后,模型进入基于 DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization)算法的强化学习阶段。与简单的格式奖励不同,Fisher-R1 引入了基于连续统计学空间的奖励函数。在衡量 Agent 计算出的 $\hat{p}$ 与真实值 $p^*$ 的接近程度时,如果直接在 $[0, 1]$ 区间做差值计算,会引发严重的推断失真:0.5 与 0.6 的差异在证据层面上微不足道,而 0.1 与 $10^{-10}$ 虽然差值同为 0.1 左右,在统计学推断意义上却跨越了数个量级。

为了克服 $p$ 值在接近 0 处的极端压缩,研究团队引入了双侧标准正态分布分位数变换:

\[z(p) = \Phi^{-1}(1 - p/2)\]

这一变换纯粹将 $p$ 值单调映射到等效的 $z$ 空间,与底层数据是否服从高斯分布完全无关。基于此,$p$ 值接近度奖励被定义为:

\[r_p(o) = \exp\left(-\frac{\lvert \min\{z(\hat{p}), 5\} - \min\{z(p^*), 5\} \rvert}{\sigma}\right)\]

结合决策正确性奖励 $r_c(o) \in {0, 1}$,整套强化学习机制完全以推断结果为导向,刻意不硬性指定“唯一正确”的方法标签。只要 Agent 选取的检验方法在统计学原理上是自洽且稳健的,其算出的 $p$ 值便会在 $z$ 空间与参考值高度重合,从而获得正向优势梯度。

实验证明:结论猜得准,不等于推断做得对

在 P-Bench 的综合评估中,研究团队设置了两套打分维度:Raw(宽松标准,仅判断 Agent 拒绝或不拒绝原假设的二元决策是否正确)和 Strict(严苛标准,在结论正确的前提下,要求估计出的双侧 $z$ 分数绝对误差 $\lvert \Delta z \rvert < 0.5$)。

评测结果揭示了一个普遍存在的严峻现实:主流前沿模型在宽松标准与严苛标准之间存在惊人的断层。以 GPT-5.4 为例,在困难集 P-Hard 的单次尝试(pass@1)中,其 Raw 准确率达到了 58.3%,但 Strict 准确率暴跌至 30.5%。换言之,该模型在接近一半的情况下虽然碰巧选对了结论走向,其背后的数值计算与方法依据与严谨的参考检验完全相悖,存在严重的“蒙猜”与逻辑虚假自洽。

相比之下,参数量仅为 14B 的开源模型 Fisher-R1 表现出显著的推断严密性:

在严苛指标 Strict pass@1 上,Fisher-R1-14B 全面超越了包括 GPT-5.4、DeepSeek-V4-Pro、Qwen3-Coder-30B 等在内的强力基线。相较于 DeepSeek-V4-Pro,Fisher-R1 在整体基准上的单次成功率实现了 21% 的平均相对提升;面对包含高级计量经济学模型和严重数据缺陷的 P-Hard 子集,其相对优势进一步扩大至 26%。消融实验表明,单独使用 SFT 虽然能发散解空间、提升 pass@3,但在 pass@1 上收效甚微;唯有结合规范的五步推断轨迹 SFT 与基于 $z$ 分数空间的可验证 RL,模型才能稳固学会“在分析代码运行前自发校验异方差与杠杆点”。

此外,针对模型是否仅仅记住了合成模板的疑问,研究人员通过嵌入空间语义相似度分析证实:真实科学任务 P-Bench 在特征空间中与合成训练集保持着清晰的距离边界,性能跃升确系源于模型习得了通用的统计推断决策逻辑,而非检索式记忆。

从跑通代码迈向可靠的科学智能

Fisher-R1 与 P-Bench 的出现,切中了当前代码生成与 Agent 落地中的一处关键盲区:我们习惯于将“代码能成功执行并输出图标数字”作为任务完成的代理信号,却忽视了数理推断层面的底层有效性。

这项研究表明,仅依靠无监督预训练或通用的代码强化学习,无法让 Agent 自主掌握微妙的假设检验规则;但通过精巧的数学映射(如 $z$ 空间重标定)并结合合成任务的端到端强化学习,可以有效将统计严密性内化为模型的一种核心推理直觉。在自主科学发现(AI for Science)日益走向全流程无人化的背景下,这类专注推断可验证性的轻量开源模型,有望在学术论文评审、自动化临床试验复核以及医疗数据本地化隐私分析等高风险场景中,成为把关科研严谨性的关键过滤机制。