RSIBench-Data:大模型自主搞数据科研,58%能突破但78%越改越差
RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

让大语言模型实现“递归自我提升”(Recursive Self-Improvement, RSI),是通往超级智能的核心假说之一。如果模型能够观察自己的失败案例,自动诊断能力缺陷,并针对性地合成高质量训练数据来强化下一代模型,闭环的自我进化便成为可能。然而,现有的自动化训练评测大多把系统工程、超参数微调、推理服务与数据决策死死绑在一起。当一个自动化流水线带来性能提升时,人们根本分不清这究竟是训练框架自带的工程红利,还是模型真正展现出了科学家的“科研决策能力”。
ArXiv URL:https://arxiv.org/abs/2607.25886v1
由 Evolvent AI 与新加坡国立大学(NUS)联合推出的全新基准 RSIBench-Data 正式瞄准了这一痛点。该基准将基座模型、微调基础设施、评估沙箱和资源预算全部严格固定,把大模型智能体(Agent)逼入一个纯粹的“以数据为中心的研究者”(Data-Centric Researcher)角色。评测覆盖了 4 个顶尖 Agent 和 6 项高难度基准,实验得出了一个既令人振奋又充满警示的发现:智能体确实初具科研直觉,在 58.33% 的设定中通过反馈迭代超越了初始策略;但这种提升高度脆弱且非单调——在达到历史最高分后选择继续尝试的场景中,高达 78.26% 最终都以大幅倒退收尾。大模型能灵光一现做出新发现,却还远不具备将实验反馈稳定转化为持续改进的严谨性。

剥离工程噪声:把大模型逼进“科研闭环”
过去评估模型自我改进能力的方案,往往存在两极分化的缺陷。一类工作退缩为静态的数据筛选(Data Selection),只允许智能体在已有的候选数据池中打分挑选题元,完全回避了无中生有的数据合成与难度课程设计;另一类工作则走入另一个极端,直接给智能体一个开放的代码库与服务器权限,允许其随意修改优化器超参数、训练框架甚至评测逻辑。在后一种情况下,跑分上涨往往来自学习率微调或工程 Bug 的巧合,根本无法评测智能体对模型认知缺陷的归因水平。
RSIBench-Data 的核心机制,就是通过明确的系统契约隔离外部干扰。整个实验环境将周边设施完全冻结:目标基座模型统一锁定为 Qwen/Qwen3.5-35B-A3B-Base,训练端完全由统一的 Tinker LoRA SFT 服务接管,评测端则置于由 Harbor 统一调度的 E2B 隔离沙箱内。智能体被剥离了修改优化器代码、调整网络架构或篡改评测流程的权限,其唯一能对训练施加影响的动作,就是输出训练数据制品以及一份被严格限制的白名单配置。
这种软硬件环境的强制约束,迫使智能体必须把全部算力聚焦在真正的科研决策上:阅读基准测试定义与种子任务,形成对基座模型缺陷的假设,合成并验证高质量数据,提交训练并观察沙箱返回的真实执行轨迹与验证信号,再根据前一轮的成败修正假设。

为了杜绝作弊,基准在输入信息上设置了严格的数据防火墙。智能体可以查阅公开的基准介绍、环境规范和公开种子仓库,也可以调用外部模型生成轨迹,但严禁接触或直接将保护测试集的任务转化为监督信号。每一个决策轮次都会留存完整的结构化审计日志,将假设文本、数据策略、产出的 Checkpoint 以及在沙箱中的得分牢牢锚定在一条时间线上,使得研究者能够像复盘人类科研日志一样,追溯智能体每一次性能飞跃或崩溃的内在逻辑。
谁是合格的数据科学家?横向矩阵评测
评测矩阵由 4 款前沿智能体与 6 个高要求任务交错组成。智能体阵容包括高推理强度的 Claude Code(分别搭载 Opus-4.8 与 Sonnet-5)以及最大推理强度的 OpenAI Codex(分别搭载 gpt-5.6-sol 与 gpt-5.6-terra)。为了消除外部生成器质量对数据合成带来的偏差,所有智能体在生成推理链、工具调用序列与执行轨迹时,统一调用相同的 Claude Opus 4.8 作为外部展开(Rollout)模型。
被评测的 6 项基准覆盖了截然不同的模型能力域:SWE-bench Verified、SWE-bench Multilingual 与 SWE-bench Pro 要求智能体在真实代码库中构建复杂的仓库级补丁监督数据;Terminal-Bench 2.0 聚焦于长程终端交互与复杂环境下的工具使用;GPQA Diamond 与 AIME 2026 则严密考察极高难度下的可验证推理与数学解题能力。每个 Agent 在单项任务上面临名义上 16 小时的物理时间上限与 500 美元的训练成本约束。
实验结果打破了“某种模型能够通杀科研全流程”的幻想。在非软件工程任务(GPQA Diamond、AIME 2026 与 Terminal-Bench 2.0)中,Codex gpt-5.6-sol 展现出了明显的优势,分别斩获 65.00%、65.00% 和 20.22% 的官方评测高分。但在软件工程类的三项 SWE 任务中,战局却彻底碎片化:SWE-bench Verified 的桂冠被 Claude Code Opus-4.8 摘得(25.80%),Multilingual 版本由 Claude Code Sonnet-5 拔得头筹(22.00%),而难度最高的 Pro 版本则被 Codex gpt-5.6-sol 拿下(9.00%)。
更值得深思的是不同模型在同一任务上的鸿沟。在 AIME 2026 上,顶尖智能体能把基座模型推升至 65.00%,而较弱的策略仅能做到 45.00%,差距达 20 个百分点;在 Terminal-Bench 2.0 上,最差的策略(Sonnet-5 仅得 5.62%)甚至大幅落后于基座模型的表现。由于所有任务基于完全相同的目标基座和统一微调架构,这一巨大方差确凿地证明:数据合成假设的高下,对最终模型的塑造力有着绝对主导的影响。
58% 的突破与 78% 的倒退:不可持续的试错
如果只看最终提交的最优模型,人们很容易对大模型自动化科研的前景盲目乐观。然而,当把视野切入智能体“轮次迭代”的动态过程时,其底层的脆弱性暴露无遗。
在全部 24 个实验设定中,智能体在 14 个设定(占比 58.33%)里成功通过多轮迭代击败了自己在首轮提交的有效模型。例如在 AIME 2026 上,Claude Code Sonnet-5 在连续 8 轮有效尝试中得分都徘徊在 15% 以下,但在第 9 轮突然领悟到关键的数据难度控制策略,一举跃升至 55.00%,最终冲至 55.83%;Codex gpt-5.6-sol 在 Terminal-Bench 2.0 上经历了首轮策略彻底崩溃的绝境,随后迅速调整合成方法,将分数从 7.87% 拉升到 15.73%。这说明大模型确实具备一定的容错、归因和探索能力,不是盲目撞大运。
然而,这种基于反馈的优化完全缺乏单调性与稳定性。在所有观测到分数峰值后仍有预算继续尝试的 23 组实验中,78.26%(18组)最终提交的末轮候选模型得分显著低于历史最高分,剩下的 5 组也仅仅是勉强恢复了历史最高水平,无一能够在峰值之上实现再突破。许多智能体往往在第二轮或第三轮凭直觉找到了黄金数据配比,但在后续尝试中,由于误读了沙箱反馈或者产生了错误的消融假设,合成出大量带有噪声或分布偏移的数据,亲手毁掉了训练效果。如果不是基准协议中允许智能体回滚并提交“历史最佳 Checkpoint”,多数智能体的最终交付成果将是一场灾难。
这种“过峰后加速衰减”的现象在搜索成本上体现得尤为刺眼。部分成功的运行以极高的算力效率收敛,例如 Codex 在 GPQA Diamond 上仅消耗 1.14 小时与 4.80 美元成本就找到了接近天花板的解;然而在 SWE-bench Pro 上,Codex 耗费了超过 300 美元的训练成本,反复迭代了十几个版本,分数却长久在个位数停滞不前。智能体目前严重缺乏人类研究员的关键素养:知止。它们不知道何时假设空间已经耗尽,何时细微的评测波动属于测量噪声,从而在盲目的反复重构中空耗资源。
优秀科研轨迹的四项核心支柱
深入分析那些实现显著正向进化的成功轨迹,可以清晰提炼出智能体在数据科研中应当遵循的四项底层规律:
第一是精准的缺陷归因(Accurate Hypotheses)。弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟是缺失了特定库的上下文理解、欠缺特定工具参数的转义格式,还是在多步骤长链规划中陷入了死循环,从而提出极具针对性的补齐假设。
第二是基于环境校验的有效监督(Validation-Grounded Supervision)。在合成轨迹数据时,优秀智能体坚决抛弃了无验证的纯文本自言自语,而是将外部展开模型生成的每一步操作置于沙箱中进行动态执行。只有那些通过了环境校验、确实修复了 Bug 或执行了正确系统调用的轨迹,才被打包作为有监督微调(SFT)的素材。
第三是行为对齐的高保真数据(Behavior-Aligned Data)。许多失败轮次合成的数据尽管在逻辑上正确,但严重偏离了目标任务的交互分布。例如在终端操作任务中,生成了过于冗长、宛如教材解释般的思考文本,导致微调后的基座模型在实际测试中变得极度啰嗦并耗尽 Token 上限。成功智能体懂得在训练数据中严格约束输出格式与行为协议,使小模型能够精准复现解决问题的高效动作。
第四是具备 Checkpoint 的防守性保留意识。科研探索本质上充满未知,优秀的研究策略不仅在于敢于向未知的极端配比做探索,更在于在整个探索生命周期中维持稳健的对照基线。那些盲目将前次 Checkpoint 彻底覆盖或忽视验证集监控的运行轨迹,无一例外在后续轮次中走向了性能崩塌。
递归自我提升的黎明与前路
RSIBench-Data 为整个大模型领域带来了一面清醒的镜子。它证实了大模型不仅可以充当代码编写者,也已经开始跨入“实验设计者”与“数据策略师”的门槛。大模型能够自主提出假设、设计数据配方并成功推高另一个模型的性能边界,标志着递归自我提升并非空中楼阁。
但残酷的现状同样摆在面前:当前的顶尖模型依然是一个“灵感充沛却缺乏严谨纪律”的初级研究员。它们能靠出色的先验知识偶遇精妙的解法,却无法在连续的实证反馈中建立单调向上的科学研究闭环。如何让智能体学会辨别评测噪声、如何建立假设的证伪逻辑、如何在多轮探索中保持稳定的数据课程设计,将是通向真正自动化 AI 科研的下一道核心命题。