RPM:Meta让AI研究员学会“挑实验”,节省超1/3算力且刷新两项SOTA

AI Research Preference Models

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

RPM:Meta让AI研究员学会“挑实验”,节省超1/3算力且刷新两项SOTA 论文图示

在大语言模型走向自动化科研(AI for Science / AI Research Agents)的浪潮中,研究者们很快撞上了一堵极其现实的高墙:算力墙。

ArXiv URL:https://arxiv.org/abs/2608.13940v1

在数学解题、单文件代码修复或终端指令交互等传统 Agent 基准中,系统迭代往往非常顺畅,因为反馈循环极其廉价——代码写完,跑几个单元测试只需几秒;数学题推导出来,对一下标准答案就能拿到即时奖励。然而,当把大模型推向真实的机器学习前沿探索时,这种即时反馈瞬间消失了。AI 可以在几分钟内生成几十种截然不同的模型架构改进、优化器重写或数据增强方案,但要验证其中任何一个方案究竟是神来之笔还是徒劳无功,往往需要将模型放到昂贵的高端 GPU 上训练数小时甚至数天。

生成想法的成本接近于零,执行验证的代价却高耸入云。这意味着,AI 研究 Agent 面临的根本矛盾不再是“能不能写出代码”,而是“在有限的算力预算下,应该优先把 GPU 分配给哪个方案”。

面对这一瓶颈,来自 Meta FAIR、牛津大学以及伦敦大学学院(UCL)的研究团队提出了一个极具针对性的解法:AI 研究偏好模型(AI Research Preference Models,简称 RPM)。他们没有继续卷代码生成能力,而是将核心突破口放在了“实验筛选决策”上。通过引入两套轻量化的偏好模型,在真正耗费大量 GPU 资源之前对候选方案进行高精度筛选,成功将基准测试中的平均得分从 $0.684$ 提升至 $0.729$,并且仅用不到原有三分之二的算力和时间,就达到了基线完整运行 24 小时的性能上限。

为什么 AI 科学家最缺的不是“灵感”,而是“审美”?

在现有的自动化机器学习研究框架(例如 AIRA-dojo)中,主流范式普遍依赖于树搜索或演化算法。Agent 维护着一棵解空间树,每个节点代表一个已经执行并测出分数的代码方案。当 Agent 选定一个父节点进行扩展时,传统的做法非常简单直接:生成一个新的代码突变,然后老老实实提交给 GPU 执行,再根据回报决定后续分支。

这种机制在算力充足的前提下尚可运行,但在真实科研中极其低效。由于大模型在编码时不可避免地会产生逻辑漏洞、无意义的超参数微调,或者在理论上看似成立但实际训练极其缓慢的方向,盲目执行这些方案会迅速烧光宝贵的 GPU 配额。人类资深研究员在开启全量训练前,通常会先审视代码设计是否靠谱、理论动机是否合理,或者随手写个轻量脚本跑几轮验证一下。人类的这种“研究审美”和“直觉判断”,恰恰是过往 AI Agent 所缺失的。

Meta 等机构的研究团队明确提出,驱动自主科研进展的核心杠杆是研究偏好(Research Preference),即如何将固定的执行预算在海量候选代码之间进行最优分配。

为了赋予 AI 这种筛选能力,研究人员构建了 RPM 框架,并将其无缝嵌入到树搜索的“子代创建(Child Creation)”阶段。Agent 不再单点突变,而是并行生成 $N$ 个候选分支代码(在实验中设为 15 个)。此时,这 15 个候选方案一个都不直接上 GPU 做全量训练,而是统一交由 RPM 进行两两对决的“淘汰锦标赛(Pairwise Tournament Knockout)”。RPM 结合当前探索树中已经跑过的历史方案与对应得分,裁定出综合潜力最高的一个代码分支,最终只对这一个胜出者投入 GPU 预算进行真正的全量评估。

两种路线:纯推理断案与沙盒预实验探针

为了平衡筛选精度与决策开销,作者团队设计了两种截然不同但互为补充的 RPM 形态。

第一种是纯推理偏好模型(Inference-only RPM)。它完全基于预训练冻结参数的大模型,不执行任何代码,纯粹依靠大模型的代码理解与科学推理能力进行裁决。为了让模型不会给出浮于表面的平庸评价,研究团队借助 DSPy 框架中的 MIPROv2 优化器对其 Prompt 进行了系统性指令优化。优化后的指令要求模型不仅要对比方案的代码与逻辑计划,还要主动关联历史搜索树中广度优先遍历(BFS)提取的有效节点,重点分析候选方案是否修复了前序探索中的缺陷、是否带来了机制创新,同时对细微且易修复的非核心代码瑕疵保持适度容忍。

第二种则是更进一步的智能体化偏好模型(Agentic RPM)。在真实世界中,即便最顶尖的科学家,单凭肉眼看代码也有走眼的时候。遇到吃不准的创新想法,最稳妥的办法是搞个“小实验试水(Pilot Experiment)”。Agentic RPM 完美复刻了这一行为范式:它被赋予了一个与主 Agent 完全隔离的沙盒环境,同样配备单张 GPU,以及 Python、Bash 和实验提交工具。在做出最终二选一的裁决前,Agentic RPM 可以主动编写简化代码,在有限的数分钟时间内进行短周期的低成本验证。

在开发 Agentic RPM 的过程中,研究团队敏锐地捕获到了大语言模型在做研究决策时的一系列有趣偏差:

  1. 过度保守与提前交卷:当给模型划定一个 5 分钟的沙盒预算时,模型往往缺乏时间规划意识,运行一两个极其微小的代码检查后就匆匆判定,导致大量的沙盒预算闲置。针对这点,团队采用了一种精巧的提示策略——在 Prompt 中对剩余预算进行“适度夸大”,给模型施加充裕感,从而促使其开展更有深度的探究。

  2. 缺乏价值的无序微调:即便模型在多次迭代中继续运行,它也往往陷入机械调参的怪圈,不断改动同一个超参数。对此,系统引入了一个独立的反馈模型(Feedback Model),在每次试水实验提交后对已有发现进行复盘,直接给出下一步最具信息量的实验指引,或者在证据已足够确凿时果断中止循环。

经过这些工程机制的校准,沙盒预实验输出的日志分析,再连同候选代码及任务描述,共同输入给裁决模型,产出具备极高置信度的筛选结果。

AIRS-Bench 实测:提速 1.5 倍,全面逼近理论上限

为了验证 RPM 的实战能力,团队在最新的前沿机器学习科研基准 AIRS-Bench 上进行了大规模的端到端评估。测试覆盖了文本和表格模态下的 20 项复杂机器学习研究任务,严格限制每个任务在单张 H200 GPU 上跑满 24 小时,并重复 10 个随机种子以确保统计可信度。更严谨的是,为了杜绝模型参数容量带来的不公平优势,生成候选代码的 Agent Backbone 与负责筛选的 RPM Backbone 统一采用了开源的 Qwen3.6-27B,确保性能的跃升纯粹来自于“筛选机制”,而非更大的底座模型。

最终的实验曲线揭示了两种 RPM 在算力折衷上的不同哲学:

纯推理的 Inference-only RPM 由于几乎不额外消耗代码执行算力,在搜索初期就展现出立竿见影的收益,整体轨迹全程稳定压制未经引导的基线方案(No-RPM),将基线最终的 $0.684$ 平均归一化得分拉升至 $0.711$。

具备沙盒试跑能力的 Agentic RPM 则展现出了更深刻的动态特性。由于每个筛选步骤都要在沙盒中跑 5 分钟左右的小规模测试,消耗了部分时间预算,在实验前期的几个小时内,其搜索步数落后,累计得分曲线相对平缓。然而,随着高质量筛选带来的“复利效应”显现,Agentic RPM 挑选出的代码分支几乎每次全量运行都能取得高质量突破。在中后期,其性能曲线呈现出陡峭的加速攀升,最终达到了 $0.729$ 的平均得分,显著缩小了与“每次候选都全量跑完再挑最高分”的验证集理论上限(Validation Oracle, $0.748$)之间的差距。

除了终局得分的提高,研究效率维度的收益更为惊人。无引导的基线 Agent 需要跑满完整的 24 小时才能拿到 $0.684$ 分;而 Inference-only RPM 和 Agentic RPM 分别在 14.88 小时(提速 $1.61\times$)和 15.50 小时(提速 $1.55\times$)就达到了这一分数线。换算下来,相当于用不到原始预算三分之二的算力成本,换来了同等水平的研究进展。

在两个极具挑战性的经典子任务上,RPM 甚至帮助 Agent 自主探索出了超越以往人类或 AI 方案的全新 SOTA:

预实验的“玄学”:AI 到底掌握了哪些研究捷径?

为了搞清楚 Agentic RPM 究竟是如何在几分钟内判断一个复杂模型潜力的,作者团队在包含图像、视频、音频任务的离线数据集上,对模型在沙盒中自动生成的 Python 代码进行了深度模式解构。

结果显示,大模型在面临时间约束时,展现出了高度类人的科研敏锐度。无论是 5 分钟还是 30 分钟的沙盒预算,Agent 都高频采取了三套简化策略:

然而,团队进一步的消融分析挖掘出了一些出人意料的规律,揭示了哪些预实验策略是真有用,哪些其实是“负优化”:

  1. 多折交叉验证得不偿失:让 Agentic RPM 强行跑多折交叉验证并不能提升它的判断准度,核心原因在于沙盒时间有限,多折任务极易触发执行超时,导致半途而废、毫无产出。

  2. 全量数据跑少步数,优于采样数据跑多步数:分析发现,使用全量数据即便只训极少 Epoch,其提供的代码质量评估信号也显著优于在小采样集上精调。数据分布的完整性对机器学习的早期判断至关重要。

  3. 不可乱删学习率调度器与数据增强:部分 Agent 在极度压缩代码时会砍掉 LR Scheduler 或复杂的数据增强模块,消融证明这会导致筛选准确率断崖式下跌。因为对于现代机器学习任务而言,许多方案的突破点恰恰依赖于这些精细的训练策略,一旦被粗暴阉割,优秀方案与糟糕方案的区分度就会被彻底抹平。

此外,在纯推理 RPM 的离线 Scaling 实验中,作者团队还验证了几个对后续系统设计极有价值的规律:当通过 BFS 提供更多历史搜索树的上下文节点时,模型的裁决准确率单调上升;增大候选池规模(从 3 个提升到 15 个)能显著拉大理论上限与实际选拔质量;而利用 LLM-Arbiter 将 GPT-5、Claude Opus 和 Gemini Pro 的推理链进行裁判式集成,可将离线选拔胜率进一步推高至 69.35%。

自动化科学探索的下一步

Meta、牛津与 UCL 提出的这项研究,直击了当前大模型 Agent 领域从“玩具场景”迈向“重资产场景”的核心阵痛。过去业界在评估自动化科研系统时,常常陷入对生成端(Backbone)参数规模的单一崇拜,幻想着更强的通用大模型只要敲敲键盘就能解决一切科学假设。

但这项工作给出了一条更为清晰的路线图:在重计算约束的领域,科研的本质是探索与利用的博弈,而偏好预测机制是实现高效探索的核心基础设施。

通过将原本盲目的全量验证拆解为“宽泛生成 + 偏好过滤 + 战略执行”,RPM 证明了即使不升级底座生成模型,仅靠决策拓扑的优化与轻量探针工具的赋能,就能换回 1.5 倍以上的探索效率增益。未来,随着这套科研偏好模型从无监督提示转向基于大规模历史科研轨迹的强化学习专项对齐,AI 科学家在面对昂贵的物理、生物及前沿计算实验时,或许真能像资深学者那样,在提笔之前就看穿哪些假说真正值得为之挥洒算力。