Frontis-MA1:从启发式搜索到可执行元进化,35B模型奖牌率达71%
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
长期以来,人工智能领域对“递归自提升”(Recursive Self-Improvement, RSI)的讨论往往停留在理论推演或科幻设想中。如果一个智能系统能够自主改进制造下一代 AI 的过程,智能的爆发式增长就会成为可能。但在工程实践中,这种自指系统极难落地:它既需要明确可量化的优化目标,又必须能够反复接受严苛、真实的物理反馈。机器学习工程(Machine Learning Engineering, MLE)恰恰是目前最理想的可执行试验场——在这里,Agent 不仅需要写出语法正确的代码,还要亲自处理复杂异构的数据、配置实验管线、定位运行时异常,并根据带有长时间延迟的验证指标决定下一步的算力分配。
ArXiv URL:https://arxiv.org/abs/2607.28568
然而,现有解决 MLE 任务的方案通常呈现出严重的“脱节”状态。一派研究专注于在推理阶段搭建复杂的外挂脚手架(Harness),利用通用大模型进行树搜索或遗传演化,但模型本身对进化的底层算子缺乏原生理解;另一派研究则尝试直接对代码大模型进行微调,却往往受制于静态数据集的监督,脱离了持续试错与环境反馈的动态过程。

针对这一核心瓶颈,开源项目 OpenMLE 与在其基础上后训练得到的 Frontis-MA1-35B 模型给出了闭环解法。该研究构建了一套涵盖“可验证沙盒环境、算子强化学习、长程演化搜索”的完整全栈体系。在最具挑战性的真实竞赛基准 MLE-Bench Lite 上,受限于单张 RTX 4090(12GB 显存上限)及每任务 12 小时的计算预算,Frontis-MA1-35B 将基础模型的奖牌平均率(Medal Average)从 39.39% 提升至 60.61%,并在配合增强版长程搜索时达到 71.21%。这一表现不仅超越了 GPT-5.5 搭配专业脚手架的水平,更逼近了万亿级参数的闭源巨无霸模型,向真正意义上的可执行“元进化”(Meta-Evolution)迈出了扎实的一步。
从单次代码生成到闭环元进化的范式跃迁
理解这项工作的关键,在于看清它在 AI4AI 技术阶梯上的定位变化。普通的程序合成关注的是输入提示词后单次生成的成功率;演化式搜索向前推进了一步,让模型在推理阶段依据代码执行的日志反馈,反复修改候选程序。然而,这种推理阶段的演化依旧是被动的,主导进化的模型自身并不理解演化轨迹背后的结构化规律。

元进化的核心改变,在于把“改进候选系统”的执行轨迹重新作为养料,去反哺和训练负责改进的语言模型本身。如上图所示,Frontis-MA1 的定位不仅是搜索系统输出的代码产物,更是整个进化飞轮的内部驱动引擎。为了让模型具备这种元进化能力,OpenMLE 将机器学习工程中纷繁复杂的代码修改行为,抽象为四个标准原子算子:用于从零构建基础管线的草稿(Draft)、用于在已有有效方案上进行算法迭代的改进(Improve)、用于分析报错并修复运行异常的调试(Debug),以及用于将两个异构解法进行优势结合的交叉(Crossover)。
这四个算子不仅构成了推理阶段长程搜索的调用接口,同时也是模型在后训练阶段的直接学习目标。当模型在训练和推理两端统一在相同的算子协议下时,数据收集、策略强化与测试时搜索才真正拼合成了一个闭环。
OpenMLE-Gym:为大模型搭建 5,758 个可验证的工程沙盒
没有高质量、高吞吐的交互环境,所谓强化学习和自提升就是空中楼阁。静态的代码仓库无法提供动态调优反馈,而单纯依靠人工编写的测试用例又无法支撑大规模的强化学习采样。为此,研究团队构建了 OpenMLE-Gym,统一了 5,758 个具有执行隔离、结构化诊断和细粒度评估能力的真实机器学习任务环境。

OpenMLE-Gym 的任务来源兼顾了高质量与大规模。首先是人工精选的基准锚点(Curated Anchors),保证评测核心标准的扎实;其次是利用自动化管线,将大规模 Kaggle 竞赛元数据转化为标准的独立执行包。针对竞赛类任务,系统会自动下载源数据,结合模式信息与指标协议,生成用于数据切分的 prepare.py 与负责私有评分的 metric.py。为了防止评测污染,所有与测试基准 MLE-Bench 存在重叠的数据被严格剔除。
在任务质量控制上,研究引入了多维度的语义过滤机制。一个合格的工程沙盒必须通过五重考验:任务定义的有效性、数据量是否足以支持建模、对原始资产利用的充分程度、问题本身的工程复杂度,以及数据是否存在泄漏或标注错误。通过这种层层筛选,OpenMLE-Gym 最终沉淀为覆盖表格、文本、图像、时间序列以及多模态任务的大规模环境库,其中分类与回归任务占比约 87%,且有 11% 属于高难度的多模态工程问题。
更为关键的是后端的沙盒执行引擎。长时间运行的机器学习程序往往面临内存溢出、死锁或环境破坏等风险。OpenMLE-Gym 实现了调度、计算与存储的解耦,为每个采样任务分配隔离的容器环境,并能够捕获包括运行成功、语法错误、提交缺失、评分失败及超时在内的六种细粒度状态。正是这种确定性、高保真的环境反馈,让语言模型在成千上万次的试错中摸索出了鲁棒的工程直觉。
算子学习:解耦、对齐与执行驱动的强化学习
在拥有了大规模执行环境后,如何将海量的执行反馈转化为模型的工程决策能力?OpenMLE-ERL 给出的答案是:不要试图让模型端到端死记硬背长达数十步的漫长探索轨迹,而是将其拆解为对四个原子算子的局部强化。

在冷启动阶段,系统采用了基于执行反馈的自适应有监督微调(Execution-Grounded SFT)。数据收集分为两条路径:并行路径负责独立采样大量的完整草稿(Draft),筛选出能够成功运行并获得有效基准分数的代码,这一路径贡献了超过 1.7 万条高质量完整样本;演化路径则深入到真实搜索树中,针对已经成型的有效代码,定向应用 Improve、Debug 和 Crossover 算子,捕捉模型在局部进行架构改进、超参调优、特征工程或错误恢复的关键步骤,沉淀了 9,000 余条局部状态转移数据。总计 2.6 万余条由真实沙盒验证过的算子样本,构成了模型理解工程演化的坚实基础。
在此基础之上,研究团队引入了基于执行结果的强化学习。在传统的文本生成强化学习中,奖励信号往往来源于静态规则或偏好判别模型;而在 MLE 场景下,奖励完全取决于代码在沙盒中跑出的真实验证指标。
为了在异构任务间建立可比的信号,系统设计了动态基线归一化机制:
\[r_{\mathrm{base}}(\tilde{s};b_{\mathrm{best}},b_{\mathrm{worst}})=\mathrm{clip}\left(\frac{\tilde{s}-b_{\mathrm{worst}}}{b_{\mathrm{best}}-b_{\mathrm{worst}}},0,1\right)^{\alpha}\]在此机制下,程序的执行得分 $\tilde{s}$ 参照当前任务历史采样的最佳与最差表现进行拉伸和裁剪,使模型始终关注于在当前技术水平上取得的边际突破。同时,为了避免策略退化为死守单一方案,研究采用了带有熵正则化优势函数(Entropic Advantage)的裁剪策略梯度,促使模型在探索新型模型架构与深挖当前方案之间维持健康的平衡。
更为精妙的是强化学习中的父节点采样机制。在决定让模型执行哪一项算子时,采样器综合考量了候选父节点的历史绝对表现、其子代解法结果的方差,以及访问冷却系数:
\[F(p)=\mathrm{norm}(R_{p})+\mathrm{norm}(\mathrm{Var}_{c\in\mathrm{child}(p)}R_{c})+\mathrm{norm}(C_{p})\]方差项的存在至关重要——如果一个方案的子代代码经常出现剧烈的指标波动,说明该代码所在的搜索区域蕴含着丰富但未被收敛的改进空间,系统会主动调配更多算子调用预算去冲刷这一区域。
OpenMLE-Evo:告别纯随机试错的经验驱动长程搜索
模型经过强化学习获得了出色的局部重构技能,但当面对一个长达 12 小时的真实项目时,全局视角的长程规划同样不可或缺。传统基于进化或蒙特卡洛树搜索的框架(如 AIRA-Evo)往往陷入一个误区:依赖模型的即时上下文进行贪婪的评分选择,导致搜索快速收敛在局部最优解,且消耗了大量的 Token 预算去反复总结未被采用的无用分支。
OpenMLE-Evo 对长程演化的状态维护进行了系统重构。在节点层面,每当候选代码运行完毕,系统并不直接调用大模型做长篇大论的总结,而是确定性地抽取其环境消耗、执行状态、关键改动和得分变化,凝练为一张标准化的“经验卡片”(Experience Card)。在全局层面,所有的经验卡片汇聚为“全局经验看板”(Experience Board),记录下当前任务中已尝试过的方法族系(如决策树类、深度神经网络、特定特征工程流水线)、各个族系的最高得分、反复遭遇的错误模式以及整体的得分爬升趋势。
在挑选下一步修改哪个父节点时,OpenMLE-Evo 拒绝了单纯根据分数高低进行轮盘赌的简单逻辑,而是采用结合“解法质量、增量进展、算法新颖性”的三维效用函数:
\[U_{i}=\lambda_{s}\tilde{s}_{i}+\lambda_{\Delta}\widetilde{\Delta}_{i}+\lambda_{n}\nu_{i},\qquad P(i\mid\mathcal{I})=\frac{\exp(U_{i}/\tau)}{\sum_{j\in\mathcal{I}}\exp(U_{j}/\tau)}\]即使某个候选方案当前的绝对分数不是全场第一,但如果它在上一代基础上有巨大的跨越式提升,或者开辟了一条全新、尚未被充分挖掘的模型族系路径,它依然能够获得充足的继续演化算力。这种非贪婪策略在长时间运行的工程任务中展现出了极强的韧性,大幅减少了模型在过拟合与死胡同里的无效内耗。
此外,系统的记忆合成被完全改为了“按需触发”。只有当父节点真正被某个特定算子(例如 Debug 或 Crossover)选中时,控制器才会从全局看板中针对性地提取相关的历史线索、失败堆栈与兄弟节点的参数配置,动态拼装成紧凑的上下文注入到提示词中。这种设计不仅将有限的推理窗口留给了最有价值的代码和数据结构本身,也彻底杜绝了因上下文冗余而引发的模型注意力涣散。
从竞赛到科学基准:端到端评测揭示了什么?
这套全栈系统的有效性,最终在严格的盲测基准中得到了量化检验。测试的核心战场是覆盖数十个真实 Kaggle 赛题的 MLE-Bench Lite。为了贴合实际工程环境的硬约束,实验设定了极其严格的硬件与时间边界:统一在单张 NVIDIA RTX 4090 上运行,显存被严格限制在 12GB 内,单任务上限为 12 小时。
在完全相同的 OpenMLE-Evo 进化脚手架下,经过后训练的 Frontis-MA1-35B 将基础模型(Qwen3.6-35B-A3B)的奖牌平均率直接从 39.39% 提升至 60.61%,在人类参赛者中的综合排位(Human Rank)也由 0.5828 跃升至 0.7647。这意味着,即便不改变推理时的搜索算法,仅仅通过对四个原子算子的强化学习,模型就获得了显著更高质量的工程生成与查错能力。
而在引入了任务无关的先验经验与异步搜索机制的 OpenMLE-Evo-Max 配置下,Frontis-MA1-35B 更是取得了 71.21% 的奖牌平均率与 0.8126 的人类相对排位。这一结果在帕累托前沿上清晰地确立了新坐标:一个 35B 参数规模的开源模型,在自身演化机制的加持下,击败了由通用脚手架驱动的 GPT-5.5 方案,并紧咬参数量数倍于己的超大前沿模型。
除了模型维度的对比,跨框架的消融实验同样提供了清晰的定论:
-
当使用相同的前沿基座模型(如 Claude 或 OpenAI 系列)时,OpenMLE-Evo 展现出了超越通用代码脚手架(如 Claude Code 或 Codex 默认配置)的长程探索稳定性,证明了经验卡片与多目标采样逻辑在复杂工程任务中的优越性。
-
为了验证后训练方法的普适性,团队在另一款基础模型(Qwen3-30B 系列)上进行了完全相同的训练复现,同样观察到了奖牌率从 34.85% 飙升至 53.03% 的显著正向迁移,排除了特定基座模型偶然带来的性能偏差。
最值得关注的或许是模型在完全未见的科学基准 NatureBench Lite 上的零样本迁移表现。NatureBench脱离了 Kaggle 风格的表格与数据挖掘套路,直接面向真实的科学计算与前沿算法重构。实验采取了严格的控制变量设计:在固定搜索框架的前提下,仅仅将底层模型替换为训练后的 Frontis-MA1,Match-SOTA 成功率即从 50% 攀升至 70%;而在固定基础模型的情况下,仅将通用搜索替换为 OpenMLE-Evo 框架,成功率则从 20% 跃升至 50%。这强有力地说明,通过大规模可执行工程沙盒沉淀下来的算子能力,并没有退化为对竞赛套路模板的机械记忆,而是抽象成了通用的科研与算法优化常识。
递归自提升的下一站
长期以来,AI4AI 领域普遍存在一种假设:只要基础语言模型的通用推理能力足够强,配合简单的提示词脚手架,复杂的工程和科研任务就能迎刃而解。OpenMLE 与 Frontis-MA1 的实践给出了一个截然不同的答案——即使是拥有数百亿参数的成熟模型,如果不直接置身于带有执行反馈的闭环环境中进行端到端的算子淬炼,它在面对真实世界中冗长、迟滞且频繁报错的工程流水线时,依然会表现得步履蹒跚。
将进化演化算子作为强化学习的显式目标,并利用轻量级的结构化经验看板解耦推理开销,OpenMLE 证明了“小而专注”的模型完全能够在高度复杂的垂直领域战胜万亿巨兽。更为深远的意义在于,OpenMLE 整体框架的完全开源,为业界研究“AI 训练 AI”提供了一套开箱即用的、真正可执行的基础设施。
从让模型学会修改一段代码,到让模型在沙盒反馈中自我纠错,再到让模型主导数以千次的实验管线迭代,人类正在一步步逼近真正的递归自提升。当下一代模型开始直接利用这套系统来为自己设计更加高效的训练数据配比、筛选更强大的神经网络层、优化自身的后训练策略时,这个关于机器自我进化的故事,才刚刚拉开序幕。