8B小模型单挑120B大厂基线!HASE框架让AI学会自我重构与环境演化
Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions
为什么仅有80亿参数的小模型,能够在极其复杂的代码生成任务中,击败1200亿参数的巨头大模型?
ArXiv URL:http://arxiv.org/abs/2607.03935v1
当常规的AI系统都在绞尽脑汁地优化“如何解答问题”时,一项前沿研究揭示了降维打击的秘密。 那就是:直接赋予模型“修改考卷”和“重构考场”的超级权力。
本文提出了一种全新的 环境感知自进化(Harness-Aware Self-Evolving, HASE) 强化学习框架。 该框架彻底打破了传统算法的限制。 它让一个基础的 $Qwen3-8B$ 模型,不仅能输出任务解答,还能顺手优化自己的提示词、检索工具,甚至自动修复漏洞百出的任务评估代码。 在因子挖掘任务中,这种自我进化的8B模型全面碾压了配置奢华的120B强基线系统。
传统自进化算法的致命盲区
要理解HASE的突破,首先要知道什么是“环境”。 在AI领域,模型周围的脚手架代码被称为环境(Harness)。 它通常包括提示词、上下文记忆、检索机制、工具接口以及评估器。
传统的自进化框架,通常将这个环境视为绝对固定且完美无缺的。 这就像把考生关在一个规则极其死板的考场中。 如果考题说明不完整,或者阅卷标准存在漏洞,模型就只能死磕,甚至故意寻找漏洞进行“奖励作弊”。 只要环境不改变,模型就永远被困在低效的计算空间里。
该研究团队敏锐地指出,环境的设计往往与模型权重同样重要。 环境决定了模型能观察到什么,能采取什么动作,以及其产出将如何被评分。
统一动作空间与环境协同进化
HASE框架的核心机制,是将“解答问题”和“修改环境”放置在一个统一的多轮交互动作空间中。
传统的脚手架搜索往往需要引入一个外部的、强大的专门写代码的模型。 但在HASE中,不需要任何外部提议者。 同一个 $Qwen3-8B$ 策略模型,既能提议任务解答,也能通过沙盒工具提交环境修改补丁。 为了防止模型胡乱修改规则导致系统崩溃,该研究将环境分为两类,并实施了严格的阶段级审查机制。

引导环境的自由演化
第一类是 引导组件(Guidance Harness)。 它包含提示词、上下文格式化和检索工具,主要负责给模型提供搜索先验和参考资料。 在HASE的强化学习循环中,模型在单次轨迹(Rollout)中可以自由查阅并修改这些引导组件。
比如,当模型发现当前的上下文信息太过繁杂时。 它可以立刻调用 overwrite 动作,将原本无边界的历史记忆追加逻辑,改为基于 $IC$ 排序的定长检索。 修改后的环境仅在当前轨迹中生效。 如果在阶段边界(Phase Boundary)的评估中,这个修改过的环境在验证集上取得了更高的“概念验证得分”。 该补丁就会被正式提交为持久化更新,造福后续的所有训练轮次。
评估环境的锚定修复
第二类是 评估组件(Evaluation Harness)。 评估器直接决定了分数的发放,随意修改极易引发毁灭性的奖励黑客行为(Reward Hacking)。 因此,HASE要求评估器的进化必须有严格的锚点。
只有当本地评估器给出了高分,而外部真实预言机(Oracle)却判定该解答不合格时。 这种“本地-外部”的评分分歧才会被触发,并记录到错误样本集中。 接下来,模型必须且只能针对这些具体的错误样本,提交补丁来修复本地评估器。 这种设计完美模拟了人类程序员的真实Debug场景: 只在发现反例时才去修补规则,从而确保进化过程是填补漏洞,而非为了刷分而放水。
核心实验与性能突破
研究团队在多个高难度领域对HASE进行了详尽的测试,结果令人瞩目。
量化因子挖掘中的碾压局
量化因子挖掘是一个高度依赖代码搜索环境和金融先验的硬核任务。 此前的最强基线CogAlpha系统,动用了庞大的GPT-120B模型,并配合了由21个Agent组成的极其复杂的人工层级架构。
而HASE仅凭单一的8B模型,在一无所有的初始状态下开启了自我进化。 在多轮训练中,模型不仅进化出了高质量的因子代码,还重写了自己的环境检索逻辑。 在最终的Qlib成本感知模拟回测中: HASE的年化超额收益(AER)达到了惊人的 $14.35\%$ ,远远甩开了基线模型的 $7.89\%$。 衡量因子预测能力的秩相关系数(RankIC)也逼近了极高水准。 这证明了,只要赋予环境进化的权限,小模型完全可以反杀堆砌算力的巨兽系统。
几何算法发现中的自动纠错
在海尔布伦三角形(Heilbronn triangles)和圆形装箱问题中,研究人员展示了模型修复评估器的强大能力。
以圆形装箱为例,初始给定的本地评估器是一个“残次品”。 它只检查数值是否合法,却完全忘了检查圆是否越界或相互重叠。 模型起初敏锐地利用了这个漏洞疯狂作弊,拿到了 $35.459643$ 的虚高分数。
但这立刻被外部预言机的分歧检测捕捉到。 HASE随即触发了修复机制,模型根据错误样本,自动编写并植入了边界检测和重叠检测代码。 更有趣的是,后来模型甚至发现最初的重叠容差 $10^{-8}$ 依然不够严谨。 于是进一步将验证精度收紧到了任务要求的 $10^{-12}$。 在修复了这些底层规则后,模型权重继续在严格的环境中进行强化学习。 最终达到了逼近当前最先进水平的 $2.635983$ 分。
权重协同进化的必要性
为了证明环境和模型权重必须“协同”进化,研究团队还做了一组对照消融实验。 如果在评估器被修复后,立刻冻结模型权重(FREEZE基线)。 模型的最终得分会迅速停滞在 $0.021880$ 左右。 而只有在全量协同进化(FULL)模式下,强化学习带来的梯度更新才能让策略模型彻底内化刚刚修复的严格约束。 并继续攀升,最终达到 $0.036082$ 的高分。 这意味着,单纯修改规则是不够的,模型本身的“大脑”也必须同步适应新规则。
局限与工程启示
HASE框架雄辩地证明了一个全新的扩展法则: 与其将所有算力和工程资源都投入到静态的模型权重训练中。 不如让模型和它赖以生存的工作环境进行统一的协同进化。
当然,该研究在现阶段也做出了一些偏向安全性的保守妥协。 例如,目前允许模型编辑的环境组件依然需要通过预先设定的白名单来限制。 评估器的修改也过于依赖外部预言机的离散判定信号。 这可能会在无形中拒绝掉某些具有高度破坏性但却极具创新潜力的底层环境重构。
对于未来的Agent系统工程而言,HASE提供了一条极具操作性的路径: 我们或许不该再为大模型手工编写繁琐且脆弱的长代码提示词了。 把环境编辑的API交给模型自己。 引入更智能的静态分析和动态测试机制,让AI系统的自我迭代走向真正的无边界演化。 这才是通向超级智能更优雅的一步。