胜率飙升至77%!AHE框架让AI代码智能体自主进化“脚手架”

Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses

近年来,大模型在长线软件工程任务中的表现令人瞩目。 从解决现实世界代码库中的复杂Bug,到执行多步终端工作流。 代码智能体似乎正在逐步接管那些曾经专属于人类程序员的繁重工作。 然而,决定这些智能体最终表现的,往往不仅仅是底层基础模型(Base Model)的智力水平。

ArXiv URL:http://arxiv.org/abs/2604.25850v3

在实际应用中,智能体极大地依赖于其外围的工程组件。 这些组件包括塑造工作风格的系统提示词、连接文件系统与终端的工具接口。 以及控制上下文、执行流和错误恢复的中间件。 学术界将这些独立于模型之外、可编辑的组件集合统称为智能体的“脚手架”(Harness)。 这就好比一台拥有顶级马力的赛车引擎,如果没有匹配的传动系统、底盘调校和空气动力学套件,依然无法在赛道上夺冠。

目前,脚手架的调优极大依赖于人类开发者的手工“打磨”。 开发者需要逐行检查海量的运行日志,寻找失败的蛛丝马迹,然后手动微调提示词或工具代码。 但随着基础模型的快速迭代,这种“刀耕火种”的试错模式显然已力不从心。 如何让AI自己去优化自己的脚手架? 复旦大学、北京大学等机构联合提出了一项名为智能体脚手架工程Agentic Harness Engineering, AHE)的全新突破性框架。

破局之道:AHE框架与三大“可观测性”支柱

让智能体自主进化脚手架,最大的拦路虎是什么? 并不是智能体本身的能力不够,而是缺乏有效的结构化反馈。 数以百万计的运行日志犹如一团乱麻,动作空间极其复杂,修改的效果也难以准确归因。 为了解决这一瓶颈,该研究敏锐地指出,核心破局点在于可观测性Observability)。 AHE构建了一个严密的闭环进化系统,通过三大支柱彻底重塑了进化过程。

组件可观测性:让动作空间清晰可见

在传统的耦合系统中,牵一发而动全身。 AHE采用了解耦的基底架构 $NexAU$,将脚手架的组件转化为独立的文件级表示。 系统提示词、工具脚本、中间件逻辑都被显式暴露出来。 这种设计让动作空间变得极为清晰,且修改操作可随时回滚。 最重要的是,为了避免污染实验数据,AHE的初始种子脚手架 $H_0$ 被刻意设计得极其精简。 它仅包含一个基础的Shell执行工具,没有任何中间件或子智能体,迫使后续添加的每一个组件都必须通过真实测试的考验。

经验可观测性:从海量数据中提取真知

面对百万级别的原始轨迹Token,直接让模型阅读是低效且昂贵的。 这就像是让赛车手在比赛后直接阅读数万行的传感器原始代码,根本无法据此调整悬挂。 AHE引入了智能体调试器Agent Debugger)框架。 它将原始轨迹转化为分层、可下钻的证据语料库。 调试器会在一个独立的文件环境中分析同类任务的失败根因或成功模式。 最终生成针对每个任务的分析报告,汇总成全局视角的概览文档。 这种渐进式披露的策略,让进化智能体能够精准吸收结构化的根本原因,而非生嚼原始日志。

决策可观测性:让修改成为可证伪的契约

决策可观测性是AHE避免陷入随机试错的最精妙一环。 每一次代码修改或提示词调整,都不会被盲目应用。 进化智能体必须提交一份包含自我声明预测的更改清单。 在下一轮任务中,系统会根据实际运行结果来验证这些预测是否成真。 这就使得每一次编辑都变成了一份可证伪的“契约”。 一旦发现修改无效或导致性能退化,系统会立刻在文件粒度上进行回滚操作。

核心实验:打破人类设计的极限表现

AHE在真实环境中的表现究竟如何? 研究团队在极具挑战性的长线终端任务基准 $Terminal-Bench\ 2$ 上进行了严格测试。 在这个包含89个复杂任务的测试集中,AHE经历了十轮无人值守的自动迭代。

Refer to caption

结果显示,AHE将其 $pass@1$ 成功率从初始的 $69.7\%$ 强劲拉升至 $77.0\%$。 这一成绩不仅超越了人类精心设计的开源标杆 $Codex-CLI$($71.9\%$)。 也毫无悬念地击败了基于纯提示词进化的 $ACE$ 和基于轨迹反馈的 $TF-GRPO$ 基线。 这清晰地证明,联合进化多个脚手架组件,远比单纯修改提示词要有效得多。

有趣的是,在最高难度的任务子集中,AHE略微落后于 $Codex-CLI$。 研究人员追踪后发现,这并非能力缺失,而是AHE自己生成的组件之间在长线任务上产生了轻微的干扰。 这一细节恰恰展示了完全自主进化的真实特性:它会在全局收益最大的方向上寻找平衡点。

卓越的泛化能力:跨任务与跨模型的迁移验证

AHE进化出的脚手架,会不会只是对当前测试集的过拟合? 为了验证这一点,研究人员将冻结后的AHE脚手架直接扔进了全新的任务环境 $SWE-bench-verified$。 在没有进行任何重新进化的前提下,AHE不仅取得了优异的总体成功率,消耗的Token数量甚至比初始种子还要少 $12\%$。

更令人振奋的是其强大的跨底座模型迁移能力。

Refer to caption

研究人员将底座模型切换为 $Qwen-3.6-Plus$、$Gemini-3.1-Flash$ 以及 $DeepSeek-V4$ 等不同厂商的模型。 结果表明,AHE脚手架在所有新底座上均实现了正向胜率增长,提升幅度在 $+5.1$ 到 $+10.1$ 个百分点之间。 这一关键发现证明,AHE沉淀下来的是通用的工程协调模式,而不是某种只能在特定模型上生效的奇技淫巧。

深度消融分析:提示词真的那么重要吗?

到底脚手架中的哪一部分带来了最大的收益? 这往往是许多开发者在日常调优中最关心的痛点。 为此,研究人员将完全进化后的AHE组件单独拆解,逐一替换回初始种子中进行消融实验。

结果出人意料:单纯将进化后的“系统提示词”放回去,反而导致了总成绩下降了 $2.3$ 个百分点。 而真正拉动性能飙升的主力军是以下三项硬核组件: 首先是工具集,它贡献了巨大的增益。进化后的工具不仅能执行Shell命令,还能自动抓取和暴露上下文线索。 其次是长期记忆机制,它在应对复杂边界条件时表现神勇,带来了高达 $5.6$ 个百分点的胜率提升。 最后是中间件逻辑,它强制引入了同构的闭环检查机制。 这一结论给业界敲响了警钟:事实性的系统架构调整,远比散文式的策略指令(纯改Prompt)更具跨域迁移价值。

同时,实验也揭示了组件之间的非加性相互作用。 记忆、工具和中间件如果各自单兵作战,提升都很明显。 但如果全部叠加,它们往往会出于共同的谨慎机制而触发重复校验,从而消耗掉宝贵的任务轮次预算。

局限性与工程启示:如何克服“退化盲区”

虽然AHE展示了极大的潜力,但研究团队也坦诚地揭示了该闭环目前的一个致命弱点。 在自我归因分析中,进化模型在预测“某个修改能修复哪些问题”时,精确度和召回率都极高,远超随机基线。 这证明它的修改是有理有据的,绝非瞎猫碰死耗子。

但在预测“这个修改可能会破坏哪些原有功能”时,智能体却表现出了明显的退化盲区Regression Blindness)。 它无法预见某个看似精妙的修复,会在另一个不起眼的角落引发崩溃。 智能体能够清晰地为自己的建设行为辩护,却对潜在的破坏性一无所知。 这导致整个进化曲线呈现出非单调的波动。

总而言之,智能体脚手架工程提供了一条切实可行的自动化道路。 它将代码智能体的工程经验转化为可积累、可审计的外部资产。 未来,如何赋予AI“退化预见性”,构建更加完备的安全护栏,将是解锁下一代完全体自动进化的最终钥匙。