Harbor-Index:统一54个Agent基准,最强模型通过率仅28%
Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation

大模型向通用智能体(Agent)演进的过程中,行业对评测基准的需求经历了一场爆发式扩张。从代码修复、系统运维、终端操作到科学探索与金融分析,各类智能体评测集在过去两年内涌现了数百个。然而,这场基准繁荣的背后隐藏着一个巨大的工程泥潭:每一个新基准往往绑定了专属的交互环境、独特的执行沙箱、私有的打分协议以及定制的模型调用脚本。
ArXiv URL:https://arxiv.org/abs/2609.04298
这种碎片化带来了一个致命难题:如果要评测 $m$ 个基准与 $n$ 个智能体框架,工程团队需要开发和维护 $\mathcal{O}(mn)$ 次定制集成。这不仅导致评测成本高昂,更使得不同论文和产品发布中的指标充满混淆因果——你很难分清一次评测成绩的提升,究竟来自模型底座的智能跃迁,还是来自脚手架(Scaffold/Harness)编写者针对特定基准私下做出的提示词工程微调。更令人尴尬的是,由于缺乏严格的统一质检,大量看似极难的评测任务,其真实未解决原因竟然是测试用例断言错误或沙箱死锁。
为了打破这种混乱割裂的局面,来自康奈尔大学、北京大学等机构的研究人员推出了统一智能体评测基础设施 Harbor Adapters,以及在此基础上经历严苛质检淬炼而成的元评测集 Harbor-Index。通过定义统一的任务环境与评分接口,该工作将工程对接复杂度从 $\mathcal{O}(mn)$ 降低到 $\mathcal{O}(m+n)$。在动用超过 30 万美元算力、消耗 2260 亿 Token、跨越 54 个基准的大规模实测之后,研究团队揭开了一系列被繁荣数据遮蔽的残酷真相,并最终筛选出一套包含 82 个高质量硬核任务的 Harbor-Index 1.0——即便是当下最前沿的 GPT-5.5 搭配专用 Codex 脚手架,其任务通过率也仅有 28.0%,所有参测模型无一能跨过 30% 这一门槛。
架构解耦:从 $O(mn)$ 到 $O(m+n)$ 的工程标准化
智能体评测之难,难在它本质上是有状态的交互式执行,而非简单的静态问答。一个评测运行器不仅要向模型输入提示词,还要拉起 Docker 容器、注入动态依赖、拦截终端 Bash 输出、挂载浏览器或文件系统驱动,并在执行结束后运行针对环境副作用的验证代码。在以往的研究生态中,基准作者往往将环境配置、验证逻辑与特定的 Agent 运行回路深度耦合在一起。
Harbor Adapters 的核心思路是将“基准定义”与“智能体执行”彻底解耦。Harbor 框架将任何一个复杂的交互式任务标准化为四个核心抽象构件:
-
Instruction(指令):面向 Agent 的无歧义目标描述;
-
Environment(环境):打包了依赖、工具链路、文件系统状态的隔离沙箱规格;
-
Test(测试):用于评定任务是否成功的判定器(如单元测试、精确字符串比对或 LLM-as-a-judge 裁判);
-
Solution(解法):用于验证环境连通性与难度基准的参考轨迹或基准答案。
在这种抽象下,一个基准只需要编写一个 Adapter 将自身的任务结构映射到 Harbor 协议中,而任意一个 Agent 也只需要对接一次 Harbor 的统一客户端。整个生态的集成复杂度因此被重构为线性的 $\mathcal{O}(m+n)$。目前,该基础设施已经适配了超过 80 个业界基准,支持 Daytona、Modal 和 E2B 等多种主流云端隔离沙箱,并兼容了 GPU 交互与模型裁判机制。
为了确保转译过程不破坏基准原有的评测语义,研究团队并未采取粗暴的代码重写,而是设计了由自动化检查、初审和终审构成的三阶段人工代码审查机制,累计在 GitHub 上产生了超过一万条审核讨论;同时在原版环境与 Harbor 适配版本之间运行严格的等价性(Parity)对比实验,确保在相同模型与随机种子下统计得分保持一致。

规模化实测:54个基准与2260亿Token的数据审判
在统一了执行接口之后,研究者得以完成以往因工程壁垒而无法实现的大规模横向受控实验。评测涵盖了来自 Google、OpenAI 和 Anthropic 的 8 个主力模型(跨越 Gemini-3 系列、Claude 4.6/4.5 系列以及 GPT-5 系列),每个模型分别在通用的跨家族脚手架 Terminus-2 以及各自厂商的原生脚手架(Codex、Claude Code、Gemini CLI)下运行,覆盖 54 个基准、6,627 个任务,每种配置重复 3 次以消除随机波动,最终累计产生了约 30 万条完整的执行轨迹。
面对如此浩瀚的交互数据,研究团队从基准有效性、脚手架作用、调用效率和失败归因四个维度展开了深度分析,得出了若干颠覆直觉的重要发现。
第一个核心洞察是评测空间的严重冗余与维度坍缩。如上图所示,虽然智能体基准层出不穷,但大量早期基准已经接近饱和。在评估的 54 个基准中,有 13 个基准的前沿模型得分已经突破 90%(例如曾经被视为高难度的 GPQA-Diamond)。更关键的是,许多基准内部的任务同质化极高。统计分析显示,在包含至少 10 个任务的 52 个基准中,平均每个基准只需要抽取 3 个代表性任务,就能以 $\rho \approx 0.923$ 的极高秩相关系数复现所有参测模型在全量任务上的能力梯队排序。这意味着当下行业耗费巨额算力运行的庞大测试套件,绝大部分计算都浪费在了捕获高度重叠的信号上。
第二个结论击碎了“脚手架设计压倒一切”的神话。在 Agent 开源社区中,针对 Prompt 模板、ReAct 循环细节和工具调用的脚手架工程常常被赋予极高权重。然而,通过引入以基准为随机截距的线性混合效应模型(Linear Mixed Model),研究者发现基准本身难度贡献了高达 $0.75$ 的组内相关系数(ICC),而在剥离环境因素后,基础模型(Base Model)的固定效应范围(0.451)是脚手架设计(0.087)的整整 5.2 倍。换言之,精心设计的 Harness 确实能优化交互效率,但在决定任务成败的根本维度上,底层基础模型的推理与规划上限依然具有绝对的统治力。
第三个发现关乎效率与经济成本的实际取舍。实验揭示了一个清晰的规律:在各个难度梯度的任务上,综合能力更强的前沿旗舰模型往往使用更少的主动交互轮数和输出 Token,它们在解决问题时表现得更为干脆利落。然而,由于前沿旗舰模型的每百万 Token 标价远高于轻量化模型,这种“Token 消耗上的精简”完全无法抵消其高昂的单价溢价。在实际账单中,低阶模型每轮任务的美元成本依然比旗舰模型低 2 到 3 倍。在任务成功率与经济账本之间,企业依然面临着不可回避的现实摩擦。
震惊的质检风暴:大量“未解难题”其实是测试用例自身的 Bug
长期以来,评测界普遍默认一个假设:榜单上那些迟迟未能攻克的长尾难题,必然代表着当下前沿大模型无法逾越的“智能天花板”。然而,当研究团队组织领域专家深入抽样轨迹进行人工质检时,却揭开了一个令人尴尬的底层事实——在现存基准最难的未解决候选任务中,有大约三分之一的任务之所以未能解决,完全是因为任务设计本身存在严重缺陷。
在智能体评测中,验证器(Verifier)的执行逻辑远比简单的单选题答案匹配脆弱得多。一旦环境依赖出现裂痕,或者评分判定器存在逻辑漏洞,模型即使生成了完全正确的解法也会被判为失败,甚至陷入无限超时。论文详细列举了几类典型的破损场景:
-
验证器死锁与事件缺失:在知名评测 GAIA2 抽检进入人工审查的 4 个难题中,基准自身的适配层根本没有触发验证器一直在挂起等待的模拟环境事件。这意味着无论接入多么强大的智能体、采用多么精妙的策略,评测进程都必然以超时结束,任务通过率被强行压制为零。
-
验证器越权断言(Verifier Overreach):在面向复杂工程的 SWE-bench Pro 中,某些任务的验证脚本竟然强行断言了某些前端 DOM 的
data-testid属性字符串以及特定的系统日志打印格式。然而,给智能体的初始 Prompt 指令中从未规定过这些内部实现细节。智能体编写了逻辑完全正确、功能完好无损的代码,却因为日志输出格式稍有出入被无情扣分。 -
刚性签名绑定抵消正确解法:在评估代码转译能力的 CRustBench 中,测试套件将 C 到 Rust 的转译结果强行绑定在一个预设的硬编码 Rust 函数接口上。只要智能体依据 Rust 最佳实践调整了所有权生命周期标注或重构了函数签名,哪怕程序兼具安全性与高效性,也会被评测脚本全盘推翻。
这些由验证器逻辑缺陷造成的失败,在传统榜单上统统被伪装成了“模型智能不足”。这种假性难度(Artificial Difficulty)不仅误导了大模型能力的发展方向,也让行业把大量资源浪费在了对抗不可解的系统 Bug 上。
Harbor-Index:82道真题重新锚定智能体天花板
为了剔除假性难度的干扰,为学术界和工业界提供一个真正经得起推敲、轻量可负担且具备长久区分度的评测标杆,研究团队构建了 Harbor-Index 1.0。
Harbor-Index 的筛选过程宛如一场残酷的质量清洗漏斗。团队首先从 54 个适配基准的 6,627 个任务池中,提取出在 GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro 跨 18 次运行中通过率均不超过 $33\%$ 的 1,311 个候选困难任务;随后引入 Gemini-3-Flash 针对指令与验证的一致性、逻辑真实性进行第一轮机器筛查,保留 307 个;紧接着,14 名资深人类专家介入展开双盲审查,剔除隐藏缺陷任务后浓缩至 110 个;随后由高级评审委员会根据任务多样性挑出 100 个;最后,高级研究员对这 100 个任务逐一进行基于完整执行轨迹的“死因剖析”和假阳性/假阴性验证,修复可修正的环境,彻底丢弃修不好或修复后难度锐减的任务,最终打磨出 82 个横跨 29 个基准的极高纯度任务集合。

随后,研究团队在 Harbor-Index 1.0 上对 9 款主力模型展开了严谨评测,涵盖闭源前沿(GPT-5.5、Claude Opus 4.8、Gemini 3.1 Pro、Qwen3.7 Max)与开源阵营主流代表(GLM 5.2、Kimi K2.6、MiniMax M3、DeepSeek V4 Pro、MiMo V2.5 Pro)。在每个模型分别运行原生脚手架与通用 Terminus-2 脚手架的受控实验中,所有参测系统在真实硬核任务面前全线告急:
在 Harbor-Index 1.0 这一套干净的考卷上,没有任何一个“模型 + 脚手架”组合的综合通过率能够突破 30%。
表现最好的组合是 GPT-5.5 搭配厂商专有的 Codex 脚手架,其通过率仅达到 28.0%;紧随其后的是 Claude Opus 4.8 搭配 Claude Code。在开源阵营中,绝大部分模型在面临高度不确定性的多步骤复杂环境时,通过率普遍跌落至 10% 乃至个位数区间。
通过对全量执行轨迹的细粒度拆解,研究者进一步定位了阻碍智能体通往成功的真实瓶颈:在当前约束下,智能体的失败主要由三类构成:453 次无解超时、361 次临门一脚的“惜败”(Near-miss),以及 445 次从根本上走偏的错误解法。其中,能力处于中后段的模型,其超时率是前三名旗舰模型的近两倍(36.7% 对比 18.7%);而原生脚手架凭借更契合模型输出习惯的上下文组织与内建工具链,能够在相同任务下将超时率从 Terminus-2 的 42% 大幅压低至 26%。
智能体评测的范式转向
Harbor Adapters 与 Harbor-Index 的落地,标志着大语言模型智能体评测正在从早期的“粗放堆量”走向“精密工业化”。
过去,评估一个 Agent 动辄需要跑数千道题目、烧毁数万美元的 API 费用,却最终在一堆充满假阳性与验证器死锁的脏数据中得出充满噪点的结论。Harbor Adapters 证明了通过统一抽象层,异构基准的维护完全可以实现工程解耦与资产复用;而 Harbor-Index 则展示了高质量元评测集的构建范式:仅仅依靠 82 道经过纯手工轨迹校准与代码审查的真题,就足以在极低的算力成本下,清晰刻画出全球顶级模型梯队的真实座次与能力断层。
当基准本身的工程裂痕被彻底修平,智能体的发展才得以摆脱虚假繁荣的迷雾。GPT-5.5 面对 Harbor-Index 时那区区 28% 的通过率并非坏事,它像一记清醒剂,不仅指明了当下大模型在长程自主规划、深层逻辑推理与严苛环境交互中的巨大鸿沟,也为下一代真正鲁棒的通用智能体确立了极具含金量的演进标尺。