StateM:扩展控制层,终端代理精度达95.3%且成本直降38倍!
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

在评估复杂任务中的大语言模型智能体时,研究人员经常观察到一种极具启发性的失败模式:底层的语言模型明明具备解决任务每一个局部步骤的能力,但整个智能体运行却依然走向失败。智能体往往会在漫长的执行过程中偏离既定计划,丢失对可变任务状态的追踪,跳过必要的验证步骤,重复毫无成效的动作,甚至在最终交付物尚未经验证时就过早地宣告任务完成。
ArXiv URL:https://arxiv.org/abs/2608.15089v1
面对这种长视野任务下的崩溃,行业内的主流应对策略几乎都集中在“模型层面”:扩大预训练规模、增加后训练数据、强化测试时推理(Test-time reasoning)或者引入多智能体协同机制。然而,近期一项相关研究提出了一个截然不同且极具现实意义的疑问:有多少被归咎于“模型能力不足”的失败,实际上仅仅是外围控制层(负责维护状态、约束执行、验证进度和从错误中恢复的框架)的失败?
基于这一洞察,研究团队提出了一种名为“Harness Scaling(控制层扩展)”的全新演进路线。与模型扩展不同,控制层扩展并不改变模型的任何权重,而是通过系统性地优化智能体周围的运行时环境,将模型已有的能力最大化地转化为可靠、完整的任务产出。为了验证这一路线,研究团队开发了 StateM——一个专为智能体设计的原生运行时系统。在 Terminal-Bench 2.1 基准测试中,StateM 在不改动模型权重的前提下,不仅将 GPT-5.5 变体的准确率提升至超越 GPT-5.6 Sol Ultra 的水平,更在后续实验中创下了 95.3% 的极高原始准确率。更令人瞩目的是,将这一套控制逻辑迁移至成本更低的 DeepSeek-V4 Flash 模型后,整个基准测试的最终 API 评估成本从 GPT 参考基线的 574.68 美元暴降至约 15 美元,同时依然维持了接近 89% 的顶尖成功率。
这一成果不仅重新定义了智能体工程的优化方向,也为如何以极低成本逼近前沿模型性能提供了清晰的实现路径。
长视野任务中的控制信号稀释与状态模糊
要理解 StateM 为什么能取得如此显著的成效,首先需要剖析现有智能体在长周期任务中究竟遭遇了什么瓶颈。研究团队提出了两个核心的运行期假说。
第一个假说是“控制信号稀释”。在许多任务的初始阶段,智能体通常会生成一个紧凑的执行计划以及明确的完成标准。然而,随着任务的推进,上下文中会堆积大量的终端命令、环境观察回显以及反复的试错与修复记录。在这个不断膨胀的追加式历史记录中,最初的紧凑计划和核心约束条件会被海量的噪音信息稀释,导致智能体在关键决策点“遗忘”了最初的目标。
第二个假说是“可变状态模糊”。在传统的单轨上下文中,智能体必须从追加式的历史记录里自行逆向推导出当前的状态:哪些子目标已经完成,哪些前置依赖还在挂起,哪些尝试已经失败,以及下一步的合法动作是什么。这种依赖模型自行从长文本中“重建”当前权威状态的做法,极易引发状态幻觉或逻辑断层。
这两个假说并非是在质疑 Transformer 架构的注意力机制存在根本缺陷,而是从系统工程的操作层面指出了现有架构的隐患。它们共同指向了一个解决方案:必须将程序性的状态外置,在智能体进入新的执行阶段时刷新相关的控制信息,并在进行重要状态流转前通过外部手段强制检查证据。
智能体控制层的设计空间与取舍
在构建外部控制层时,现有的系统往往在“运行时强制力”与“智能体自主性”之间面临艰难的权衡。
一方面,基于有限状态机(Finite State Machine)或图结构(如 LangGraph)的运行时能够提供极其明确的工作流状态、持久化能力、条件路由和错误恢复机制。但在这些系统中,执行往往是围绕开发者预先编写的静态控制器组织的。这种架构的强制力极强,却大幅剥夺了智能体的自主探索和推理空间,往往将智能体降级为固定节点内的一个简单 API 调用。
另一方面,通用命令行(CLI)智能体(如 Codex 或 Claude Code)保留了极大的推理和动作空间,允许智能体自由选择工具、修改代码和迭代解决问题。然而,它们所依赖的软性计划(Soft plans)、检查单或指令文件,本质上只是一段自然语言文本,无法在系统层面形成统一且具备强制校验能力的控制面。智能体随时可能无视这些软约束,导致任务在中途失控。
StateM 准确地切入了这一设计空间的中间地带,目标是融合广泛的智能体自主性与明确、可强制执行的状态流转。这并不是简单地给智能体增加一个外部监控器,而是重新定义了“谁来操作控制层”的问题。
StateM:智能体原生的控制层架构
StateM 是一个专为长周期 CLI 智能体设计的轻量级运行时。它的核心控制层表现为一个人类可读的 YAML 运行手册(Runbook),其中定义了离散的状态、合法的状态流转(Transitions)、特定状态下的局部指令、钩子函数(Hooks)、检查条件(Checks)以及恢复规则。
StateM 的架构设计严格遵循两个核心原则。
第一个原则是将每一个“状态”视为一个“上下文与契约的边界”。当智能体进入某个状态时,StateM 运行时会自动为其刷新适用于该阶段的活动指令和持久化任务信息,从而避免了控制信号在冗长历史中被稀释。而当智能体试图离开当前状态时,必须满足明确的退出条件(Exit conditions)。宿主运行时会直接执行这些校验条件;对于那些需要语义判断的条件,则要求智能体生成可审计的证明记录,甚至触发进一步的审查或修复。这一机制至关重要,因为在 StateM 中,智能体单方面“宣告”任务完成不再被视为有效的独立验证。
第二个原则是“智能体与人类共享控制层”。在 StateM 中,智能体仍然是核心的执行者,保留了完整的、统一的推理循环。但它的执行进度被暴露在一个宿主运行时可强制执行、且人类用户可随时介入修改的控制面上。更为巧妙的是,StateM 具有极强的“智能体原生”特性:智能体可以通过其执行任务时所使用的同一个普通命令行环境,来检查自身当前状态、请求状态流转、查看失败的校验条件、回顾执行历史,甚至在遇到意外中断后进行恢复。这一切都不需要对底层的语言模型进行任何微调或修改。
通过这种设计,StateM 历史性地将三种通常难以共存的属性集成在了一个系统中:
-
状态边界既提供了刷新的控制上下文,又构成了明确的流转契约。
-
通用智能体保留了统一的推理循环,而没有被强行拆解成固定图节点中的局部模型调用。
-
运行手册是一个机器可操作的共享工件,智能体和用户可以通过完全相同的执行环境对其进行检查、审计和修订。
弥合程序性执行的三重鸿沟
有了明确的控制面后,研究团队深入探讨了智能体在长期执行中可能遇到的三种认知与行为鸿沟,并利用 StateM 的机制逐一进行了定点突破。
首先是“认知鸿沟(Epistemic gap)”,即智能体在决策点根本缺乏相关知识或合适的方法。其次是“程序性合规鸿沟(Procedural-compliance gap)”,即正确的操作流程已经在上下文中激活,但智能体未能完整遵守或提前终止了执行。
最容易被忽视的是“程序性记忆鸿沟(Procedural-memory gap)”。智能体在一次运行中可能成功诊断出了某个错误并加以解决,但在后续遇到相同风险时,却无法保留并重新调用这一经验教训。现有的提示词工程往往难以跨越多个独立的运行实例来积累这种程序性经验。
StateM 通过“状态局部上下文(State-local context)”、“版本化的实践(Versioned practices)”以及“受检流转(Checked transitions)”来分别应对这三重鸿沟。状态标识了当前运行所处的精确位置;版本化的程序性记忆则记录了系统在过往运行中积累的、在该特定位置应当采取的正确行动;而受检流转则强制保证了合规性。
这促成了一种被称为“失败驱动的控制层优化(Failure-driven harness optimization)”的开发范式。在一次运行失败后,无论是人类还是一个独立的“超级智能体”,都可以将失败原因归类为上下文缺失、流转无效、检查薄弱等控制层缺陷。随后,系统可以提出针对性的修改,如调整状态边界、强化拦截钩子或补充恢复规则。候选的修改在经过回归测试后,会被合并到新版本的运行手册中。在这个过程中,模型权重没有发生任何改变,但关于如何执行特定任务的程序性知识却大量累积在了这个外部的控制层中。
质量与成本前沿的实证突破
为了验证 Harness Scaling 的有效性,研究团队在 Terminal-Bench 2.1 和 BusinessBench 两个基准上进行了多维度的严格评估,其结果在“质量”与“成本”两个前沿均展现出了惊人的优势。
在质量前沿方面,StateM 证明了控制层的优化完全可以媲美甚至超越模型代际的升级。在 Terminal-Bench 2.1 上,结合了 StateM 的 GPT-5.5 变体(xhigh)达到了 92.1% 的准确率,远超 83.1% 的基线水平,甚至以微弱优势压倒了下一代模型 GPT-5.6 Sol Ultra 的 91.9%。
更具有说服力的是控制逻辑的“跨代际冻结迁移”能力。研究团队将在 GPT-5.5 上开发固化的运行手册直接应用于 GPT-5.6 系统,未做任何逻辑修改。结果显示,该组合在 445 次公开提交测试中创下了 95.3% 的极高原始准确率(即使剔除可能存在争议的测试轨迹,准确率依然稳定在 93% 以上),并且在 89 个独立任务中至少取得了一次成功。同样被冻结的控制配置文件,也成功将较弱的 GPT-5.6 Luna 模型的准确率从 76.7% 提升至 85.4%,这一成绩甚至在数值上超越了更为强大的 Sol xhigh 基准。
在成本前沿方面,StateM 展现出了重塑行业生态的潜力。通过保持完全相同的运行时架构、高层级的运行手册结构以及核心控制规则,研究团队尝试将执行引擎切换为极具成本优势的 DeepSeek-V4 Flash 模型。
在仅仅消耗了不到 38 美元的自适应改造成本后,适配后的 DeepSeek 系统在完整基准测试中达到了 88.1% 的准确率;而在排除了一个对延迟极度敏感的特定任务后,其准确率进一步提升至 89.1%。这一成绩几乎完美复刻了官方报告中 GPT-5.6 Sol max 88.8% 的最高记录。但在最终的评估开销上,完整获取这套测试成绩的 DeepSeek API 实际消耗仅约为 15 美元,而相比之下,GPT 官方参考基线的耗资则高达 574.68 美元。即使将前期的适配成本一并计入,DeepSeek 全流程的总开销也仅为 52.22 美元。这意味着,通过先进的外围控制层设计,开源/低成本模型能够在长视野复杂任务中实现近 38 倍的成本降幅,同时保持顶尖的执行质量。
在任务泛化性(Task-side generalization)评估中,研究团队在 BusinessBench 上进行了测试。结果表明,当控制配置文件与特定的执行结构高度匹配时,性能提升最为显著。例如,在“预算审批”和“机器操作”这两个机制匹配的任务族中,系统的准确率大幅提升了 10.04 个百分点。这证明了具体的操作规则在结构相似的任务间具有很强的泛化能力,而识别并强制执行这些控制节点的方法论,则可以更广泛地应用于各类异构工作流中。
模型之外的智能基座
长期以来,AI 社区习惯于将智能体性能的边界等同于底层模型参数规模与预训练数据的边界。然而,StateM 的研究结果为行业敲响了警钟:模型能力与执行可靠性是对系统性能做出独立贡献的两个不同维度。在当前的技术阶段,对于许多复杂任务而言,瓶颈甚至已经不再是模型本身的推理能力,而是系统如何约束、引导并持久化这种能力。
StateM 的成功并不意味着模型扩展(Model Scaling)已经不再重要,也并不代表一本静态的运行手册就能通吃所有模型与场景。它的真正价值在于,证明了运行时语义和控制层开发原则是可以广泛迁移的。那些从无数次失败中总结出的通用死后剖析(Postmortem)结论,完全可以通过 StateM 转化为持久化、可强制执行的前置条件和实践策略。
随着智能体被越来越多地部署到真实的高价值工作流中,这种“将经验从历史对话中剥离,沉淀为系统级控制逻辑”的 Harness Scaling 范式,或许将成为下一代 AI 工程架构的必由之路。毕竟,当一个 15 美元的控制层优化方案能够匹敌数百美元的前沿模型算力堆叠时,行业优化的天平,已经开始向系统工程的一侧倾斜。