StartupBench:顶尖大模型端到端成功率仅30%?首个真实商业工作流Agent基准发布

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

StartupBench:顶尖大模型端到端成功率仅30%?首个真实商业工作流Agent基准发布 论文图示

当前大语言模型(LLM)与智能体(Agent)的演进正在经历一次关键范式转移:学术界与产业界不再满足于让模型回答单轮问答、执行短程 API 调用或在合成环境中通过沙盒测试,而是期望它们真正扮演“数字员工”,自主接管长程的真实业务流,交付符合行业严苛标准的工作成果。然而,现有的 Agent 基准测试大多由科研人员在实验室中凭经验设定,测试用例常常脱离了真实商业世界的诉求,导致模型在榜单上跑分亮眼,落地到企业实际业务中却频频翻车。

ArXiv URL:https://arxiv.org/abs/2608.17800v1

为了打破评估环境与真实需求之间的脱节,来自字节跳动 Seed(ByteDance Seed)、南京大学等机构的联合研究团队推出了 StartupBench。这项工作不再从学术假设出发去空想 Agent 应该具备什么能力,而是直接深入已经被市场验证(Market-Validated)的真实商业场景,系统调研了 20 余家获得超过百万美元融资且具备付费客户的 AI 原生创业公司,访谈了超过 30 位企业核心深度用户,将真实高频交付的工作流抽象为 97 个完整的端到端交付任务。

StartupBench 总览图

测试结果给当前对通用 Agent 的盲目乐观泼了一盆冷水:在统一的执行框架下,即便是目前业界最强的顶尖模型(如 GPT-5.6-sol、Kimi-K3),面对这套端到端业务流时,完整满足业务验收标准的成功率(得分 $\ge 90$ 分)也仅仅在 30% 左右徘徊。模型虽然能完成大量中间过程,看似做出了像模像样的报告或表格,但在面对错综复杂的格式规范、数据对齐、专业事实推理等深层业务约束时,往往漏洞百出。

为什么学术界现有的 Agent 评测容易“失真”?

在评估大模型自主完成真实工作的能力时,学术界与工业界长期面临两个难以调和的结构性矛盾。

第一个矛盾在于任务来源的真实性缺失。早期的 Agent 评测如 GAIA、AgentBench 等,侧重于评估通用工具调用与短程逻辑推理;后续出现的计算机使用或企业软件模拟环境,虽然迈向了更长的时间跨度,但任务往往依然依赖研究员根据通用常识或公开数据进行自顶向下的设计。这类任务很难捕捉到企业用户真正愿意付费委托给 AI 的“刚需痛点”,也很难复刻商业环境下复杂而零碎的前置约束。

第二个矛盾在于评估粒度的严重粗糙化。真实职场中的交付物不是一句简单的选择题答案,而是多格式、多层级的复合制品(Deliverables),包括带复杂嵌套公式的 Excel 财务模型、符合法务排版规范的合规审查备忘录、严密论证的研报、工程代码补丁乃至幻灯片。过去许多评测仅依靠粗粒度的 LLM-as-a-Judge 给整体质量打一个主观印象分,或者只对比最终产物的某几个关键词。这种评估机制极易被“表面看上去写得很完整、实际上计算全错、关键条款完全遗漏”的模型蒙混过关。

商业化 AI 创业公司的存在为解决这两个问题提供了天然的参照系。一家 AI 初创产品能获得机构融资并在市场上形成付费规模,意味着其背后的工作流已经受过市场的真实筛选——用户确确实实愿意为这类任务买单,且用户对产出质量有着明确的验收标准。StartupBench 的核心逻辑,正是将这些经过真金白银检验的业务工作流“逆向工程”为基准测试用例。

从创业公司真实业务流到可复现 Benchmark 的转化管线

为了将非标准化的商业实操沉淀为严密可测的学术基准,研究团队建立了一套严格的提炼与质控管线。整个流水线包含场景筛选、用户深度访谈、专家任务重构和多重质量校准四个阶段。

StartupBench 数据构建流程图

首先,团队调研了覆盖多垂直领域的 AI 原生企业,筛选标准极其明确:融资金额需超过 100 万美元,且具备显著的真实付费采用或活跃用户规模,以此剔除概念验证性质的玩具项目,锁定了 20 余款真实落地产品。

随后,团队与这些产品涉及领域的 30 余位深度企业用户展开半结构化访谈,细致梳理日常工作中的原始上下文、用户输入材料、中间约束、交付物格式以及真实的废弃与验收边界,还原出包含真实操作细节的种子案例。

在此基础上,团队引入了超过 50 位垂直行业专家(涵盖金融分析师、法务专家、医生、资深软件架构师等),将种子案例转化为形式化的标准测试三元组 $\mathcal{T}=(q, \mathcal{E}, \mathcal{R})$:

  1. $q$ 代表包含复杂多层级要求的自然语言用户指令;

  2. $\mathcal{E}$ 代表初始工作区,包含任务必须的所有异构源文件(如研报 PDF、数据底表、历史合同文本等);

  3. $\mathcal{R}={(p_i, w_i)}_{i=1}^n$ 代表预先拟定的细粒度评估规则集(Rubrics),每个规则 $p_i$ 对应一个独立的质量判定点,并赋予对应的权重 $w_i$。

任务构建完成后还需经历严格的难度校准与筛选。研究人员在预实验阶段使用前沿模型对任务进行试跑,那些当前主流模型能够轻松拿到高分、缺乏区分度的任务直接被剔除;若模型因为指令本身含糊、输入文件缺失导致失败,任务会被退回给专家重构。最终定稿的 StartupBench 汇聚了 97 个高质量任务,分布于 6 大支柱行业:医疗与健康(21.6%)、金融(18.6%)、法律(16.5%)、商业与企业管理(19.6%)、理工与计算机科学(16.5%)以及教育与人文(7.2%)。任务产出形式全面覆盖了 DOCX、XLSX、PPTX、PDF、Markdown、代码和可视化图表等真实办公产物。

细粒度 Agent-as-a-Judge:如何精准裁判复杂交付物?

面对几十页包含表格、引用和图表的复杂交付物 $\mathcal{D}$,单次提示大模型打分必然会导致幻觉、注意力漂移以及打分宽松等问题。StartupBench 提出了一套基于细粒度规则的自动化评测机制。

平均每个任务包含 25.3 条 相互独立的评测规则,跨越格式规范性、结构完整性、计算与逻辑正确性、领域专业事实深度等 6 个维度,并划分为 3 种重要性级别。在评测运行时,评测系统首先为模型生成的交付物生成一个轻量级的“证据视图” $\mathcal{V}(\mathcal{D})$,包含解析出的纯文本流以及按页渲染的高清图像,同时允许裁判模型在需要时调用底层工具直接挂载、读取原生二进制文件。

针对每条独立的规则 $p_i$,评测系统都会启动一个专职的裁判 Agent:

\[(y_i, e_i) = \mathrm{AgentJudge}\big(J, q, \mathcal{D}, \mathcal{V}(\mathcal{D}), p_i\big)\]

裁判 Agent 必须在交付物中定向寻找与该规则对应的证据片段,并输出布尔判定 $y_i \in {0, 1}$ 与对应的判定依据 $e_i$。最后,系统汇总该任务所有规则的加权得分:

\[\mathrm{score}(\mathcal{D}, \mathcal{T}) = \frac{\sum_{i=1}^{n} w_i y_i}{\sum_{i=1}^{n} w_i} \in [0, 1]\]

实验表明,这种“化整为零”的评测策略至关重要。研究团队让人类领域专家对模型产出进行双盲打分校验,逐条规则独立裁判方案与人类专家的一致性达到了 92.78%,在以 90 分为及格线的成功与否判定上一致性高达 92.84%。而如果采用业界常用的“将全部规则打包扔给单一裁判模型一次性打分”的消融方案,与专家的一致性立刻骤降至 83%,且由于长上下文下模型容易出现格式错误,平均每个任务需要反复重试两次以上才能获得有效评分。

评测结果揭晓:最强模型也只迈过了三成门槛

研究团队选取了目前市面上最主流的 9 款代表性闭源与开源前沿大模型,在统一的通用 Agent 底座框架(统一规划、统一沙箱与工具集)下进行了严格的多次评测。

评测设定了两个核心指标:一个是加权平均得分(Average Score),反映模型在部分达成任务上的进展;另一个是硬核的任务成功率(Success Rate),只有最终得分 $\ge 90$ 的任务才算作成功交付,低于该阈值则视为在商业落地场景中不合格。

从得分上看,顶尖模型(如 Kimi-K3 与 GPT-5.6-sol)的平均得分在 73.6 分左右,显示出强大的局部信息处理和文本生成底蕴;然而,一旦以严苛的交付成功率来衡量,最强模型的整体成功率也仅仅维持在 30% 上下。绝大多数任务中,模型虽然生成了庞大的文档结构,却因关键事实推导错误、格式未严格满足下游系统要求或漏掉了核心约束,无法直接投入商业使用。

模型在不同规则维度上的表现热力图

细分领域的表现进一步揭示了“通用大模型在专业深度上的分化”:

为什么会失败?通用 Agent 触碰到的能力天花板

通过细致的行为与结果分析,研究团队指出了当前通用智能体在应对复杂工作流时的两大核心能力缺陷:

1. 复杂长指令遵从的“伪完成”倾向

在真实的复杂交付任务中,用户往往会一口气提出十几项交织在一起的隐式与显式约束(例如“必须输出为包含特定表头的 xlsx 格式”、“汇总比率必须使用加权而非简单平均”、“文档第一部分必须按照某监管指引结构展开”)。

规则层面的核心失败案例分析

实测发现,当前大模型普遍存在“视觉欺骗式完成”倾向:它们倾向于优先满足那些在宏观形态上最容易被看到的表层指令(把字数写够、章节标题列全、语言风格对齐),从而在外观上看起来高度专业;然而,对于深藏在段落内部的计算逻辑、跨表格引用的公式有效性、特定限制字段的排他性要求,模型经常选择性忽略或敷衍了事。一旦面对细粒度规则的逐条严审,这种表面的完备性便会瞬间崩塌。

2. 专业工作惯例与深度领域常识的匮乏

模型在不同学科维度的折戟,本质上暴露了其对现实世界各行各业“暗知识”(Tacit Knowledge)的欠缺。商业分析师做财务底表时默认要保留动态公式以便审计,而大模型往往直接将静态数值甚至粗略估计硬编码进单元格;法务工作者依赖精准的先例和法条条目对照,模型却往往提供宽泛的常识性说理;在工程应用中,模型无法准确将系统架构图中的组件与下游代码实现严密映射。这种领域专业度是通用预训练与宽泛指令微调很难单凭直觉补全的。

关键消融发现:框架影响有限,垂直优化才是胜负手

在 Agent 研究领域,学术界经常将精力投入于设计更繁复的框架(Framework/Harness)、更长链条的 ReAct 循环或更精巧的系统提示词。为了探究框架本身对最终评测结果的影响,StartupBench 团队进行了两项极具启发性的控制对比实验。

第一项实验:横向对比不同通用 Agent 框架。 研究人员让所有主流模型分别在三种不同的主流通用框架下运行。实验结果呈现出惊人的一致性:更换通用 Agent 框架所带来的模型得分波动平均只有 1.79 分。对于 GLM-5.1,框架差异带来的浮动仅有 0.61 分;即便是受框架影响相对最大的模型,波动也没有超过 2.7 分。最关键的是,不同框架下所有模型的相对排名完全没有发生任何改变。

这一发现给热衷于“刷框架提示工程”的研究敲响了警钟:决定复杂长程工作流交付质量的决定性瓶颈在于底层基座模型的核心推理与遵从能力,通用的外围包裹层对端到端完成率的边际贡献已经极其微弱。

第二项实验:通用 Agent 对决垂直商业原生 Agent。 研究人员将通用底座驱动的 Agent 与这些工作流来源的真实初创产品(Specialized Agents)进行了直接对抗。这些垂直产品针对特定领域在模型选型、专业工具集成、领域知识库检索及受限解码上做过多轮定向优化。

结果表明,即便综合所有通用模型在多次运行中能拿到的最高理论得分(Oracle General),垂直商业 Agent 依然在各项指标上呈现出碾压态势。专用系统不仅在格式合规率上趋近 100%,其在特定行业工作惯例上的稳定性也是通用 Agent 所无法比拟的。

走向真正的“工作型 Agent”

StartupBench 的价值不仅在于提供了一个更严苛的排位榜,更在于指明了 Agent 评测范式的发展趋势:脱离玩具数据集与纯理论沙盒,以真实市场需求和端到端可用交付物为导向。

这项工作清楚地表明,从“能够就某个话题侃侃而谈”到“能够交付直接入库或直接呈递给客户的专业成果物”,大模型技术中间还隔着一道巨大的鸿沟。复杂的长上下文多约束管理、严密的代码与数值校验闭环,以及沉浸在具体行业工作流中的专家经验,构成了通向下一代实用级智能体的关键壁垒。对于致力于打造企业级 AI 应用的开发者而言,仅靠将通用大模型套上一层通用的规划外壳远远不够;深入产业肌理、重构交付物验证机制,将是未来让 AI 真正接管复杂工作的必由之路。