WorkSurface-Bench:选对知识源依然答不对!路由达99%但正确率仅56%

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

WorkSurface-Bench:选对知识源依然答不对!路由达99%但正确率仅56% 论文图示

在面向企业的智能体落地场景中,让大模型完成一次业务分析往往需要调度完全不同形态的知识资产。例如一位运营分析师要求排查:“哪些源文件汇总成了负差异库存报表,且各运输方式的总物流成本是多少?”面对这类需求,Agent 必须翻阅非结构化报告理清业务口径,利用 SQL 查询聚合表格中的数值,还要沿文件依赖图定位数据血缘。文档检索做不了 SQL 聚合,数据库查询理不清文件依赖图,这些异构数据载体彼此无法替代。

ArXiv URL:https://arxiv.org/abs/2607.25765v1

然而,现有的评测体系往往忽略了这一前置决策。传统的 RAG 基准测试通常只盯住最终答案是否正确,一旦回答失误,开发者很难分辨模型究竟是翻错了知识库,还是翻对了知识库却算错了数;工具调用基准则侧重在几千个 API 端点中精准匹配函数签名,却极少考察智能体能否识别问题对底层知识形态(Prose、SQL 或 Graph)的基础诉求。这种端到端评测的黑盒状态,让企业级 Agent 的系统调优变得异常盲目。

针对这一症结,来自北京大学、中国科学院大学与中关村实验室的研究团队提出了全新的评测基准 WorkSurface-Bench。该工作将非结构化文档、结构化表格与文件关系图统称为“知识表面”(Surface),并在企业真实工作区语境下构建了 1,151 个高质可审计任务。该评测最核心的发现极具冲击力:即便人工将所需工具直接收窄至完美答案的黄金表面(Gold-constrained),使模型的路由准确率(Route F1)飙升至 98.7%–99.8%,主流前沿大模型的最终答案正确率(Answer)依然仅在 56.1%–75.3% 之间徘徊。选对工具和知识库只是完成复杂任务的入场券,后置的信息提取、跨模态合成与计算推导,依然横亘着巨大的能力鸿沟。

WorkSurface-Bench 将统一的企业语料投影到文档、表格与图三大知识表面

从“工具选择”深入到“知识表面路由”

在企业真实业务中,Agent 面对的信息并不是整齐划一的纯文本。WorkSurface-Bench 依托 Workspace-Bench-Lite 的真实人设工作空间,把企业数据原生投影到三个典型的知识表面:

第一个表面是文档检索(RAG Surface)。研究团队将各类业务流程报告、PDF 及演示文稿统一转为 UTF-8 格式的 Markdown,消除了多模态 OCR 和解析失真的干扰,专门考查叙述性事实与定性规则的提取。

第二个表面是数据分析(Table Surface)。常规 RAG 往往生硬地将大表格切块喂入向量库,这在面对多维度统计和数值聚合时极其脆弱。该基准将标准化的 CSV 与工作表挂载为 DuckDB 内存数据库中的视图,只允许通过精确的只读 SQL 语句来获取动态聚合结果。

第三个表面是数据血缘(Graph Surface)。与传统以实体关系为主的概念知识图谱不同,企业内的图表面还原了原生的文件依赖关系,例如“某个脚本依赖哪张底表”“某份汇总报表引用了哪些中间文件”。这让 Agent 具备了追溯业务流与资产上下游的可能。

这种三元划分确立了“表面路由”(Surface Routing)的独特价值:工具只是执行某种操作的具体 API,而知识表面决定了 Agent 必须从何种认知维度来理解与提取信息。当模型处理多步骤提问时,它必须先在宏观上界定该找哪几类知识表面,再进一步进入子步骤决定调用何种具体检索算子。

绝非黑盒幻觉:全量可执行、可审计的数据集构建

为避免基准测试自身沦为“大模型根据大模型幻觉打分”的循环论证,WorkSurface-Bench 在任务生成管线上设立了严苛的审计与验证机制。整个基准包含 1,151 个原子任务,涉及 5 类企业职能角色,所有标准答案的产生均建立在可回溯的证据链之上。

WorkSurface-Bench 可审计任务构建流水线

构建流水线采用了确定性派生与强约束模型扩充相结合的双通道。第一条确定性通道直接从底层人工编写的评分标准(Rubric)和元数据中挖掘金标。凡是源材料中记录的确切数值、通过 DuckDB 聚合计算完全吻合的统计量,或是依赖图中唯一的输入文件溯源路径,都会自动沉淀为基准任务。

第二条通道利用 LLM 提出候选问题,但强制绑定验证产物(Proof Artifacts)。任何涉及表格的问题必须提交对应的 DuckDB SQL 语句,且必须在实际数据库环境中顺利执行并重现结果;所有文档类问题必须附带源文本中一字不差的切片证据(Verbatim Spans);图依赖问题则必须通过连通路径校验。任何产生执行错误、字段漂移或无法精准锚定原文的候选问题均被直接淘汰。

在完成自动化过滤后,研究者还引入了严格的语义审计。候选池先经由 GPT-5.5、DeepSeek 与 Gemini 的交叉打分筛除具有泄漏线索或歧义的样本,随后抽取 200 个分层样本交由 3 位人类专家进行独立的盲审复核。在涵盖必要性、原子性与真实性等 6 项审计指标中,全部 200 个任务均以多数票通过质检,其中 192 个任务在所有维度获得了三名专家的一致肯定。这种纯确定性、全留痕的答案机制,彻底摒弃了用无监督 LLM 充当主观裁判的不可控性。

解耦四大评测维度,彻底定位 Agent 卡在哪一步

现有评测的一大缺陷是指标单一。如果一个 Agent 在复杂问题上拿了零分,工程师无法得知它是在起跑线选错了库,还是进对了库却没有读全文件,抑或是算力不足半路耗尽。WorkSurface-Bench 设计了一套四元解耦的诊断式评分体系:

  1. 路由评分(Route F1):衡量模型在执行轨迹中实际触达的知识表面集合与黄金标准表面集合之间的重合度。如果一个任务明确需要“表格+图”,而 Agent 仅使用了文档检索,其路由分数将受到精准惩罚。

  2. 证据获取(Evidence):关注物理层面的资产命中率。文档任务是否真正读取了目标文件?表格任务是否成功查询了关联视图?图任务是否检索到了终点证据节点?该指标只核验物理资产是否被精准触及,暂不评估语义理解,以此隔离“找没找到”与“用没用对”。

  3. 最终答案(Answer):根据不同数据类型执行严格的比对。绝对值 100 以内的整数必须完全匹配,其余连续数值允许 5% 的相对误差;集合类实体要求计算免顺序干扰的 Set F1;布尔值与文本采用标准化精确匹配。全数据集不包含任何自由发散的主观简答题,全凭可程序化裁决的标准输出定胜负。

  4. 推理效率(Efficiency):将模型消耗的 Token 数量与统一基准预算进行线性对标。既防范 Agent 通过穷举遍历刷高召回率,也抑制无意义的长文本重复兜圈。

四项指标按业务重要性加权构成综合得分(Aggregate),最终答案占 35%,证据占 30%,路由占 25%,效率占 10%。这一精细拆解使评测能够像 X 光机一样,精准透视 Agent 失败的具体解剖位点。

路由达 99% 但答对率仅 56%:实验揭示的关键瓶颈

研究团队围绕四大主流模型基座(GPT-4o-mini、DeepSeek-V4-Pro、Gemini-3.1-Pro 以及 GPT-5.5),在 6 种不同自主程度的 Agent 设定下展开了横跨 27,624 条完整调用轨迹的全面压测。

测试设定的阶梯设计极具对照价值:从纯凭参数化记忆裸答的闭卷基线(S1 No-tool),到无脑强行只做文档检索的(S2 Always-RAG);从前置单选工具的朴素路由(S3 Naive-router),到三类表面全部放开让 Agent 自由循环交替调用的(S4 ReAct-all);再到提供黄金提示词但工具全开放的(S6 Gold-hint/all),以及严格收窄工具箱、只提供金标表面的(S5 Gold-constrained)。

从实验数据中浮现出的首要事实是:路由与最终解答之间仅呈现中等相关性($\rho=0.62$),完美路由绝不等于能得到正确答案。在黄金约束的 S5 设定下,由于系统从底层阻断了多余工具的可见性,四大基座的 Route F1 几乎拉满,均稳定在 98.7% 至 99.8% 的极高区间。但与之形成鲜明对比的是,最终的 Answer 正确率极度分化且上限堪忧:Gemini-3.1-Pro 录得最高的 75.3%,DeepSeek-V4-Pro 为 68.6%,GPT-5.5 为 64.9%,而 GPT-4o-mini 仅有 56.1%。这意味着即便抹平了最困难的选库障碍,模型面对下游业务仍有四分之一到近半数的概率彻底答错。

造成这种“选对却答错”的瓶颈主要分为两级。第一级是物理层面的资产采集失效(Acquisition Failure):即使知道要查表格,模型依然可能由于 SQL 拼写错误或字段误解,未能拉取到对应的视图,导致 Evidence 总体得分落后于 Route 分数 20 到 30 个百分点。第二级则是信息摄入后的合成与计算崩溃(Synthesis Failure):在轨迹明明完整命中了所有对应文档与表格数据的情况下,多步骤推理过程中的数值代换偏差、逻辑倒错和幻觉推理,依旧导致大量已到手的证据在最后一步功亏一篑。

提示表面 vs 没收工具:两种干预手段的本质差异

工程部署中常有一个直觉假设:给大模型提供更详尽的系统提示(Prompt Hints),就能省去在代码层限制工具权限的繁琐控制。WorkSurface-Bench 对 S4、S6 与 S5 的成对干预实验彻底推翻了这一经验主义假设。

对比自由调用的 S4 与附带金标表面提示的 S6 可以发现,直接在 Prompt 中告诉模型“这个问题需要使用表格与依赖图”确实有助于引导注意力。GPT-4o-mini、Gemini 与 GPT-5.5 的答题正确率分别获得了 9.9、2.8 和 4.4 个百分点的实质性提升。然而在 DeepSeek-V4-Pro 上,表面提示并没有带来显著的答题收益,反而引发了更多的探索试探。

更关键的分水岭体现在 S6(知道该用什么,但所有工具都可用)向 S5(不仅知道该用什么,且非目标工具被物理屏蔽)的跨越中。从 S6 切换到 S5 时,模型的回答正确率并没有一致提升,GPT-5.5 的准确率甚至从 71.2% 反常跌落至 64.9%;然而,系统的推理效率指标却普遍飙升了 8.8 到 22.3 个百分点。深入轨迹分析可以发现,当所有工具同时可见时,即使 Prompt 明令禁止,各模型在 7.8% 至 63.5% 的任务中依然会不可遏制地发出至少一次无关工具调用。这种底层的注意力游移不仅徒增了大量的 Token 开销与延迟,也暴露了大模型在面对诱导性动作空间时的控制脆弱性。

由此得出的工程结论极为清晰:向 Prompt 灌入表面提示,主要是改变语义理解的倾向性,但要想真正压制幻觉动作、提升调用效率并清洗推理轨迹,必须在中间件层面强行剔除动作空间中的无关工具

跨表面交互是企业级 Agent 的真实分水岭

在任务分类维度上,基准展现出了强烈的异质性。单表面任务中,各大模型往往能各显神通:在纯表格计算任务上,GPT-4o-mini 与 DeepSeek 均能跑出 88% 到 91% 的极高水准;在纯文档问答上,各家也能维持在 80% 左右的扎实区间。

然而一旦步入跨表面任务(Cross-surface),系统性能骤然承压。当问题需要同时穿梭于“文档+图”或“图+表格”乃至三者兼具的语境下时,即使在各自最优的配置下,所有模型的跨表面表现均比其单表面峰值暴跌了 13.0 至 45.7 个百分点。例如在单表面表格任务上表现极佳的 GPT-5.5,面对跨表面问题时的平均正确率一度下滑至 48.2%;仅有 Gemini-3.1-Pro 在复杂跨表面任务中展现出较强的韧性,依然能维持在 75.8% 的高位。

这表明当前的智能体在处理单一模态或标准化工具流时已相对成熟,但在处理多跳异构信息流——先从非结构化文本中确定实体,再去知识图谱中验证上游血缘,最终拼装出参数下发给数据库引擎做聚合——这种高度交织的复杂链路时,上下文管理与工作记忆的损耗呈指数级放大。

WorkSurface-Bench 为企业级智能体的评估提供了一面镜子。它打破了长期以来将检索、调用与作答揉成一团的黑盒惯例,将“知识表面的识别”确立为独立于语义推理的显式维度。未来的 Agent 架构演进显然不能只停留在不断向上下文塞入工具说明,如何在架构前端引入更轻量、低延迟的表面路由器,在执行中继层实施动态的工具遮罩,并在获取异构证据后构建专用的计算验证机制,将是企业级应用真正走向可靠投产的关键命题。