DataSpace:异构工作区分析新基准,顶尖多模态模型准确率仅66.34%

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

DataSpace:异构工作区分析新基准,顶尖多模态模型准确率仅66.34% 论文图示

在企业和科研机构的实际业务中,当分析师需要计算一份基金风险指标或核对季度供应链数据时,答案几乎从来不会现成地躺在某一张干净的数据库表格里。现实中的核心证据往往支离破碎:计算规则可能写在管理规范的 PDF 报告中,行业基准可能来自一段会议演示视频的解说旁白,而原始的交易明细则分散在本地的 SQLite 数据库、CSV 文件或 JSON 接口导出包里。用户提出的问题可能是中文,而支撑数据和系统字段却是英文。

ArXiv URL:https://arxiv.org/abs/2608.03451v1

面向这种复杂的实际场景,来自香港科技大学与清华大学的研究团队提出了 DataSpace——一个面向异构工作区、强调可验证完整表格交付的复杂数据智能体(Data Agent)评测基准。这项工作不仅涵盖了 410 个跨语言分析任务、7439 个异构工件、总计 15.01 GB 的数据规模,还成为了 KDD Cup 2026 数据智能体复杂分析挑战赛 的官方评测基准。

评测结果揭示了一个冷酷的现状:即便调用 2026 年最新发布的顶尖多模态大模型,在标准配置下的端到端任务最高准确率也仅有 66.34%,多达 76 个任务被所有参评的前沿模型全数折戟;而在固定相同模型底座的情况下,仅仅更换智能体运行框架(Agent Harness),就会产生高达 15.36 个百分点的性能断层。这一基准明确表明,当前大模型在走向真正企业级自主数据分析时,其核心瓶颈已不仅是编写简单的查询语句,而是在多模态工件中完成证据发现、多表关联推理以及完整结果物化的综合工程能力。

DataSpace 任务接口示意图

从单表查询到工作区求解:数据分析基准的演进缺口

过去数年里,学术界和工业界对大模型数据能力的评估主要沿着两条互不相交的路径前进。一条是以 Spider、BIRD 以及 Spider 2.0 为代表的结构化查询与 Text-to-SQL 路径。这类基准擅长考察严密的 SQL 语法生成与复杂的多表关联逻辑,并依靠真实的数据库执行引擎来实现确定性评估。然而,它们通常在任务开始前就已经帮智能体指定好了目标数据库和确切的表名,剥离了在杂乱文件堆中自主探索和辨别证据的关键步骤。

另一条路径则是以各种长文档理解、多模态检索或开放式智能体框架为代表的无结构化评测。这些工作引入了长篇 PDF、扫描图像或音视频,但任务目标往往被退化为提取某个数值、做出单项选择,或者生成一份难以通过严格规则验证的自由文本报告。虽然也有少数基准尝试引入工作区概念,但在评估手段上要么依赖昂贵且主观的 LLM-as-a-Judge,要么允许模糊匹配,导致评测结果充满了随机性与幻觉噪声。

真实世界的数据分析工作对智能体提出了作为“工作区求解器(Workspace Solver)”的完整要求。这种要求体现为三个无法割裂的维度:

  1. 工作区范畴(Workspace Scope):智能体拿到的不是单一文件,而是一个自包含的本地工作区目录,里面可能混合了 CSV、JSON、SQLite、Markdown、PDF 乃至音视频,同时伴随着大量干扰文件和中英双语交织的表达。

  2. 输出契约(Output Contract):用户需要的是可直接导入下游系统的完整结构化表格结果,而非一句口头总结或一段执行代码。无论是单行统计值还是成千上万行的数据集,智能体必须完整输出。

  3. 评估语义(Evaluation Semantics):评测系统必须具备数学与代数层面的确定性,既能够包容列名微调、浮点精度舍入、日期格式异构等表象差异,又必须在行数缺失、多余无效列或排序颠倒时给出零容忍的判定。

正是在这三项严苛标准的交汇处,现有基准均出现了覆盖空白。DataSpace 的核心设计理念,正是建立一个将多模态证据发现、多步关系代数计算与确定性输出评估完全统一的客观试验场。

DataSpace-Builder:基于可执行事实的构建引擎

如果只是人工随机构造杂乱的文件堆,极易产生逻辑歧义、无解任务或验证黑箱。为了保证每一个任务既贴近现实的复杂性,又拥有坚不可摧的数学可验证性,研究团队设计了一套名为 DataSpace-Builder 的四阶段构建管线。该管线以真实医疗领域数据集 EHRSQL 与金融分析数据集 BULL 为种子源,巧妙利用它们自带的可执行 SQL 作为可解析的“关系代数真值发生器”,反向推演并物化出整个异构工作区。

DataSpace-Builder 构建流水线总览

构建流水线由四个紧密咬合的阶段构成:

第一阶段是跨语言转换(Cross-Language Transformation)。为了打破大模型基准长期存在的纯英语偏见,团队针对临床和金融领域的实体术语与业务语义,进行结构化的英汉双向映射。在重写自然语言问题 $q_{0}$ 和数据库实体 $\mathcal{D}{0}$ 的同时,底层的 SQL 逻辑 $\sigma{0}$ 也会被重构为能够直接在翻译后库上跑通的代码 $\sigma_{c}$。系统会通过自动执行校验和严格的双向数值对齐,确保经过语言重塑后的数据逻辑与原始逻辑严格同构,杜绝语义丢失。

第二阶段是约束感知关系抽样(Constraint-Aware Relational Sampling)。原始 Text-to-SQL 数据集往往数百道题目共享同一个庞大的数据库状态,如果直接复用,会导致所有任务的实体高度趋同,模型容易发生实体记忆泄漏。DataSpace-Builder 在保留完整表结构与外键约束的前提下,实施细粒度的关系抽样,为每一个任务生成独立的局部微型数据库 $\mathcal{D}{s}$。抽样过程必须满足严格的有效性约束:保证原始 SQL 在抽样后的数据库上执行不会产生非预期的空结果集或语义退化,从而为每个任务固化出一份唯一的候选参考答案 $\mathcal{Y}{s}$。

第三阶段是模态路由与工件渲染(Modality Routing & Artifact Rendering)。这是将结构化关系数据“打散”为多模态杂乱工作区的核心魔术。系统采用预设的规则策略,将数据表拆分并渲染进不同的物理介质中:部分表保持为原生的 CSV 或 SQLite 格式;部分宽表和键值记录被转化为 Markdown 文档;更复杂的业务数据则被排版为长达数十页甚至上百页的高保真 PDF 报表。

尤为精妙的是其视频模态的生成机制。针对部分分析任务,系统会提取抽象语法树(AST)中的过滤谓词或部分中间结果单元格,将其注入到结构化的分镜脚本中,通过文本转语音(TTS)与图形渲染合成一段动态数据视频。此时,智能体面对的原始问题中不再直接提供该筛选条件,模型必须“听完”或“看完”视频中的动态规则,才能拼凑出完整的查询意图。

第四阶段是专家审查与任务修复(Human Review & Task Repair)。即使执行引擎验证无误,也无法完全排除语言表达上的歧义。团队引入了 11 位金融与医疗领域的专业人员组成专家评审团,采用严格的双盲独立求解流程。两位专家在不知道参考答案的情况下仅凭工作区文件作答,答题完毕后比对标准答案,并针对每一列的语义类型、数值精度容差、是否要求强制保序等细节,联合拟定不可篡改的评测配置。只有在两位专家完全达成共识后,该任务才被封存入库;任何存疑项均需经过审查修复或直接剔除。

告别“黑盒裁判”:语义感知确定性评估器

在大模型基准评测中,LLM-as-a-Judge 因判断标准飘忽不定、易受长文本诱导和无法精确定位行列偏差而饱受诟病。DataSpace 彻底摒弃了模型裁判,设计了一套在代数层面兼具鲁棒性与严苛性的确定性评估器(Deterministic Evaluator)

在评测体系中,任务成功与否遵循严格的指示函数:

\[s_{i}=\mathbf{1}\!\left[\widehat{\mathcal{Y}}_{i}\equiv_{c_{i}}\mathcal{Y}_{i}\right]\]

其中 $\widehat{\mathcal{Y}}{i}$ 为智能体提交的预测表格,$\mathcal{Y}{i}$ 为标准答案,$c_{i}$ 为该任务冻结的评测配置。

这一评估器在底层执行三层精密对齐:

首先是表头无关的列空间排列对齐。现实中,智能体可能将“净值增长率”写成“收益率”或缩写为“NAV_Growth”。评估器并不强制要求列名英文字符完全匹配,而是枚举所有可能的列排列组合 $\pi \in \Pi_{d_{i}}$,只要存在一种置换能使得各列数据在规范化后完全吻合即可。

其次是类型与精度感知的数值规范化。评估器依据配置将单元格映射为文本、数值、日期、布尔等基础语义类型。对于浮点数,它支持配置绝对小数位容差或有效数字精度,并自动将百分比字符串与小数浮点进行数学等价转换;文本则统一进行 Unicode NFC 规范化并剔除无意义首尾空白。

最后是依赖业务语义的行保序比对。对于明确包含“排名前五”“按时间倒序”等提示的排序敏感型任务,评估器要求逐行绝对一致;而对于集合查询类任务,则在多重集(Multiset)语义下校验行内容的无序等价性。

这种评测机制确立了一个冷酷的规则:局部匹配不给分。哪怕智能体算对了 99% 的数值,只要遗漏了一行、误多输出了一列,或者把百分比单位错误放大了 100 倍,整个任务直接判为 0 分。唯有如此,才能逼近企业生产级系统对“可信交付”的底线要求。

实验与剖析:多模态前沿模型的真实短板

在统一的轻量级 ReAct 架构智能体(DataSpace-Agent)驱动下,团队测试了六款 2026 年最新涌现的顶尖多模态大模型底座,包括 Grok 4.5、GPT-5.6 Sol、Kimi K3、MiMo-V2.5、Claude Sonnet 5 与 MiniMax M3。同时,在固定 MiMo-V2.5 底座的前提下,横向对比了 DataSpace-Agent、Smolagents、Codex、Claude Code 以及 Grok Build 等五套业界主流的智能体 Harness。这一严密对照实验揭示了数据智能体在当前技术周期下的关键瓶颈。

在模型综合表现上,性能冠军由 Grok 4.5 摘得,其准确率达到 66.34%;GPT-5.6 Sol 紧随其后,取得 64.63% 的成绩。然而,这一最高胜率意味着即便在全知全能的宣发光环下,仍有超过三分之一的企业级异构数据分析任务无法被大模型正确解决。在数据集中,甚至存在 76 个“硬核”任务,被全部六款顶尖模型一致判定失败,证明了 DataSpace 基准极高的区分度与尚未饱和的挑战性。

在精度与资源消耗的权衡方面,实验绘制出了一条鲜明的帕累托前沿。虽然 GPT-5.6 Sol 的准确率略微落后 Grok 4.5 约 1.71 个百分点,但其在推理效率上展现出了极高的工程价值:相比于 Grok 4.5,GPT-5.6 Sol 在平均每个任务上消耗的 Token 减少了 74.2%,工具调用步数缩减了 50.3%,实际端到端墙上时钟延迟(Latency)降低了 39.2%。这表明顶尖模型在达到相近分析能力时,其思维路径的紧凑程度与工具使用的果断性存在巨大差异。对于追求极致低成本的工业落地场景,开源生态中的 MiMo-V2.5 则构成了另一条成本前沿:单任务推理成本仅需 0.011 美元,而 Grok 与 GPT 的单任务调用成本则分别达到了 0.169 美元与 0.200 美元。

更为震撼的数据来自 Harness 框架层面对比。在完全相同的模型底座(MiMo-V2.5)控制下,不同智能体框架的准确率在 30.98% 到 46.34% 之间剧烈震荡,差值高达 15.36 个百分点。这一现象证明,当前大模型落地数据分析,绝非“把模型连上几个 Python 工具”那么简单。框架的规划策略、上下文窗口对超长异构文档的修剪机制、针对多轮工具报错的自愈逻辑,直接决定了底层模型能发挥出三成还是五成的真实功力。

为了探究模型能力崩塌的深层诱因,研究人员将任务特征与模型失败轨迹进行了深度拆解。统计分析发现,跨模态证据整合多表关联(Join)是引发所有参评模型性能衰退的最主要推手。当任务从单一纯文本或单表结构转向融合多模态证据时,所有模型的准确率均出现了 1.8 至 14.0 个百分点的断崖式下滑;而一旦业务逻辑需要跨越两张以上的表进行复杂的键值连接,模型准确率会再度重挫 9.7 到 19.8 个百分点。大模型往往会在实体对齐阶段张冠李戴,或者由于中间抽取的表格存在细微格式差异,导致后续的 Pandas 甚至 SQLite 连接操作直接抛出静默错误。

令人警醒的发现还在于对 Grok 4.5 失败轨迹的细粒度人工审计。在审阅的 136 个错误样本中,有高达 56.6% 的失败并非因为模型“找不到数据”或“算不出正确数字”,而是源于目标结果误解与列投影错误(Target-Result Misunderstanding & Faulty Column Projection)。换言之,大模型经常在沙盒环境里通过一通花哨的 Python 代码准确算出了分析师想要的底层指标,但在最后一步格式化输出时,却自行添加了无意义的调试列、遗漏了题目明确要求的维度字段,或者截断了分页输出。在 13 次未能提交任何结果的严重超时/预算耗尽案例中,仅有 5 次是由于代码死循环或工具无限报错,其余案例均是因为智能体在得到了答案后,在如何组织为完全合规的表格形式上反复自我怀疑、徒劳重试直至耗尽算力。

从“写代码的大模型”迈向“可靠的交付系统”

DataSpace 的发布,为近年来火热却略显浮躁的数据智能体研究带来了一面客观的镜子。它通过真实反映企业多模态、跨语言杂乱工作区的复杂现实,指出了生成式 AI 跨入可信生产环境的核心鸿沟:大模型不仅要有读懂单篇长文档的“阅读理解力”,或者在预设题干下写出标准查询的“代码生成力”,更必须具备在信息碎片中自主拼凑实体关系、在脏数据中对齐多模态线索、并严格遵守工业级数据接口契约的“交付确定性”。

对于从事 Agent Harness 架构设计和企业级数据中台研发的团队而言,DataSpace 提供的不仅是一个打分榜单,更是一套极其宝贵的设计指引。实验已经证明,单纯堆砌上下文长度或盲目增加推理步数,并不能直接消除多表关联逻辑中的拓扑混乱,也无法自动解决输出维度的漂移。未来的突破点,或许在于如何让智能体学会在执行复杂分析前先“固化输出 Schema”、如何开发轻量且鲁棒的跨模态数据抽取流水线,以及如何在代码沙盒中建立确定性的自验回溯闭环。

DataSpace 迈出了将复杂数据工作区转化为可验证评测基准的关键一步。当数据智能体能够在这个包含 15 GB 真实噪音与跨模态暗礁的工作区中游刃有余地交付出分毫不差的数据报表时,自动化商业智能与自主数据科学的黎明,才算真正到来。