XL-DocBench:当上下文拉长到2303页,百万Token大模型为何最高只拿44分?

XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

大语言模型的上下文窗口已经从早期的数千 Token 扩展到如今主流的数十万乃至上百万 Token。在各类“大海捞针”(Needle-in-a-Haystack)测试或长文本合成问答基准中,许多前沿模型几乎都能刷出接近满分的成绩。然而,当这些模型真正被投放到金融合规审核、临床试验指南对照、法律法规检索以及复杂工程技术手册的实际生产环境中时,幻觉、漏看、断章取义和强行作答的现象依然屡见不鲜。

ArXiv URL:https://arxiv.org/abs/2608.00036

现实世界中的超长专业文档通常多达数百甚至上千页。在这类场景下,用户几乎从不提出只需要匹配单个孤立段落的“关键词检索型”问题,而是需要系统在纷繁复杂的附录、图表、脚注和反复修订的条款之间,判断某项例外条件是否成立、汇总多个报表的统计数据、比对跨年份多份文件的演变,或者在文档缺乏充分依据时严谨地选择“拒答”。为了衡量模型在真实超长文档中到底具备怎样的证据追踪与归纳推理能力,研究人员推出了 XL-DocBench 基准。

XL-DocBench 是一个面向超长专业文档理解、经由全人工核验的高难度评测基准。该基准涵盖 6 个专业领域的 1,519 道高质量问题,测试文档的中位数长度为 211 页,最长上下文跨度甚至达到 2,303 页。评测结果揭示了一个残酷的现实:即便面对当前最先进的专有视觉语言大模型(VLM)与前沿 Agent 检索系统,最强方案的总体准确率也仅有 44.0%;名义上拥有 1M 级别超长窗口的模型,在统一的可用预算下依然比最优的多轮检索 Agent 落后 4 到 7 个百分点。这表明长文本处理能力的本质瓶颈,根本不是单纯堆叠注意力窗口就能解决的。

为什么现有长文档基准测不出真实瓶颈?

过去的文档理解(Document Understanding)评测经历了由浅入深的过程。最早的 DocVQA、ChartQA、TAT-QA 主要聚焦在单页文档、信息图表或表格内的视觉与文本联合问答;随后出现的 MP-DocVQA、DUDE 和 SlideVQA 将视野拓宽到了少量多页(通常在几页到十几页之间)文档。而在长文本领域,L-Eval、InfiniteBench 等测试集虽然扩充了 Token 长度,但大多是剥离了原生视觉排版、图表坐标与多栏结构的纯文本长串。

真实的工业级文件往往具备三个高度棘手的特征:首先是“文档体量极大且排版异构”,一份数百页的财报往往混杂着密集的多栏文本、穿插的财务报表与趋势图;其次是“证据高度离散”,一个结论的推演往往需要综合第 12 页的政策定义、第 85 页的表格注释以及第 140 页的补充说明;最后是“容错代价极高”,在合规与医疗场景中,如果前置证据缺失,模型必须能够主动弃权(Abstain),强行拼凑答案会带来灾难性后果。

以往的测试集往往将所有错误混为一谈,模型最终得到的只是一个单纯的准确率数字,无法区分模型究竟是没有找到那几页关键内容,还是找到了证据却无法遵循类型化规则完成多步推理。缺乏精确到“页码级”(Page-level)的真值证据链,使得技术方案的迭代始终处于黑盒归因状态。XL-DocBench 正是为了彻底填补这一空白而设计。

树引导与多层过滤:兼顾规模与证据严谨性

为上千页的专业文档设计测试题,单纯依靠人工标注或单纯交由大模型合成都走不通。如果完全依靠人类专家从头阅读 2,000 页的规范来出题,人力成本与时间周期将无法承受;而如果直接让大模型基于长 PDF 批量提问,模型通常只会生成两类低质样本:要么是仅依赖局部片段就能解答的简单检索题,要么是脱离原文随意发散、缺乏确切逻辑支点的宏观假大空问题。

为此,XL-DocBench 提出了一套“树引导的由粗到细构建框架”(Tree-Guided Coarse-to-Fine Construction Protocol),在模型自动化提议与人工专业核验之间建立起清晰的分工管线。

XL-DocBench 数据集构建流程与校验管线

该方案的核心思想是利用长文档天然具备的目录树与层级结构,引导模型在指定的不同章节分支上构造具备路径依赖的问答。形式化地讲,假定候选问题 $q$ 需要跨越文档树节点集合 $\mathcal{U}$ 中的信息,管线会强制验证路径依赖性:对于 $\mathcal{U}$ 中的任意子节点 $u$,问题 $q$ 绝不能仅通过排除了 $u$ 之后的剩余上下文 $\mathcal{C}(\mathcal{U}\setminus{u})$ 得到解答。在生成过程中,上一轮粗粒度生成的问题 $q^{(\ell)}$ 会依据下一层级的子章节集合 ${\mathrm{ch}(u):u\in\mathcal{U}^{(\ell)}}$ 进行迭代细化:

\[q^{(\ell+1)}=\mathcal{R}_{\ell}\!\left(q^{(\ell)},\{\mathrm{ch}(u):u\in\mathcal{U}^{(\ell)}\}\right)\]

通过这种方式,问题从诞生起就天然具备跨章节、多局部的离散依赖特征。

机器合成的问题在进入人工视野之前,还要经历极其苛刻的自动过滤流程。其中最重要的一道防线是“无上下文过滤器”(No-context Filter)。该过滤器将问题在完全剥离文档内容的前提下投喂给评判模型,如果依靠大模型的通用世界知识、常识推断或问题本身的行文线索泄露就能猜出答案,该题就会被立即剔除。这一步骤直接清除了大量看似高深实则无意义的伪长文档问题。

最终保留的样本由来自 6 个专业领域的 194 位人类专家进行逐一精细审查。专家不仅需要给出独立答案,更核心的任务是完成三项落地标记:精准定位支持该结论的页码集合、划定句子级的原文引用证据(Evidence Quotes),并确认该题适用哪一种类型化验证规则(Typed Verification Rule)。在全流程中,系统最初合成的 3,550 个候选问题仅有 2,104 个通过了专家核验,淘汰率达 40.7%;研究团队随后进一步剔除了难度偏低的样本,最终沉淀出 1,519 道高难度的正式测试集。

数据集全景:多页、多模态与严谨拒答

经过层层筛选保留的 1,519 道题目,构建出目前最具挑战性的真实长文档评测基准之一。从整体结构和统计特征来看,该数据集呈现出四个非常鲜明的技术切面:

为了进一步让评测具备诊断价值,XL-DocBench 将所有问题划分为三层梯队(Tier)、共计 12 种精细推理类型:第一层基础推理包含跨段比较与引用链追踪;第二层结构推理涉及排序、多项覆盖与对账重合;第三层高级推理则涵盖集合差集计算、合规与特殊条款检查、时间序列反推、反事实假设以及无依据拒答等。这种分类使得评测结果不再是一个笼统的百分比,而是能精准定位模型在特定认知层级上的断裂点。

实验评测:大模型在超长现实面前的集体受挫

研究团队对业界主流的前沿专有大模型、开源大模型以及多 Agent 检索框架进行了端到端评测。评测涵盖了 GPT-5.4、Claude Opus 4.6、GPT-5.2、Kimi-K2.5、DeepSeek-V3.2、Qwen3.5 系列等,并在输入形式上对比了全页图像输入(Img)、限制在上下文窗口 80% 预算以内的逐页 OCR 文本输入,以及专门处理长 PDF 的检索增强智能体方案(如 MDocAgent、SimpleDoc 和 DeepRead)。评测以类型化规则约束下的严格执行准确率(Accuracy)为主要指标,并辅以 Token 级别的 F1 值和归一化编辑距离相似度(ANLS)。

测试暴露出的首要现象是:整体表现远低于预期,最先进方案仍难以逾越 50% 门槛。在所有被测方案中,即便调用了当前公认最顶尖的模型与 Agent 框架,整体准确率最高的一组也仅达到 44.0%。这表明在千页级别的复杂规则推理面前,当前 AI 系统距离达到人类专业从业者的合格线仍有巨大的性能鸿沟。

另一个极具颠覆性的发现是:百万级原生上下文窗口,并没有带来预想中的碾压优势。在理论上,GPT-5.4 与 Claude Opus 4.6 均具备 1M Token 级别的超大上下文容量,在评测设置中获得了高达约 800K Token 的可用 OCR 文本预算,足以将绝大部分长文档的内容“一锅端”送入 Prompt;而 DeepSeek-V3.2 的名义窗口仅为 128K(可用预算约 102K)。然而实验表明,虽然 1M 模型相比小窗口单次阅读确实有明显优势,但在相同的 OCR 单次直读设定下,Claude Opus 4.6 仅取得略高于 GPT-5.4 的表现,二者均被专门针对 PDF 进行多轮检索、筛选紧凑上下文再做判决的 Agent 方案拉开了 4 到 7 个百分点的差距。

这直接证明了“容量红利”与“检索红利”在长文档处理中呈现出部分相互替代、而非简单线性叠加的关系。当文档长度延伸到数千页时,即便模型注意力机制在数学上能够覆盖整个序列,模型在庞大的上下文噪声中提取关键信息、保持多步逻辑活跃度、并准确抑制无关细节的能力依然会严重衰退。

诊断归因:模型究竟死在检索还是死在推理?

得益于 XL-DocBench 提供的专家级页码标注与细粒度问题标签,研究人员能够穿透表面的总分,将系统的失败拆解为“检索未命中”与“推理不依从”两类截然不同的错误成因。

当把模型的准确率按照上下文长度、所需证据页数量以及证据跨度(Evidence Span,即最早证据页与最晚证据页之间的页数距离)展开分析时,所有直接阅读型模型都展现出几乎一致的单调下滑趋势。更值得玩味的是,随着所需证据页数量的上升,单次直读模型的崩溃速度远高于具备局部聚焦能力的 Agent 架构。当一个问题只需要 1 页证据时,很多系统尚能维持较体面的答对率;而一旦所需证据页扩展到 3 到 5 页以上,直读模型的表现便呈现出断崖式下挫。

通过分离 Agent 架构中的“证据命中率”(Evidence Hit)与“最终答案产出率”(Answer Yield),研究还发现了两类截然相反的系统软肋:

一些系统能够通过搜索找到人类专家标注的全部证据页面,但最终的作答准确率却极低。深入分析显示,这类系统普遍在“集合差异追踪”(Set Difference)和“合规例外处理”(Compliance Checks)等高级推理任务上折戟。模型虽然“看到”了所有的条目,却无法在长篇大论中准确区分“哪些项目属于集合 A 但被第 200 页的补充条款排除在集合 B 之外”。

另一种失败模式则集中在“无解拒答”(Unanswerable / None-answer)场景。几乎所有被测的直接阅读型大模型在这一维度上的得分都极度难看。大模型天生具备顺应提示词强制作答的迎合倾向,当被要求从一份上千页但实际上未提及某项关键参数的报告中得出结论时,模型不仅无法敏锐察觉“证据不充分”,反而倾向于将长文中其他无关年份或近似实体的数值生搬硬套到答案中,构造出看似可信的严重幻觉。

此外,纯文本 OCR 模式与视觉图像模式的对比也揭示了工程落地中的现实取舍。纯文本 OCR 输入降低了视觉 Token 的开销,使得文本更易被检索命中,但在面对表格嵌套、跨页图表对齐等排版强相关的题目时,OCR 的序列化抹平直接造成了拓扑信息丢失;而全图像输入虽然保留了完整的图表与视觉版式,却极度挤占多模态模型的视觉注意力预算,导致模型在超长序列的翻页处理中极易发生“中途遗忘”。

超长文档智能的后续演进方向

XL-DocBench 所呈现的评测结果,对当前大模型在复杂垂直行业中的落地路径给出了极具价值的警示。它清晰地表明,单纯卷上下文窗口的长度,并不能自然治愈超长多页文档理解中的系统性缺陷。

未来的技术突破大概率不在于单一维度的上下文扩容,而在于架构层面的协同演化。首先,面向专业文档的检索增强生成(RAG)必须从单纯的短文本向量切片召回,升级为具备全局目录感知与层级跳跃能力的“结构化页面级导航 Agent”;其次,模型必须引入更加严格的“证据驱动约束”,将答案生成与可验证的原文引用强制绑定;最后,评测机制也必须摒弃只看最终文本重合度的粗放思路,全面转向以可信归因、页码回溯与精确拒答为核心的细粒度验证标准。在通往真正可靠的企业级 AI 助手的道路上,XL-DocBench 提供了一面足够冷酷、但也足够真实的照妖镜。