1.2B反超200倍巨头:MinerU2.5-Pro重塑文档解析飞轮

MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale

当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。

ArXiv URL:http://arxiv.org/abs/2604.04771v1

论文中的核心图示

论文原图:用于辅助理解核心方法或实验结果。

这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。

真正拖后腿的,是高度同质化且存在缺陷的训练数据。基于这一发现,本文提出全新的 MinerU2.5-Pro 模型。

在完全不修改原本 1.2B 参数架构的前提下,该研究纯粹依靠数据工程与训练策略的重构,将数据规模扩大至 6550 万。

最终,该模型在升级版的基准测试中斩获 95.69 分,不仅超越了同架构基线,更越级击败了参数量大其两百倍的通用多模态巨头。

数据引擎:跨越“标注质量悖论”

文档解析的训练数据面临着典型的“标注质量悖论”。那些最能提升模型能力的困难样本(如密集公式、复杂嵌套表格),恰恰是自动化标注最容易出错的地方。

如果只是盲目扩大数据量,只会放大这种数据偏见与噪声。为此,该研究设计了一套由三大核心组件构成的全新数据引擎。

这就像是为模型量身定制了一套“题海战术与精细化辅导”系统,不仅要找出难题,还要确保给出的标准答案绝对正确。

难易度感知采样机制

长尾分布是数据构建的顽疾。高频的简单单栏论文极多,而多栏复杂排版极少。

多样性与难度感知采样Diversity-and-Difficulty-Aware Sampling, DDAS)机制应运而生。它在页面和元素两个颗粒度上进行聚类。

更关键的是,它不再盲目抓取,而是结合了对样本难度的评估,专门给中等难度和高难度样本打上高权重,以此扩充数据。

跨模型一致性校验

那么,在没有人工干预的海量无标注数据中,如何定义一道题到底“难不难”?

这里,我们引入一个克制且延续的比喻:把不同的异构模型看作是一个个“阅卷老师”。

如果所有老师对同一份文档给出的解析结果高度一致,说明这是一道“基础题”。此时,直接采用一致的预测作为正确答案即可。

这就是跨模型一致性校验Cross-Model Consistency Verification, CMCV)的核心逻辑。它利用多个异构模型输出的共识度,快速对海量数据进行难度分级(简单、中等、困难)。

如果所有“阅卷老师”都给出了不同的答案,说明遇到了真正的“困难题”。这类题目绝不能直接拿去训练模型,否则会引入巨大噪声。

渲染验证的自我纠错闭环

对于这些导致集体翻车的“困难题”,该研究设计了判定与修正Judge-and-Refine)流水线。

直接让模型进行自我反思往往是无效的。因为模型擅长从图像生成代码(如 $LaTeX$),却极难在大脑中想象出这段复杂代码渲染后的视觉模样。

这就像让学生干巴巴地检查自己写的几何公式,很容易产生“我写的全对”的幻觉。

打破幻觉的唯一方法,就是让他把图画出来。该流水线强迫模型将生成的结构化代码“渲染”回图像。

随后,系统利用具有强大视觉推理能力的判定模型,直接对“原图”和“渲染图”进行像素级的视觉比对,精准定位差异并迭代修正。

仅剩下极少部分连这个闭环都无法修复的变态级样本,才会被送入人工专家标注队列。

渐进式训练策略

通过上述数据引擎,研究团队获得了 6550 万的高质量易/中等样本,以及 19.2 万极高质量的困难样本。

与之匹配的,是精心设计的三阶段训练策略:

第一阶段:大规模有监督微调。模型使用 6550 万的共识数据进行全参数训练。这相当于给模型打下极度扎实的基础,其数据量比前代扩大了近十倍。

第二阶段:高质量困难样本微调。利用专家标注的 19.2 万困难数据进行针对性强化,专攻复杂表格和密集公式等硬骨头。

第三阶段:基于GRPO的强化学习对齐。传统的交叉熵损失仅仅是孤立地预测每一个 Token。

这无法直接反映出诸如编辑距离或表格准确率等结构性指标。

因此,该阶段引入了组相对策略优化Group Relative Policy Optimization, GRPO)。

针对公式识别,直接将 $CDM$ 指标作为奖励函数;针对表格,将 $TEDS$ 作为奖励。这种让训练目标与评测标准直接挂钩的做法,大幅提升了最终输出的准确度。

评测协议重构:消除颗粒度偏见

在评估阶段,该研究深刻指出了现有基准测试中存在的隐蔽漏洞:匹配策略偏见。

在原有的单一颗粒度匹配逻辑中,如果真实标注将一个多行公式视作“一个整体块”,而模型将其精准识别出,但分成了“多行独立块”输出。

那么,尽管语义完全正确,模型也会被直接判零分。这严重损害了评测的公平性。

为此,本文提出了 OmniDocBench v1.6,其核心是多粒度自适应匹配Multi-Granularity Adaptive Matching, MGAM)算法。

该算法保持真实标注 $\mathcal{G}$ 不变,仅在预测端 $\mathcal{P}$ 动态寻找最优切分粒度。

它通过三个步骤寻找全局最优解:

  1. 直接在原始颗粒度下进行二分图匹配。
  2. 将预测元素按换行符等标识强行拆解成极细颗粒度 $\mathcal{P}^{\prime}$,再重新匹配。
  3. 枚举 $\mathcal{P}^{\prime}$ 所有连续子序列的合并方案,寻找最优匹配块。

最终选取三种方案中得分最高的一种作为最终匹配 $\mathcal{M}^{*}$。这一举措彻底剥离了输出格式差异带来的干扰,让评测真正回归到“内容识别能力”本身。

此外,新基准还特意引入了包含 296 页高难度样本的独立测试子集,极大提升了测试的区分度。

结论与工程启示

MinerU2.5-Pro 的成功不仅是一次分数的刷新,更是对数据中心化 AI 理念的绝佳证明。

在模型架构逐渐收敛的今天,系统性地优化数据的覆盖率、信息密度以及标注准确性,所带来的收益远大于对模型结构的微调。

当然,文档解析的终局不仅在于提取内容的准确度,更在于对文档内在结构的深层语义理解(例如跨页内容的连续性、图文指代关系等)。

这不仅是当前评测系统的盲区,也是下一代文档解析技术亟需攻克的前沿阵地。