1.2B反超200倍巨头:MinerU2.5-Pro重塑文档解析飞轮
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。
ArXiv URL:http://arxiv.org/abs/2604.04771v1

论文原图:用于辅助理解核心方法或实验结果。
这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。
真正拖后腿的,是高度同质化且存在缺陷的训练数据。基于这一发现,本文提出全新的 MinerU2.5-Pro 模型。
在完全不修改原本 1.2B 参数架构的前提下,该研究纯粹依靠数据工程与训练策略的重构,将数据规模扩大至 6550 万。
最终,该模型在升级版的基准测试中斩获 95.69 分,不仅超越了同架构基线,更越级击败了参数量大其两百倍的通用多模态巨头。
数据引擎:跨越“标注质量悖论”
文档解析的训练数据面临着典型的“标注质量悖论”。那些最能提升模型能力的困难样本(如密集公式、复杂嵌套表格),恰恰是自动化标注最容易出错的地方。
如果只是盲目扩大数据量,只会放大这种数据偏见与噪声。为此,该研究设计了一套由三大核心组件构成的全新数据引擎。
这就像是为模型量身定制了一套“题海战术与精细化辅导”系统,不仅要找出难题,还要确保给出的标准答案绝对正确。
难易度感知采样机制
长尾分布是数据构建的顽疾。高频的简单单栏论文极多,而多栏复杂排版极少。
多样性与难度感知采样(Diversity-and-Difficulty-Aware Sampling, DDAS)机制应运而生。它在页面和元素两个颗粒度上进行聚类。
更关键的是,它不再盲目抓取,而是结合了对样本难度的评估,专门给中等难度和高难度样本打上高权重,以此扩充数据。
跨模型一致性校验
那么,在没有人工干预的海量无标注数据中,如何定义一道题到底“难不难”?
这里,我们引入一个克制且延续的比喻:把不同的异构模型看作是一个个“阅卷老师”。
如果所有老师对同一份文档给出的解析结果高度一致,说明这是一道“基础题”。此时,直接采用一致的预测作为正确答案即可。
这就是跨模型一致性校验(Cross-Model Consistency Verification, CMCV)的核心逻辑。它利用多个异构模型输出的共识度,快速对海量数据进行难度分级(简单、中等、困难)。
如果所有“阅卷老师”都给出了不同的答案,说明遇到了真正的“困难题”。这类题目绝不能直接拿去训练模型,否则会引入巨大噪声。
渲染验证的自我纠错闭环
对于这些导致集体翻车的“困难题”,该研究设计了判定与修正(Judge-and-Refine)流水线。
直接让模型进行自我反思往往是无效的。因为模型擅长从图像生成代码(如 $LaTeX$),却极难在大脑中想象出这段复杂代码渲染后的视觉模样。
这就像让学生干巴巴地检查自己写的几何公式,很容易产生“我写的全对”的幻觉。
打破幻觉的唯一方法,就是让他把图画出来。该流水线强迫模型将生成的结构化代码“渲染”回图像。
随后,系统利用具有强大视觉推理能力的判定模型,直接对“原图”和“渲染图”进行像素级的视觉比对,精准定位差异并迭代修正。
仅剩下极少部分连这个闭环都无法修复的变态级样本,才会被送入人工专家标注队列。
渐进式训练策略
通过上述数据引擎,研究团队获得了 6550 万的高质量易/中等样本,以及 19.2 万极高质量的困难样本。
与之匹配的,是精心设计的三阶段训练策略:
第一阶段:大规模有监督微调。模型使用 6550 万的共识数据进行全参数训练。这相当于给模型打下极度扎实的基础,其数据量比前代扩大了近十倍。
第二阶段:高质量困难样本微调。利用专家标注的 19.2 万困难数据进行针对性强化,专攻复杂表格和密集公式等硬骨头。
第三阶段:基于GRPO的强化学习对齐。传统的交叉熵损失仅仅是孤立地预测每一个 Token。
这无法直接反映出诸如编辑距离或表格准确率等结构性指标。
因此,该阶段引入了组相对策略优化(Group Relative Policy Optimization, GRPO)。
针对公式识别,直接将 $CDM$ 指标作为奖励函数;针对表格,将 $TEDS$ 作为奖励。这种让训练目标与评测标准直接挂钩的做法,大幅提升了最终输出的准确度。
评测协议重构:消除颗粒度偏见
在评估阶段,该研究深刻指出了现有基准测试中存在的隐蔽漏洞:匹配策略偏见。
在原有的单一颗粒度匹配逻辑中,如果真实标注将一个多行公式视作“一个整体块”,而模型将其精准识别出,但分成了“多行独立块”输出。
那么,尽管语义完全正确,模型也会被直接判零分。这严重损害了评测的公平性。
为此,本文提出了 OmniDocBench v1.6,其核心是多粒度自适应匹配(Multi-Granularity Adaptive Matching, MGAM)算法。
该算法保持真实标注 $\mathcal{G}$ 不变,仅在预测端 $\mathcal{P}$ 动态寻找最优切分粒度。
它通过三个步骤寻找全局最优解:
- 直接在原始颗粒度下进行二分图匹配。
- 将预测元素按换行符等标识强行拆解成极细颗粒度 $\mathcal{P}^{\prime}$,再重新匹配。
- 枚举 $\mathcal{P}^{\prime}$ 所有连续子序列的合并方案,寻找最优匹配块。
最终选取三种方案中得分最高的一种作为最终匹配 $\mathcal{M}^{*}$。这一举措彻底剥离了输出格式差异带来的干扰,让评测真正回归到“内容识别能力”本身。
此外,新基准还特意引入了包含 296 页高难度样本的独立测试子集,极大提升了测试的区分度。
结论与工程启示
MinerU2.5-Pro 的成功不仅是一次分数的刷新,更是对数据中心化 AI 理念的绝佳证明。
在模型架构逐渐收敛的今天,系统性地优化数据的覆盖率、信息密度以及标注准确性,所带来的收益远大于对模型结构的微调。
当然,文档解析的终局不仅在于提取内容的准确度,更在于对文档内在结构的深层语义理解(例如跨页内容的连续性、图文指代关系等)。
这不仅是当前评测系统的盲区,也是下一代文档解析技术亟需攻克的前沿阵地。