从DenseOn到mLateOn:LightOn用28亿数据证明,延迟交互才是多语言检索更优解?

DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

从DenseOn到mLateOn:LightOn用28亿数据证明,延迟交互才是多语言检索更优解? 论文图示

检索模型的性能瓶颈,正在被闭源数据的高墙严密包围。过去两年里,开源社区在模型底座上频频推陈出新,但顶尖的检索系统——无论是单向量稠密检索(Dense Retrieval)还是基于多向量的延迟交互检索(Late-Interaction)——其关键竞争力几乎完全维系在庞大且未公开的训练混合配方、严苛的清洗规则以及私有的难负例挖掘流程上。哪怕使用完全相同的模型架构(例如 ModernBERT),在公开配方与闭源配方下训练出的系统,在标准基准测试 BEIR 上也能拉开近 2.5 个 nDCG@10 点数的鸿沟。开源社区难以复现前沿结果,更无法在受控变量下探究模型能力的真正来源。

ArXiv URL:https://arxiv.org/abs/2607.27178v1

来自 LightOn 的研究团队正式发布了 DenseOn 与 LateOn 系列模型及全流程配方,彻底打破了这一“黑盒”。该研究不仅完整重构并开源了包含 6.65 亿对高质量图文/文档样本的英文对比预训练数据集、带精细难负例的 188 万对微调集,还通过系统性的机器翻译拓展构建了高达 28 亿对的多语言检索预训练库。更具启发性的是,当研究者在完全相同的多语言底座(mmBERT-base)、相同数据与相同损失函数下比对稠密单向量模型(mDenseOn)与延迟交互多向量模型(mLateOn)时,发现了一个深刻的技术现象:单向量表示在面对训练未覆盖的语种时泛化能力急剧衰减;而基于 Token 级细粒度交互的 ColBERT 架构,能够充分激活预训练语言模型底座中潜藏的跨语言几何结构,在零样本未见语种与复杂文字系统上逆势展现出惊人的泛化性能。这项工作不仅提供了同参数量级下刷新纪录的完全开源检索模型,更从表示机制的本质层面重新定义了多语言检索的数据扩展范式。

治标先治本:重构完全透明的端到端检索数据链

要厘清检索模型的性能从何而来,首要任务是在公开透明的地基上重建一个能匹敌顶尖闭源系统的英文配方。长期以来,阿里巴巴团队的 mGTE 技术报告被公认为行业标准之一,但其内部庞大的 34 个数据源及处理细节并未向公众开放。LightOn 团队从源头逆向追踪,逐一找齐这 34 个公开数据源,重构格式匹配逻辑,并引入基于 FineWeb-Edu 的最新网络爬取切片替换原方案中过时的网页数据。整个原始语料库在清洗前膨胀至约 14 亿个“查询-文档”对。

与以往粗暴设置硬性阈值丢弃样本的做法不同,该研究采用了一种“非破坏性元数据过滤管线”。每一个数据对都会被实时打上三种维度的元数据标记:一是结构质量的布尔标签,用于识别异常长短文本或格式破损;二是基于 MD5 的哈希去重标识,精确剔除冗余项;三是调用开源重排器 mxbai-rerank-large-v2 计算出的跨编码器(Cross-Encoder)语义相关性打分。这种设计的绝妙之处在于,所有过滤逻辑全部延后至训练读取数据时动态触发。研究人员保留了约 48% 的核心数据(6.65 亿对)用于预训练,但将包含完整 14 亿对样本及其评价值的数据库全数公布。任何下游开发者无需重新跑动昂贵的数据挖掘管线,即可按需自拟过滤规则。

在微调阶段,团队采纳 NV-Retriever 的难负例挖掘体系,覆盖 FiQA、Natural Questions、HotpotQA、MS MARCO 等 7 个经典检索基准。研究者借助强力检索器为每个查询召回语义最相近的 Top-2048 个段落作为硬负例候选池,产出了 188 万个高难度监督微调对。依托这一高质量英文基座,团队训练出参数量仅为 149M 的单向量模型 DenseOn 与延迟交互模型 LateOn。在严格包含 15 个公开任务的 BEIR 零样本基准测试中,两者分别取得了 56.20 与 57.22 的平均 nDCG@10 评分,一举刷新了同等尺寸模型的开源 SOTA。去污染(Decontamination)验证更是表明,即使完全扣除训练集与测试集重合的样本,LateOn 的排名不仅没有下滑,反而相对其他闭源系统逆势上升,证明了该数据清洗范式的纯粹性与高泛化度。

翻译即对齐:28亿样本的低成本跨语言跃迁

在夯实英文管线后,研究团队将目光投向了长期困扰学术界的难题:高阶的检索监督信号(如复杂查询、高质量人工标注)绝大多数依然积聚在英语世界,稀缺语种往往难以承担专门标注的高昂代价。团队决定检验一条经典路径的极限:利用生成式大语言模型作为机器翻译引擎,将经受过严格相关性验证的英文数据种子扩展为多语言语料库(Translate-Train)。

翻译过程并不是单纯将查询与文档机械切片后分别调用翻译接口。为了保证语义在目标语言中的自然性与一致性,研究团队使用参数量为 24B 的 Mistral-Small-3.1-24B-Instruct,以“查询-文档”联合输入的形式,辅以两样本提示词,将其整体转译为法语、德语、意大利语、西班牙语、葡萄牙语、瑞典语、挪威语和阿拉伯语 8 种目标语言。联合转译能够让模型在相同的语境中理解生僻术语与隐式关联,避免词义剥离。针对跨语言检索场景,团队进一步引入了交叉组合策略:在目标语言对中,将 25% 的样本替换为源语言查询匹配异语种翻译文档(例如英语查询检索西班牙语文档)。预训练池最终扩展到了 28 亿对样本,包含单语翻译对与跨语检索对。

在监督微调阶段,团队采用推理能力更强的 Qwen3-32B 对 188 万英文 SFT 样本进行高保真翻译,并将每个查询对应的负样本通过 NV-Retriever 严格截断并筛选出质量最高的 Top-10 候选项。为进一步拓展模型的工业应用边界,团队额外混入了来自 MIRACL(多语言 QA)、MLDR(长文档检索)以及 LateOn-Code(代码搜索)的真实监督数据,最终形成了跨越 9 种自然语言与代码体系的 1630 万样本微调集。

基于预训练掩码语言模型 mmBERT-base(307M 参数),团队分别构建了单向量模型 mDenseOn 与多向量模型 mLateOn。两者训练时的骨干网络完全相同,训练批次完全相同,数据配比完全相同,且均引入了针对重排器 mxbai-rerank-large-v2 的 KL 散度知识蒸馏目标。唯一的不同,仅在于最后的表征机制:前者通过 [CLS] 向量汇聚出单一稠密嵌入并辅以 Matryoshka 维度降维训练;后者则遵循 ColBERT 范式,保留所有 Token 的多向量表征,并在推理打分时使用长度归一化的 MeanMaxSim 交互机制。

相同的参数与数据,为何交互架构彻底碾压单向量?

评测结果呈现出极具技术冲击力的分化。在标准的跨语言全功能评测中,两款模型接受了包含短文本多语言检索(MIRACL)、长文档多语言检索(MLDR)、通用英文检索(BEIR)以及跨语言代码检索(MTEB Code)的严苛检验。

在英文 BEIR 测试中,多语言训练完全没有引发“遗忘效应”:mDenseOn 取得了 56.70 的 nDCG@10,与参数量翻倍的 pplx-embed-v1-0.6b 和 jina-v5-text-small 打成平手,大幅领先同尺寸的 embeddinggemma-300m;而多向量版本的 mLateOn 则飙升至 57.56,超越了同场测试的所有多语言基准模型。在 MTEB Code 代码检索测试中,尽管没有在预训练阶段加入专门的代码语料,仅凭 SFT 阶段的有针对性微调,mDenseOn(71.53)和 mLateOn(73.48)也双双跻身轻量级代码检索的第一梯队。

真正的性能分水岭出现在多语言和长文档场景下,实验数据揭示出两种架构在语义对齐机制上的本质鸿沟:

  1. 未见语种的零样本泛化能力: 在 MIRACL 基准中,若只评估训练集覆盖的目标语种(英语、阿语、法语、德语、西语),mDenseOn 录得 59.61 分,与主流系统持平。然而一旦将评测范围扩大到 MIRACL 的全部 18 种语言(包含 13 种在检索训练阶段完全没见过的语言),mDenseOn 的成绩不仅没有借由基础底座发力,反而下跌至 58.02 分。令人吃惊的是,哪怕面对同样采用拉丁字母书写系统的芬兰语、印尼语和斯瓦希里语,单向量稠密模型也发生了明显的性能溃缩。反观 mLateOn,其在受训目标语言上取得了 65.61 分,而在包含所有未见语言的全局榜单上,不仅没有下滑,反而逆势跃升至 67.04 分——整整领先相同配置的 mDenseOn 9 个百分点,直逼体量两倍以上的 BGE-M3。即便面对西里尔文、天城文、孟加拉文、泰文以及中日韩汉字等完全异构的书写系统,mLateOn 依然表现出强劲的跨语种检索抽取能力。

  2. 长文档信息的吸收效率: 在 MLDR 评测中,两者的分化达到了戏剧性的程度。在训练数据覆盖的目标语种长文档中,mLateOn 斩获 87.69 分,而在全语种长文档上依然维持在 77.92 分的高位。共享完全相同训练集的 mDenseOn,在相同测试集上的表现足足落后 mLateOn 达 20 个 nDCG 点数。这雄辩地证明,长文档多语言性能的爆发并非单纯来自于 MLDR 训练集的数据记忆,而是延迟交互架构在面对冗长语义段落时,能够通过细粒度的 Token 寻址避开长程依赖带来的信息稀释,将匹配精度推向极致。

为什么 Token 级别的延迟匹配能打通跨语言壁垒?

对比实验的控制变量极为严密,这一显著的技术断层迫使我们重新思考检索表示学习的底层机理。为什么同样的 Translate-Train 路径,在 Dense 架构下只能实现“目标语言的机械迁移”,而在 Late-Interaction 架构下却能蜕变成“全多语言的自适应泛化”?

其核心症结在于单向量池化(Pooling)所造成的“跨语言对齐瓶颈”。现代多语言预训练骨干网络(如基于 MLM 掩码语言建模训练的 mmBERT)在底层其实已经构建了一套相对连续的高维跨语言空间,不同语言的词元在该空间中存在某种隐式的局部几何对应。当我们将网络适配为单向量稠密模型时,必须依赖 [CLS] 或 Mean-pooling 操作将整段文本压缩为孤立的高维向量,并通过对比损失将成对的语义向彼此拉近。由于训练集中仅包含 8 种转译语言,单向量对比损失强行重塑了顶层的整个几何流形,迫使模型将有限的表征容量集中在拟合这 8 种语言的整体全局表征上。这种“全局拉扯”具有排他性,极易破坏基础底座在预训练阶段为未见语言建立起的脆弱跨语言空间平衡,最终导致模型在面对未训练语种时,单向量映射发生严重漂移。

延迟交互模型则彻底规避了这一瓶颈。ColBERT 类的评分方式并不是把文本压扁,而是计算查询中每个词元在候选文档所有词元上的最大余弦相似度并求和:

\[S(Q, D) = \frac{1}{\lvert Q \rvert} \sum_{i \in Q} \max_{j \in D} (E_{q, i} \cdot E_{d, j}^\top)\]

在多语言检索场景下,这种局部交互机制展现出独特的鲁棒性。机器翻译产生的监督信号通过延迟交互损失传导时,不需要强行拉拢整句的抽象语义心智,而是优化跨语言同义词元、实体名词或结构标点之间的细粒度投影。当检索系统面对一种全新的未知语言时,哪怕该语言的全局句子向量漂移严重,其底层的大量功能词、共享子词、命名实体以及上下文拓扑关系依然稳固地锚定在 mmBERT 的词元高维空间中。MeanMaxSim 机制允许查询中的关键词元直接在文档中“点对点”搜寻相似度最高的局部对应项,从而绕过了全局池化造成的语义衰减。这在数学和工程上证明了:Token 级别的晚期匹配,能够最大程度地保全预训练底层原本习得的多语言对齐拓扑结构。

开源检索模型进入工业落地的下一阶段

DenseOn 与 LateOn 的开源发布,不仅为检索社区提供了一套可全流程审计、可低成本复现的基准资产,更对当前检索与 RAG(检索增强生成)系统的架构选型带来了务实的工程启示。

长期以来,工业界在多语言检索方案上面临两难:单向量 Dense 模型推理极其迅捷、向量数据库兼容度高,但在跨语言转移和长文档切片匹配上上限受限;多向量 ColBERT 模型表现惊艳,却常因多向量存储开销过大、检索复杂度高而令人望而却步。LightOn 团队不仅提供了经受住 Matryoshka 维度截断验证的单向量模型,还基于 FastPlaid 库为多向量索引提供了极度高效的检索实现,使得 mLateOn 这类系统在保持超强跨语言泛化力与长文本抗压力的同时,推理延迟能够压缩在生产环境可接受的毫秒级阈值内。

更为重要的是,该研究给算力受限的多语言检索开发者指明了一条低成本捷径:构建多语言检索系统,或许并不需要搜集所有小语种的高清对齐语料。只要依托一个足够稳固的多语言预训练编码器底座,利用主流语言构建数百万至数千万量级的高质量机器翻译对,再配合延迟交互架构的局部匹配特性,就能以极高的数据投资回报率自然解锁十几种、甚至几十种未见语种的零样本检索能力。检索技术的竞争,终于开始从单纯比拼闭源语料规模的军备竞赛,走向利用表征特性撬动泛化极限的深水区。