NCP-ArchPreview:打破单Token限制,以一半数据追平7B基准

NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

NCP-ArchPreview:打破单Token限制,以一半数据追平7B基准 论文图示

自现代大语言模型确立以 Transformer 为基石的扩展范式以来,下个词预测(Next-Token Prediction, NTP)几乎成为了大模型预训练的唯一铁律。这种极简的目标函数赋予了模型惊人的泛化能力,但也带来了难以回避的根本性缺陷:模型被紧紧束缚在浅层的、字符或子词级别的表面符号流中。每一个 Token 的生成都被迫承担过度的局部语法细节,而高阶的语义规划、逻辑结构与宏观概念,只能作为表层预测的副产物在隐层中被动涌现。

ArXiv URL:https://arxiv.org/abs/2609.10715v1

与自然语言形成鲜明对比的是计算机视觉领域的发展路径。以 Latent Diffusion 和 JEPA(联合嵌入预测架构)为代表的技术路线早已证明,摆脱像素级的低效重建、直接在抽象的潜空间中进行表征建模,不仅能大幅降低冗余计算,更能直接捕获高阶的不变量与结构信息。语言模型能否借鉴这一范式,在保留离散自回归生成能力的同时,真正迈入潜空间建模?

来自上海人工智能实验室(Shanghai AI Lab)与上海交通大学 LUMIA 实验室的研究团队给出了肯定答卷。他们发布了首个在数万亿 Token 级别规模化验证的潜空间语言模型:NCP-ArchPreview。该模型跳出了单一的 NTP 范式,引入了跨越多个 Token 的下个概念预测(Next Concept Prediction, NCP)机制。在基于 Dolma-3 数据集进行的 5.73T Tokens 严苛预训练中,8.9B 参数规模的 NCP-ArchPreview 展现出了颠覆性的优化效率:仅消耗基线模型 51.3% 的训练数据,就追平了 OLMo-3-7B 的最终预训练损失,收敛速度提升 1.95 倍;在完整训练完成后,其下游多项基准宏平均得分超出 2.45 分,GSM8K 数学推理更是实现了 5.99 分的大幅跃升。这一成果不仅打破了非传统自回归架构难以规模化扩展的质疑,更为下一代基座模型的架构演进提供了切实可行的工业级蓝图。

从表面符号到抽象潜空间:解构三段式混合架构

要在自回归语言模型中引入概念级建模,首要难题在于如何定义“概念”。自然语言缺乏天然的边界与预设的语义单元,强行依赖外部语义解析器或启发式规则往往会引入不可控的噪声与归纳偏差。NCP-ArchPreview 的核心思想非常纯粹:直接从模型内部的隐层表征中自组织提炼离散概念,并将其作为具有强约束的显式预测目标

为了实现这一目标,NCP-ArchPreview 对标准 Transformer 的骨架进行了重构,形成了一个三段式的模块化流动体系:由 16 层组成的 Token Encoder、位于中枢的 8 层 Concept Module,以及负责最终输出的 16 层 Token Decoder。整套架构维持了与标准自回归模型一致的输入输出接口,却在中间层开辟出了一条独立的高阶语义通道。

在信息流动的第一阶段,输入序列 $x_{1:T}$ 经由 Token Encoder 映射为底层的 Token 级隐藏状态 $h_{1:T} \in \mathbb{R}^d$。随后,系统以固定窗口大小 $k$(文中取 $k=4$)对连续的 Token 状态进行均值池化(Mean Pooling),将时间步长压缩为 $M = \lfloor T/k \rfloor$:

\[c_m = \frac{1}{k} \sum_{i=1}^k h_{(m-1)k+i}\]

这一操作将局部的细节表征压缩为连续的概念原型 $c_m \in \mathbb{R}^d$。随后,连续概念被送入一个精心构建的矢量量化(Vector Quantization, VQ)模块。为了避免单一超大 Codebook 带来的计算爆炸与表示坍缩,研究团队采用了乘积量化(Product Quantization, PQ)设计:将每个 $d$ 维的概念向量等分为 $S$ 个特征切片,每个切片独立匹配属于自己的局部 Codebook(包含 $N$ 个基向量)。这种分段解耦使得仅仅拥有 $N \times S$ 个实际基向量的量化层,能够组合出高达 $N^S$ 种离散概念语义,在参数量仅约 17M 的极小开销下,为模型构建了一个极其广阔且结构化的离散概念词表。

处于中枢的 Concept Module 专门负责在这一离散概念空间内进行自回归推演。如果直接让模型回归连续向量,目标空间缺乏结构约束,表征极易发生漂移甚至崩溃;而如果直接通过硬判决(Argmax)选取离散 Code,又会导致整个前向传播不可微。NCP-ArchPreview 采用了一种优雅的“软加权”策略:针对每个 PQ 分段,Concept Module 的预测头输出一个对当前 Codebook 的概率分布 $\boldsymbol{\pi}_m^s$,再通过加权期望求和重构出可微的预测概念片段:

\[\hat{c}_m^s = \sum_{n=1}^N \pi_{m,n}^s e_n^s\]

重构拼接后的预测概念 $\hat{c}_m$ 既受限于预先学到的离散基向量流形,又保持了完全可微的梯度通道。在随后的生成阶段,这些预测出的概念表征在时间轴上被重复扩展 $k$ 次,并在因果维度上施加因果位移偏移量 $\Delta = k$。这意味着,模型在生成当前 Token 之前,已经提前“看”到了高阶语义模块对未来多步概念的规划结果。被因果对齐的概念向量直接残差叠加至 Token 隐藏状态中,驱动 Token Decoder 完成最终的 Token 分布预测。

为了打破模块分层造成的深层信息阻滞,NCP-ArchPreview 还引入了受 MUDDFormer 启发的层次化残差路由机制。系统不仅在每个模块内部部署了能够自适应跨越深度的层内残差连接(IRC),还在 Token Encoder、Concept Module 与 Token Decoder 之间架设了动态带权的跨模块残差通道(CRC)。这种密集的动态跳连确保了底层的细粒度语法特征与高层的抽象概念能够自由互通,让梯度反向传播在整整 40 层混合结构中畅通无阻。

三位一体的端到端目标:因果自洽与梯度控制

在一个既包含连续回归、又包含离散量化与自回归分类的复杂系统中,如何设计损失函数与梯度流动路径,直接决定了模型能否稳定收敛。NCP-ArchPreview 构建了一个紧密耦合的三位一体联合目标函数:

\[\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{NTP}} + \alpha \mathcal{L}_{\text{NCP}} + \beta \mathcal{L}_{\text{VQ}}\]

这三个损失项在优化过程中各司其职,且具有严格的因果隔离设计:

在优化器选择上,团队放弃了纯粹的 AdamW 方案,全面引入基于正交化更新的 Moonlight Muon 矩阵优化器。针对矩阵权重的谱范数约束,使得该模型在高学习率与跨越数万亿 Token 的长时间训练中展现出了极强的数值稳定性,成功规避了概念预测模块由于跨抽象层级交互可能诱发的注意力 Logit 溢出风险。

1.95倍收敛提速:数万亿Token训练的实证检验

任何架构创新如果不能在产业级规模下自证其效率,就只能停留在学术玩具的层面。NCP-ArchPreview 最大的说服力,正在于其在 5.73T Tokens 规模上交出的亮眼答卷。

在基准设定上,研究团队严格对齐了目前完全开源的高质量模型 OLMo-3-7B,采用相同的 Dolma-3 数据课程。在第一阶段(Stage-1)针对 5.73T Tokens 的预训练过程中,NCP-ArchPreview 的训练损失曲线展现出了惊人的下潜速度。曲线在最初阶段便与基线拉开差距,并随着训练推进持续扩大优势,最终阶段一的损失差值达到了 0.091。最关键的数据在于:NCP-ArchPreview 仅消耗了总 Token 量 51.3% 的数据预算,其训练损失便追平了 OLMo-3-7B 跑满全量 5.73T 数据的最终损失。换言之,在达到相同语言建模损失的前提下,NCP 机制带来了 1.95 倍的收敛加速。

进入针对高质量代码与数学数据退火的第二阶段(Stage-2)后,这种加速优势依旧稳固。NCP-ArchPreview 仅用 66.2% 的 Token 消耗量即追平了 OLMo-3-7B 的第二阶段终点,收敛速度提升 1.51 倍,且全程损失波动显著小于基线。

部分学者可能会质疑:NCP-ArchPreview 拥有 8.9B 参数,而 OLMo-3 仅为 7B 级别,性能的提升是否仅仅是参数堆叠的自然体现?针对这一尖锐问题,技术报告中给出了一系列极具说服力的受控消融实验。在严格控制计算量(Compute-aligned)与严格对齐参数量(Parameter-aligned)的对比中,一个仅使用 85% 计算量的 NCP-ArchPreview 能够直接逼平完全对齐参数量的 8.9B 标准 Transformer 基线。在 Pareto 计算效率曲线上,NCP 架构实现了 1.74 倍的帕累托效率增益。这有力地证明了,性能增益的核心驱动力并非单纯的容量膨胀,而是双层层次结构与概念预测目标带来的信息处理密度革命

在涵盖 30 多个权威评估基准的下游任务表现上,NCP-ArchPreview 展现出了全面的领先格局。在第一阶段结束时,其下游宏平均得分全面压制 OLMo-3-7B:

这一结果充分契合了研究的底层直觉:在数学推理与复杂常识问答中,解题的关键往往不在于当前字词的微观搭配,而在于宏观思维链路(Thought Path)的正确展开。NCP 模块在潜空间内对未来概念的提前建构,赋予了模型一种近乎于“先构思、后行文”的高维规划能力。

从轻量领域适配到投机采样:潜空间的多面价值

如果一种架构仅在预训练阶段表现优异,而在后续微调或推理落地中带来沉重负担,其工程价值便会大打折扣。NCP-ArchPreview 展现出的另一项迷人特质,在于其训练完成后留下的这个离散概念潜空间,为下游应用开辟了多条低成本、高收益的全新路径。

第一项衍生应用是极致轻量化的垂直领域自适应。在传统范式下,针对代码、医学或数学等特定领域的持续预训练往往需要微调数十亿参数的全量模型,或依赖 LoRA 等外挂结构。NCP-ArchPreview 提供了一种全新接口:由于其 VQ Codebook 承担了表征空间离散原型的映射职责,当模型迁移到特定垂直领域时,研究人员甚至可以冻结全部 8.9B 的骨干网络,仅单独微调那 17M 参数的 VQ 模块

实验结果显示,仅仅对这 17M 权重在 Magicoder、Orca-Math 等特定语料上进行低成本迭代,模型便能在完全不遗忘通用能力的前提下,迅速完成对目标领域的概念重对齐。其数学与代码能力的跃升幅度,甚至能媲美相当计算量级下的全参数微调。这从侧面证实,底层特征无需大动干戈,概念空间的坐标微调便足以重塑模型对特定领域的认知投射。

第二项应用则切中了当前大模型落地的另一大核心痛点:自回归推理延迟。投机采样(Speculative Decoding)是目前解决推理内存带宽瓶颈的主流手段,但草稿模型(Drafter)往往需要耗费额外算力,且预测接受率存在明显上限。研究团队将 NCP-ArchPreview 习得的概念表征直接注入到 DFlash2 投机采样草稿模型中,结果表明:在近乎零额外计算开销的前提下,草稿模型的平均接受长度(Mean Accepted Length)直接提升了 4.17%。概念模块预测的高阶语义充当了强大的先验信标,帮助草稿模型在快速生成时牢牢锚定主模型的宏观走向,大幅减少了因局部词符预测发散而导致的拒绝重采样。

结语:潜空间语言模型的演进前瞻

在很长一段时间里,大语言模型的架构创新似乎陷入了瓶颈:各家实验室在更宽、更深的密集 Transformer 结构上内卷参数规模,或围绕混合专家(MoE)做稀疏化工程调度,而处于核心底座的下个词预测范式却被视为不可撼动的圣杯。

NCP-ArchPreview 的发布,在学术界与工业界之间撕开了一道充满想象力的裂隙。它不仅首次在万亿 Token 的宏大尺度下确立了潜空间自回归建模的工程可行性,更用扎实的数据打破了“NTP 即一切”的思维定势。以仅一半的数据消耗量达到基线终点、下游逻辑推理全面超越、单模块极简领域适配以及投机采样加速——这些特性叠加在一起,使潜空间预测不再仅仅作为一种锦上添花的辅助损失,而是演变为一种足以重塑基座模型构建原则的架构范式。

从当前的 NCP-ArchPreview 走向完全由潜空间主导的终极语言系统,未来仍有一系列迷人的课题有待解构:例如,从固定长度的 Token 池化迈向动态、自适应语义粒度的概念划分;从离散概念辅助生成迈向彻底在潜空间内进行超长程逻辑推演,仅在最终交互界面解码为自然语言。上海人工智能实验室全面开源的这一技术蓝图,无疑为整个开源社区在标准 Transformer 之外探索更加高效、更具人类思考特质的下一代基座模型,点亮了一盏极具启发性的明灯。