上海AI实验室Intern-S2-Mobius:解耦知识与推理,推理提速近4倍!

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

上海AI实验室Intern-S2-Mobius:解耦知识与推理,推理提速近4倍! 论文图示

在大语言模型通往深度推理的演进过程中,长思维链(Long CoT)几乎成了标配。面对复杂的数学、代码和逻辑推导,模型动辄吐出数千个 Token,在繁琐的草稿纸式推演中反复试错、回溯和自检。然而,这种依赖离散 Token 堆叠出来的推理能力,正在逼近算力与延迟的承受极限。推理成本随生成长度非线性攀升,大量简单甚至中等难度的任务也被迫消耗巨额计算预算。

ArXiv URL:https://arxiv.org/abs/2608.14290v1

问题的根源不仅在于解码策略,更深植于经典的 Transformer 架构本身。在现行范式中,前馈网络(FFN)充当存储知识的键值记忆库,自注意力机制(Self-Attention)充当组合推理算子,每一层都将知识与推理紧紧捆绑在一起。上海人工智能实验室提出的 Intern-S2-Mobius(基于全新架构 Mobius-v0)尝试打破这一数十层层叠的旧秩序:它将知识存储彻底从层级绑定中剥离,构建全局共享的记忆模块,同时让多个推理算子在连续隐状态中进行多轮迭代推演。

这一知识与推理分离(Knowledge-Reasoning Separation)的设计带来了显著的系统收益。在从零训练(Training-from-scratch)的 7B 规模实验中,Mobius 仅消耗 Baseline Transformer 模型 62.6% 的训练数据,便达到了相当的下游评测分数,数据利用效率提升至 1.6 倍;而在基于开源模型 Qwen3.5-35B 的持续预训练(Continual Pre-training)中,Intern-S2-Mobius 不仅完整保留甚至强化了通用能力,还将端到端推理速度提升了近 4 倍,将长思维链中大量冗余的离散 Token 压缩回紧凑的潜空间计算中。

Transformer 的隐性桎梏:单向残差与低密度 Token 推理

要理解 Mobius 的破局点,首先需要解构 Transformer 在处理复杂推理时的结构性缺陷。

自 ResNet 确立残差连接以来,恒等映射成为了深度模型信息穿透的核心机制。然而,现行所有主流残差网络本质上都是单向的,信息只能从浅层单向流向深层。这种前向单向性给语言建模埋下了一个固有短板:若模型在前向计算的浅层阶段未能成功检索、激活解决特定子问题所需的关键知识向量,深层计算层便无法强行“回溯”获取这部分记忆。此时,模型唯一的自救方式是先解码出一个或多个信息密度极低的过渡 Token,借助自回归机制开启下一轮前向传播,赌后续步骤能重新激活相关知识。这种在物理层级上无法“反向求知”的局限,是导致当今模型在生成过程中不断喋喋不休、制造冗余推理痕迹的底层诱因之一。

与此同时,当前的推理范式将所有“思考、试错与修正”过程全部外化在了离散的自然语言 Token 上。离散 Token 是一种信息密度较低的载体,模型在探索解题路径时,被迫把每一次犹豫和自我反驳都完整解码出来。这种试错修正机制让 Token 序列无限拉长,带来了平方级增长的 KV 缓存压力与严重的端到端延迟。

逆向残差与全局记忆池:Mobius 的解耦架构

面对单向残差的知识检索局限,理想方案是引入“逆向残差”(Backward Residual Connection),让深层推理网络也能反向调用浅层的知识。然而,直接构建显式的反向有向无环图会彻底破坏现代分布式训练的计算图拓扑,带来极度复杂的异步流水线与并行瓶颈。

Mobius 给出的解法相当精巧:通过解耦与共享,间接实现双向知识互通。

在 Mobius-v0 架构中,研究人员将原本分散在数十个不同 Transformer 块中的 FFN 全部剥离出来,水平拼接成一个超大规模的全局共享记忆池(Globally Shared Memory)。与此同时,计算层蜕化为多个专注于结构重组与动态路由的推理算子(Reasoners,即 Self-Attention 模块)。

通过这种改动,原本被严格层级隔离的知识向量全部处于统一寻址空间下。浅层与深层的推理算子共享完全相同的知识调用权限,无论是第一轮推演还是第十轮迭代,计算核心都能随时按需抓取全网范围内的知识表征,彻底绕开了传统层级堆叠所带来的知识断层问题。在工程实现上,为防止参数规模扩张导致显存与算力过载,Mobius 在大参数版本中引入了类似混合专家(MoE)的块状切分方案,在前向传播中进行稀疏激活,兼顾了超大知识库的表达力与推理效率。

动态潜空间推理:让思考发生在连续向量之中

解耦了知识存储后,推理算子又该如何高效工作?这构成了 Mobius 的第二大核心能力:动态潜空间推理(Dynamic Latent Reasoning)。

既然离散 Token 是推理延迟和冗余的放大器,Mobius 选择将深思熟虑、试错以及推导自检等中间过程完全内化在连续向量空间中。模型以隐状态(Hidden States)作为缓存介质和信息载体,推理算子在隐空间中以极高的循环频率(High-loop frequency)不断向全局记忆池发起查询,将提取到的知识向量反复注入隐状态进行多轮迭代演化。

这种设计将循环 Transformer(Looped Transformer)的高效参数复用与扩散语言模型(Diffusion Language Model)的连续状态提炼融为一体:

  1. 它在结构上不需要堆叠过于臃肿的物理层深,仅依靠少数几层推理核心便能完成一次多轮表征进化;

  2. 在连续向量中完成充分的去噪与路径寻优后,模型不再需要每走一步就吐出若干个用于过渡的无意义字符,而是可以直接完成紧凑的联合表征,在关键决策点单次爆发式输出高信息密度的结果 Token。

由于中间试错完全由连续可微的向量优化承载,KV 缓存的管理复杂度被大幅简化,模型也不再受到“固定解码步数”的机械限制,能够根据输入问题的内在复杂度,自适应地在连续向量空间内分配思考预算。

实验实测:数据压缩比 1.6 倍,推理吞吐与长度质变

为了严密验证知识推理分离架构的可行性,研究团队分别进行了针对极限定量评估的“从零训练”(TFS)以及贴近工业界实际落地路径的“持续预训练”(CPT)。

在 7B 规模(激活参数约 1B 的 MoE)的从零预训练评测中,Mobius 与标准架构 Transformer 在相同的 1TB Token 数据集上展开对照。结果表明,Mobius 在全训练周期的 MMLU 评估中全程压制传统 Transformer。基线 Transformer 在吞咽完整整 1TB 语料后获得的下游任务性能,Mobius 仅需使用 62.6% 的训练数据量(0.626×)即可完全对齐。这证实了此前学界对 Transformer 参数冗余的假设:在传统层级结构中,大量参数被迫在不同层之间机械重复存储同一类事实知识;一旦将其解耦为集中式共享记忆,表征压缩率便会发生质的跃迁。

如果说从零训练展现了数据效率,那么在 Qwen3.5-35B(激活约 3B 参数)基础上的架构迁移实验则展现了其工业价值。研究人员将已有的开源检查点平滑迁移至 Mobius 架构并进行 1TB Token 的持续预训练,随后追加了监督微调(SFT)与强化学习(RL)。评估数据显示,Intern-S2-Mobius 在各类基准上完全匹敌甚至超越了原有规模模型,最惊艳的表现在于端到端推理表现:整个系统的端到端推理速度提升了近 4 倍。

在论文披露的 MMLU-Pro 线性代数命题推理对决中,这种差异展现得淋漓尽致。对于一道涉及基向量与线性相关的判断题:

更关键的是,缩短的生成长度并未以准确率为代价,它剔除的几乎全部是单向残差架构下为“唤醒记忆”而被迫生成的空转 Token。

架构谱系重估:Mobius 处于什么位置?

将 Mobius 置于当下 AI 架构探索的宏观坐标系中,可以更清晰地看清它的取舍。

潜空间推理(Latent Reasoning)领域,此前已有 COCONUT、CODI 等工作探索过将最后一层的隐状态作为下一步输入,或是引入 Pause Token 延缓预测以换取思考空间。但这些方法往往停留在训练技巧或微观补丁层面,底层依然受困于层级固化的传统 Transformer 骨架。循环网络如 Universal Transformer 虽然实现了深度循环,但每一步依然带着全套 FFN 跑,参数更新成本居高不下。Mobius 的不同之处在于它从底层改造了组织形式:将知识的读取抽象为低开销的跨层共享查询,使推理层能以极小的前向开销进行高频迭代。

推理加速策略上,投机采样(Speculative Decoding)通过小模型草拟、大模型验证来提高吞吐,多 Token 预测(MTP)通过辅助头生成未来候选项。然而,无论投机还是 MTP,其每一次单步决策从宏观上看仍然只完整遍历了一次全网知识。Mobius 则是在生成之前,于连续空间内部执行了多轮密集的知识重组,它天然适配并行多 Token 预测,但内在表征的信息密度远非单次前向传播的外推模型可比。

残差与注意力演进方向,近年来无论是 Mamba、Gated Delta Network 等线性状态空间模型,还是 Hyper-Connection 这类残差拓扑升级,多侧重于降低交互复杂度或增强前向传输能力。Mobius 并没有试图盲目去削减 Attention 的计算阶数,而是通过提供全局共享知识池,让单次 Attention 能够检索到更高质量、更全局的特征输入,以计算轨迹的极度紧凑来摊平甚至反超计算成本。

总结与未来延伸

Intern-S2-Mobius 证明了一件事:大模型并不必然要被拘束在“知识与推理层层绑死”的经典 Transformer 拓扑中,更不必将全部的认知推导均寄托于喋喋不休的长文本流。将 FFN 提炼为共享记忆池,将 Attention 释放为自适应的隐式推理器,为突破当前长思维链的算力黑洞提供了一条极具说服力的结构性通路。

当然,这一新型架构依然留下了广阔的未拓疆域。正如作者团队在文末所指出的,在更具挑战性的具身世界模型(World Model)与自主科学发现(Scientific Discovery)中,模型需要面对完全由连续信号构成的物理规律和跨模态交互,单纯的离散 Token 机制注定举步维艰,而原生的隐空间推理可能展现出更大潜力。此外,这种知识集中共享、算子反复调用的全新计算模式,也对底层的片上显存带宽和软硬件协同设计(Hardware-Software Co-Design)提出了全新的系统级命题。摆脱了低密度 Token 束缚的模型演化,或许才刚刚拉开序幕。