微软最新证据:Transformer并非层数闲置,而是按难度自适应!
Do Transformers Use their Depth Adaptively? Evidence from a Relational Reasoning Task

近年来,大语言模型的能力随着参数规模和网络深度的增加而显著跃升。直觉上,层数越深,模型能够处理的逻辑越复杂。然而,近期学术界却出现了一种截然相反的声音:有研究通过对残差流的分析指出,Transformer 模型后半部分的层对最终输出的贡献微乎其微,甚至砍掉后面的层也不会对结果产生致命影响。这引发了一个尖锐的争议——大模型的深度真的是被浪费了吗?
ArXiv URL:https://arxiv.org/abs/2604.12426v1
针对这一问题,微软研究院的最新研究给出了有力的反驳。他们认为,先前的研究之所以得出“深度闲置”的结论,是因为评估任务的难度定义过于模糊,且指标在过多的 Token 上进行了平均。在这项新工作中,微软研究团队构建了一个严格控制变量的多跳关系推理任务,直接观察模型在面对不同难度时,是否会动态调整其对网络深度的使用。
实验结果揭示了一个令人兴奋的结论:Transformer 并不是在做无用功,而是具有隐式的“容量保留”机制。对于简单的任务,模型在较浅的层就已经得出了结论;而对于复杂的长逻辑链任务,模型会调用更多的深度来进行跨 Token 的信息整合。特别是当模型摆脱通用语言建模的束缚(即进行完全微调)后,这种按难度自适应分配深度的现象表现得极为强烈。
这篇研究不仅澄清了关于大模型深度利用率的误解,更为我们理解大模型内部的推理机制、评估微调策略以及设计自适应计算架构提供了全新的视角。
深度之争:理论瓶颈与经验主义的碰撞
在探讨这篇论文的核心机制之前,我们需要先理解为什么大模型的“深度使用”会成为一个关键议题。从理论计算复杂度的角度来看,深度是 Transformer 解决算法和推理任务的绝对瓶颈。多项理论研究证明,对于需要多步组合的复杂逻辑,浅层网络在数学上是无法完成计算的。这种理论上的刚需,也是目前思维链(Chain-of-Thought)技术之所以有效的原因之一:通过生成中间步骤,思维链实际上在时间维度上为模型提供了额外的有效计算深度。
然而,实证研究却得出了让人困惑的结论。在 Csordás 等人于 2025 年发表的研究中,他们发现无论是数学题还是多跳问答,模型后半段的层似乎并没有在执行根本性的新计算。Hu 等人的后续研究也印证了这一点,认为不同难度任务下模型深度的使用并没有系统性的差异。
理论与实践的断裂,促使微软的研究人员提出了一个关键假设:如果模型的深度在平均意义上显得效率低下,那么它有没有可能是在隐式地“保留容量”,专门为应对真正困难的任务做准备?
为了验证这一点,研究人员摒弃了那些难度难以精确量化、答案长度不一的通用基准测试(如 GSM8K 或 MATH),转而采用了一个高度受控的合成数据集——CLUTRR(Compositional Language Understanding and Text-based Relational Reasoning)家庭故事推理任务。
精准探针:如何测量深度的自适应性?
CLUTRR 任务的设计堪称精妙。它生成由多个句子组成的家庭关系故事,每一个句子陈述两个人之间的基本亲属关系。模型的任务是将这些关系链条组合起来,推断出目标人物之间的最终关系。
任务的难度由一个极其明确的变量控制:推理链条中的关系跳数(Hop)。例如,一个 2 跳的故事可能是“A是B的父亲,B是C的兄弟”,模型需要推断出 A 是 C 的父亲。而一个 5 跳的故事则包含 5 段首尾相连的关系,模型需要进行 5 次逻辑组合才能得出最终答案。
为了将关注点纯粹集中在单次前向传播中的内部计算,研究团队对任务进行了严格的约束。所有的故事都被修改为以“Therefore, PersonA is PersonB’s”结尾,使得模型的推理结果完全浓缩在接下来的单个 Token 的预测上。通过这种方式,他们排除了自回归生成过程中长度变化带来的干扰。
为了穿透 Transformer 的“黑盒”,研究者使用了两种强大的可解释性分析技术:
第一种是 Logit Lens(对数几率透镜)。在 Transformer 中,隐藏状态在每一层通过残差连接不断演化:
\[\textstyle h_{l}=h_{l-1}+f_{l}(h_{l-1})\]Logit Lens 的核心思想是,将中间某一层 $l$ 的隐藏状态 $h_l$ 强行通过最终的 LayerNorm 和反投影矩阵 $W_U$,提前将其映射回词表空间,计算出中间预测概率 $\tilde{p}_{l,T}$。通过观察模型在第几层首次将正确答案的概率推升到合理阈值之上,研究人员可以精确测量模型产生似是而非的预测所需的深度。
第二种是 Causal Patching(因果补丁)。这是一种干预主义的实验方法。研究人员同时运行一个基础故事和一个反事实故事(比如将基础故事中间的“兄弟”替换为“父亲”,导致最终答案改变)。他们将反事实故事在特定层、特定 Token 的隐藏状态“补丁”到基础故事的计算图中,观察最终的预测结果恢复到反事实答案的程度。这种方法能够精确追踪任务相关信息是如何在不同层、不同 Token 之间进行整合的。
预训练模型:微弱但真实的自适应调节
研究团队首先评估了一系列参数量从 1.2 亿到 140 亿不等、且架构和训练配方各异的开源预训练模型,包括 GPT-2、Pythia、Phi、Qwen2.5 和 LLaMA-3。
实验揭示,即便是在没有经过专门逻辑训练的基座模型中,也确实存在自适应使用深度的初步证据。

Logit Lens 的分析显示,对于部分规模较大的模型而言,它们处理更简单的任务时,往往能够在更浅的层级就产生正确的顶层预测。难度越低,模型内部的表征向正确方向收敛的速度就越快。


通过对比不同跳数下的层级表现可以清晰地看到,较深的模型在处理较长的逻辑链时,预测概率的上升曲线明显更加平缓,意味着模型确实在利用更多的后续层来逐步逼近正确答案。
而因果补丁技术的应用,则进一步揭示了跨 Token 信息整合的动态过程。


数据表明,随着逻辑链条跳数的增加,模型需要使用更多层的计算资源来将分布在句子各个位置的关系信息整合到最终的查询 Token 上。上述结果与此前那些认为“深层无用”的研究结论形成了局部但关键的背离。微软团队认为,先前研究的盲区在于指标设计过于粗糙,将那些本身就不需要太多逻辑深度的死记硬背类 Token 与真正需要复杂组合推理的 Token 混为一谈,从而淹没了模型在深度分配上的微妙差异。
微调的张力:卸下语言包袱后的深度大爆发
如果说预训练模型受限于其需要保持通用语言建模能力(比如在最后几层进行“反标记化”操作以输出通顺的自然语言),导致其自适应深度的表现还比较克制;那么,当模型被专门针对任务进行微调时,深度的自适应性将如何爆发呢?
研究团队对不同规模的 GPT-2 和 Pythia 模型进行了对比微调实验,并设置了两种截然不同的微调范式:
其一是更受约束的 LoRA 微调,这种方法只更新注意力权重,在很大程度上保留了模型原有的语言连贯性;
其二是彻底放开的 完全微调(Full Finetuning),这种方法允许模型破坏原有的通用语言能力,将所有参数的潜力倾注于解决家庭树逻辑推理上。

实验结果展现出了惊人的差异。在完全微调的情况下,模型展现出了迄今为止最清晰、最一致的自适应深度使用证据。如对比图所示,完全微调模型对于 2 跳的简单任务,在非常早期的层就已经牢牢锁定了正确答案;而对于复杂的 10 跳任务,它则会按部就班地利用几乎所有的层,将推理过程均匀地平摊到整个网络的深度上。
更深层次的因果补丁分析揭示了导致这种差异的底层机制。

在上面这组对比图中,完全微调的模型(上图)在进行跨 Token 的信息混合时,使用了远比 LoRA 微调模型(下图)更宽泛的层范围。彻底解开参数束缚后,完全微调模型重新分配了它的内部计算流:它放弃了维持词表对齐的任务,转而构建起了一个深邃的逻辑组合工厂。
不仅如此,完全微调模型在信息整合的顺序上也表现出了高度的纪律性:它最先整合离目标人物最近的最后一条关系线索,而将故事最开头的关系信息留到最后几层才进行混合。这种反向整合的路径,反映出模型内部形成了一种高效且符合逻辑的计算图。
从整体统计图表中可以更加宏观地确认这一趋势。无论是 LoRA 还是完全微调,模型都学会了将更多深度的计算资源投入到难度更高的任务中。对于更长的关系链,它们的信息混合起始阶段发生得更早,而信息整合完成的阶段则被推迟到了更深的层中。完全微调模型对计算深度的“压榨”达到了极致,它不仅仅是将原有的逻辑迁移到不同层,而是彻底重塑了逻辑的深度拓扑结构。
结论与未来演进
微软的这项工作以极其受控的单 Token 推理实验,强有力地反驳了“大模型后半段层数闲置”的论调。实验明确指出,模型计算资源的分配并非一成不变,而是与任务难度呈现出高度的自适应关联。
这项发现为大模型技术路线的发展带来了深远的影响。首先,它揭示了一个本质的权衡:通用语言建模能力与极端复杂的逻辑推理能力之间存在对网络深度的争夺。当模型需要时刻准备输出流畅的自然语言词汇时,它的残差流就被强行约束在了具有语义意义的空间内,从而限制了深层网络进行纯粹抽象逻辑操作的空间。这解释了为什么完全微调(放弃通用性)能够激发出极其强大的自适应深度利用率。
其次,既然模型天然具备根据难度分配深度的机制,那么这为下一代自适应计算(Adaptive Computation)或循环 Transformer 架构(Recurrent Transformers)提供了坚实的理论和实验基础。未来的模型或许不再需要静态地堆叠数百层网络,而是可以通过动态循环少量的层,按需决定推理深度,从而在计算效率和推理能力之间实现真正的动态平衡。