告别Token依赖!清华与NUS联合揭秘大模型隐空间,盘点4大机制与7大能力
The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook
现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。
ArXiv URL:http://arxiv.org/abs/2604.02029v1
这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。
信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。
大模型真的必须“说人话”来完成内部思考吗?
答案或许是否定的。清华大学与新加坡国立大学联合发布了一项重磅综述。
该研究全面定义了语言模型中的隐空间(Latent Space)。
本文提出,连续的隐空间不仅是隐藏的实现细节,更是下一代AI的机器原生计算底座。
该研究构建了一个二维分类学框架,统摄了4大底层机制与7项核心能力。

范式转移:显式符号至连续隐空间
在经典的自回归模型中,所有的运算最终都落在显式空间(Explicit Space)中。
这指的是语言符号的离散空间,模型通过词表来预测下一个Token。
然而,为了对语言进行计算,模型首先会将Token映射为内部的连续表示。
这些通过多层非线性计算转换的连续状态,构成了隐空间(Latent Space)。
隐空间是模型编码和操作信息的连续、可学习的表征空间。
它包含了文本序列在显式空间之外的上下文、语义和关系特征。
显式的生成路径可以表示为 $\mathbf{y}\sim\Phi_{\theta}(\cdot\mid\mathbf{x})$。
而在隐空间范式下,生成过程往往受到连续变量 $\mathbf{z}$ 的引导:
\[\mathbf{y}\sim\Phi_{\theta}(\cdot\mid\mathbf{x},\mathbf{z})\]
相较于传统的显式词汇空间,隐空间展现出截然不同的表征特性。
它使用机器原生的向量化表征,具有连续、灵活和高效的特点。
最重要的是,隐空间能够保留高保真的语义信息。
它绕过了离散化和语言渲染的步骤,可以在计算步骤之间传递极其丰富的连续信息。
这其中包括许多无法用自然语言准确表达的模态结构。
演进脉络:从原型探索到全面爆发
随着大语言模型在各项任务中展现出卓越性能,对其隐空间的探索也经历了迅猛的演进。
该研究将这一发展轨迹清晰地划分为四个阶段:

首先是原型期。研究人员开始质疑语言模型是否必须用自然语言表达中间推理步骤。
这一阶段主要验证了理论可行性,尝试用连续表征替代离散的思考过程。
随后进入形成期。该阶段主要集中于文本域的隐式推理,并初步向多模态扩展。
研究者建立了解释隐空间为何生效的理论体系。
紧接着是扩展期。隐空间研究从以文本为中心,迅速向视觉、具身动作等生态扩展。
诸如隐式记忆、测试时缩放(Test-time Scaling)等跨领域主题开始涌现。
如今正处于爆发期。特定领域的架构设计和优化策略层出不穷。
跨语言、视觉、动作和多智能体系统的统一框架正推动该领域走向成熟。
核心机制:隐空间的架构与表征
理解隐空间如何运作,是本文最具技术深度的部分。
如果将语言模型的显式输出比作“大声朗读”,那么隐空间计算就像是“内隐思考”。
“大声朗读”必须遵守语法、受限于发音速度(Token生成速率)。
而“内隐思考”则是脑海中电信号的快速传递,不拘泥于具体词汇,信息密度极高。
该综述从架构、表征、计算和优化四个维度,解构了这种“内隐思考”的底层机制。
架构层:重塑计算流
在架构层面,研究人员正在打破单一的自回归框架。
第一种方式是主干网络(Backbone)直连。隐式计算直接嵌入在主生成架构中。
模型在隐状态上执行迭代或结构化的状态转移:
\[\mathbf{h}_{t+1}=\Phi^{back}(\mathbf{h}_{1:t},\mathbf{x},\mathbf{y}_{1:t})\]第二种方式是外挂组件(Component)。在保留原主干网络的基础上,增加功能模块。
这些模块专门负责构建、转换或检索隐式表征,然后注入到解码过程中:
\[\mathbf{z}=\Phi^{\mathrm{comp}}\left(\mathbf{h},\mathbf{x}\right)\]第三种方式引入了辅助模型(Auxiliary Model)。
由外部独立模型提供隐式引导信号,用于调节或优化宿主模型的生成:
\[\mathbf{z}=\Phi^{\mathrm{aux}}(\mathbf{x})\]通过对表2和表3的精简分析可以发现,外挂组件的方式最为灵活。
它能在不大幅修改预训练权重的前提下,为模型外接“记忆区”或“控制中枢”。
表征层:雕刻连续信息载体
脱离了离散的Token后,如何定义“内隐思考”的信息载体 $\mathbf{z}$?
这是决定模型语义表达能力的关键。
内部表征直接利用主干网络的前向激活值。
这是一种无参数的提取方式,彻底绕过了离散词表瓶颈。
例如,从特定的 Transformer 层提取隐藏状态集合:
\[\mathbf{z}=g\!\left(\{\mathbf{H}_{l}\}_{l\in S}\right)\]外部表征则依赖于结构独立的辅助编码器。
这为弥合不同模态之间的鸿沟提供了原则性方法。
可学习表征通过直接嵌入在主干网络中的参数化模块来主动构建。
例如连续的虚拟Token,这使其能够捕捉文本预训练难以覆盖的复杂空间布局。
运算范式:隐空间中的深度加工
在隐空间中进行运算,赋予了模型比逐字生成更灵活的计算机制。
延续“内隐思考”的隐喻,这部分决定了模型脑海中的思绪是如何运转的。
压缩运算
这一范式将显式的长轨迹投影到语义密集的隐式表征上。
这就像是将一篇冗长的演讲,在脑海中瞬间压缩成一个高度概括的核心洞察。
压缩算子 $\Phi(\cdot)$ 作用于中间隐藏状态 $\mathbf{h}$:
\[\mathbf{z}=\Phi(\mathbf{h}),\quad|\mathbf{z}|\ll|\mathbf{h}|\]这种方式以显式长度换取隐式密度,大幅降低了推理时的计算和内存开销。
扩展运算
与压缩相反,扩展运算旨在增加隐式计算的深度或广度。
在不显著增加模型参数的前提下,通过循环或拓扑结构增加隐空间的运算量。
例如,在特定步数 $T$ 和宽度 $K$ 上进行迭代:
\[\mathbf{h}_{t+1}^{(k)}=\Phi\!\left(\bigl\{\mathbf{h}_{t}^{(k)}\bigr\}_{k=1}^{K}\right)\]自适应运算
这种方式更加智能,它根据输入 $\mathbf{x}$ 的复杂程度动态决定运算的深度和广度。
模型不再使用固定的超参数,而是通过学习到的停机函数 $\mathcal{T}$ 来决定何时结束思考。
这就像大脑在遇到难题时会自动陷入深思,遇到简单问题则迅速给出直觉反应:
\[(T,\,K)=\mathcal{T}(\mathbf{h}_{t};\,\mathbf{x})\]能力映射:七大维度的全面赋能
当语言模型拥有了强健的隐空间机制,其能力边界得到了极大的拓展。
该综述详细梳理了隐空间带来的七大核心能力。
除了传统的推理(Reasoning)能力得到显著提升外,隐空间在记忆和协作上的表现尤为抢眼。
在记忆(Memory)方面,隐式记忆彻底打破了上下文窗口(Token长度)的物理限制。
模型可以将历史信息压缩为高维向量,实现几乎无限的记忆回溯。
在协作(Collaboration)场景中,多智能体之间的沟通不再依赖缓慢的文本交互。
它们可以通过传递隐空间向量,实现类似“脑机接口”般的高带宽、无损信息共享。
此外,隐空间还广泛赋能于规划、建模、感知以及具身智能等前沿领域。
局限剖析与工程启示
尽管隐空间展现出巨大的潜力,但该研究也毫不避讳地指出了当前的严峻挑战。
首当其冲的便是可解释性与可控性的缺失。
由于显式的生成轨迹是人类可读的,开发者可以轻松进行审计和控制。
但机器原生的隐空间表征,就像是一个难以窥探的黑盒。
人类很难对这种“内隐思考”过程进行细粒度的直接评估与干预。
如何在保持连续空间计算优势的同时,引入人类对齐的验证机制,是未来的核心命题。
从工程启示来看,隐空间为测试时缩放(Test-Time Scaling)提供了新路径。
未来的大模型可能不再一味追求庞大的参数量。
而是通过在隐空间中自适应地分配计算资源,用极低的通信成本换取极高的推理精度。
隐空间,正在悄然定义下一代通用人工智能的真实形态。