告别黑盒!InfoFlow揭秘多层Transformer:两层架构如何省下指数级参数?
Transformer架构无疑是当今AI繁荣的绝对基石。然而,面对动辄数十乃至上百层的庞然大物,理论界却长期陷入一种尴尬的“偏科”状态。目前,学界对单层Transformer的数学性质已经有了相对透彻的理解,但多层Transformer的内部运作机制依然是一个巨大的黑盒。堆叠层数仅仅是为了增加...
Transformer架构无疑是当今AI繁荣的绝对基石。然而,面对动辄数十乃至上百层的庞然大物,理论界却长期陷入一种尴尬的“偏科”状态。目前,学界对单层Transformer的数学性质已经有了相对透彻的理解,但多层Transformer的内部运作机制依然是一个巨大的黑盒。堆叠层数仅仅是为了增加...
DeepSeek-Prover潜力释放:仅需简单“骨架”提示,性能飙升43%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
9小时攻克11道Putnam难题!Seed-Prover 1.5重塑AI形式化证明。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
英伟达亮剑LLM路由:成本锐减74%,性能直追理论最优!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Transformer 突破理论极限: 循环层解锁 CFL 语法识别。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“黑盒”炼丹:人大&厦大联合发布,LLM全生命周期理论图谱。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
群表示位置编码(GRAPE):统一RoPE与ALiBi的理论框架。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM推理的“系统2”觉醒:谷歌、斯坦福联手揭秘“算法思维”理论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM越大越强?谷歌DeepMind等雄文揭示其5大“理论天花板”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据告急?北大清华发现:数据集越大,重复训练收益越高,价值可达logN倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一个“增强重叠”(Augmentation Overlap)理论,通过揭示同一类别的不同样本在数据增强下会产生重叠的视图,解释了实例级别的对比学习为何能学习到具有类别区分性的表示,并基于此推导出了更紧密的下游任务性能界。
本文主张用“单位资源能力”而非单纯的规模来衡量AI进展,并提出了一个基于梯度指导资源分配的理论框架,通过识别和优先利用高影响力的参数和数据,来显著提升大语言模型(LLM)生命周期中的效率。
本文首次为Transformer的长度泛化(length generalization)能力提供了定量的边界,通过引入一种“模拟论证”方法,证明了当训练序列足够长,能够“模拟”更长序列上的内部行为时,模型便能实现长度泛化,并给出了所需训练长度与模型参数、任务复杂度之间关系的具体数学刻画。
本文通过为编码器-解码器架构(RedLLM)集成现代LLM技术(如旋转位置编码),并在约1.5亿至80亿参数规模上与主流的解码器-仅架构(DecLLM)进行系统性对比,发现RedLLM在指令微调后,能以显著更高的推理效率达到甚至超越DecLLM的性能,证明了该被忽视架构的巨大潜力。
本文推导出了一个连接Kullback-Leibler散度(KLD)和Jensen-Shannon散度(JSD)的新的、紧致的下界,从而在理论上证明了最大化基于JSD的判别器目标函数等同于最大化互信息(MI)的一个可靠下界,为表示学习中广泛使用的判别式方法提供了坚实的理论基础。
本文提出了一种名为 THOUGHTCOMM 的多智能体协作新范式,它使智能体能通过理论上可识别的、直接的潜在“思想”进行交流,而非传统的自然语言,从而突破语言瓶颈,提升集体智能的协作效率和上限。
本文提出了一个可量化的框架来定义和衡量通用人工智能(AGI),即将其定义为在认知通用性(versatility)和熟练度(proficiency)上与受过良好教育的成年人相匹配的系统,并通过借鉴人类心理测量学中的CH-C认知能力理论,将通用智能分解为十个核心认知域进行评估。
本文证明,通过将大规模测试时搜索算法(test-time search)应用于开源代码大语言模型(如 Code Llama-70B),可以在国际信息学奥林匹克(IOI)竞赛级别的算法问题上达到金牌水平,这一成就先前被认为只有顶级的专有模型才能实现。
本文通过数学分析 Transformer 模型中参数分配的效率,从理论上揭示了对于信息提取任务,早期层中的注意力头数量与头维度之间存在权衡关系,并证明了 Softmax 激活函数存在饱和效应,这为后期层减少参数提供了理论依据,最终提出了跨层优化参数(注意力和头维度)分配的原则性策略。
本文通过理论证明和实验分析,揭示了Transformer解码器中的因果掩码 (Causal Mask) 本身就是一种位置信息来源,它能诱导出偏好邻近token的注意力模式,并且会与RoPE等显式位置编码相互作用,将其相对注意力模式扭曲为非相对模式。
本文提出 LIMI 方法,证明通过极少量(仅78个)精心策划的高质量训练样本,即可训练出在智能体任务上超越使用海量数据训练的模型的强大AI智能体,从而确立了智能体开发的“少即是多”原则。
本文通过博弈论中的迭代囚徒困境 (Iterated Prisoner’s Dilemma) 框架,系统地研究了语言模型智能体在长期交互中的合作与对抗行为,发现其表现不亚于甚至超越了顶尖的经典策略,并能快速适应对手策略的变化,但与人类相比,其策略更倾向于短期收益最大化而非建立长期互利合作。
本文通过揭示结构化状态空间模型 (SSM) 与注意力机制在结构化半可分矩阵 (semiseparable matrices) 理论下的对偶关系,提出了一个名为“状态空间对偶 (State Space Duality, SSD)”的统一框架,并基于此设计了一种新的、更高效的语言模型架构 Mamb...
本文提出了一种“计算最优”扩展策略,即根据问题的难度自适应地分配测试时(test-time)的计算资源,并证明在特定场景下,这种策略比单纯扩展模型参数能更有效地提升大型语言模型(LLM)的性能。
本文提出了一种名为Mamba的新型序列建模架构,它通过引入选择性状态空间模型(Selective SSM),在保持线性时间复杂度的同时,实现了与Transformer相媲美的性能,尤其在处理长序列任务上表现出色。
本文通过在极具挑战性的MATH数学数据集上进行实验,证明了过程监督 (Process Supervision) 在训练奖励模型方面显著优于结果监督 (Outcome Supervision),其训练出的模型能更可靠地解决复杂的多步推理问题。
本文提出了一种利用机器学习(ML)预测来改进在线算法性能的理论框架,设计的算法在预测准确时性能接近最优(一致性),在预测错误时性能也不会大幅下降,可优雅地退化到经典在线算法的水平(鲁棒性)。
本文提出了一个名为 Ψ-偏好优化 (ΨPO) 的通用理论框架,该框架统一了现有的从人类偏好中学习的方法(如 RLHF 和 DPO),并在此基础上提出了一种名为 IPO 的新方法,它通过直接优化成对偏好而非依赖 Bradley-Terry 模型,有效解决了 DPO 在面对确定性或稀疏偏好数据时容...