AI理论

告别黑盒!InfoFlow揭秘多层Transformer:两层架构如何省下指数级参数?

Transformer架构无疑是当今AI繁荣的绝对基石。然而,面对动辄数十乃至上百层的庞然大物,理论界却长期陷入一种尴尬的“偏科”状态。目前,学界对单层Transformer的数学性质已经有了相对透彻的理解,但多层Transformer的内部运作机制依然是一个巨大的黑盒。堆叠层数仅仅是为了增加...

LLM Router: Prefill is All You Need

英伟达亮剑LLM路由:成本锐减74%,性能直追理论最优!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Context-Free Recognition with Transformers

Transformer 突破理论极限: 循环层解锁 CFL 语法识别。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Group Representational Position Encoding

群表示位置编码(GRAPE):统一RoPE与ALiBi的理论框架。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Algorithmic Thinking Theory

LLM推理的“系统2”觉醒:谷歌、斯坦福联手揭秘“算法思维”理论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

On the Fundamental Limits of LLMs at Scale

LLM越大越强?谷歌DeepMind等雄文揭示其5大“理论天花板”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

An Augmentation Overlap Theory of Contrastive Learning

本文提出了一个“增强重叠”(Augmentation Overlap)理论,通过揭示同一类别的不同样本在数据增强下会产生重叠的视图,解释了实例级别的对比学习为何能学习到具有类别区分性的表示,并基于此推导出了更紧密的下游任务性能界。

Quantitative Bounds for Length Generalization in Transformers

本文首次为Transformer的长度泛化(length generalization)能力提供了定量的边界,通过引入一种“模拟论证”方法,证明了当训练序列足够长,能够“模拟”更长序列上的内部行为时,模型便能实现长度泛化,并给出了所需训练长度与模型参数、任务复杂度之间关系的具体数学刻画。

Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model

本文通过为编码器-解码器架构(RedLLM)集成现代LLM技术(如旋转位置编码),并在约1.5亿至80亿参数规模上与主流的解码器-仅架构(DecLLM)进行系统性对比,发现RedLLM在指令微调后,能以显著更高的推理效率达到甚至超越DecLLM的性能,证明了该被忽视架构的巨大潜力。

Thought Communication in Multiagent Collaboration

本文提出了一种名为 THOUGHTCOMM 的多智能体协作新范式,它使智能体能通过理论上可识别的、直接的潜在“思想”进行交流,而非传统的自然语言,从而突破语言瓶颈,提升集体智能的协作效率和上限。

A Definition of AGI

本文提出了一个可量化的框架来定义和衡量通用人工智能(AGI),即将其定义为在认知通用性(versatility)和熟练度(proficiency)上与受过良好教育的成年人相匹配的系统,并通过借鉴人类心理测量学中的CH-C认知能力理论,将通用智能分解为十个核心认知域进行评估。

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

本文证明,通过将大规模测试时搜索算法(test-time search)应用于开源代码大语言模型(如 Code Llama-70B),可以在国际信息学奥林匹克(IOI)竞赛级别的算法问题上达到金牌水平,这一成就先前被认为只有顶级的专有模型才能实现。

Allocation of Parameters in Transformers

本文通过数学分析 Transformer 模型中参数分配的效率,从理论上揭示了对于信息提取任务,早期层中的注意力头数量与头维度之间存在权衡关系,并证明了 Softmax 激活函数存在饱和效应,这为后期层减少参数提供了理论依据,最终提出了跨层优化参数(注意力和头维度)分配的原则性策略。

Behind RoPE: How Does Causal Mask Encode Positional Information?

本文通过理论证明和实验分析,揭示了Transformer解码器中的因果掩码 (Causal Mask) 本身就是一种位置信息来源,它能诱导出偏好邻近token的注意力模式,并且会与RoPE等显式位置编码相互作用,将其相对注意力模式扭曲为非相对模式。

LIMI: Less is More for Agency

本文提出 LIMI 方法,证明通过极少量(仅78个)精心策划的高质量训练样本,即可训练出在智能体任务上超越使用海量数据训练的模型的强大AI智能体,从而确立了智能体开发的“少即是多”原则。

Collaboration and Conflict between Humans and Language Models through the Lens of Game Theory

本文通过博弈论中的迭代囚徒困境 (Iterated Prisoner’s Dilemma) 框架,系统地研究了语言模型智能体在长期交互中的合作与对抗行为,发现其表现不亚于甚至超越了顶尖的经典策略,并能快速适应对手策略的变化,但与人类相比,其策略更倾向于短期收益最大化而非建立长期互利合作。

Mamba: Linear-Time Sequence Modeling with Selective State Spaces

本文提出了一种名为Mamba的新型序列建模架构,它通过引入选择性状态空间模型(Selective SSM),在保持线性时间复杂度的同时,实现了与Transformer相媲美的性能,尤其在处理长序列任务上表现出色。

Let's Verify Step by Step

本文通过在极具挑战性的MATH数学数据集上进行实验,证明了过程监督 (Process Supervision) 在训练奖励模型方面显著优于结果监督 (Outcome Supervision),其训练出的模型能更可靠地解决复杂的多步推理问题。

Improving Online Algorithms via ML Predictions

本文提出了一种利用机器学习(ML)预测来改进在线算法性能的理论框架,设计的算法在预测准确时性能接近最优(一致性),在预测错误时性能也不会大幅下降,可优雅地退化到经典在线算法的水平(鲁棒性)。

A General Theoretical Paradigm to Understand Learning from Human Preferences

本文提出了一个名为 Ψ-偏好优化 (ΨPO) 的通用理论框架,该框架统一了现有的从人类偏好中学习的方法(如 RLHF 和 DPO),并在此基础上提出了一种名为 IPO 的新方法,它通过直接优化成对偏好而非依赖 Bradley-Terry 模型,有效解决了 DPO 在面对确定性或稀疏偏好数据时容...