Vision Transformers are Circulant Attention Learners
ViT暗藏“循环”玄机?清华新作:用FFT将注意力复杂度降至。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
ViT暗藏“循环”玄机?清华新作:用FFT将注意力复杂度降至。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Loss一直降,模型却没学会?揭秘LLM持续预训练的“学习假象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
少即是多?8-bit量化竟让大模型持续学习能力暴涨15%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
斯坦福GOAT:重构注意力底层数学,显存降36%,长文本性能全面超越RoPE。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
性能媲美XGBoost,解释性堪比Lasso:斯坦福新作“注意力Lasso”详解。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型“瘦身”革命:砍掉99.7%注意力连接,内部电路清晰100倍且性能不降!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型融合实测:6种先进方法惨败,竟不敌最简单的“加减法”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Mistral AI新作QuacK:不靠归一化,动态学习率让Transformer训练提速10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别硬裁剪!阿里SAPO算法,用“柔性门控”提升LLM训练稳定性与性能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别玄学Prompt!字节跳动ELPO框架,F1分数最高提升7.6分。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
OpenAI重磅发现:让Transformer“瘦身”99.9%,电路可解释性暴增16倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MIT新突破:Transformer实现火箭全程自主驾驶,成本仅高出最优解3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MIT联手英伟达发布FlashMoBA:稀疏注意力提速14.7倍,长文本处理迎来新篇章。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
KimiLinear揭秘:首次全面超越全注意力,1M上下文解码提速6倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让大模型学会“专注”:AWS发布Focal Attention,参数减42%,长文本性能飙升82%!
本文提出了一种名为高阶线性注意力 (Higher-order Linear Attention, HLA) 的新型注意力机制,它通过紧凑的前缀充分统计量 (prefix sufficient statistics) 实现了高阶交互,同时保持了线性时间复杂度和流式计算能力,从而在不牺牲表达能力的...
本文提出了一种名为 SpecAttn 的免训练方法,该方法将推测解码(speculative decoding)与稀疏注意力相结合,通过利用草稿模型(draft model)已计算出的注意力权重来为目标模型(target model)动态预测并选择重要的 Token,从而在不显著牺牲模型性能的...
本文提出了一种名为“上下文引导策略优化” (In-Context Steered Policy Optimization, ICPO) 的新型强化学习框架,该框架利用大推理模型 (Large Reasoning Models, LRM) 固有的上下文学习 (In-Context Learnin...
本文提出了一种名为 GaLLoP 的稀疏微调新方法,它通过优先选择在下游任务上梯度最大、且在预训练模型中权重绝对值最小的参数进行微调,从而在提升任务性能的同时有效保留预训练知识,实现了卓越的分布内(ID)和分布外(OOD)泛化能力。
本文提出了一种名为 Stream 的可解释性框架,通过其具体实现算法 Stream-Attn,利用动态稀疏注意力机制,以近线性的时间( )和线性空间( )复杂度,高效分析大型语言模型在百万级Token长上下文中的注意力模式,从而在消费级GPU上实现了以往难以企及的机理可解释性分析。
本文提出了一种名为 Ring-linear 的高效混合注意力架构,通过将线性注意力(Linear Attention)与标准的 Softmax 注意力相结合,在显著降低长上下文推理的 I/O 和计算成本的同时,保持了强大的模型性能。
本文通过分析大型语言模型(LLM)在推理任务中的注意力模式,揭示了一种“预规划-锚定”(Preplan-and-Anchor)的内在节奏,并基于此发现提出了一种细粒度策略优化方法,有效解决了传统强化学习方法中奖励稀疏和信用分配不明确的问题,从而显著提升了LLM的复杂推理能力。
本文提出了一种名为 DRO-InstructZero 的方法,它将分布式鲁棒优化(Distributionally Robust Optimization, DRO)与贝叶斯优化(Bayesian Optimization, BO)相结合,用于搜索在数据分布发生变化时仍能保持高性能的、具有鲁棒...
本文提出了一种名为DEPO的新型强化学习框架,它通过解耦高效与低效推理片段的优势计算、引入难度感知的长度惩罚和优势裁剪机制,在保持甚至提升模型准确率的同时,显著减少了大型推理模型的无效推理(“过度思考”)和响应长度。