告别盲目堆料:全景解析大模型训练效率的“数据-内存-算力”协同法则
在当今的大模型研发中,算力焦虑几乎笼罩着每一个技术团队。当我们将目光聚焦于动辄千亿参数的模型时,往往会陷入一个误区:单纯地增加GPU数量就能解决一切问题。然而,真实的工程痛点远比这复杂。
在当今的大模型研发中,算力焦虑几乎笼罩着每一个技术团队。当我们将目光聚焦于动辄千亿参数的模型时,往往会陷入一个误区:单纯地增加GPU数量就能解决一切问题。然而,真实的工程痛点远比这复杂。
大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实...
当前,大语言模型正从被动响应的知识库,向主动解决现实难题的通用求解器跨越。实现这一跨越的核心,在于彻底打通智能体、逻辑推理与代码这三大核心能力。然而,闭源巨头在特定领域表现惊艳,开源界却始终缺乏一个能统一上述能力的轻量级霸主。本文将深入剖析清华大学与智谱AI最新联合发布的GLM-4.5及其轻量版。
斯坦福GOAT:重构注意力底层数学,显存降36%,长文本性能全面超越RoPE。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
少即是多?8-bit量化竟让大模型持续学习能力暴涨15%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Loss一直降,模型却没学会?揭秘LLM持续预训练的“学习假象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
ViT暗藏“循环”玄机?清华新作:用FFT将注意力复杂度降至。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLSA:让Diffusion Transformer提速28倍的“对数级”稀疏注意力机制。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
ETH新作SLHF:用“领导者-跟随者”博弈重塑对齐,推理性能零样本提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SonicMoE:64张H100顶96张用,MoE训练显存暴降45%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
DPO假设失效?康奈尔联合Netflix提出SPO:大模型对齐的“单指标”革命。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
移位代替乘法!LLM推理提速10倍、内存节省87.5%的PoT-QAT技术。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
像搭积木一样优化Prompt:CMU新作MPO,分块微调击败TextGrad。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM越深越“健忘”?字节MoDA架构:性能+2.11%,开销仅3.7%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
挑战Ring-Attention霸主地位:Mesh-Attention实现3.4倍加速,通信暴降85%。
蒸馏即遗忘?大模型记忆率暴跌50%,揭秘知识蒸馏的“隐私红利”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
微软Kascade:无需训练,H100上长文本推理提速4.1倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GRPO多奖励训练“失效”?GDPO解耦归一化:AIME准确率提升6.3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“写死”的工作流:IBM万字综述,定义Agent动态进化新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
打破投机采样瓶颈:美团提出“稀疏验证”框架,Attention与MoE全面瘦身。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
性能媲美XGBoost,解释性堪比Lasso:斯坦福新作“注意力Lasso”详解。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型“瘦身”革命:砍掉99.7%注意力连接,内部电路清晰100倍且性能不降!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Mistral AI新作QuacK:不靠归一化,动态学习率让Transformer训练提速10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型融合实测:6种先进方法惨败,竟不敌最简单的“加减法”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别硬裁剪!阿里SAPO算法,用“柔性门控”提升LLM训练稳定性与性能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别玄学Prompt!字节跳动ELPO框架,F1分数最高提升7.6分。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
OpenAI重磅发现:让Transformer“瘦身”99.9%,电路可解释性暴增16倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MIT联手英伟达发布FlashMoBA:稀疏注意力提速14.7倍,长文本处理迎来新篇章。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MIT新突破:Transformer实现火箭全程自主驾驶,成本仅高出最优解3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
KimiLinear揭秘:首次全面超越全注意力,1M上下文解码提速6倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让大模型学会“专注”:AWS发布Focal Attention,参数减42%,长文本性能飙升82%!
本文提出了一种名为 SpecAttn 的免训练方法,该方法将推测解码(speculative decoding)与稀疏注意力相结合,通过利用草稿模型(draft model)已计算出的注意力权重来为目标模型(target model)动态预测并选择重要的 Token,从而在不显著牺牲模型性能的...
本文提出了一种名为高阶线性注意力 (Higher-order Linear Attention, HLA) 的新型注意力机制,它通过紧凑的前缀充分统计量 (prefix sufficient statistics) 实现了高阶交互,同时保持了线性时间复杂度和流式计算能力,从而在不牺牲表达能力的...
本文提出了一种名为“上下文引导策略优化” (In-Context Steered Policy Optimization, ICPO) 的新型强化学习框架,该框架利用大推理模型 (Large Reasoning Models, LRM) 固有的上下文学习 (In-Context Learnin...
本文提出了一种名为 GaLLoP 的稀疏微调新方法,它通过优先选择在下游任务上梯度最大、且在预训练模型中权重绝对值最小的参数进行微调,从而在提升任务性能的同时有效保留预训练知识,实现了卓越的分布内(ID)和分布外(OOD)泛化能力。
本文提出了一种名为 Stream 的可解释性框架,通过其具体实现算法 Stream-Attn,利用动态稀疏注意力机制,以近线性的时间( )和线性空间( )复杂度,高效分析大型语言模型在百万级Token长上下文中的注意力模式,从而在消费级GPU上实现了以往难以企及的机理可解释性分析。
本文提出了一种名为 Ring-linear 的高效混合注意力架构,通过将线性注意力(Linear Attention)与标准的 Softmax 注意力相结合,在显著降低长上下文推理的 I/O 和计算成本的同时,保持了强大的模型性能。
本文提出了一种名为DEPO的新型强化学习框架,它通过解耦高效与低效推理片段的优势计算、引入难度感知的长度惩罚和优势裁剪机制,在保持甚至提升模型准确率的同时,显著减少了大型推理模型的无效推理(“过度思考”)和响应长度。
本文提出了一种名为 DRO-InstructZero 的方法,它将分布式鲁棒优化(Distributionally Robust Optimization, DRO)与贝叶斯优化(Bayesian Optimization, BO)相结合,用于搜索在数据分布发生变化时仍能保持高性能的、具有鲁棒...
本文通过分析大型语言模型(LLM)在推理任务中的注意力模式,揭示了一种“预规划-锚定”(Preplan-and-Anchor)的内在节奏,并基于此发现提出了一种细粒度策略优化方法,有效解决了传统强化学习方法中奖励稀疏和信用分配不明确的问题,从而显著提升了LLM的复杂推理能力。
本文提出了一种名为 GatePro 的新型、无参数的专家选择优化方法,它将 MoE 模型中的专家选择问题构建为一个最优传输问题,无需可学习的门控参数或人工调整的负载均衡损失函数,即可实现高效且稳定的专家分配。
本文首次系统性地揭示了在使用Flash Attention进行低精度(BF16)Transformer模型训练时,导致训练崩溃的内在机制,指出其根源在于注意力机制中出现的相似低秩表示与BF16算术固有有偏舍入误差的累积效应,两者共同形成恶性循环,最终导致损失爆炸。
本文提出一种名为 RiskPO 的大语言模型训练后优化方法,通过引入一个基于风险度量的目标函数(MVaR),替代传统的均值优化目标,从而将模型优化的重点放在处理困难样本上,有效缓解了熵坍塌问题,并显著提升了模型的推理能力。
本文提出,在数据受限而计算资源无限的未来场景下,通过深度优化正则化、模型集成和知识蒸馏等经典算法,可以显著提升语言模型预训练的数据效率,其效果远超单纯增加训练轮次或模型参数的传统方法。
本文提出了一种名为 IGPO (Inpainting-Guided Policy Optimization) 的强化学习框架,它利用扩散大语言模型 (dLLM) 独特的“填补” (inpainting) 能力,通过在探索过程中策略性地注入部分真实推理线索,从而有效解决强化学习中的探索效率低下和...
本文提出了一种名为“近似最近邻注意力”(ANNA)的高效注意力机制,其时间复杂度为亚二次方,并从理论上证明了它在保持与大规模并行计算(MPC)模型等价的强大表达能力的同时,能够高效解决关键推理任务,且其能力可涵盖低秩注意力机制。
优化技术已成为解决工程设计、经济规划和科学发现等领域复杂问题的关键。实践中,优化算法分为精确方法和近似方法,但没有任何一种算法能普适于所有问题(“没有免费的午餐”定理),这使得算法的选择、配置和设计高度依赖专家知识。机器学习,特别是强化学习(RL),虽被用于降低这种复杂性,但其泛化能力有限。
本文提出Spotlight Attention,一种通过可学习的非线性哈希函数来高效检索KV缓存(Key-Value Cache)的方法,从而在几乎不损失性能的前提下,显著提升大语言模型(LLM)的推理速度。
本文提出了一种名为 LLaMA-Adapter 的高效微调方法,它通过引入一个仅有1.2M可学习参数、带有零初始化注意力的轻量级适配器,在冻结 LLaMA 模型主体的情况下,实现了快速(1小时内)、高效的指令微调,并能轻松扩展到多模态任务。
本文提出了一种名为KTO (Kahneman-Tversky Optimization) 的新型大模型对齐方法,它基于前景理论,仅需“可取”或“不可取”的二元反馈信号,便能在10亿到300亿参数规模的模型上达到甚至超越基于偏好数据的DPO方法的性能。
本文提出了一种名为 StreamingLLM 的高效框架,通过保留少量初始 Token 作为“注意力池 (Attention Sinks)”来稳定注意力分布,从而使预训练好的大语言模型无需微调即可处理无限长的流式输入。