Kimi K2重磅开源:万亿参数与MuonClip重塑Agent智能

Kimi K2: Open Agentic Intelligence

大语言模型正经历从静态模仿向主动交互的深刻变革。 这标志着智能体Agentic Intelligence)时代的全面开启。 在此范式下,模型必须学会在复杂多变的环境中自主感知、规划、推理并采取行动。 然而,打造极致的智能体能力,意味着要在预训练与后训练阶段跨越两座大山。 在预训练阶段,高质量数据枯竭使“Token效率”成为决定模型缩放的关键。 在后训练阶段,多步推理和工具调用等高级行为极其稀缺,人工标注成本高昂。 面对挑战,月之暗面重磅开源了包含1.04万亿总参数量的Kimi K2。 这是一个激活参数达320亿的混合专家模型Mixture-of-Experts, MoE)。 该研究独创MuonClip优化器,彻底解决了大规模训练的不稳定性。 更通过大规模合成Agent数据与联合强化学习机制,刷新了开源模型的性能天花板。

ArXiv URL:http://arxiv.org/abs/2507.20534v1

MuonClip优化器:打破Token效率的枷锁

大模型训练通常在数据和算力之间寻找平衡,但在优质数据受限的今天,必须提升Token的利用率。 该研究引入了高效的Muon优化器。在同等算力和规模下,Muon性能显著优于AdamW。 然而,将Muon扩展到万亿参数级别时,研究团队发现了一个致命问题:训练极易出现不稳定性。 这种不稳定性主要表现为注意力逻辑值(Attention Logits)的异常爆炸。 现有的软截断方法只能在最后强行限制数值。 但在限制应用前,查询(Query)和键(Key)的点积依然会疯狂增长。 同时,由于K2采用了多头潜在注意力Multi-head Latent Attention, MLA)架构。 其Key矩阵在推理时并未完全实例化,导致传统的QK-Norm方法无法适用。

为了攻克难题,研究提出了一种优雅的权重裁剪机制——QK-Clip。 如果将Muon优化器比作一台马力全开的赛车引擎,注意力逻辑值就是引擎的实时转速。 转速无限制飙升必然导致“爆缸”,而事后限制速度则于事无补。 QK-Clip就像是一个深植于引擎内部的智能限速器。 它直接在每次参数更新后,对Query和Key的投影权重进行缩放限制。

\[\mathbf{W}\_{q}^{h}\leftarrow\gamma^{\alpha}\mathbf{W}\_{q}^{h}\qquad\mathbf{W}\_{k}^{h}\leftarrow\gamma^{1-\alpha}\mathbf{W}\_{k}^{h}\]

这种底层约束确保了逻辑值的增长被牢牢锁死在安全范围内。 赛车可以在每次换挡时保持巅峰加速度,同时绝对不会越过红线。 凭借MuonClip,Kimi K2在消耗15.5万亿Token的漫长预训练中。 成功实现了令人惊叹的零损失毛刺(Zero Loss Spike)。 Kimi K2 Training Loss

数据重写与架构演进:算力与数据的极致压榨

为了进一步压榨Token价值,K2在预训练数据准备上并未简单重复利用数据。 简单重复会导致严重的过拟合。该研究采用了一套精巧的自动回归分块重写管线。 对于知识密集型文本,系统会在保留上下文关联的前提下,拆分长文本并顺序重写。 对于数学文献,则将其转化为更易吸收的“学习笔记”风格,并引入了跨语种翻译。 这种受控的数据增强,在不引入幻觉的同时,极大丰富了高质量Token供给。

在架构层面,K2基于严谨的稀疏性缩放定律进行了大胆取舍。 研究表明,在保持每次前向计算量不变时,增加专家总数能持续降低训练损失。 为此,K2配置了多达384个专家,每次前向计算仅激活其中的8个。 但在注意力机制上,K2却做出了极为务实的“逆向操作”。 长文本场景下的推理开销是智能体应用的致命伤。 当上下文达到128k时,若将注意力头数翻倍,推理算力将暴增83%。 而实验证实,翻倍注意力头带来的性能增益仅为0.5%到1.2%。 因此,K2果断将注意力头数精简为64个,为超长上下文应用留足了算力冗余。

在万亿参数规模下,训练基础设施的容错与效率直接决定了项目的成败。 该研究没有死磕某一种特定的并行策略,而是设计了一套极具弹性的混合并行方案。 通过将流水线并行、专家并行与数据并行深度融合,K2能够适配多种规格的集群。 为了打破显存瓶颈,研究团队对层归一化等算子实施了选择性重计算。 并巧妙利用FP8格式存储非敏感激活值,将剩余激活值异步卸载到CPU内存中。 这种榨干硬件性能的工程调度,为万亿参数模型的稳定迭代奠定了坚实基础。

后训练进化:从静默知识到具身智能的蜕变

大模型要真正走向实用,必须具备操作工具与环境交互的能力。 在监督微调(SFT)阶段,K2团队打造了一个空前规模的Agent数据合成管线。 他们不仅接入了3000多个真实的MCP工具,还演化出了20000多个合成工具。 为了让模型学会使用工具,系统为不同任务生成了包含明确成功标准的评估维度。 在多轮轨迹生成中,一个功能完备的工具模拟器承担了“世界模型”的角色。 它动态维护状态变化,并注入受控的随机性以模拟真实环境的复杂度。 更精妙的是,为了弥补纯模拟环境的缺陷,研究团队引入了真实的执行沙盒。 模型必须在真实开发环境里运行代码,通过客观的测试用例来获得反馈。 这种虚实结合的拒接采样策略,让K2的工具调用能力产生了质的飞跃。

混合强化学习:自我反思与价值对齐

强化学习(RL)是解锁大模型潜力的一把金钥匙。 但如何将其扩展到不可直接验证的主观任务中,一直是业界的难题。 Kimi K2在可验证奖励之外,创造性地引入了自我反思规则奖励机制。 该机制允许K2在面对开放式问答或创意写作等任务时,扮演自己的“严苛考官”。 模型会针对自己生成的多个回答进行两两比较对战。 评判标准不仅包括AI助手的核心价值观,还包含旨在消除奖励作弊的规范性维度。

这种自我反思能力并非凭空产生,而是在一个闭环系统中持续进化的。 模型首先在数学和逻辑等客观任务中,提炼出评判真伪和优劣的底层逻辑。 随后,将这种从可验证数据中沉淀出的判断力,迁移注入到主观评估模型中。 由此,K2不仅能解出高难度的微积分,还能在长对话中精准把握用户意图。

在构建智能体的过程中,忠实度是决定其能否在开放环境中可靠运行的生命线。 K2专门训练了一个句子级别的裁判模型,用于揪出缺乏证据支撑的事实性断言。 这大幅降低了多步工具调用中的幻觉累积。 为了应对RL训练中模型容易生成冗长回复的通病,K2实施了严格的预算控制。 系统为不同任务设定最大Token预算,对超出限制的输出施加严厉惩罚。 结合辅助的PTX损失函数,K2在大幅提升推理深度的同时,保持了语言的凝练。

实验评估与工程启示

详实的评测数据证明了Kimi K2在非思考模型阵营中的绝对统治力。 在考察Agent综合能力的Tau2-Bench上,K2斩获了66.1分。 在ACEBench基准测试中,K2的得分也达到了令人瞩目的76.5分。 在极具挑战的SWE-Bench Verified中,K2以65.8的高分脱颖而出。 这一成绩大幅超越了绝大多数开源与闭源的竞争对手。 Kimi K2 main results 更令人瞩目的是,在未开启额外思考时间的情况下,它的各项理科成绩依然优异。 K2在LiveCodeBench和AIME 2025中分别拿下了53.7分和49.5分。

Kimi K2的发布,不仅仅是又一个开源大模型的诞生。 它更是一次对Agentic Intelligence落地的系统性工程示范。 从MuonClip对底层优化器缺陷的优雅修补,到灵活取舍的万亿参数架构设计; 从虚实结合的Agent轨迹合成,到打通主客观边界的自我反思强化学习框架。 这些扎实的技术细节,为如何利用有限算力和数据孕育出高度自主的AI Agent,提供了极具价值的参考蓝图。