GLM-4.5开源:32B激活参数斩获AIME 91%,重塑ARC全能模型
GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models
当前,大语言模型正从被动响应的知识库,向主动解决现实难题的通用求解器跨越。 实现这一跨越的核心,在于彻底打通智能体、逻辑推理与代码这三大核心能力。 然而,闭源巨头在特定领域表现惊艳,开源界却始终缺乏一个能统一上述能力的轻量级霸主。 本文将深入剖析清华大学与智谱AI最新联合发布的GLM-4.5及其轻量版。 该研究以极高的参数效率,在AIME 24数学基准上斩获91.0%的惊人准确率。 它在多项榜单中击败诸多大体量模型,位列全球开源与闭源模型综合第三名。
ArXiv URL:http://arxiv.org/abs/2508.06471v1
架构演进:深层网络与混合专家的化学反应
探讨GLM-4.5的底层突破,不可忽视其对混合专家(Mixture-of-Experts, MoE)架构的精妙调整。 该模型总参数量为355B,但在实际推理时仅需激活32B参数。 这种设计在保证极高模型容量的同时,完美兼顾了训练与推理的计算效率。 与近期发布的其他顶尖模型不同,本文发现加深网络层数能显著提升深度推理的上限。 因此,研究团队果断选择减少模型的隐藏层维度与路由专家数量,转而大幅增加模型的高度。 在自注意力机制的设计上,模型采用了分组查询注意力,并结合了部分旋转位置编码。 令人反直觉的是,该研究将注意力头数大幅增加至96个。 虽然这未在初期的训练损失上体现出明显优势,却在多项高难度推理基准上大放异彩。 为了有效稳定注意力机制的对数分布范围,模型还引入了 $QK-Norm$ 技术。 此外,网络末端增设了额外的多标记预测(Multi-Token Prediction, MTP)层。 这一前瞻性设计,为后续推理阶段的高效投机解码提供了硬件级别的直接支持。
训练机制:从通用基石到专项特训
模型的成长并非一蹴而就,预训练与中期训练为其奠定了坚实的能力基石。 在预训练阶段,模型吞吐了高达 $23T$ 的海量高质量Token。 这不仅包括常规网页与社交媒体,还涵盖了大量的学术论文与开源代码库。 预训练被巧妙地分为两个阶段。 初期以建立通用世界认知为主,后期则大幅提升了代码与理科数据的采样权重。 进入中期训练(Mid-Training)后,模型的上下文窗口迎来了质的飞跃。 序列长度从最初的 $4096$ 被强力扩展至 $131,072$ 的超长上下文域。 为了让模型适应这种跨度,旋转位置编码的基础频率也从一万飙升至一百万。 在此阶段,研究人员采用了最佳匹配打包策略,摒弃了粗暴的随机截断。 这确保了超长代码文件和复杂逻辑推理过程在训练数据中的绝对完整性。
后训练启示:专家迭代与强化学习的重构
GLM-4.5的后训练阶段是其能力跃升的核心,也是本文最为硬核的方法论所在。 这里我们不妨用“全能运动员的终极特训”来理解其专家模型迭代(Expert Model Iteration)机制。 后训练被严格划分为两个阶段。 第一阶段是分身专项特训。 模型先分化出三个独立的“克隆体”,分别交由推理、智能体和通用对话环境进行强化学习。 第二阶段则是肌肉记忆的终极融合。 通过复杂的自蒸馏技术,系统将三个专项专家的能力“熔炼”回一个统一的混合推理躯壳中。 这种独特模式让最终的模型既能开启深度思考模式,也能在日常对话中瞬间做出直接响应。
在最难啃的推理强化学习领域,该研究完全摒弃了传统的KL散度惩罚。 模型主要基于 $GRPO$ 框架进行底层的策略优化。 对于代码强化学习,本文提出了一个极具工业应用价值的实证结论。 将传统的序列级别损失替换为基于Token加权的平均损失极为关键。 这种极其细粒度的梯度信号不仅大幅加快了模型参数的收敛速度。 它还有效抑制了模型在训练中投机取巧,防止其生成过于简单的重复性代码。 在数学推理的突破上,难度递进的课程学习成为了打破能力天花板的利器。

如上图曲线所示,当基础题目的训练收益陷入停滞时。 及时引入极高难度的竞赛级题目,能让模型的解题能力再次出现陡峭的上升。
智能体强化学习:测试时计算的另类扩展
智能体任务的强化学习同样充满未知与挑战。 该研究针对网络搜索和代码生成,构建了极高复杂度的沙盒验证环境。 通过引入大模型作为用户模拟器,系统自动合成了大量需要跨源操作的多步工具调用轨迹。

在探讨测试时计算的扩展法则时,智能体任务展现出了截然不同的规律。 传统的推理模型通常通过无休止地增加输出Token数量来换取更高的准确率。 但智能体模型则是通过增加与真实环境的交互轮数来实现计算力的变现。 如上图所示,当允许网络搜索代理进行更多轮次的试错与网页浏览时。 模型完成复杂检索任务的成功率呈现出极为平滑的上升趋势。 为了消除模型中偶尔出现的中英夹杂或格式崩溃等低概率异常。 团队还引入了专门的病态行为强化学习(Pathology RL),精准定向打击这1%的顽疾。
核心评估:参数效率与实战能力的双重胜利
在全面且严苛的基准测试中,GLM-4.5展现了令人震撼的参数杠杆率。

在TAU-Bench智能体基准测试中,该模型取得了70.1%的极高分数。 这一成绩稳居榜单第二,紧跟在未开源的OpenAI o3之后。 在验证极其严格的SWE-bench代码修复测试中,其解决率达到了64.2%。 这一惊艳表现全面超越了GPT-4.1,直逼闭源标杆Claude Sonnet 4。 值得注意的是,取得如此辉煌战绩的GLM-4.5,其参数量仅为同级竞品的一半甚至三分之一。 为了避免模型陷入单纯的“刷榜”陷阱,研究团队还引入了高强度的深度人工盲测。 在真实软件开发场景的代码智能体对抗中,GLM-4.5展现出了极高的工程鲁棒性。 它的工具调用成功率高达90.6%,在任务完成的一致性上力压一众顶尖大模型。 在翻译等极度依赖文化语境的任务中,该模型同样表现出跨越级的理解力。 面对带有强烈网络亚文化的生僻梗词,传统翻译引擎往往不知所云。 但GLM-4.5却能精准穿透字面,捕捉其背后的习惯用语内涵。
工程启示与未来展望
GLM-4.5的成功不仅是分数的胜利,更为工业界提供了宝贵的实践指南。 首先,科学与数学类任务的强化学习极其挑剔底层数据的纯度。 混杂质量的数据会导致模型能力倒退,唯有纯净的专家验证数据才是攀登巅峰的阶梯。 其次,优化器的选择对大规模MoE模型的训练至关重要。 全面拥抱 $Muon$ 优化器不仅能承受更大的批次,更在收敛稳定性上远超常规方案。 最后,虽然模型在道德与心理健康等安全维度上表现优异,但在处理社会偏见方面仍有提升空间。 这提醒我们,在追求模型全能化的同时,底层价值观的精细对齐依然是任重道远的长期课题。