模型优化 第3页

SEAD:三层熵引导在线蒸馏,跳过50%Token,数学准确率提升4.8!

在大型推理模型的部署中,知识蒸馏(KnowledgeDistillation)是将数百亿参数模型的强大能力压缩至轻量级模型的核心手段。长期以来,离线策略(Off-policy)蒸馏占据主导地位,即让学生模型在教师模型预先生成的静态数据上进行训练。

蚂蚁集团提出Soft Clamp:打破行为杠杆不平衡,过度调用率降至9%

大语言模型正在加速演进为能够自主执行复杂任务的智能体(Agent)。在这一演进路线中,模型面对的最核心挑战之一不仅是“如何准确地生成工具调用参数”,更在于一系列离散的战略决策:“何时该调用工具”、“何时该消化工具的返回结果”,以及“何时该直接用自然语言回答用户”。

阿里EvoSOP:让Agent自动合成SOP,成功率提升13.4%

在当前的大语言模型(LLM)Agent研究中,工具调用能力已成为其与真实世界交互、解决复杂任务的核心基石。然而,当开发者们不断赋予Agent各种能力时,一个明显的效率瓶颈逐渐显现:现有框架绝大多数依赖由“原子操作”(AtomicActions)组成的静态工具集。

直降17%!普林斯顿揭示特权自蒸馏为何反噬思考模型?

在大型语言模型的自我进化路线中,带有特权上下文的同策略自蒸馏(On-PolicySelf-Distillation,OPSD)一直被视为一种极具潜力的范式。这种方法让模型互为师生,同时给予“教师”模型额外的特权信息(例如标准答案或完整解题步骤),从而引导“学生”模型更高效地学习。

TOP-D:微软零开销蒸馏新框架,平滑无界奖励,准确率提升25.84%

在大语言模型的后训练(Post-training)阶段,如何有效地将强大的闭源或超大参数模型的能力“灌输”给较小的学生模型,一直是极具挑战的核心命题。在过去的探索中,同策略蒸馏(On-PolicyDistillation,简称OPD)凭借其能够提供密集奖励信号、且不易发生灾难性遗忘的优势,迅速...

UI-MOPD:多教师在线蒸馏!跨平台GUI智能体成功率达38.2%

随着多模态基础模型和智能体系统的快速演进,图形用户界面(GUI)智能体正经历从单平台任务执行向跨平台复杂交互的关键跨越。真实世界的数字工作流往往需要跨越桌面应用程序、移动端App和Web服务,这就要求智能体不仅能适应异构的GUI环境,还要准确保留各个平台独有的交互习惯。

Direct-OPD:不模仿小模型策略,而是转移隐式奖励,4小时提升Qwen3表现

带有可验证奖励的强化学习(RLVR)是当前激活大型语言模型深层推理能力的核心密码。从各大顶尖机构的动作来看,让模型在数学、代码等逻辑严密领域通过自我纠错和多步推理来获取高分,已经成为一种标配。然而,这种后训练(post-training)范式极其昂贵。

GLM-4.5开源:32B激活参数斩获AIME 91%,重塑ARC全能模型

当前,大语言模型正从被动响应的知识库,向主动解决现实难题的通用求解器跨越。实现这一跨越的核心,在于彻底打通智能体、逻辑推理与代码这三大核心能力。然而,闭源巨头在特定领域表现惊艳,开源界却始终缺乏一个能统一上述能力的轻量级霸主。本文将深入剖析清华大学与智谱AI最新联合发布的GLM-4.5及其轻量版。

Nemotron 3 Super开源:提速7.5倍的120B混合架构MoE解读

大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实...

Mixture-of-Depths Attention

LLM越深越“健忘”?字节MoDA架构:性能+2.11%,开销仅3.7%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。