模型优化 第2页

Solar Open 2:混合注意力支撑1M上下文,1/6参数逼平1.6T模型

Solar Open 2 提出了一种名为“选择性权重迁移”(Selective Weight Transfer)的热启动策略,打破了传统认知中“架构大幅改变必须从头预训练”的铁律。模型上一代版本 Solar Open 1 采用纯 Softmax 骨架,路由专家数为 128 个。

零阶优化破解智能体自进化瓶颈:困难样本成功率从22%跃升至54%

为了打破这一“能力天花板”,来自北京理工大学和深圳北理莫斯科大学的研究团队提出了一种全新的 零阶自进化框架 。该方法彻底跳出了“必须先采出正确轨迹才能训练”的传统思维,而是对大模型的 LoRA 参数施加微小扰动,仅依据最终答案计算连续的困惑度损失差。

LOPD:给自蒸馏换上可学习隐空间,不到30%采样预算超越GRPO

他们提出了 隐式在线自蒸馏(Latent On-Policy Self-Distillation,简称 LOPD) 。该方法将特权上下文重构成一个端到端可学习的隐空间连续向量,不仅彻底摆脱了人工规则对经验形态的束缚,更在工具调用与代码生成两大高壁垒场景下。

ReCache:解耦跨工具注意力,KV显存缩减92.4%且首字提速3.6倍

针对这一瓶颈,来自东方理工大学、上海交通大学与西安交通大学的研究团队提出了 ReCache 。该框架通过三大递进机制打破了工具调用的缓存困局:用“资源级注意力”切断不同工具之间的横向交互,赋予每个工具完全独立的局部坐标,使其 KV 块具备天然的组合不变性。

SCAFFOLD:打破两层浅层抽象,递归技能蒸馏让Web Agent狂飙17分

针对这些根本缺陷,来自 MBZUAI、麦吉尔大学等机构的研究团队提出了 SCAFFOLD 框架。通过多实例参数化抽象、递归组合、基于最小描述长度(MDL)的库压缩,以及周期性的权重蒸馏,SCAFFOLD 彻底打通了从“动作轨迹”到“深层程序抽象”再到“模型内生能力”的自进化闭环。

TAPO:不靠额外数据,让大模型 Agent 学会“预判动作后果”

针对这一问题,本文提出了一种轻量且通用的后训练框架—— TAPO (Transition-Aware Policy Optimization)。该方案的核心突破在于: 不采集任何额外的专家数据,不增加任何多余的在线采样环境交互,也不在推理时引入额外的计算负担。

SparseDitto:突破350倍格式悬崖,用LLM闭环定制GPU稀疏内核

来自美国东北大学与明尼苏达大学的研究团队提出了全新解决方案 SparseDitto 。该系统将大语言模型(LLM)的开放代码生成能力与基于真实硬件测量的闭环反馈相结合,为任意给定的稀疏矩阵、算子和目标 GPU 动态定制最优的底层 CUDA 内核。

ElasticBack:无需篡改模型权重,单技能条件后门拿下89%攻击成功率

为了破解上述矛盾,ElasticBack 提出了一种以“门控词”(Gate Words)为枢纽、将触发词视作激活开关的联合优化框架。整个攻击流程的核心思想是: 先利用语义锚定技术在技能文档中精准植入一条带有严格约束边界的休眠规则 ,将其参数与行为锁定后,再依托黑盒代理模型。

从全Softmax转向混合架构:SANA-Video 2.0用25%锚点换来120倍加速

当视频生成的分辨率迈向720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散Transformer(VideoDiT),大多重度依赖全时空三维Softmax注意力。

微软新研究:告别昂贵的逐次思考,离线技能蒸馏让非推理模型省下最高6倍Token

在复杂的大模型智能体(Agent)任务中,开启推理模式(如思维链或强化学习诱导的“思考”机制)往往能带来显著的成功率提升。然而,这一表现的背后往往伴随着沉重的推理溢价(ReasoningPremium):模型的输出Token数量通常会膨胀3到6倍,并且每次交互、每个任务实例都要重新进行一遍完整...

**AsmEvo:AMD突破无源码GPU优化!汇编级代理最高提速3.88倍**

在当今的高性能机器学习系统中,GPU内核的执行效率往往决定了整个大模型推理或训练的吞吐天花板。然而,在实际的工业部署环境中,开发者常常面临一个极为棘手的黑盒困境:那些真正跑在显卡上的算子,往往只是一团无法直接阅读和修改的编译后二进制文件。

AutoSaddler:微软基于执行追踪自动优化Agent框架,性能最高提升10个百分点!

随着大型语言模型(LLM)能力的飞速提升,我们见证了它们在诸多单步交互任务中展现出令人惊艳的表现。然而,当这些模型被真正放入自主代理(Agent)系统中,去执行需要长期规划、多步推理和复杂环境交互的任务时,一种被称为“参差智能”(JaggedIntelligence)的现象便会显现:它们在某些...

SecOPD:Token级反馈击破提示注入,攻击率降至9.0%

大模型正从单纯的聊天机器人向能够操作工具、浏览网页和处理文件的AIAgent演进。在这个过程中,提示注入(PromptInjection)成为了横亘在应用落地前的一座大山,并被普遍视为AIAgent面临的首要安全威胁。

Kimi K3:混合注意力与稳定LatentMoE,扩展效率提升2.5倍

在大语言模型(LLM)的发展进程中,扩展定律(ScalingLaws)长期主导着预训练阶段的资源投入。然而,随着推理模型和强化学习在测试时计算(Test-timecomputation)上的突破,行业逐渐演化出两条平行的扩展轴线:一是继续扩大预训练基础模型的参数规模,二是在测试阶段通过强化学习...

MOONSHOT:Google与OpenAI提出多目标剪枝框架,大模型困惑度降低32.6%

随着当代视觉与大语言模型(LLMs)参数规模的指数级增长,其在推理阶段所消耗的计算资源与显存带宽已成为实际部署中的严峻挑战。在众多模型压缩策略中,网络剪枝(NetworkPruning)因其能够直接移除冗余权重而备受关注。特别是在大模型时代,传统的“剪枝-微调”范式由于高昂的重训练成本变得不再现实。

MOPD:小米等提出多教师同策略蒸馏,归一化得分提升5.5分!

在大语言模型(LLM)的后训练(Post-Training)阶段,强化学习(RL)已经成为提升模型特定领域能力的标准范式。无论是利用可验证奖励进行数学推理训练,还是在沙盒环境中进行代码能力的代理式强化学习,或者是基于规则反馈优化指令遵循能力,针对单一领域的强化学习管道往往能够稳定且大幅度地提升...