模型优化

SPADE:自适应3D分块稀疏引擎,视频扩散注意力提速3.4倍

他们提出了名为 SPADE 的免训练(Training-Free)、输入自适应稀疏注意力引擎。该框架打破了以往算法设计与系统实现相割裂的局限,从“算法-系统协同设计”出发,构建了一套统一的稀疏表达规范、极低开销的自适应方案生成算法,以及深度适配现代 GPU 架构的执行引擎。

深度研究Agent剪枝:位置比算法更关键,Token消耗降低73%

无论是各类商业化的研究助手,还是开源社区构建的自动化研究流水线,都在尝试让大语言模型处理极其开放且复杂的调研任务。然而,这类长程(Long-horizon)任务普遍伴随着极其高昂的计算代价:智能体沿着分解出的子问题不断发起检索、抽取网页、发散分支,上下文体积呈现雪崩式膨胀。

AnchorKV:不丢弃任何Token实现20倍KV缓存压缩,70B模型保留99%精度

最新提出的 AnchorKV 彻底打破了这种两难困境。它在 不丢弃任何一个 Token 位置 的前提下,将 KV 缓存体积压缩了整整 20 倍。在 70B 参数规模的模型上,AnchorKV 在 20 倍极致压缩下依然保留了未压缩基准 99.3% 的综合性能;而在多任务检索和长文本大海捞针测试中。

SKILL-KD:把行为落差转化为文本补丁,对比蒸馏让弱Agent最高提升56%

最新提出的 SKILL-KD 框架打破了这一僵局。它将外部技能库重新定义为跨能力智能体之间的 显式蒸馏介质 :不依赖参数微调,而是直接对比教师与学生在同一任务中的 行为落差 (Actionable Discrepancy),将其转化为能够动态验证并迭代修正的“文本技能补丁”。

MemeMind:全错样本如何破局?离线轨迹重构让Agent能力提升22%

来自哔哩哔哩(Bilibili)与复旦大学的研究团队在最新论文中提出了 MemeMind 框架,专门针对这一盲区提出了破局方案。MemeMind 的核心亮点在于 参考答案引导的工具轨迹重构 :它在离线阶段利用终局的参考答案,由专门的模块反推所需证据,主动调度异构工具完成检索、裁切与交叉验证。

微软提出OEO:自进化Agent无需预设流程,GPT-5.5在线编排省下65%交互Token

为此,他们提出了一种名为 OEO (Open-Ended Optimization,开放式优化)的极简范式:框架仅负责严格锁定目标、预算、权限和评测红线,而把“何时收集证据、如何诊断失败、提出何种粒度的修改以及何时停止”的全部过程控制权,彻底交给前沿优化器在线自主编排。

TRACE:长程Agent压缩为何频遭退化?配对闭环验证破解执行不稳定性

针对这种执行失真,研究团队提出了 TRACE ( Trajectory-Relative Agent Context ComprEssion )框架。该方法抛弃了依靠终局任务成败做逆向归因的粗粒度反馈逻辑,转而在发生压缩的“截断边界”处,通过成对的闭环局部续写来直接度量压缩带来的额外执行退化。

OneDayAgent:日常长程任务新SOTA达到0.821!任务拆解+记忆压缩+验证修复三合一框架

实验结果显示,以 GLM-5.2 作为驱动底座的 OneDayAgent 取得了 0.821 的综合得分,显著超越基准官方测试的各类通用智能体方案。在遵循指令、事实准确性、逻辑完备性等维度,以及无论是否携带多模态附件的测试组中,该方案均取得了全面领先。消融实验进一步证实了各个模块的必要性。

不是盲猜而是看懂后果:GHD用下一张截图后视蒸馏突破手机Agent

研究团队据此提出了 门控后视蒸馏(Gated Hindsight Distillation, 简称 GHD) 。该方法在训练时引入一个参数完全共享的“教师视角”,让它额外观察到下一帧真实截图,从而利用事后诸葛亮式的后验视角为推理与动作重新打分;同时设计了严格的门控机制。

HarnessOpt-Bench:AI如何自己优化AI?模型底座影响是脚手架的1.8倍

由 Scale AI 团队主导的最新研究提出了 HarnessOpt-Bench ,这是业内首个针对“端到端自动化 Harness 优化”建立的标准化评测基准。这项研究跳出了过去各家系统在自选题目、自定规则下的“自嗨式优化”,搭建了一套具备严格隔离防护与预算控制的可信评测协议。