FocusMem:不是无脑压缩轨迹!三大解耦机制让GUI Agent任务成功率最高提升18分
为了彻底解决这一困境,研究团队提出了 FocusMem 。它不再试图打造一个容量更大的黑盒压缩器,而是将隐式记忆的职责明确解耦为三个维度: 存什么(内容基底) 、 怎么看(状态自适应读取) 以及 信不信(置信度门控) 。
为了彻底解决这一困境,研究团队提出了 FocusMem 。它不再试图打造一个容量更大的黑盒压缩器,而是将隐式记忆的职责明确解耦为三个维度: 存什么(内容基底) 、 怎么看(状态自适应读取) 以及 信不信(置信度门控) 。
近日,来自字节跳动、佐治亚理工学院、加州大学圣地亚哥分校(UCSD)以及马里兰大学帕克分校的研究团队提出了一项颠覆性的训练范式: 无监督在线自蒸馏(Unsupervised On-Policy Self-Distillation, u-OPSD) 。
他们提出了名为 SPADE 的免训练(Training-Free)、输入自适应稀疏注意力引擎。该框架打破了以往算法设计与系统实现相割裂的局限,从“算法-系统协同设计”出发,构建了一套统一的稀疏表达规范、极低开销的自适应方案生成算法,以及深度适配现代 GPU 架构的执行引擎。
KVDiagnosis:为了让长文本推理在有限的硬件上跑得通,工业界与学术界提出了五花八门、令人眼花缭乱的 KV Cache 压缩算法,涵盖 Token 驱逐、层/头动态分配、通道剪枝、低比特量化以及语义块合并等不同技术路线。
无论是各类商业化的研究助手,还是开源社区构建的自动化研究流水线,都在尝试让大语言模型处理极其开放且复杂的调研任务。然而,这类长程(Long-horizon)任务普遍伴随着极其高昂的计算代价:智能体沿着分解出的子问题不断发起检索、抽取网页、发散分支,上下文体积呈现雪崩式膨胀。
来自上海人工智能实验室(Shanghai Artificial Intelligence Laboratory)等机构的研究团队提出了全新的蒸馏框架 SimpleOPD 。
最新提出的 AnchorKV 彻底打破了这种两难困境。它在 不丢弃任何一个 Token 位置 的前提下,将 KV 缓存体积压缩了整整 20 倍。在 70B 参数规模的模型上,AnchorKV 在 20 倍极致压缩下依然保留了未压缩基准 99.3% 的综合性能;而在多任务检索和长文本大海捞针测试中。
最新提出的 SKILL-KD 框架打破了这一僵局。它将外部技能库重新定义为跨能力智能体之间的 显式蒸馏介质 :不依赖参数微调,而是直接对比教师与学生在同一任务中的 行为落差 (Actionable Discrepancy),将其转化为能够动态验证并迭代修正的“文本技能补丁”。
来自中国科学院、上海交通大学以及上海期智研究院的研究团队针对该瓶颈,提出了软硬件协同设计的专用加速框架 Deltoris。该框架敏锐地抓住了机器人高频控制场景中的物理连续性特征——相邻两帧之间的视觉和状态输入往往拥有高达 98% 的冗余。
来自哔哩哔哩(Bilibili)与复旦大学的研究团队在最新论文中提出了 MemeMind 框架,专门针对这一盲区提出了破局方案。MemeMind 的核心亮点在于 参考答案引导的工具轨迹重构 :它在离线阶段利用终局的参考答案,由专门的模块反推所需证据,主动调度异构工具完成检索、裁切与交叉验证。
为此,他们提出了一种名为 OEO (Open-Ended Optimization,开放式优化)的极简范式:框架仅负责严格锁定目标、预算、权限和评测红线,而把“何时收集证据、如何诊断失败、提出何种粒度的修改以及何时停止”的全部过程控制权,彻底交给前沿优化器在线自主编排。
针对这种执行失真,研究团队提出了 TRACE ( Trajectory-Relative Agent Context ComprEssion )框架。该方法抛弃了依靠终局任务成败做逆向归因的粗粒度反馈逻辑,转而在发生压缩的“截断边界”处,通过成对的闭环局部续写来直接度量压缩带来的额外执行退化。
来自 IBM Research 的研究者在论文《Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization》中提出了一个反直觉的疑问: 我们真的必须在目标模型上运行整个搜...
这项工作将这一现象定义为 语义物化 ( Semantic Materialization ),并系统性地提出了面向稀疏事件 KV 服务的“内存契约”(Memory Contract)。
来自 ELLIS、UIUC、Together AI 以及德克萨斯大学奥斯汀分校等机构的联合研究团队,在最新论文中揭开了这一缺失的优化层,并提出了一种专为后训练量身定制的新范式:等谱优化(Isospectral Optimization,简称 ISO)。
面对上述困境,WitCert 提出了极为精巧的几何分解方案,其理论核心建立在对 RoPE 结构的频域洞察之上。研究团队指出,RoPE 在数学本质上是一个关于频率对(Frequency Pairs)的分块对角正交变换。
FutureBridge-OPD:来自美团等机构的研究者在论文《Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation》...
实验结果显示,以 GLM-5.2 作为驱动底座的 OneDayAgent 取得了 0.821 的综合得分,显著超越基准官方测试的各类通用智能体方案。在遵循指令、事实准确性、逻辑完备性等维度,以及无论是否携带多模态附件的测试组中,该方案均取得了全面领先。消融实验进一步证实了各个模块的必要性。
针对这一核心痛点,来自阿里巴巴集团、厦门大学、浙江工商大学和浙江大学的研究团队提出了 Search2Skill 框架。该研究一改过去闭门造车式的反思路线,转向“向外看”(Outward-Looking)的主动探索机制:让模型在感知到自身能力短板时主动调用外部搜索。
研究团队据此提出了 门控后视蒸馏(Gated Hindsight Distillation, 简称 GHD) 。该方法在训练时引入一个参数完全共享的“教师视角”,让它额外观察到下一帧真实截图,从而利用事后诸葛亮式的后验视角为推理与动作重新打分;同时设计了严格的门控机制。
来自蚂蚁集团、普林斯顿大学与斯坦福大学的研究团队在最新论文中给出了截然不同的解法,他们提出了名为 AQuA (Recursively Self-Improving Quantitative Trading Research Agents)的量化投研系统。
由 Scale AI 团队主导的最新研究提出了 HarnessOpt-Bench ,这是业内首个针对“端到端自动化 Harness 优化”建立的标准化评测基准。这项研究跳出了过去各家系统在自选题目、自定规则下的“自嗨式优化”,搭建了一套具备严格隔离防护与预算控制的可信评测协议。
在大模型工程落地的世界里,训练后量化(Post-Training Quantization, PTQ)早已是事实上的行业标准。绝大多数团队在部署开源模型时,都默认 4-bit 权重属于“几乎无损”的安全区,3-bit 往往伴随着不确定性,而 2-bit 则被普遍视为不可用的性能废墟。
针对这一核心矛盾,Alaya Lab 提出了全栈开源的交互式长程视频世界模型 AlayaWorld 。该模型基于约 15B 参数的视频扩散 Transformer(DiT)骨干,能够在 540p 和 720p 分辨率下持续输出 24 fps 的稳定视频。