推理

BDH-CQ:摆脱思维链Token,150M小模型以0.07美分刷爆ARC能效比

这一结果直接穿透了此前由各类前沿大模型与递归求解器构建的成本-精度帕累托前沿(Pareto Frontier),在基准测试的经济性与计算效率上立下了新的标杆。理解 BDH-CQ 的核心,在于厘清它如何打破“上下文适应”与“隐空间深度计算”之间的长期割裂。

SpeedRunner:代码化技能学习,推理成本最高降8倍

该研究提出了一种名为 SpeedRunner 的代码化技能归纳框架,通过将轨迹分析本身定义为编码任务,使智能体能够在纯在线(Online)交互中自动提炼、重构高阶可执行代码技能。实验表明,SpeedRunner 在保持极高任务成功率的同时,将智能体的推理 Token 消耗降低到了基线方案的 到 。

GeoForge:中科院等提出免微调自进化框架,遥感Agent准确率达77%

来自中国科学院与重庆大学的研究团队提出了 GeoForge ,这是一个 免微调(Training-free)、非参数化自进化的地球观测智能体框架 。该研究的核心转变在于:放弃代价高昂且难以持续迭代的模型权重微调,转而在大模型外部构建一套结构化的“三层非参数执行记忆”。

DelegSearchBench:解耦Deep Search能力,调用搜索不等于智能

DelegSearchBench:为了从根源上确立诊断标准,论文正式提出了 委派智能(Delegation Intelligence) 的概念。在深层信息搜寻场景中,模型不应被预设为盲目开启检索的无脑搬运工,检索工具实质上是一种需要权衡调度的外部认知资源。

ERR+:奖赏推理“熵降”,字节新框架提点8.7%且Token缩减20%

针对这一两难困境,字节跳动与华东师范大学的研究团队提出了全新框架 ERR+ 。与以往试图压制熵的做法不同,ERR+ 敏锐地捕捉到一个全新现象: 真正优质且正确的推理链,并不是从头到尾保持低熵,而是在探索之后发生频繁且剧烈的“熵降”(Entropy Drop) 。

CommitKV:区分休眠与完结,让多轮Agent显存直降5倍、推理加速5.6倍

腾讯与厦门大学联合提出的 CommitKV 指出,现存算法的根本症结在于采用了“单点快照式”的重要性评估逻辑:当前轮次注意力权重低的上下文,不代表未来就永远用不上。将“暂时休眠”的背景事实与“已彻底完结”的工具调用混为一谈,会导致关键记忆被过早误删。

Canary Tools:用6类陷阱诊断Agent工具选择,高梯队模型未必更安全

Canary:这项研究表明,工具描述中的“吹嘘”行为是一种极其危险的系统性隐患。哪怕是公认最聪明的基础模型,也会被带有“高级”、“全功能”标签的工具误导。因此,在平台层对工具的描述进行格式化清洗、限制夸大修辞,并对重叠功能的工具实行严格的颗粒度约束,应当成为基础设施建设的标准规范。