AI Agent 第10页

PlayWorld:用Agent玩家测9大世界模型,揭示长程演化致命短板

针对这一困境,研究团队提出了首个以智能体玩家模拟人类闭环交互的世界模型评测基准——PlayWorld。该基准构建了 171 个带有明确长程目标的交互场景,引入具备多模态感知能力的 Agent Player 实时调整控制策略,并设立了多维度的视觉问答打分规程(VQA Rubric Verifier)。

ReCache:解耦跨工具注意力,KV显存缩减92.4%且首字提速3.6倍

针对这一瓶颈,来自东方理工大学、上海交通大学与西安交通大学的研究团队提出了 ReCache 。该框架通过三大递进机制打破了工具调用的缓存困局:用“资源级注意力”切断不同工具之间的横向交互,赋予每个工具完全独立的局部坐标,使其 KV 块具备天然的组合不变性。

SCAFFOLD:打破两层浅层抽象,递归技能蒸馏让Web Agent狂飙17分

针对这些根本缺陷,来自 MBZUAI、麦吉尔大学等机构的研究团队提出了 SCAFFOLD 框架。通过多实例参数化抽象、递归组合、基于最小描述长度(MDL)的库压缩,以及周期性的权重蒸馏,SCAFFOLD 彻底打通了从“动作轨迹”到“深层程序抽象”再到“模型内生能力”的自进化闭环。

SHAPER:不改权重也能自进化!微软演化技能与脚手架超越微调10.5分

来自微软研究院和东北大学的研究团队在最新论文中提出了一个跳出传统思路的解法: SHAPER 。该框架指出,现代具身智能体本质上是一个围绕基座模型构建的复杂系统,其执行表现不仅由模型权重决定,更受外部程序化指导(技能 Skill)以及上下文组织代码(脚手架 Harness)的直接制约。

E-Bench:从单步调API到真实状态流转,顶尖Agent可靠性为何不足60%?

为了兼顾环境的逼真度与评测的完全可控性,E-Bench 采取了“全合成(Fully Synthetic)”的底层设计方案,并提出了核心原则: 将环境合成与任务合成彻底解耦 。许多传统合成评测往往采用“为任务定制快照”的做法,每个问题只拼装一组恰好够用的局部模拟数据。

HyGAE:统一Critic兼顾Token与轮次,多轮VLM决策胜率达到91%

研究者从理论上严格证明了 Token 级与轮次级强化学习在策略梯度目标上的数学等价性,并在此基础上提出了全新的 HyGAE 框架。该框架不仅巧妙融合了两者的优势估计,还通过理论证明消解了训练两个独立价值网络的算力负担。

不用外挂小模型:Self-Speculation让工具预判命中率达66.3%

针对这一系统性难题,该研究团队提出了 Self-speculating Agent(自推测智能体) 。他们放弃了外部小模型,直接让部署的目标智能体自身兼任“推测者”,在单一模型内通过联合强化学习(Joint Agent-Speculator RL)同时学会“任务解决”与“自我预测”。