AI Agent

AgentOPSD:清华美团提出递归自蒸馏,ALFWorld成功率达89.1%

针对这一困境,美团、清华大学与浙江大学的研究团队提出了 AgentOPSD 。该方法不增加任何独立的 Critic 价值网络,也不引入额外的环境采样交互(Rollouts),而是通过在对数几率(Log-odds)空间内递推更新贝叶斯信念状态,将稀疏的轨迹级奖励重塑为细粒度的轮次级信用。

HLSmith:给大模型装上硬件专家直觉,C转HLS实现4.24倍加速与100%仿真通过

他们提出的 HLSmith 框架将 C 到 HLS 的转换重新定义为“硬件微架构演进”,而非单纯的“代码翻译”。该框架不仅提炼了硬件专家优化技巧并将其模块化、守卫化(guarded recipes),还通过分阶段编译反馈与模型适配策略,让 LLM 能够像资深硬件工程师一样逐步重构代码。

Skill-Use:给大模型装上技能库,为何最高分只有0.61?

这项工作提出了首个专门评估渐进式披露机制下智能体技能调用能力的基准—— Skill-Use 。在覆盖 9 大领域的 177 个真实任务测试中,即便集结了业内最顶尖的前沿模型(包括 GPT-5.5、Claude Opus 4.8 等),最强组合下的综合技能使用评分(SU Score)也仅达到 。

SkillHEX:假设驱动树搜索破除利用陷阱,技能自演化通过率达57.9%

针对这一顽疾,来自微软、不列颠哥伦比亚大学、加州大学圣迭戈分校与中国科学技术大学的研究团队提出了名为 SkillHEX 的全新闭环自演化框架。该方案打破了传统的单线盲目试错范式,将科学研究中的“假设检验”思想引入技能排错,并结合非对称的树搜索机制。

TraceCompiler:将Agent轨迹编译为确定性工作流,API调用缩减68%

针对这一困境,研究人员提出了 TraceCompiler 。这项工作的核心构想是将 Agent 在多次探索中留下的嘈杂、混乱的执行轨迹(Traces),通过无监督聚类、行为去噪和严格的数据流依赖分析,“离线编译”为结构清晰、高确定性且可直接执行的工作流代码。

WeClawArena:跨用户协作Agent为何频遭越权?

来自亚利桑那州立大学(ASU)、卡耐基梅隆大学(CMU)与南加州大学(USC)的研究团队联合提出了 WeClawArena 。这是首个面向以人为中心的智能体网络、针对跨用户私有工作区协作与安全性展开全链路评测的可审计基准与运行时沙箱。

SkillSV:用结构感知Shapley为Agent技能定价,实现无损安全剪枝

为了解开这个黑盒,来自微软、南京航空航天大学、合肥大学与鹏城实验室的联合研究团队提出了 SkillSV (Structure-Aware Shapley Valuation)。该框架首次将结构感知引入博弈论中的 Shapley 值定价体系,把复杂的技能文档编译为受约束的合作博弈结构。

SpeedRunner:代码化技能学习,推理成本最高降8倍

该研究提出了一种名为 SpeedRunner 的代码化技能归纳框架,通过将轨迹分析本身定义为编码任务,使智能体能够在纯在线(Online)交互中自动提炼、重构高阶可执行代码技能。实验表明,SpeedRunner 在保持极高任务成功率的同时,将智能体的推理 Token 消耗降低到了基线方案的 到 。

CTBench:华为等评估电信运维智能体,揭示大模型“答对答案却无证据”

针对这一脱节现状,来自华为技术有限公司与伦敦玛丽女王大学的研究团队提出了专门针对电信网络排障能力的智能体基准评测集 CTBench 。这项包含 234 个由一线电信专家深度构建与验证的任务评测揭示了一个耐人寻味且值得警惕的现实:当前最前沿的智能体组合在简单的端点识别上表现亮眼。

GeoForge:中科院等提出免微调自进化框架,遥感Agent准确率达77%

来自中国科学院与重庆大学的研究团队提出了 GeoForge ,这是一个 免微调(Training-free)、非参数化自进化的地球观测智能体框架 。该研究的核心转变在于:放弃代价高昂且难以持续迭代的模型权重微调,转而在大模型外部构建一套结构化的“三层非参数执行记忆”。