AI Agent 第2页

深度研究Agent剪枝:位置比算法更关键,Token消耗降低73%

无论是各类商业化的研究助手,还是开源社区构建的自动化研究流水线,都在尝试让大语言模型处理极其开放且复杂的调研任务。然而,这类长程(Long-horizon)任务普遍伴随着极其高昂的计算代价:智能体沿着分解出的子问题不断发起检索、抽取网页、发散分支,上下文体积呈现雪崩式膨胀。

SHE:解耦四大安全工件,大模型Agent安全脚手架实现轨迹自进化

针对这一瓶颈,复旦大学、上海人工智能实验室、上海交通大学与香港科技大学联合提出了安全脚手架演化框架—— SHE (Safety Harness Evolution)。该研究首次将 Agent 的安全外围系统确立为能够通过历史执行轨迹自主迭代进化的动态系统。

ArbiGraph:单任务近满分,为何分支任务会让智能体准确率大跌33%?

针对这一空白,研究人员提出了 ArbiGraph ,一个能够任意扩展、拓扑结构可控且完全可自动验证的评测基准生成器。通过将任务形式化为强类型的有向无环图(DAG),ArbiGraph 能够剥离单任务解题能力的干扰,专门诊断智能体在不同数据流拓扑下的上下文管理瓶颈。

CodeRescue:代码报错不必换大模型,35%成本超越全量升级

针对这一症结,来自亚马逊、字节跳动、纽约大学与华盛顿大学的研究团队提出了名为 CodeRescue 的后失败恢复路由框架。该工作颠覆了“失败即升级”的固有认知,将代码执行失败后的应对机制建模为跨异构动作的决策路由,并引入共形风险控制(Conformal Risk Control, CRC)实现...

EvoDRC:让大模型自主修芯片!技能演化框架把版图违规降低73.5%

近期发表的研究提出了 EvoDRC 框架,试图打破这一僵局。该方案将大模型(LLM)驱动的智能体系统引入块级(Block-level)DRC 自动化修复,并提出了一套“技能自演化”(Skill-Evolution)机制:利用外部不相关设计冷启动初始经验,并在目标芯片的实际修复中沉淀、筛选与重构...

SlotGuard:告别暴力打码,Agent凭据泄露归零且成功率不崩的新架构

伊利诺伊大学厄巴纳-香槟分校(UIUC)的研究团队提出的 SlotGuard ,试图从根源上打破“要隐私就丧失能力”的零和博弈。该方案在本地运行时与云端模型之间构建了一道极轻量的拦截边界:它既不依赖云端合规承诺,也不搞破坏语义的粗暴打码。

MissionBench:大模型掌舵无人机,人类达84%而最强AI仅35%

从地面到天空,具身智能的技术演进并非仅仅多了一个 轴的高度维度,它实质上对大模型的视点自适应选择、连续位姿动态控制和多阶段任务闭环提出了前所未有的严苛要求。MissionBench 的出现,如同一面清晰的棱镜。