AI Agent 第5页

AgentGUI:苏黎世联邦理工开源长程Agent控制台,排查提速38%

为了让多智能体协作具备直观的实体感,AgentGUI 引入了“虚拟工位(Desk)”的设计隐喻。在系统主面板中,各个并发运行的任务被抽象为一个像素风格的虚拟办公室,每一个独立的 Agent 都拥有专属的“办公桌”。用户发起新任务只需点击空工位、输入指令并拖入上下文文件。

医疗Agentic AI最新综述!四大架构解构+557项研究全景映射

论文作者在此提出了一个极其清醒的警示: 基准测试数据表明,多智能体协同并不必然优于经过良好微调的单一强基模型 。如果智能体之间的角色划分缺乏实质性的临床任务映射,所谓的协同很容易退化为多模型输出的机械重叠,甚至会诱发错误观点的虚假共识。

AttriMem:Token级归因切入过程反馈,破解Agent记忆学习瓶颈

来自浙江大学等机构的研究团队提出了 AttriMem ,这是一种通过归因技术提取过程反馈的 Agent 记忆学习框架。其核心思想在于:不再将记忆动作当成黑盒,而是利用最终答案的变化反向推导中间记忆中具体到 Token 级别的贡献,将全局结果奖励与局部过程奖励深度融合。

DocOps:最强Agent拿下67%即见顶!210个任务测出文档操作三大软肋

针对这一痛点,中国科学院信息工程研究所等机构的研究团队提出了名为 DocOps 的可验证基准测试框架。该框架将真实办公场景中的文档操作拆解为多层级的能力维度与工作流梯度,并引入了严格基于原生文档结构的代码化确定性验证机制。

GAUGE:大模型做金融估值为何建表93分、商业判断仅78分?

为打破这一死结,研究团队提出了针对 Agent 端到端金融估值建模的全新评测基准 GAUGE 。该基准不再依赖单一分析师的单点数值,而是构建了基于行业实践分布的“三层观察实践包线”(Observed-Practice Envelope),结合 56 个细粒度可审计切面与 8 道有效性门控。

VulAgentRL:以代码图为验证器,7B模型跨过程漏洞检测超越Opus

为了打破这一僵局,来自新加坡政府技术局(GovTech)、哈尔滨工业大学与新加坡管理大学的研究团队提出了 VulAgentRL。该框架没有盲目依赖更长的上下文窗口去粗暴内联调用图,而是将漏洞挖掘形式化为一个具备主动工具探索能力的智能体强化学习任务。

GS-Agent:不是预测像素而是驱动仿真,多智能体自主构建4D物理世界

当业界试图通过堆叠更大的参数量和海量视频来“强行内化”物理规律时,来自马萨诸塞大学等机构的研究团队提出了一条截然不同的解决路径: 不要让基础模型去硬猜物理规律,而应当让它扮演数字化身,以“代码”为媒介,直接调度确定性的物理仿真引擎。

SceneActBench:看懂3D不等于能动手?11款顶尖VLM实测最高仅50.2分

SceneActBench 摒弃了纯文本问答与粗粒度成败反馈,直接构建了一套端到端的无头 Blender 执行评测回路。整个评测回路高度标准化且对环境实施了严格的“防信息泄漏”处理。原始资产往往会在文件命名、初始坐标或元数据节点中无意识泄露真实位置与尺寸。

WorkSurface-Bench:选对知识源依然答不对!路由达99%但正确率仅56%

针对这一症结,来自北京大学、中国科学院大学与中关村实验室的研究团队提出了全新的评测基准 WorkSurface-Bench 。该工作将非结构化文档、结构化表格与文件关系图统称为“知识表面”(Surface),并在企业真实工作区语境下构建了 1,151 个高质可审计任务。

快手A/B Agent:分层经验树闭环调优,实测线上GMV提升4.829%

A/B Agent 的首要突破,在于打破了以往将 A/B 测试报告作为独立文档进行索引的粗暴做法,构建了一套 分层策略经验树 (Hierarchical Strategy Experience Tree)。在工业系统中,一份历史实验报告往往混杂着多次策略变动、中间失败的调参参数和复杂的综合指标...

MSEval:多智能体从零写代码,换个组织架构分差竟超30分!

针对这一盲区,最新研究提出了多智能体从零代码构建评测基准 MSEval 。该基准将“协作拓扑(Coordination Topology)”提升为评测的核心自变量,在统一的项目需求、模型底座与自动化部署测试流水线下,系统性测试了 10 种不同的团队组织模式。

AtumAI:从自然语言到数据中心控制面策略,性能超越专家手工设计

为了打破这一困局,研究人员提出了面向数据中心控制面策略生成的结构化框架 AtumAI 。该框架通过前端的“任务编译器”与后端的“演化设计发现循环”,将自然语言需求自动转化为具备严格约束保障的中间表示,并通过扩散模型、演化算法与代理模型的协同配合,实现了系统化的全局策略搜索。

CADIR:跨软件可编辑中间表示,三大CAD环境节点重建率达100%

特别针对困扰业界的拓扑选择难题,CADIR 提出了结构化的语义选择器语法: {% raw %} {% endraw %} 该选择器通过显式指定目标类型 (点、边、面)、空间或几何参考原点 、邻接遍历算子 、几何谓词过滤条件 以及确定性序关系 ,彻底终结了“在未排序边列表中盲选第一项”的不可控操作。

DataClawEval:五大引擎100个真实任务,最强Agent得分仅74.9

为了解决这一难题,DataClawEval 团队设计了一套融合“人在回路(Human-in-the-Loop)”的任务重构与验证管线。如上图所示,整套流水线从企业脱敏源码切入。研究人员首先对生产环境的代码片段进行清洗和特征采样,随后借助大模型逆向重构任务意图,并针对性地合成输入测试表。

DrawAI:两阶段Agent重构静态图像,39项指标测评13款前沿模型

为了系统性攻关这一难题,研究团队提出了 DrawAI 框架,构建了一套覆盖四大视觉资产领域、结合确定性规则与多模态大模型裁判的综合评测基准 DrawAI-Bench ,并设计了将感知规划与代码执行拆解的两阶段智能体工作流 DrawAI-Flow 。