AgentGUI:苏黎世联邦理工开源长程Agent控制台,排查提速38%
为了让多智能体协作具备直观的实体感,AgentGUI 引入了“虚拟工位(Desk)”的设计隐喻。在系统主面板中,各个并发运行的任务被抽象为一个像素风格的虚拟办公室,每一个独立的 Agent 都拥有专属的“办公桌”。用户发起新任务只需点击空工位、输入指令并拖入上下文文件。
为了让多智能体协作具备直观的实体感,AgentGUI 引入了“虚拟工位(Desk)”的设计隐喻。在系统主面板中,各个并发运行的任务被抽象为一个像素风格的虚拟办公室,每一个独立的 Agent 都拥有专属的“办公桌”。用户发起新任务只需点击空工位、输入指令并拖入上下文文件。
论文作者在此提出了一个极其清醒的警示: 基准测试数据表明,多智能体协同并不必然优于经过良好微调的单一强基模型 。如果智能体之间的角色划分缺乏实质性的临床任务映射,所谓的协同很容易退化为多模型输出的机械重叠,甚至会诱发错误观点的虚假共识。
来自浙江大学等机构的研究团队提出了 AttriMem ,这是一种通过归因技术提取过程反馈的 Agent 记忆学习框架。其核心思想在于:不再将记忆动作当成黑盒,而是利用最终答案的变化反向推导中间记忆中具体到 Token 级别的贡献,将全局结果奖励与局部过程奖励深度融合。
来自佛罗里达州立大学(Florida State University)的研究团队在一篇前沿工作中直击这一痛点,提出了 ConsistencyGate 。这是一个基于自洽性(Self-Consistency)准入控制的写入网关:它不依赖任何模型微调,也不去改变检索和淘汰逻辑,而是在事实准备写入...
为了打破这种“能力虚标”的死循环,一项针对智能体评测有效性的研究正式提出了 协议有效性(Protocol Validity) 的理论框架,并开发出无需人工盯梢的事后审计系统 HackDetect 。
针对这一痛点,中国科学院信息工程研究所等机构的研究团队提出了名为 DocOps 的可验证基准测试框架。该框架将真实办公场景中的文档操作拆解为多层级的能力维度与工作流梯度,并引入了严格基于原生文档结构的代码化确定性验证机制。
为打破这一死结,研究团队提出了针对 Agent 端到端金融估值建模的全新评测基准 GAUGE 。该基准不再依赖单一分析师的单点数值,而是构建了基于行业实践分布的“三层观察实践包线”(Observed-Practice Envelope),结合 56 个细粒度可审计切面与 8 道有效性门控。
为了打破这一僵局,来自新加坡政府技术局(GovTech)、哈尔滨工业大学与新加坡管理大学的研究团队提出了 VulAgentRL。该框架没有盲目依赖更长的上下文窗口去粗暴内联调用图,而是将漏洞挖掘形式化为一个具备主动工具探索能力的智能体强化学习任务。
当业界试图通过堆叠更大的参数量和海量视频来“强行内化”物理规律时,来自马萨诸塞大学等机构的研究团队提出了一条截然不同的解决路径: 不要让基础模型去硬猜物理规律,而应当让它扮演数字化身,以“代码”为媒介,直接调度确定性的物理仿真引擎。
来自复旦大学、伦敦玛丽女王大学与中关村学院的联合研究团队提出了 OrchBench ,这是首个通过确定性仿真(Deterministic Simulation)将多智能体编排决策与实际执行完全解耦的评测基准。
最新提出的 PATS (Policy-Aware Training Scaffolding)框架提供了一种截然不同的解法:它不再把外部技能当成推理资产,而是将其重构为 随模型能力演化、在部署时完全剥离的“动态训练脚手架” 。
SceneActBench 摒弃了纯文本问答与粗粒度成败反馈,直接构建了一套端到端的无头 Blender 执行评测回路。整个评测回路高度标准化且对环境实施了严格的“防信息泄漏”处理。原始资产往往会在文件命名、初始坐标或元数据节点中无意识泄露真实位置与尺寸。
为了填补这一评测空白,最新研究提出了 SciExplore 。该基准将真实的科研信息搜寻抽象为一个渐进的认知阶梯,涵盖跨 10 多个学科的 103 项博士级深度任务,系统性评测大模型从最底层的实体推理到顶层的领域级结构化知识合成能力。
针对端侧 Agent 在算力成本、可靠性与云端协同之间的多重冲突,研究团队提出了名为 TSDS (Think Short, Defer Smart,意为“短思考、巧转交”)的协同框架。
针对这一症结,来自北京大学、中国科学院大学与中关村实验室的研究团队提出了全新的评测基准 WorkSurface-Bench 。该工作将非结构化文档、结构化表格与文件关系图统称为“知识表面”(Surface),并在企业真实工作区语境下构建了 1,151 个高质可审计任务。
A/B Agent 的首要突破,在于打破了以往将 A/B 测试报告作为独立文档进行索引的粗暴做法,构建了一套 分层策略经验树 (Hierarchical Strategy Experience Tree)。在工业系统中,一份历史实验报告往往混杂着多次策略变动、中间失败的调参参数和复杂的综合指标...
来自四川大学、电子科技大学等机构的研究团队提出了 Active-SWE ,这是首个系统评测 Coding Agent 在 脱离 Issue 报告前提下 进行“主动找 Bug 并修复”(Proactive Bug Fixing)的基准平台。
针对这一盲区,最新研究提出了多智能体从零代码构建评测基准 MSEval 。该基准将“协作拓扑(Coordination Topology)”提升为评测的核心自变量,在统一的项目需求、模型底座与自动化部署测试流水线下,系统性测试了 10 种不同的团队组织模式。
为了打破这一困局,研究人员提出了面向数据中心控制面策略生成的结构化框架 AtumAI 。该框架通过前端的“任务编译器”与后端的“演化设计发现循环”,将自然语言需求自动转化为具备严格约束保障的中间表示,并通过扩散模型、演化算法与代理模型的协同配合,实现了系统化的全局策略搜索。
特别针对困扰业界的拓扑选择难题,CADIR 提出了结构化的语义选择器语法: {% raw %} {% endraw %} 该选择器通过显式指定目标类型 (点、边、面)、空间或几何参考原点 、邻接遍历算子 、几何谓词过滤条件 以及确定性序关系 ,彻底终结了“在未排序边列表中盲选第一项”的不可控操作。
针对这一核心痛点,最新研究提出的 CoEvoKG 框架给出了一个极具启发性的闭环解法: 将知识图谱(Knowledge Graph, KG)同时作为可验证训练任务的“发生器”与智能体进化的“永久证据记忆库” 。
针对这一困境,开源研究项目 Crayotter 提出了全新范式: GRPB(Group-Relative Preference Backpropagation,组内相对偏好反向传播) 。
为了解决这一难题,DataClawEval 团队设计了一套融合“人在回路(Human-in-the-Loop)”的任务重构与验证管线。如上图所示,整套流水线从企业脱敏源码切入。研究人员首先对生产环境的代码片段进行清洗和特征采样,随后借助大模型逆向重构任务意图,并针对性地合成输入测试表。
为了系统性攻关这一难题,研究团队提出了 DrawAI 框架,构建了一套覆盖四大视觉资产领域、结合确定性规则与多模态大模型裁判的综合评测基准 DrawAI-Bench ,并设计了将感知规划与代码执行拆解的两阶段智能体工作流 DrawAI-Flow 。