ForestBench:告别裁判大模型,用参考森林实现多智能体毫秒级评测
来自中国科学院、西南大学和腾讯的研究团队在论文中提出了全新评测基准 ForestBench 。该方案跳出了大模型主观判分的窠臼,将异构的多智能体原生执行轨迹映射到统一的有向无环协作图(DAG)空间中,并提出了“参考森林”(Reference Forest)的概念。
来自中国科学院、西南大学和腾讯的研究团队在论文中提出了全新评测基准 ForestBench 。该方案跳出了大模型主观判分的窠臼,将异构的多智能体原生执行轨迹映射到统一的有向无环协作图(DAG)空间中,并提出了“参考森林”(Reference Forest)的概念。
FrontierFinance:他们提出了“细粒度、源头可归因准则”(Source-Attributed Rubrics)评分机制。每一个复杂查询都被专业金融专家拆解为数个到数十个必须满足的事实判断准则,总计构成了 11,543 条二元判据。
西北工业大学与清华大学的研究团队提出了 Act2Intention 框架,首次系统性地构建了覆盖“意图理解(Understanding) 意图预测(Prediction) 经验执行(Execution)”全链路的主动式移动智能体体系。
为了精准刻画并探究这一瓶颈,阿里巴巴集团联合清华大学提出了面向通用移动智能体的高难度基准 GMA(General Mobile Assistants)。这项研究不仅构建了一个包含 7 款深度定制开源应用的多样化 Android 仿真生态,还设计了横跨四个难度层级的 300 项真实评估任务。
为了搞清楚研发过程中的增益与损失发生在何处,研究团队将 Agent 的研发闭环显式拆解为三大正交的能力维度: 1. 方案构想(Solution Framing, C1) :衡量模型在最开始能否提出合理、有潜力的优化假设。
为了全面覆盖机械工程设计流程,CADWorld 系统梳理了机械设计与制造领域的系统知识,构建了涵盖 11 个工作流类别的任务分类学(Taxonomy)。基准包含的 200 个任务覆盖了 183 个具体机械知识点。
TimeSage-EV:目前大模型社区在时序理解上的评测,大多遵循类似 ChatTime-TSQA 或 TSRBench 的思路:给定一段历史数值曲线,向模型提出几个关于极大值、极小值、平均趋势或简单周期的定点问题。另一些通用智能体基准虽然引入了代码执行、网页检索和工具调用,却很少将时间演进作...
为了拆开这个黑盒,全新基准测试 ClawTrack 提出了一套“双轨评估”(Dual-assessment)框架:不仅看智能体达成了什么(Task Score,任务分),更要逐轮打分衡量它是如何达成的(Process Score,过程分)。
针对这两个根因,研究团队提出了名为 FACT (Force-Aware Contact-Rich Manipulation via Timestep Modulation)的框架,无需修改网络骨干或增加数据,仅凭噪声调度重分配与时间感知力注入。
通过前置依赖与执行轨迹反向合成管线,GABench 构建了包含 10,400 个兼具复杂性与可验证标准答案的端到端 Agent 任务。实验评估了包含 Qwen3-235B、GLM-5-turbo、DeepSeek-V4-pro、GPT-5-mini 等在内的前沿模型。
面对这种隐蔽而危险的群体性误导,传统的过滤门禁与只看讨论记录的法官模型几乎全线失效,而研究团队提出的“独立裁判(Referee)”机制,通过在会后向模型发起一次私下重质询(Private Re-query),以非介入式的干预信号切断了虚假的从众效应,为多智能体系统的临床安全治理提供了极其关键的...
ParaRecover:为了对模型在执行过程中的表现进行多维切片,研究团队提出了 SDE 评估细则(SDE Rubric) ,将评测视角由单一维度的二元对错,拆解为三个互为补充的核心支柱: - 结构完整性(Structural Integrity, SI) :评估模型是否能准确维持合法的 DA...
针对这一前沿交叉地带,一项名为 ABLE (Agentic BAIM–LLM Evaluation)的评估基准正式提出。该基准专门设计用于测试大模型智能体调用专业生物 AI 工具完成蛋白质设计全流程的能力。
来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D 。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 25,000 条多视角真值视频。
很多团队寄希望于“等待下一代更强的前沿大模型来解决一切”,而企业级商业分析 Agent 公司 Leni 提出的研究却给出了不同的视角: 大模型的可靠性并不主要依赖模型本身的智商跃迁,而是取决于包裹在模型外部的架构设计 。
AppSim-Bench 专门设计了 183 个包含数值推理属性的子任务,涵盖四类具体操作: - 计数(Counting) :需要连续滑动并统计界面上符合条件的卡片或列表项总数; - 算术计算(Arithmetic Calculation) :需要抓取多个控件中的数值并进行加减折算。
针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench 。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Probe Task)为核心的受控历史序列。
基于这一观察,作者提出了名为探针过滤引导训练(Probe-Filtered Bootstrapped Training, PBT)与探针引导重排(Probe-Guided Reranking, PGR)的完整框架,并构建了难度分级的真实评测基准 ParamBench。
来自北京理工大学、北京交通大学和中国人民大学的研究团队提出了 WebGrader ,针对上述痛点提供了一种全新解法:他们将开放式网页生成的强化学习表述为一个 可执行奖励构建(Executable Reward Construction) 问题。
MobileJudgeBench:研究团队提出的第一个现实检验场景是: 裁判质量的提升,是否能真实保全 Agent 之间的排名关系?如果在基准测试中,裁判给出略带偏差的分数,是否会导致排行榜名次完全颠覆?
Harbor-Index:为了确保转译过程不破坏基准原有的评测语义,研究团队并未采取粗暴的代码重写,而是设计了由自动化检查、初审和终审构成的三阶段人工代码审查机制,累计在 GitHub 上产生了超过一万条审核讨论;同时在原版环境与 Harbor 适配版本之间运行严格的等价性(Parity)对比实验。
针对这一困境,来自 NVIDIA 与加利福尼亚大学圣克鲁兹分校(UC Santa Cruz)的研究团队提出了 BaT(Benchmark-as-Teacher) 。该方法颠覆了传统基准测试只作为静态考卷的固有定位,将其转变为指导智能体自我进化的动态基础设施。
基于这些长周期数据,EgoMonth 提出了一个受到认知心理学与工作记忆理论启发的 14 任务评估体系,将其清晰地划分为由浅入深的三个认知层级: 1. 图式巩固(Schema Consolidation) :评估模型从长时间高度冗余的生活记录中提取稳定行为模式与统计规律的能力。
来自斯坦福大学(Stanford University)、Prentis AI 以及 Titan Holdings 的联合研究团队在最新工作中提出了 AutoResearchEval 评测基准与实证失效分类法 ARFT (AutoResearch Failure Taxonomy)。