AI评测 第2页

ForestBench:告别裁判大模型,用参考森林实现多智能体毫秒级评测

来自中国科学院、西南大学和腾讯的研究团队在论文中提出了全新评测基准 ForestBench 。该方案跳出了大模型主观判分的窠臼,将异构的多智能体原生执行轨迹映射到统一的有向无环协作图(DAG)空间中,并提出了“参考森林”(Reference Forest)的概念。

GMA:评测8大前沿模型,真实手机工作流成功率为何全线跌破20%?

为了精准刻画并探究这一瓶颈,阿里巴巴集团联合清华大学提出了面向通用移动智能体的高难度基准 GMA(General Mobile Assistants)。这项研究不仅构建了一个包含 7 款深度定制开源应用的多样化 Android 仿真生态,还设计了横跨四个难度层级的 300 项真实评估任务。

TimeSage-EV:首个动态时序智能体基准,大模型归因预测不足47分

TimeSage-EV:目前大模型社区在时序理解上的评测,大多遵循类似 ChatTime-TSQA 或 TSRBench 的思路:给定一段历史数值曲线,向模型提出几个关于极大值、极小值、平均趋势或简单周期的定点问题。另一些通用智能体基准虽然引入了代码执行、网页检索和工具调用,却很少将时间演进作...

医疗多智能体被两个同伴带偏38%?独立裁判用私下质询破解从众陷阱

面对这种隐蔽而危险的群体性误导,传统的过滤门禁与只看讨论记录的法官模型几乎全线失效,而研究团队提出的“独立裁判(Referee)”机制,通过在会后向模型发起一次私下重质询(Private Re-query),以非介入式的干预信号切断了虚假的从众效应,为多智能体系统的临床安全治理提供了极其关键的...

RoboPhys-3D:用3D重建解耦生成误差,Cosmos拿下92.7%真值表现

来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D 。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 25,000 条多视角真值视频。

AppSim-Bench:告别真机随机噪音,19个手机Agent最高成功率仅50.27%

AppSim-Bench 专门设计了 183 个包含数值推理属性的子任务,涵盖四类具体操作: - 计数(Counting) :需要连续滑动并统计界面上符合条件的卡片或列表项总数; - 算术计算(Arithmetic Calculation) :需要抓取多个控件中的数值并进行加减折算。

不是经验越多就越聪明:PATH-Bench揭示终身智能体的路径依赖困境

针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench 。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Probe Task)为核心的受控历史序列。

WebGrader:可执行评测自进化,8B模型网页生成逆袭480B巨兽

来自北京理工大学、北京交通大学和中国人民大学的研究团队提出了 WebGrader ,针对上述痛点提供了一种全新解法:他们将开放式网页生成的强化学习表述为一个 可执行奖励构建(Executable Reward Construction) 问题。

Harbor-Index:统一54个Agent基准,最强模型通过率仅28%

Harbor-Index:为了确保转译过程不破坏基准原有的评测语义,研究团队并未采取粗暴的代码重写,而是设计了由自动化检查、初审和终审构成的三阶段人工代码审查机制,累计在 GitHub 上产生了超过一万条审核讨论;同时在原版环境与 Harbor 适配版本之间运行严格的等价性(Parity)对比实验。

NVIDIA提出BaT:以评测为师分阶段强化,9B模型超越Claude Opus

针对这一困境,来自 NVIDIA 与加利福尼亚大学圣克鲁兹分校(UC Santa Cruz)的研究团队提出了 BaT(Benchmark-as-Teacher) 。该方法颠覆了传统基准测试只作为静态考卷的固有定位,将其转变为指导智能体自我进化的动态基础设施。

EgoMonth:首个跨月第一人称长视频基准,最强模型落后人类22.4%

基于这些长周期数据,EgoMonth 提出了一个受到认知心理学与工作记忆理论启发的 14 任务评估体系,将其清晰地划分为由浅入深的三个认知层级: 1. 图式巩固(Schema Consolidation) :评估模型从长时间高度冗余的生活记录中提取稳定行为模式与统计规律的能力。