AI评测

ARAC-Bench:顶会审稿视角评测Auto-Research,最高分仅67.9

针对这一核心断层,来自浙江大学等机构的研究者提出了 ARAC-Bench (Auto-Research's Alignment and Completeness Benchmark)。该基准不再单纯以“最终答案是否匹配”来定胜负,而是将研究过程对齐真实人类科研行为与完整性作为评测核心。

MissionBench:大模型掌舵无人机,人类达84%而最强AI仅35%

从地面到天空,具身智能的技术演进并非仅仅多了一个 轴的高度维度,它实质上对大模型的视点自适应选择、连续位姿动态控制和多阶段任务闭环提出了前所未有的严苛要求。MissionBench 的出现,如同一面清晰的棱镜。

VideoVIBE:从静态代码走向交互视频诊断,V2Lens免微调涨分7.18

来自北京人工智能研究院(BAAI)、北京理工大学、北京工业大学、湖南大学、奥克兰大学、澳门大学和悉尼科技大学等机构的研究团队,针对这一痛点推出了视频真值诊断基准 VideoVIBE,并同步提出了免训练的多智能体协同诊断系统 V2Lens。

超越记忆榜单:科学长文本下的受限上下文恢复与评测真相

为了探索适合科研文献的专门记忆模式,研究团队在论文中提出了名为 Theoria 的三层记忆框架。科研人员阅读文献的过程通常是分层的:底层是具体的实证结果(Evidence),中间是由若干相似方法或流派形成的聚类群落(Community),顶层则是统领性的理论脉络(Theory)。

SteerBench-Work:大模型不是太冒进,而是过度拦截率高达28.1%

SteerBench-Work 最具突破性的设计在于其构建的“证据翻转镜像”(Evidence-Reversed Mirrors)。研究团队选取了最典型的真实事故场景,完整保留其表层的操作危险特征,但将背后的验证状态彻底翻转——补充具备法律效力的授权凭单、合规部门的签名确认、审计日志或明确的业...

医疗Agentic AI最新综述!四大架构解构+557项研究全景映射

论文作者在此提出了一个极其清醒的警示: 基准测试数据表明,多智能体协同并不必然优于经过良好微调的单一强基模型 。如果智能体之间的角色划分缺乏实质性的临床任务映射,所谓的协同很容易退化为多模型输出的机械重叠,甚至会诱发错误观点的虚假共识。

DocOps:最强Agent拿下67%即见顶!210个任务测出文档操作三大软肋

针对这一痛点,中国科学院信息工程研究所等机构的研究团队提出了名为 DocOps 的可验证基准测试框架。该框架将真实办公场景中的文档操作拆解为多层级的能力维度与工作流梯度,并引入了严格基于原生文档结构的代码化确定性验证机制。

DataClawEval:五大引擎100个真实任务,最强Agent得分仅74.9

为了解决这一难题,DataClawEval 团队设计了一套融合“人在回路(Human-in-the-Loop)”的任务重构与验证管线。如上图所示,整套流水线从企业脱敏源码切入。研究人员首先对生产环境的代码片段进行清洗和特征采样,随后借助大模型逆向重构任务意图,并针对性地合成输入测试表。

DrawAI:两阶段Agent重构静态图像,39项指标测评13款前沿模型

为了系统性攻关这一难题,研究团队提出了 DrawAI 框架,构建了一套覆盖四大视觉资产领域、结合确定性规则与多模态大模型裁判的综合评测基准 DrawAI-Bench ,并设计了将感知规划与代码执行拆解的两阶段智能体工作流 DrawAI-Flow 。

微软238万次评测:跨语言Agent看似答对,背后动作策略为何只保留72%?

然而实验结果显示,模型的指令遵循率不足 1%。即便面临违规惩罚,大模型依然顽固地使用英语枢纽来拆解任务。这解释了那近 30% 的策略丢失从何而来:非英语语种被迫引入的翻译转换步骤、由翻译不准确诱发的二次重试、以及从非英语跨越到英语所导致的 Token 消耗与推理路径扭曲。