ARAC-Bench:顶会审稿视角评测Auto-Research,最高分仅67.9
针对这一核心断层,来自浙江大学等机构的研究者提出了 ARAC-Bench (Auto-Research's Alignment and Completeness Benchmark)。该基准不再单纯以“最终答案是否匹配”来定胜负,而是将研究过程对齐真实人类科研行为与完整性作为评测核心。
针对这一核心断层,来自浙江大学等机构的研究者提出了 ARAC-Bench (Auto-Research's Alignment and Completeness Benchmark)。该基准不再单纯以“最终答案是否匹配”来定胜负,而是将研究过程对齐真实人类科研行为与完整性作为评测核心。
为此,他们提出了 叙事承诺保持 (Narrative Commitment Preservation,简称 NCP)的形式化框架,并构建了包含 100 个基于经典电影情节的环境基准 NCP-Bench 。评测结果揭示了一个残酷的事实:文笔出众并不等于具备长程逻辑鲁棒性。
由百度、上海交通大学、西安交通大学与中关村学院等机构组成的联合研究团队,针对这一长期困扰 AI for Science 的根本瓶颈,提出了名为 Janus 的算法与评估器协同演化框架。
KVDiagnosis:为了让长文本推理在有限的硬件上跑得通,工业界与学术界提出了五花八门、令人眼花缭乱的 KV Cache 压缩算法,涵盖 Token 驱逐、层/头动态分配、通道剪枝、低比特量化以及语义块合并等不同技术路线。
该工作不仅建立了一个包含 3,000 个经过真实 API 执行验证的高质量中文测试集,更首次提出了能够实现自我迭代演进的双阶段闭环构建框架 PCCF(PluginEval Closed-Loop Construction Framework)。
RealisticTritonBench:实验结果给大模型在底层系统优化上的应用浇了一盆冷水:即使是当前最顶尖的推理与代码模型,在真实系统环境下的综合任务成功率最高也仅有 25.81%,全模型平均成功率低至 18.71%。
AhaBench:研究团队设计了一个三联记分卡机制: 1. 初始得分(Initial Score, ) :模型在没有经验时的“冷启动”能力。2. 经验后得分(Post-Experience Score, ) :经历过相关教学、过往解题轨迹或经营历史后,在 去除了显式提示或改变了测试条件 的新环...
从地面到天空,具身智能的技术演进并非仅仅多了一个 轴的高度维度,它实质上对大模型的视点自适应选择、连续位姿动态控制和多阶段任务闭环提出了前所未有的严苛要求。MissionBench 的出现,如同一面清晰的棱镜。
MMShopBench:在交互工具层面,沙盒为 Agent 提供了两项互补的检索手段: 1. 基于 BM25 的文本检索 :覆盖商品标题、属性、类目及店铺字段,在用户以自然语言明确提出品牌、材质、特定型号等参数时发挥主要作用。
最新提出的基准测试 PAUSE (Personal AI Assistants in Unified Service Environments)直截了当地揭穿了这种繁荣表象:在包含持久化用户状态、严格权限隔离和动态系统配置的真实个人服务环境中,即便是当前最强大的前沿模型,在涉及状态推理与配置感...
来自亚利桑那州立大学(Arizona State University)与独立研究者的最新工作提出了 AndroidReality 。该工作没有止步于笼统地感叹“现实很残酷”,而是从马尔可夫决策过程(MDP)的形式化视角出发。
针对这一断层,来自韩国京畿道教育研究院、印第安纳大学、高丽大学等机构的研究团队提出了 EduClaw-Bench 。这是首个将智能体导师置于 30 天连续虚拟教学环境中的长周期评测基准。
来自北京人工智能研究院(BAAI)、北京理工大学、北京工业大学、湖南大学、奥克兰大学、澳门大学和悉尼科技大学等机构的研究团队,针对这一痛点推出了视频真值诊断基准 VideoVIBE,并同步提出了免训练的多智能体协同诊断系统 V2Lens。
为了探索适合科研文献的专门记忆模式,研究团队在论文中提出了名为 Theoria 的三层记忆框架。科研人员阅读文献的过程通常是分层的:底层是具体的实证结果(Evidence),中间是由若干相似方法或流派形成的聚类群落(Community),顶层则是统领性的理论脉络(Theory)。
针对这一矛盾,ProEvent 提出了一套“先定骨架、逆向推导、层层加噪”的数据合成流水线。整个流程如图 2 所示,主要划分为四个系统化阶段: 第一阶段是 联系人画像池构建 。
SteerBench-Work 最具突破性的设计在于其构建的“证据翻转镜像”(Evidence-Reversed Mirrors)。研究团队选取了最典型的真实事故场景,完整保留其表层的操作危险特征,但将背后的验证状态彻底翻转——补充具备法律效力的授权凭单、合规部门的签名确认、审计日志或明确的业...
论文作者在此提出了一个极其清醒的警示: 基准测试数据表明,多智能体协同并不必然优于经过良好微调的单一强基模型 。如果智能体之间的角色划分缺乏实质性的临床任务映射,所谓的协同很容易退化为多模型输出的机械重叠,甚至会诱发错误观点的虚假共识。
针对这一痛点,中国科学院信息工程研究所等机构的研究团队提出了名为 DocOps 的可验证基准测试框架。该框架将真实办公场景中的文档操作拆解为多层级的能力维度与工作流梯度,并引入了严格基于原生文档结构的代码化确定性验证机制。
FilmBench 的提出,标志着视频生成的评测重心正从“普通网民视角的可用性”迈向“专业创作者维度的严苛性”。通过将北京电影学院的视听语言训练体系与前沿 AI 评测技术结合,该基准为模型研发者提供了一面直面工业缺陷的镜子。
来自大连理工大学、哈尔滨工业大学、香港科技大学、上海人工智能实验室、深圳河套学院以及香港中文大学等机构的联合研究团队,针对这一长期被忽视的痛点,提出了专为化学自驱实验室设计的机器人故障分析框架 LabRobFail 。
这篇题为《Zing: Social Mind for LLMs》的技术报告,系统性地提出了面向大模型“社交心智”(Social Mind)的完整工程与算法方案:代号为 知境 (Zing)的体系。
为了解决这一难题,DataClawEval 团队设计了一套融合“人在回路(Human-in-the-Loop)”的任务重构与验证管线。如上图所示,整套流水线从企业脱敏源码切入。研究人员首先对生产环境的代码片段进行清洗和特征采样,随后借助大模型逆向重构任务意图,并针对性地合成输入测试表。
为了系统性攻关这一难题,研究团队提出了 DrawAI 框架,构建了一套覆盖四大视觉资产领域、结合确定性规则与多模态大模型裁判的综合评测基准 DrawAI-Bench ,并设计了将感知规划与代码执行拆解的两阶段智能体工作流 DrawAI-Flow 。
然而实验结果显示,模型的指令遵循率不足 1%。即便面临违规惩罚,大模型依然顽固地使用英语枢纽来拆解任务。这解释了那近 30% 的策略丢失从何而来:非英语语种被迫引入的翻译转换步骤、由翻译不准确诱发的二次重试、以及从非英语跨越到英语所导致的 Token 消耗与推理路径扭曲。