AI评测 第3页

CAP:跨108个网站实测!顶尖浏览器Agent最高成功率仅8.0%

来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP (Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作以及动态视觉感知三大核心瓶颈展开全面评测。

ContextWeave:记忆不是检索问答,真实工作流偏好分从41.5升至70.6

大语言模型智能体(LLMAgent)的研究重心,正在从做一道数学题、写一段自洽代码等孤立任务,迅速转向跨越数天乃至数月的真实连续工作流。当任务的生命周期被拉长,上下文窗口的物理上限与持续膨胀的信息量之间产生了不可调和的矛盾。

FinEvo-Bench:金融Agent自演化纵向基准,留存经验最高涨19分

绝大多数大语言模型Agent的评估基准,在设计逻辑上都有一个隐形假设:每个任务都是孤立发生的。Agent面对一个任务,调动工具、推理规划、输出结果,随后环境刷新,上下文清空,一切归零。但现实世界中的专业工作流绝非如此。

PatientAgentBench:从答卷到替患者办事,分诊通过率相差56%

医疗大模型正在经历一场从“做题家”到“执行者”的剧烈转折。在过去两三年里,评估一个医学大模型的水平,主流方法几乎都是给它一张考卷:从美国医师执照考试(USMLE)到各科临床单项选择题,只要模型在问答基准上刷出高分,往往就会被冠以“具备医生级水准”的光环。

Capek 0.5:小鹏机器人具身大模型,四大专家融合提质28项评测

大语言模型与多模态视觉模型(VLM)正在迅速成为具身智能体的“推理大脑”。然而,真正将视觉语言模型置于物理机器人中时,研究者往往会遭遇一个尖锐的矛盾:机器人的真实执行过程本质上是高频迭代的动态闭环,机器人的每一次机械臂抬起、每一次底盘移动,都会立即重构周围的几何场景与物理状态,从而不断产生全新...

AppDeltaWorld:基于增量代码机制的GUI世界模型,评测达73.5分

移动端GUI(图形用户界面)智能体正处于一个关键的演进节点。多模态基础模型的出现,使得智能体可以直接通过屏幕像素感知和触摸动作来操作智能手机。这种通用的交互范式使其能够跨越繁杂的应用边界,直接执行复杂长程任务。

HANDBOOK.md:65个长文档智能体任务,最强模型仅达36.2%

大语言模型智能体正在以前所未有的速度深入企业核心业务流。在真实的生产环境中,它们的部署模式通常遵循一种默认的“长期指令”架构:开发者会将一份系统提示词、一份企业合规文件或是一份厚厚的技能说明书塞进模型的上下文窗口中,并理所当然地信任智能体在后续所有的工具调用和多步交互中,都能严格受这些先决规则...

SRE-Bench:首个无污染逆向基准,最强AI仅解出31.5%

在过去一年里,具备自主运行能力的网络安全AI智能体(CybersecurityAgents)在漏洞挖掘和代码审计领域展现出了惊人的进展。然而,这种繁荣很大程度上建立在一个理想化的前提之上:智能体能够直接获取目标软件的源代码。

OSReward:VLM裁判靠谱吗?降本60倍的模型逼近闭源前沿

在计算机使用智能体(Computer-UsingAgents,简称CUA)的高速发展中,我们正面临一个极为棘手且往往被忽视的基础性问题:当一个智能体在屏幕上点来点去、输入文本、执行代码后,我们如何确定它真的完成了任务?

清华提出GEIS:Agent技能改进闭环,长文生成击败STORM

在当前的大模型能力版图中,短文本回答、代码生成或是日常对话的响应早已不是难点。然而,当我们把视线转向撰写维基百科级别的深度文章、行业技术报告或是长篇分析文档时,大模型的表现往往暴露出明显的局限性。

ContinuityBench:LLM有状态故障转移!对话连续性达99.2%

在生产级别的大语言模型(LLM)部署中,开发者往往会配置多个模型提供商(Provider)以确保系统的高可用性。当主模型服务商遭遇宕机或严格的速率限制时,网关会自动将流量切换到备用模型。从监控面板上看,HTTP状态码依然是绿色的“200OK”,系统看似运转正常。

告别单一成功率!AgentAtlas揭穿大模型评估盲区,准确率最高暴跌40%

当大语言模型从只能聊天的对话框,走向可以操作代码库、控制浏览器乃至接管操作系统的智能体时代时,我们该如何评价它究竟好不好用?现有的评估体系正陷入一种极度的“分数内卷”。在过去两年中,OSWorld、WebArena等知名基准测试上的最佳成功率飙升了5到7倍,甚至有系统声称超越了人类基准。

AI接管设备?超500篇文献全景解码大模型GUI Agent

当Claude发布其具备“电脑操控”能力的最新模型时,整个科技圈为之震动。这项技术让AI不再局限于聊天窗口,而是真正接管了我们的鼠标和键盘。微软、北京大学与上海人工智能实验室近期联合发布了一项重磅长篇综述。该综述系统梳理了超过500篇核心文献,全面揭开了这项前沿技术的神秘面纱。

Agent评测盲区:BIWM量化执行接口对多步信念的扭曲

评价一个大语言模型Agent的能力,业界通常只看一个最终指标:即该模型是否成功解决了当前任务。这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。该研究揭示了一个在各类大模型榜单中常被忽视的盲点。决定Agent能否成功的,不仅是模型本身的基础智力。还有那个将模型与外部环境连接起来的“脚手架”。

AI全面接管设备:OS Agents核心架构机制万字全景解析

Anthropic近期发布的ComputerUse功能让整个科技圈沸腾了。AI不再局限于聊天窗口中的文本对话。它们正在跨越屏幕的边界,直接操控鼠标和键盘。从苹果的AppleIntelligence到智谱的AutoGLM,变革已然发生。这类能自主操作计算设备的AI被统称为操作系统智能体(OSAg...

打脸Agent自动演化:同等算力下不如简单重试,泛化提升仅0.6%

当前,让大语言模型自己优化其工具和提示词(即自动Harness演化)被视为通向更强Agent的前沿方向。许多研究宣称,通过让Agent分析自身失败轨迹并自动修改代码外壳,能在各类基准测试中取得显著的性能飞跃。然而,来自AllenAI等机构的一项最新研究无情地戳破了这一幻象。