CAP:跨108个网站实测!顶尖浏览器Agent最高成功率仅8.0%
来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP (Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作以及动态视觉感知三大核心瓶颈展开全面评测。
来自清华大学、爱丁堡大学、澳门科技大学、东南大学等机构的研究团队联合提出了全新基准 CAP (Cross-site, complex Actions, and Perception),针对跨网站工作流、复杂 UI 操作以及动态视觉感知三大核心瓶颈展开全面评测。
针对这一脱节现象,NVIDIA 团队提出了名为 ACES(Agentic Continuous Evaluation of Skills)的持续评估框架,并在开源工具 NVIDIA SkillEvaluator 中实现了该方法。
他们提出了一种具备自我修改能力的 Lean 证明智能体框架,核心亮点在于打破了“固定评测基准评判自修改代码”的传统范式,引入了智能体与基准题库的 协同进化(Coevolution)机制 。
大语言模型智能体(LLMAgent)的研究重心,正在从做一道数学题、写一段自洽代码等孤立任务,迅速转向跨越数天乃至数月的真实连续工作流。当任务的生命周期被拉长,上下文窗口的物理上限与持续膨胀的信息量之间产生了不可调和的矛盾。
绝大多数大语言模型Agent的评估基准,在设计逻辑上都有一个隐形假设:每个任务都是孤立发生的。Agent面对一个任务,调动工具、推理规划、输出结果,随后环境刷新,上下文清空,一切归零。但现实世界中的专业工作流绝非如此。
医疗大模型正在经历一场从“做题家”到“执行者”的剧烈转折。在过去两三年里,评估一个医学大模型的水平,主流方法几乎都是给它一张考卷:从美国医师执照考试(USMLE)到各科临床单项选择题,只要模型在问答基准上刷出高分,往往就会被冠以“具备医生级水准”的光环。
评估代码智能体(CodingAgent)的能力正在陷入一种尴尬的困境:榜单上的分数越来越高,但在真实工程环境里写起代码来依然漏洞百出。这种落差背后的核心症结在于两点。
大语言模型与多模态视觉模型(VLM)正在迅速成为具身智能体的“推理大脑”。然而,真正将视觉语言模型置于物理机器人中时,研究者往往会遭遇一个尖锐的矛盾:机器人的真实执行过程本质上是高频迭代的动态闭环,机器人的每一次机械臂抬起、每一次底盘移动,都会立即重构周围的几何场景与物理状态,从而不断产生全新...
在大模型推理成本高居不下的背景下,模型路由(LLMRouting)被普遍视为最直接的降本增效利器。它的逻辑非常直观:遇到简单问题交给廉价的小模型,遇到复杂推理才激活昂贵的大模型。
当下的前沿大模型不仅能回答简单的事实提问,还能借助搜索工具写出看似条理清晰的长篇调研报告。然而在真实的专业工作场景中,真正的难点往往不在于围绕单个话题天马行空地写几千字,而在于严谨、系统化地完成大规模信息收集与交叉核验。
移动端GUI(图形用户界面)智能体正处于一个关键的演进节点。多模态基础模型的出现,使得智能体可以直接通过屏幕像素感知和触摸动作来操作智能手机。这种通用的交互范式使其能够跨越繁杂的应用边界,直接执行复杂长程任务。
大语言模型智能体正在以前所未有的速度深入企业核心业务流。在真实的生产环境中,它们的部署模式通常遵循一种默认的“长期指令”架构:开发者会将一份系统提示词、一份企业合规文件或是一份厚厚的技能说明书塞进模型的上下文窗口中,并理所当然地信任智能体在后续所有的工具调用和多步交互中,都能严格受这些先决规则...
在过去一年里,具备自主运行能力的网络安全AI智能体(CybersecurityAgents)在漏洞挖掘和代码审计领域展现出了惊人的进展。然而,这种繁荣很大程度上建立在一个理想化的前提之上:智能体能够直接获取目标软件的源代码。
在计算机使用智能体(Computer-UsingAgents,简称CUA)的高速发展中,我们正面临一个极为棘手且往往被忽视的基础性问题:当一个智能体在屏幕上点来点去、输入文本、执行代码后,我们如何确定它真的完成了任务?
大语言模型(LLM)驱动的Agent正在迅速重塑软件开发、数据分析和复杂工作流的自动化方式。为了让通用模型能够胜任特定领域的复杂任务,行业内形成了一种标准的做法:为Agent注入“技能”(Skills)。
在当前的大模型能力版图中,短文本回答、代码生成或是日常对话的响应早已不是难点。然而,当我们把视线转向撰写维基百科级别的深度文章、行业技术报告或是长篇分析文档时,大模型的表现往往暴露出明显的局限性。
在生产级别的大语言模型(LLM)部署中,开发者往往会配置多个模型提供商(Provider)以确保系统的高可用性。当主模型服务商遭遇宕机或严格的速率限制时,网关会自动将流量切换到备用模型。从监控面板上看,HTTP状态码依然是绿色的“200OK”,系统看似运转正常。
当大语言模型从只能聊天的对话框,走向可以操作代码库、控制浏览器乃至接管操作系统的智能体时代时,我们该如何评价它究竟好不好用?现有的评估体系正陷入一种极度的“分数内卷”。在过去两年中,OSWorld、WebArena等知名基准测试上的最佳成功率飙升了5到7倍,甚至有系统声称超越了人类基准。
随着大语言模型技术的演进,能够自主编写代码、浏览网页甚至控制电脑的Agent(智能体)正迎来爆发式增长。然而,当你开发出一个全新的Agent,想知道它到底有多强时,噩梦就开始了。当前,Agent领域的评测正处于一种极度“碎片化”的状态。
从被动回答问题的聊天机器人,到能够自主完成深度研究的数字员工,AI正在经历一场重大的范式转换。近期爆火的复杂商业系统无不昭示着,大语言模型智能体(LargeLanguageModelAgent,LLMAgent)时代的全面到来。
当Claude发布其具备“电脑操控”能力的最新模型时,整个科技圈为之震动。这项技术让AI不再局限于聊天窗口,而是真正接管了我们的鼠标和键盘。微软、北京大学与上海人工智能实验室近期联合发布了一项重磅长篇综述。该综述系统梳理了超过500篇核心文献,全面揭开了这项前沿技术的神秘面纱。
评价一个大语言模型Agent的能力,业界通常只看一个最终指标:即该模型是否成功解决了当前任务。这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。该研究揭示了一个在各类大模型榜单中常被忽视的盲点。决定Agent能否成功的,不仅是模型本身的基础智力。还有那个将模型与外部环境连接起来的“脚手架”。
Anthropic近期发布的ComputerUse功能让整个科技圈沸腾了。AI不再局限于聊天窗口中的文本对话。它们正在跨越屏幕的边界,直接操控鼠标和键盘。从苹果的AppleIntelligence到智谱的AutoGLM,变革已然发生。这类能自主操作计算设备的AI被统称为操作系统智能体(OSAg...
当前,让大语言模型自己优化其工具和提示词(即自动Harness演化)被视为通向更强Agent的前沿方向。许多研究宣称,通过让Agent分析自身失败轨迹并自动修改代码外壳,能在各类基准测试中取得显著的性能飞跃。然而,来自AllenAI等机构的一项最新研究无情地戳破了这一幻象。