DSAgentBench:真实环境测试275个数据科学任务,最强Agent仅56.7%成功率
真实世界的数据科学远不止是在隔离的沙盒中编写几行Python代码并顺利通过单元测试。对于一线的分析师和算法工程师而言,日常工作是一个长周期、跨工具的复杂链路:从异构数据源的获取与清洗,到终端环境的依赖管理,再到JupyterNotebook的探索性分析、IDE中的模型训练以及最终的可视化呈现。
真实世界的数据科学远不止是在隔离的沙盒中编写几行Python代码并顺利通过单元测试。对于一线的分析师和算法工程师而言,日常工作是一个长周期、跨工具的复杂链路:从异构数据源的获取与清洗,到终端环境的依赖管理,再到JupyterNotebook的探索性分析、IDE中的模型训练以及最终的可视化呈现。
计算机使用智能体(Computer-UseAgents)的发展正面临一个残酷的物理屏障:它们无法在真实世界中自由地试错。一个智能体只有在它的行为产生实际后果时,才能真正学到东西。一次点击改变了保存的状态,一条信息送达了真人,或者一个拒绝跳转的页面告诉智能体“你刚才的操作无效”——这些都是宝贵的反馈。
随着大语言模型(LLM)Agent部署场景的复杂化,其工作周期早已突破了单一上下文窗口的限制。为了在跨越数月的回话或代码维护中保持一致性,持久化的外部记忆成为了核心设计。
长期以来,人工智能在科学领域的应用(AIforScience)大多局限于“静态问答”模式。模型或许能准确回答某个具体的生物学机制或物理公式,但在真实的科研场景中,科学发现往往需要跨越极长的时间维度,涉及多种模态的证据收集、复杂工具的迭代调用,以及对外部环境的持续规划与交互。
当今的大语言模型智能体(Agent)正越来越多地被部署在持久化的真实环境中,执行动辄需要数十分钟甚至数小时的复杂任务。它们需要读写共享文件、调用外部API、修改系统状态,并在漫长的工作流中反复利用这些信息。然而,面对这样复杂的运行机制,目前的AI安全评估却依然停留在“一问一答”的石器时代。
在当今的人工智能前沿,顶尖的AIAgent(智能体)极少只是一个“裸”的大语言模型或视觉语言模型。为了在复杂的真实环境中执行诸如软件开发、网页浏览和日常工具调度等任务,这些模型通常会被包裹在一个极其复杂的推理框架(InferenceHarness)中。
在计算机使用智能体(Computer-UsingAgents,简称CUA)的高速发展中,我们正面临一个极为棘手且往往被忽视的基础性问题:当一个智能体在屏幕上点来点去、输入文本、执行代码后,我们如何确定它真的完成了任务?
长视距AI智能体(Agent)的表现上限,早已不再仅仅取决于底层大模型的参数规模或基础能力。现如今,智能体的能力体现是一个由模型、执行环境(Harness)、环境交互边界和评估器共同组成的系统工程。
大模型智能体(Agent)在调用外部工具时,往往会毫无保留地吞下返回的所有数据。这种对外部输入“来者不拒”的机制,正在成为Agent系统中最致命的安全隐患。NVIDIA研究团队在最新论文中揭示了一种名为“状态破坏攻击”(State-CorruptionAttacks)的隐蔽手法。
长期以来,人工智能在数字世界中的行动能力主要依赖于代码生成和应用程序接口(API)。现代大语言模型已经能够熟练地编写程序或调用各类软件工具,但在真实的人类工作环境中,大量的数字化工作远远超出了这些接口的覆盖范围。
图形用户界面(GUI)是人类访问数字服务的主要入口。如果大模型能够理解界面、自主点击滑动,就能成为操控现有数字设备的通用执行器,免去为每个服务开发专用API的繁琐。然而,当前多数表现惊艳的GUIAgent其实都患有“温室病”。
在人工智能向通用能力迈进的进程中,自动化研究智能体(AutoResearchagents)一直被视为一块重要的试金石。现代大语言模型已经展现出了令人瞩目的能力:给定一个科学问题或工程需求,它们可以自主提出假设、编写代码实现解决方案,并根据执行结果不断迭代。
在当前的大语言模型服务架构中,前缀缓存(PrefixCaching或KVCache)已经成为降低推理延迟的标配。当模型处理多轮对话或长上下文时,前缀缓存能够有效复用已经计算过的状态,避免重复的预填充(Prefill)计算。
图形用户界面(GUI)智能体展现出了将自然语言意图转化为跨软件生态多步操作的巨大潜力。然而,从基准测试的进步到真实世界的可靠部署,GUI智能体一直被两大瓶颈死死卡住:一是训练层面的数据稀缺与分布偏差;二是交互层面的提示词歧义与执行不可靠。
在游戏开发、物理仿真以及具身智能等前沿领域,根据用户的自然语言指令快速构建可交互的开放式3D世界,一直是一项极具挑战性的核心任务。近年来,随着多模态大语言模型(MLLM)的爆发,学术界和工业界开始尝试利用多模态Agent来实现3D世界构建的自动化。
在短上下文和干净的演示数据上,现有的大语言模型网页智能体(BrowserAgent)已经展现出令人惊艳的性能。然而,当这些智能体真正被部署到现实世界的动态网页中时,它们的表现往往会遭遇滑铁卢。
随着大语言模型(LLM)Agent在生产环境中的快速部署,一个反复出现的规律逐渐浮出水面:任务执行的可靠性,其实已经不再主要取决于底层的LLM模型能力,而是越来越依赖于包裹在模型外围的基础设施层——也就是所谓的“Agent执行脚手架(AgentExecutionHarness)”。
大语言模型(LLM)驱动的Agent正在迅速重塑软件开发、数据分析和复杂工作流的自动化方式。为了让通用模型能够胜任特定领域的复杂任务,行业内形成了一种标准的做法:为Agent注入“技能”(Skills)。
当大语言模型(LLM)作为智能体被组合成多智能体系统(Multi-AgentSystems)时,一个根本性的矛盾始终悬而未决:智能体之间的相互交流,究竟是会促使它们在观点和输出上趋于一致,还是会激发更多的多样性?
当我们在生产环境中同时运行多个大型语言模型(LLM)智能体时,一个经典但致命的计算机科学问题正在以全新的形态复活:并发控制。无论是修复代码库、管理Kubernetes集群,还是协作编辑长文档,一旦多个智能体开始读取和修改同一个共享状态,它们的执行轨迹就会交织在一起。
测试时提示词学习(Test-timepromptlearning)为基础模型的部署后适配提供了一种轻量级机制。与传统的权重微调不同,这种方法通过更新提示词来应对新输入、分布偏移和失效模式,特别适合通过与环境交互来自我优化的智能体(Self-ImprovingAgents)。
在多智能体大型语言模型(LLM)系统的部署中,开发者往往会面临一个棘手的现象:当多个专注于特定子任务的智能体协同工作时,系统输出经常会出现严重的幻觉。这种幻觉与单个模型能力不足所导致的胡言乱语不同,在很多情况下,每一个智能体在隔离状态下都进行了完全正确的逻辑推理,但它们组合在一起的结果却自相矛盾。
当前,大语言模型的应用范式正在从单次对话向终身学习智能体(LifelongAgents)快速演进。为了应对复杂任务,这类智能体需要记住用户的偏好、迭代行动计划、积累工具使用经验,并在长周期的交互中保持敏捷的响应。然而,现有的基础设施在这方面正面临一个隐蔽却致命的瓶颈。
大型语言模型正在从单一智能体的问答模式,向多智能体协同工作流快速演进。在这些系统中,多个智能体会进行交流、检索信息、对中间输出进行批判,并共同生成最终答复。虽然这种架构通过任务分解显著提升了系统处理复杂问题的鲁棒性,但它也引入了全新的可靠性风险:最终答案不再由单一的孤立模型生成,而是从一系列消...