最新发布
Wuying-Browser-Agent:结合课程微调与在线RL,长序列网页控制WebVoyager达80.6%!
在短上下文和干净的演示数据上,现有的大语言模型网页智能体(BrowserAgent)已经展现出令人惊艳的性能。然而,当这些智能体真正被部署到现实世界的动态网页中时,它们的表现往往会遭遇滑铁卢。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
在短上下文和干净的演示数据上,现有的大语言模型网页智能体(BrowserAgent)已经展现出令人惊艳的性能。然而,当这些智能体真正被部署到现实世界的动态网页中时,它们的表现往往会遭遇滑铁卢。
PAPER INSIGHTS
图形用户界面(GUI)智能体展现出了将自然语言意图转化为跨软件生态多步操作的巨大潜力。然而,从基准测试的进步到真实世界的可靠部署,GUI智能体一直被两大瓶颈死死卡住:一是训练层面的数据稀缺与分布偏差;二是交互层面的提示...
在医疗人工智能的演进历程中,基于文本的大语言模型已经展示了令人瞩目的疾病诊断和医学推理能力。然而,真实的医患问诊从来不是一个纯粹的文本交换过程。在临床实践中,医生通过观察患者的面部表情、倾听咳嗽的音色、评估患者的体态和...
在当前的大语言模型服务架构中,前缀缓存(PrefixCaching或KVCache)已经成为降低推理延迟的标配。当模型处理多轮对话或长上下文时,前缀缓存能够有效复用已经计算过的状态,避免重复的预填充(Prefill)计算。
在评估复杂任务中的大语言模型智能体时,研究人员经常观察到一种极具启发性的失败模式:底层的语言模型明明具备解决任务每一个局部步骤的能力,但整个智能体运行却依然走向失败。
形式化方法一直被视为软件工程领域对抗复杂系统缺陷的终极武器。对于分布式架构和高并发系统而言,多线程交织调度和网络消息传递的非确定性,使得系统状态空间呈现指数级爆炸。
在人工智能向通用能力迈进的进程中,自动化研究智能体(AutoResearchagents)一直被视为一块重要的试金石。现代大语言模型已经展现出了令人瞩目的能力:给定一个科学问题或工程需求,它们可以自主提出假设、编写代码...
在大型语言模型向复杂智能体(Agent)演进的过程中,模型需要从单纯的“一次性文本生成”转向能够在真实或模拟环境中执行长周期多步骤任务。特别是在基于终端(Terminal)的任务中,智能体需要协调代码库上下文、命令行交...
图形用户界面(GUI)是人类访问数字服务的主要入口。如果大模型能够理解界面、自主点击滑动,就能成为操控现有数字设备的通用执行器,免去为每个服务开发专用API的繁琐。然而,当前多数表现惊艳的GUIAgent其实都患有“温...
长期以来,人工智能在数字世界中的行动能力主要依赖于代码生成和应用程序接口(API)。现代大语言模型已经能够熟练地编写程序或调用各类软件工具,但在真实的人类工作环境中,大量的数字化工作远远超出了这些接口的覆盖范围。
大模型智能体(Agent)在调用外部工具时,往往会毫无保留地吞下返回的所有数据。这种对外部输入“来者不拒”的机制,正在成为Agent系统中最致命的安全隐患。NVIDIA研究团队在最新论文中揭示了一种名为“状态破坏攻击”...
在复杂软件系统的生命周期中,存在一个基础却常被忽视的矛盾:软件项目的存活时间,远远超过任何单个代码贡献者的参与周期。当大语言模型被引入代码生成领域时,当前的智能体开发范式几乎都在试图解决一个死胡同般的问题——如何让Ag...
长视距AI智能体(Agent)的表现上限,早已不再仅仅取决于底层大模型的参数规模或基础能力。现如今,智能体的能力体现是一个由模型、执行环境(Harness)、环境交互边界和评估器共同组成的系统工程。
在计算机使用智能体(Computer-UsingAgents,简称CUA)的高速发展中,我们正面临一个极为棘手且往往被忽视的基础性问题:当一个智能体在屏幕上点来点去、输入文本、执行代码后,我们如何确定它真的完成了任务?
在当今的人工智能前沿,顶尖的AIAgent(智能体)极少只是一个“裸”的大语言模型或视觉语言模型。为了在复杂的真实环境中执行诸如软件开发、网页浏览和日常工具调度等任务,这些模型通常会被包裹在一个极其复杂的推理框架(In...
当今的大语言模型智能体(Agent)正越来越多地被部署在持久化的真实环境中,执行动辄需要数十分钟甚至数小时的复杂任务。它们需要读写共享文件、调用外部API、修改系统状态,并在漫长的工作流中反复利用这些信息。然而,面对这...
在大语言模型(LLM)的发展进程中,扩展定律(ScalingLaws)长期主导着预训练阶段的资源投入。然而,随着推理模型和强化学习在测试时计算(Test-timecomputation)上的突破,行业逐渐演化出两条平行...
长期以来,人工智能在科学领域的应用(AIforScience)大多局限于“静态问答”模式。模型或许能准确回答某个具体的生物学机制或物理公式,但在真实的科研场景中,科学发现往往需要跨越极长的时间维度,涉及多种模态的证据收...
在大型语言模型(LLM)走向智能体(Agent)化、深度介入现实业务的过程中,安全防御一直是悬在开发者头顶的达摩克利斯之剑。传统的安全训练往往依赖人类组成的“红队”(RedTeam)来测试模型的漏洞,或者收集有限的攻击...
在视觉-语言-动作(Vision-Language-Action,VLA)模型的演进路径上,行业正面临一个关键的架构分岔口。当前主流的范式倾向于将预训练的视觉语言模型(VLM)与一个独立训练的动作专家(如基于流匹配或扩...
随着大语言模型(LLM)Agent部署场景的复杂化,其工作周期早已突破了单一上下文窗口的限制。为了在跨越数月的回话或代码维护中保持一致性,持久化的外部记忆成为了核心设计。
计算机使用智能体(Computer-UseAgents)的发展正面临一个残酷的物理屏障:它们无法在真实世界中自由地试错。一个智能体只有在它的行为产生实际后果时,才能真正学到东西。一次点击改变了保存的状态,一条信息送达了...