PM-Bench:UCLA发布前瞻记忆基准,最强GPT-5.4得分仅65.1%
大语言模型(LLM)驱动的智能体系统正在被赋予越来越长周期的任务期望。如今的模型能够浏览网页、编写代码、制定计划、调用工具,并在多轮对话中采取行动,而不再局限于单次提示词的响应。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
大语言模型(LLM)驱动的智能体系统正在被赋予越来越长周期的任务期望。如今的模型能够浏览网页、编写代码、制定计划、调用工具,并在多轮对话中采取行动,而不再局限于单次提示词的响应。
软件工程的发展史,本质上就是一部关于“复用”(Reuse)的演进史。从早期的复制粘贴代码片段,到引入标准化的库和框架,再到基于云的微服务架构,开发者们一直在寻找更高效的方式来避免重复造轮子。随着生成式AI和自主智能体(...
在当前的大模型能力版图中,短文本回答、代码生成或是日常对话的响应早已不是难点。然而,当我们把视线转向撰写维基百科级别的深度文章、行业技术报告或是长篇分析文档时,大模型的表现往往暴露出明显的局限性。
随着大语言模型(LLM)的快速迭代,AI正在从仅能处理单次会话的简单助手,演变为能够跨越数天、数周乃至数月陪伴用户的长期智能体。在这种长周期、多会话的交互场景中,长记忆能力(Long-termMemory)已经成为决定...
随着大语言模型能力的飞跃,智能代理(Agent)正在经历从一次性问答机器人向状态持久、可长期运行的个人桌面和手机助手的关键转型。然而,真实的设备生态往往不提供完美结构化的API接口,很多高价值任务要求系统直接在图形用户...
检索增强生成(RAG)已经成为大模型解决幻觉和获取外部知识的标准范式。为了让大模型具备更复杂的推理能力,基于知识图谱的GraphRAG逐渐成为当前的研究热点。然而,现有的系统往往潜藏着一个致命缺陷:它们将知识图谱视为一...
随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监...
在生产级别的大语言模型(LLM)部署中,开发者往往会配置多个模型提供商(Provider)以确保系统的高可用性。当主模型服务商遭遇宕机或严格的速率限制时,网关会自动将流量切换到备用模型。从监控面板上看,HTTP状态码依...
当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这...
当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼...
当前,由大语言模型(LargeLanguageModels,LLMs)驱动的自主网页智能体正试图接管复杂的浏览器工作流。但它们常常因为无法留存和复用交互知识,被迫在每次遇到熟悉任务时从零开始推理,导致极高的错误率。
OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这...
在当今的大模型研发中,算力焦虑几乎笼罩着每一个技术团队。当我们将目光聚焦于动辄千亿参数的模型时,往往会陷入一个误区:单纯地增加GPU数量就能解决一切问题。然而,真实的工程痛点远比这复杂。
当用户要求手机上的智能助手“帮我核对上个月的账单,计算出餐饮开销占比并填入新的备忘录”时,大多数现有的AI助手在点击了几次屏幕后,往往会陷入迷茫。它们要么忘了最初要找什么,要么算错了数据,甚至一直在同一个页面里无意义地...
当一个部署在生产环境中的数据分析Agent连续三次生成了逻辑完美的SQL语句,却仅仅因为数据库表名的大小写不匹配而屡屡报错时,它该如何自救?在绝大多数现有的工程架构中,它只能反复撞墙,因为控制它如何调用工具、如何拦截异...
机器智能不仅能写代码,现在已经开始自主做物理实验了。它们甚至向顶级学术期刊的既定结论“开炮”了。该研究展示了一个由大语言模型驱动的智能体。它不再仅仅是“读”论文,而是真正去“跑”计算物理的复杂仿真。在测试中,它自主复现...
长期以来,人工智能在物理世界面临着一个尴尬的困境:机器人在工厂里极其精准,但只要光线微调或零件偏移,它们就会立刻宕机。这种“专机专用”的模式,要求开发者为每一个特定任务收集数据、定制算法并在受限环境中部署。然而,自然语...
大语言模型虽然拥有惊人的语义理解能力,但始终受制于静态的预训练数据。当面对实时信息检索、复杂数学计算或特定领域操作时,纯参数模型往往会产生严重的知识幻觉。单纯依靠扩大模型参数来“死记硬背”世界知识,不仅训练成本极其高昂...
当前的智能体系统正面临一个尴尬的瓶颈:即便是回复一句简单的“你好”,系统底层也可能消耗成千上万个Token。对于复杂的多步推理任务,这种累积的计算成本更是高得令人咋舌。与此同时,市面上成熟的Agent产品(如Claud...
面对百万字的海量专业文档,当下的AI助手往往力不从心。传统的检索增强生成(Retrieval-AugmentedGeneration,RAG)就像个只会翻书找原话的初学者。一旦资料多到超出模型的上下文窗口,它就只能“断...
现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚...
当前AI应用开发者最头疼的往往不是模型不够聪明,而是月底暴涨的API云账单。为了让Agent顺利完成复杂任务,系统不得不塞入极其冗长的系统提示。不仅如此,在多轮对话中还要反复回放完整的历史记录、巨大的工具描述文档。
当多个顶级大语言模型组成团队时,它们真的能像人类精英一样高效协同吗?现实情况往往令人啼笑皆非:它们不仅经常无法达成共赢,甚至会因为资源分配问题“大打出手”,或者干脆达成一种极其糟糕的妥协。为什么大模型能够轻松通过极其困...
当AI智能体面对需要跨应用操作、历经数十步的复杂电脑任务时,它们往往会陷入“我刚做了什么”以及“我现在在哪”的混沌之中。随着操作历史的不断堆积,大量错误的尝试和冗杂的信息让智能体彻底迷失。本文解读的最新研究Struct...