AI Agent 第22页

Agent脚手架自进化:GSME框架破解评估噪音,冻结模型性能暴涨15.5%

在真实的业务部署中,决定一个大语言模型(LLM)任务表现的,往往不仅是其内部那堆被冻结的千亿参数,更是包围在模型外围的“脚手架”——系统提示词、注入的背景知识、运行时的重试控制循环以及各类配置参数。当模型权重不可触及(由于使用闭源API或微调成本极其高昂)时,优化这些外围结构成了开发者手中唯一...

AI Agent的无限进化:双轨自我提升架构技术全景解析

真正的自动化系统不仅需要能执行预设指令,更需要具备在遇到挫折时自我反思、并修改自身运行逻辑的能力。当前的AIAgent大多依赖人类工程师进行“打补丁”式的迭代,一旦面对长尾的边缘场景,往往会陷入死板执行的困境。如何让系统摆脱外部依赖,实现自主且可控的进化?

SkillAudit揭秘:无真值反馈的Agent技能自进化,任务胜率暴涨17%

大模型Agent在应对专业领域的长周期任务时,往往需要依赖提前编写好的“技能”(Skills)——即结构化的操作指南与代码包。然而,真实业务环境是动态的。随着API接口的废弃、边缘场景的涌现,原本完美的技能很快就会退化甚至帮倒忙。让Agent在实战中自我更新技能,是业界公认的解法。

SkillComposer:Agent技能自我进化,跨级提升模型4.5分

在当前的智能体(Agent)开发中,开发者常常陷入一个两难境地。如果为特定任务编写高度定制的策略,这些技能往往无法迁移到其他场景。反之,如果提取过于抽象的通用技能,在面对具体任务时又显得指导不足。这种“特化”与“泛化”的矛盾,一直是限制智能体在复杂推理任务中表现的瓶颈。

告别“一次性”Agent!SkillOS重塑技能管理,性能跃升近10%

当前的大模型智能体(Agent)普遍存在一个极大的局限性:它们往往是“一次性”的解题机器。在处理完一个复杂的流式任务后,它们通常无法从历史交互中吸取教训并积累经验。面对源源不断的新任务,如果Agent每次都要从零开始摸索,注定无法胜任复杂的现实世界需求。

StructAgent:统一因果结构让长序列智能体告别迷失,胜率飙升至78.9%

当AI智能体面对需要跨应用操作、历经数十步的复杂电脑任务时,它们往往会陷入“我刚做了什么”以及“我现在在哪”的混沌之中。随着操作历史的不断堆积,大量错误的尝试和冗杂的信息让智能体彻底迷失。本文解读的最新研究StructAgent,为这一难题提供了一种极其优雅的解法。

大模型也会“聊崩”?多智能体谈判实验揭秘4大协作陷阱

当多个顶级大语言模型组成团队时,它们真的能像人类精英一样高效协同吗?现实情况往往令人啼笑皆非:它们不仅经常无法达成共赢,甚至会因为资源分配问题“大打出手”,或者干脆达成一种极其糟糕的妥协。为什么大模型能够轻松通过极其困难的单体推理测试,却在简单的多轮团队沟通中频频翻车?

告别Token依赖!清华与NUS联合揭秘大模型隐空间,盘点4大机制与7大能力

现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。大模型真的必须“说人话”来完成内部思考吗?答案或许是否定的。

省28.4% Token!开源Agent框架ToFu性能反超Claude

当前的智能体系统正面临一个尴尬的瓶颈:即便是回复一句简单的“你好”,系统底层也可能消耗成千上万个Token。对于复杂的多步推理任务,这种累积的计算成本更是高得令人咋舌。与此同时,市面上成熟的Agent产品(如ClaudeCode)多为闭源的黑盒系统。

告别“幻觉”:涵盖18种工具的Tool Learning通用框架全解析

大语言模型虽然拥有惊人的语义理解能力,但始终受制于静态的预训练数据。当面对实时信息检索、复杂数学计算或特定领域操作时,纯参数模型往往会产生严重的知识幻觉。单纯依靠扩大模型参数来“死记硬背”世界知识,不仅训练成本极其高昂,而且无法保证信息的实时性与准确性。

打破“专机专用”魔咒:基础大模型重塑通用机器人的核心机制与局限

长期以来,人工智能在物理世界面临着一个尴尬的困境:机器人在工厂里极其精准,但只要光线微调或零件偏移,它们就会立刻宕机。这种“专机专用”的模式,要求开发者为每一个特定任务收集数据、定制算法并在受限环境中部署。然而,自然语言处理和计算机视觉领域的基础大模型,却展现出了惊人的开放世界泛化能力。

AI进军真实物理科研:端到端复现111篇论文,揪出42%潜在错误

机器智能不仅能写代码,现在已经开始自主做物理实验了。它们甚至向顶级学术期刊的既定结论“开炮”了。该研究展示了一个由大语言模型驱动的智能体。它不再仅仅是“读”论文,而是真正去“跑”计算物理的复杂仿真。在测试中,它自主复现了111篇计算物理学论文。令人震惊的是,它揪出了其中论文的潜在科学错误。

TTHE:无需微调与标签,测试时脚手架演化让Agent准确率暴涨38%

当一个部署在生产环境中的数据分析Agent连续三次生成了逻辑完美的SQL语句,却仅仅因为数据库表名的大小写不匹配而屡屡报错时,它该如何自救?在绝大多数现有的工程架构中,它只能反复撞墙,因为控制它如何调用工具、如何拦截异常的“工作流程序”在出厂部署的那一刻起,就已经被彻底焊死了。

手机操作不再断片!UI-Copilot凭副驾驶机制实现GUI任务17.1%性能跃升

当用户要求手机上的智能助手“帮我核对上个月的账单,计算出餐饮开销占比并填入新的备忘录”时,大多数现有的AI助手在点击了几次屏幕后,往往会陷入迷茫。它们要么忘了最初要找什么,要么算错了数据,甚至一直在同一个页面里无意义地来回滑动。

WebShaper:集合论重构数据合成,打造最强开源搜索Agent

OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却常常卡在一个致命瓶颈上:高质量训练数据的极度匮乏。

大模型Agent的“缰绳”:4大标准重新定义Agent Harness与6大系统横测

当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不要撒谎,是最脆弱的控制手段。真正能解决这一痛点的,是模型外围...

Adaptation of Agentic AI

13所顶尖名校联手:Agentic AI 适配的 4 大核心范式与未来路线图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。