AI Agent 第19页

SelfMem:引入自我优化机制,百万Token下基准得分最高提升48.7%

随着大语言模型基础能力的飞跃,当前的AI智能体已经能够处理极长的上下文,熟练调用外部工具,并执行跨度极长的复杂任务。然而,当这些智能体被部署在真实的长期交互场景中时,它们不可避免地会遇到一个核心瓶颈:如何有效地记住并利用历史经验。

SkillFab:告别一次性代码!华为等打通Agent技能生命周期

当前的大模型智能体(Agent)已经展现出令人惊叹的单点任务解决能力。面对复杂的指令,它们能够自主调用工具、反思错误,并通过与环境的不断交互找到破局之道。然而,这种成功往往是高度脆弱且孤立的。

SkillWiki:哈工大与腾讯打造,打通Agent技能全生命周期演进

随着大语言模型驱动的智能体(Agent)从执行简单的单次工具调用,逐步演进为能够自主执行复杂长周期任务的系统,Agent需要掌握的技能数量和种类正在急剧膨胀。为了在真实环境中有效运作,Agent必须从多种来源获取大量可复用的技能。

中科院提出CLSR:让大模型自创符号语言,推理Token缩减3-6倍

大型语言模型(LLMs)在处理复杂推理任务时,往往依赖于思维链(Chain-of-Thought,CoT)技术。通过让模型一步一步地用自然语言写出推理过程,其准确率确实得到了显著提升。然而,这里隐藏着一个根本性的效率错位:人类用来沟通和理解的自然语言,对于机器的内部逻辑推理而言,真的是最经济、...

Agentic Data Environments:哥大打造AI安全底座,AIM准确率提升49.8%

随着大型语言模型的普及,自动化正迎来从“辅助生成”向“自主执行”的转折点。现代AIAgent不仅能够编写代码、浏览网页,更能自主调用API、操作终端甚至查询生产数据库。然而,当前的AI自动化往往止步于“只读”阶段,例如通过检索增强生成(RAG)回答问题或汇总财务报表。

EvoAgentBench:不是任务记忆而是能力转移,跨四领域揭露所有自动进化方法的短板

在长时间跨度的大型语言模型(LLM)系统研究中,一个不争的共识正在成型:一个实用的智能体(Agent)不应该每次都从零开始解决任务。当Agent在复杂环境中经历过成功与失败后,它应当能够像人类一样,将过往的经验沉淀为可复用的策略——比如一套有效的搜索工作流、一种特定的代码调试模式,或是某种严谨...

阿里EvoSOP:让Agent自动合成SOP,成功率提升13.4%

在当前的大语言模型(LLM)Agent研究中,工具调用能力已成为其与真实世界交互、解决复杂任务的核心基石。然而,当开发者们不断赋予Agent各种能力时,一个明显的效率瓶颈逐渐显现:现有框架绝大多数依赖由“原子操作”(AtomicActions)组成的静态工具集。

MetaSkill-Evolve:双尺度元技能进化,准确率涨23.5分

大模型智能体(LLMAgents)在处理长周期、开放性任务时的能力正在快速进化。为了让智能体不只是“见招拆招”,研究人员往往会为其配备“技能(Skill)”——一种可复用、可编辑的程序化知识库。然而,手工编写的静态技能很难应对智能体在实际应用中遇到的海量且多样的任务。

MRMS:不是扩展上下文,而是结构-向量-图双轴长效记忆基座!

语言模型能够在单次提示的对话中生成连贯的回复,但当面对需要长期存在的长效智能体(Long-LivedAIAgents)时,单纯依赖上下文窗口的扩展往往会遭遇系统性的瓶颈。长效智能体需要在跨度极长、次数繁多的交互中维持对用户偏好、既往决策、约束条件以及未完成目标的记忆。

Progressive Crystallization:提取确定性工作流,成本降低70%

在企业级IT运维(AIOps)中,引入大语言模型(LLM)驱动的Agent已经成为解决复杂故障的主流方向。Agent通过调用工具观察系统状态、进行逻辑推理并执行修复动作,这种高度的灵活性使其能够有效应对前所未见的新型故障。

不是固定Top-K!SkillReranker:基于执行图的Agent自适应技能检索

大模型智能体(Agent)正越来越多地依靠外部技能库来完成复杂任务。相比于完全依赖模型的隐式推理能力,调用封装好的功能代码或API能够显著提升执行的稳定性和成功率。然而,随着技能库规模的不断膨胀,如何精准地为当前任务挑选最合适的技能,成为了制约Agent系统能力上限的瓶颈。

UI-MOPD:多教师在线蒸馏!跨平台GUI智能体成功率达38.2%

随着多模态基础模型和智能体系统的快速演进,图形用户界面(GUI)智能体正经历从单平台任务执行向跨平台复杂交互的关键跨越。真实世界的数字工作流往往需要跨越桌面应用程序、移动端App和Web服务,这就要求智能体不仅能适应异构的GUI环境,还要准确保留各个平台独有的交互习惯。

清华提出GEIS:Agent技能改进闭环,长文生成击败STORM

在当前的大模型能力版图中,短文本回答、代码生成或是日常对话的响应早已不是难点。然而,当我们把视线转向撰写维基百科级别的深度文章、行业技术报告或是长篇分析文档时,大模型的表现往往暴露出明显的局限性。

中科院等最新实证!4大市场数据揭示Agent Skill复用真相

软件工程的发展史,本质上就是一部关于“复用”(Reuse)的演进史。从早期的复制粘贴代码片段,到引入标准化的库和框架,再到基于云的微服务架构,开发者们一直在寻找更高效的方式来避免重复造轮子。随着生成式AI和自主智能体(AIAgent)的爆发,一种全新的可复用构件正在悄然重塑整个生态——技能(S...

PM-Bench:UCLA发布前瞻记忆基准,最强GPT-5.4得分仅65.1%

大语言模型(LLM)驱动的智能体系统正在被赋予越来越长周期的任务期望。如今的模型能够浏览网页、编写代码、制定计划、调用工具,并在多轮对话中采取行动,而不再局限于单次提示词的响应。

Meta主动记忆智能体:变被动检索为精准干预,长任务提升8.3%

在大型语言模型驱动的智能体(LLMAgent)研究中,业界长期受困于一个看似无解的顽疾:当任务轨迹变得越来越长,智能体会不可避免地变得“健忘”且固执。这种健忘往往不是因为上下文窗口不够大,而是智能体在漫长的局部试错和多步执行中,丢失了对全局约束和历史经验的控制力。

半数算力提升4.8分!GRADE:四大门控重构自适应多智能体推理

大模型推理能力的发展,正逐渐从依赖单体模型参数的线性增长,转向多智能体(Multi-agent)协作机制。然而,简单地堆叠多个智能体往往会带来推理延迟与显存占用的成倍增加,更关键的是,过去的研究并未彻底解决三个核心问题:遇到具体查询时究竟该唤醒哪些智能体?查询信息需要在智能体层级中下探到多深?

Apple提出Shared Selective Persistent Memory:4大机制将完成率升至96%

当前,具备自主规划和工具调用能力的AgenticLLM(智能体大模型)系统正在重塑数据分析与代码生成的范式。然而,所有主流的智能体框架都面临一个根本性的上下文难题:会话是无状态的。每次用户启动一个新任务,系统就像完全失忆一样从零开始,直接丢弃了在过往会话中积累的工具配置、领域约束、数据模式以及...

Amazon提出自进化Agent:离线编译工具让延迟降62%!

在当今的大模型应用中,基于代码生成的智能体(Agent)正逐渐成为处理复杂软件和操作系统的主流交互方式。面对各种长尾的故障排查、工作流调度和数据查询,Agent可以通过阅读自然语言指令、实时编写代码并执行来达成目标。