AI Agent 第20页

AgentLocate:多视角验证与微调机制,精准定位多智能体故障

在基于大语言模型(LLM)的复杂应用前沿,多智能体系统正在成为解决跨领域复杂任务的核心范式。通过将不同的职责分配给具备专门设定的智能体,系统能够实现更丰富的推理、更灵活的规划以及跨越多个工具的协调工作流。

港大等提出EvoGraph-R1:自进化多模态GraphRAG,打破静态检索瓶颈!

检索增强生成(RAG)已经成为大模型解决幻觉和获取外部知识的标准范式。为了让大模型具备更复杂的推理能力,基于知识图谱的GraphRAG逐渐成为当前的研究热点。然而,现有的系统往往潜藏着一个致命缺陷:它们将知识图谱视为一种静态的数据结构。

SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习

随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。

告别Prompt玄学!ACDL:首个定义Agent动态上下文的标准语言

在构建复杂的大语言模型系统中,开发者常遭遇一个幽灵般的工程难题。看似相同的系统架构,实际运行时的智能表现却大相径庭。这种差异的根源,往往隐藏在系统与模型交互的上下文结构中。随着多步推理和工具调用的普及,提示词早已不再是静态的文本。它变成了一个随着时间线动态演进、不断累积历史信息的复杂组合体。

突破大模型思考极限:最新推理前沿综述拆解两大核心演进路线

当OpenAI的o1模型横空出世,紧接着DeepSeek-R1震撼开源界时。人们敏锐地察觉到,大语言模型不再仅仅是“单句接龙”的文本生成器。它们开始展现出极具深度的长程逻辑推演能力。这种被称为“大模型推理”的核心能力。正成为区分传统聊天机器人与高级人工智能系统的一道巨大分水岭。

胜率飙升至77%!AHE框架让AI代码智能体自主进化“脚手架”

近年来,大模型在长线软件工程任务中的表现令人瞩目。从解决现实世界代码库中的复杂Bug,到执行多步终端工作流。代码智能体似乎正在逐步接管那些曾经专属于人类程序员的繁重工作。然而,决定这些智能体最终表现的,往往不仅仅是底层基础模型(BaseModel)的智力水平。在实际应用中,智能体极大地依赖于其...

移除AI游戏就崩溃?53款案例深度解析真正的AI原生游戏

当非玩家角色能够滔滔不绝地与你自由对话,或者任务系统能够自动生成无尽的支线时,这是否意味着我们已经踏入了AI原生游戏的时代?许多开发者将生成式大模型直接塞入游戏,仅仅将其作为剧情的“润色工具”或NPC的“聊天外挂”。然而,真正的革命并非如此简单。

告别“阅后即焚”:435篇文献揭秘Agent持久化状态治理机制

现在的智能助手越来越懂你,但大多数仍像是在上演现实版《初恋50次》——一旦单次任务结束,上下文清空,所有的用户偏好和任务教训瞬间清零。这种“单次情景”(Episodic)模式确实安全,因为过去是无关紧要的。然而,为了让真正成为得力助手,它们必然要走向“永远在线”的常驻模式。

爆降51% Token消耗!清华北大开源AOHP:重构Agent原生安卓系统

如今的AI智能体能陪你聊天、帮你写代码。但如果你让它在手机上跨App比价并买杯咖啡,它往往会笨手笨脚,甚至频繁出错。为什么?因为现有的智能手机操作系统,是为“人类点击”设计的,而不是为“代码调用”准备的。传统的操作系统界面是由开发者固定的,GUI的渲染是为了人类视觉,而非机器逻辑。

别只看结果!HarnessAudit揭秘智能体框架的隐秘安全漏洞

当你要求你的AI助手“整理本月的财务报表”时,它在几分钟后递交了一份完美无瑕的总结。但在你惊叹其效率的同时,是否曾想过:在这个过程中,它有没有偷偷翻阅你电脑里标注着“绝密”的HR薪资档案?有没有把部分敏感数据误发给了另一个负责闲聊的AI模块?随着大语言模型技术的演进,如今的AI早已不再是单打独...

突破纯文本瓶颈!增强语言模型(ALMs)如何用推理与工具重塑AI边界

尽管以大语言模型为核心的技术已深入数百万人的日常,它们依然面临着不可忽视的工程痛点。纯统计的语言建模范式带来了令人头疼的幻觉,模型在复杂数学计算和实时信息获取上也总是捉襟见肘。为了打破纯文本生成的局限,学术界正在推动一场大规模的范式转移。

大模型长记忆返璞归真:Nano-Memory极简检索法降低近半Token消耗

随着智能体与用户的交互日益频繁,让大语言模型记住几个月甚至一年前的冗长对话,已成为各大研究团队竞相攻克的难题。为了实现这种长期记忆,现有的主流方案往往走向了无休止的“堆料”之路。从极其复杂的层次化摘要,到繁琐的强化学习图谱构建,亦或是引入专门的记忆层与模型权重更新,记忆系统变得越来越臃肿。

别再只让大模型写代码了!Meta与斯坦福联合提出“代码即脚手架”,重构AI智能体引擎

长期以来,业界对大模型代码能力的关注点,大多停留在“AI写代码”这一单一结果上。人们惊叹于模型能通过算法竞赛,或者能写出精妙的前端网页。但在Meta、斯坦福大学和UIUC的最新联合研究中,这一固有认知被彻底打破。他们提出了一种名为代码即智能体脚手架(CodeasAgentHarness)的全新范式。

打破死板规则!CORAL让多Agent自主进化,探索效率飙升10倍

解决没有标准答案的开放性科学难题,一直被视为人工智能迈向更高级形态的试金石。面对复杂的物流调度或底层的系统内核优化,传统的“单次生成”模式早已捉襟见肘。近年来,将大语言模型嵌入进化算法循环中,成为了破局的新希望。然而,该研究敏锐地指出,当前的系统依然像流水线上的牵线木偶,被固定的搜索规则死死限...

纵览124篇文献:LLM智能体动态技能库的八阶段生命周期揭秘

当大语言模型从简单的对话助手,逐步深入并接管实际的工作流时,一个严峻的核心瓶颈浮出水面。这种瓶颈并非模型单次推理能力的不足,而是智能体(Agent)能否在重复性任务中复用过程知识。如果每次遇到相似任务,智能体都要在有限的上下文窗口中从头推导策略,这显然低效且不可靠。

放弃提示词!Harness架构打造120/120满分企业级Agent

许多企业级大模型应用在原型阶段表现惊艳,往往只需一段系统提示词加上基础的检索增强生成(Retrieval-AugmentedGeneration,RAG)就能在演示环境跑通业务逻辑。然而一到真实商业环境落地,合规溯源、权限路由和输出审计等严苛要求,会让单纯依赖提示词的系统瞬间崩溃。

从“死记硬背”到“经验直觉”:LLM智能体记忆机制的三阶进化论

很多开发者在构建大模型智能体时,常会遇到一个非常棘手的问题。给智能体配备了外部工具,写了超长的提示词,但它在多步复杂任务中依然会“断片”。它要么在同一个地方重复犯下逻辑错误,要么在动态变化的环境中彻底迷失了最初的目标。根本原因在于,大语言模型(LargeLanguageModel,LLM)本身...

告别记忆污染!GAM分层图记忆让Agent长程推理提升86%

当前的大语言模型虽然能在单次对话中对答如流。但一旦进入长期交互,它们常常会陷入“记了新的,忘了旧的”的窘境。现有的记忆系统大多采用统一流式更新。这意味着每一次日常闲聊的噪音,都可能直接污染已经建立的核心知识库。如何让Agent既能快速吸收新信息,又能稳固保持长期记忆?

告别黑盒!GaP多智能体生成计算图,机器实操成功率飙升至99%

当前,端到端的视觉-语言-动作大模型在通用机器人领域风头正盛。然而,当这些模型真正走入商业和工业流水线时,往往会遭遇“水土不服”。在真实的工厂或商用厨房中,机器人需要日复一日地执行极高可靠性的任务。传统的“黑盒”大模型缺乏可解释性,一旦目标物体的位置或姿态发生微小偏移,成功率便会断崖式下跌。

GLM-4.5开源:32B激活参数斩获AIME 91%,重塑ARC全能模型

当前,大语言模型正从被动响应的知识库,向主动解决现实难题的通用求解器跨越。实现这一跨越的核心,在于彻底打通智能体、逻辑推理与代码这三大核心能力。然而,闭源巨头在特定领域表现惊艳,开源界却始终缺乏一个能统一上述能力的轻量级霸主。本文将深入剖析清华大学与智谱AI最新联合发布的GLM-4.5及其轻量版。