SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
本文提出了一种名为 SlideAgent 的分层智能体框架,通过设置全局、页面、元素三个级别的专业智能体,将复杂的多页视觉文档理解任务分解,先构建独立于查询的结构化知识库,再进行针对性推理,从而显著提升了大型语言模型在处理幻灯片等文档时的细粒度理解和推理能力。
本文提出了一种名为 SlideAgent 的分层智能体框架,通过设置全局、页面、元素三个级别的专业智能体,将复杂的多页视觉文档理解任务分解,先构建独立于查询的结构化知识库,再进行针对性推理,从而显著提升了大型语言模型在处理幻灯片等文档时的细粒度理解和推理能力。
本文提出了一种名为 AgentFold 的新型网页智能体,它通过模仿人类主动管理心智暂存区的方式,在执行长时程任务时对上下文进行主动“折叠”和整合,从而在保持上下文简洁性的同时避免关键信息丢失,并以较小的模型规模实现了顶尖的性能。
本文提出了 AgentFrontier,一个基于教育心理学“最近发展区”(ZPD)理论的数据合成框架,通过自动生成位于大语言模型(LLM)能力边界上的复杂推理数据,从而系统性地提升智能体(Agent)的跨领域、综合推理能力。
本文提出了一种名为 ParallelMuse 的两阶段智能体并行思维框架,通过“功能指定的局部展开”策略和“压缩推理聚合”方法,在提升深度信息寻求 (deep information-seeking) 任务效果的同时,显著降低了探索所需的Token成本。
本文提出了一种名为 E-GRPO 的新方法,通过重利用合成数据生成过程中被忽略的实体信息,构建了一个细粒度的实体感知奖励函数,以解决传统强化学习方法中的奖励稀疏和“功亏一篑”(near-miss)问题,从而更有效地训练搜索智能体。
Agentic AI综述从符号/经典与神经/生成两条技术谱系梳理智能体架构,解释规划、决策及工具交互的不同实现方式。本文解读其分类框架、典型应用和未来方向,帮助区分不同类型智能体的能力来源与适用边界。
本文提出了一种专为金融科技(Fintech)领域设计的智能体化检索增强生成(Agentic Retrieval-Augmented Generation, A-RAG)架构,通过一个由专业智能体组成的模块化、迭代式流水线,有效解决了领域内术语密集、缩写混杂和知识碎片化等挑战,显著提升了检索精度...
本文提出了一种名为 AsyncThink 的新推理范式,它允许大型语言模型通过一种“组织者-工作者”协议,将复杂的思考过程分解为可并发执行的子任务,并通过强化学习自主学会如何优化这种异步协同结构,从而在降低推理延迟的同时提升了解决问题的准确性。
本文提出一个名为FM Agent的通用多智能体框架,该框架创新性地结合了大型语言模型(LLM)的推理能力和大规模进化搜索,以自动化方式在运筹优化、机器学习、GPU内核优化和数学问题等多个领域解决复杂的现实世界挑战,并取得了最先进(SOTA)的成果。
本文提出了一种名为智能体数据协议 (Agent Data Protocol, ADP) 的轻量级表示语言,它通过将来自不同来源、格式各异的智能体训练数据统一为标准模式,解决了数据碎片化问题,从而实现了对大型语言模型智能体进行大规模、多样化且高效的监督式微调。
本文提出了一种名为“智能体元编排器” (Agentic Meta-Orchestrator, AMO) 的新架构,用于构建可扩展的多任务Copilot服务,该架构通过学习排序模型进行智能体路由,利用LoRA臂实现高效多任务推理,并通过元学习决策树来动态规划推理路径。
本文是一篇以应用为导向的综述,系统性地分析了检索增强生成(RAG)、推理增强以及智能体(Agentic Systems)系统如何通过提升模型能力来缓解大型语言模型(LLM)中的知识型和逻辑型幻觉。
随着大型语言模型 (Large Language Models, LLMs) 的兴起,一种新的范式——数据智能体 (Data Agents)——应运而生。数据智能体被定义为一个综合性的、由LLM驱动的架构,它能自主协调数据与AI生态系统,以处理复杂的数据相关任务。
本文提出了Alita-G,一个自进化生成智能体框架,它通过系统性地生成、抽象和管理一系列称为模型上下文协议(Model Context Protocol, MCP)的工具,将一个通用智能体转化为特定领域的专家,从而在提升复杂推理任务准确率的同时降低了计算成本。
本文通过将智能体(Agent)的内存架构与乔姆斯基层级(Chomsky hierarchy)中的抽象机进行类比,建立了一套形式化等价框架,指出智能体的计算能力和可验证性由其内存类型(无内存、堆栈、无限读写内存)决定,从而为设计更高效、更安全的智能体系统提供了理论基础和工程指导。
本文提出了一种名为 BrowseConf 的测试时扩展 (Test-Time Scaling, TTS) 方法,它通过利用大语言模型智能体对其回答的“口头表述置信度” (Verbalized Confidence),来动态决定是否需要进行额外的计算尝试,从而在保证任务性能的同时,显著提升了网络...
本文提出了一种名为“多智能体进化 (Multi-Agent Evolve, MAE)”的框架,通过让单个大语言模型扮演提问者 (Proposer)、解答者 (Solver) 和裁判 (Judge) 三个协同进化的角色,利用强化学习在无需人工标注数据的情况下实现通用推理能力的自我提升。
本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具集解决复杂真实世界任务。
现有用于评估智能体的基准测试主要沿着两个维度发展:搜索宽度与搜索深度。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 Mixture-of-Minds (MoM) 的多智能体框架,它将表格理解任务分解为规划、编码和回答三个专门的角色,并引入一个基于蒙特卡洛树搜索(MCTS)和强化学习(RL)的自提升训练框架,从而显著提升了模型的表格推理能力。
本文提出了一个名为 TheMCPCompany 的大规模工具调用基准(包含超18000个工具),并通过实验证明,利用专门的工具集比通用浏览器能带来更好的性能和更低的成本,但从海量工具中检索并组合正确工具以解决复杂问题仍是当前智能体面临的核心挑战。
本文提出了一种名为 VideoAgentTrek 的可扩展方法,通过一个逆动力学模块(VADM)从未经标注的公开屏幕录制视频中自动挖掘出结构化的训练数据,从而解决了训练计算机使用智能体(Agent)时对大规模手动标注数据的依赖问题。
好的,我已判断这是一篇 [综述] 论文。我将严格遵循综述报告的模板,以原文结构为基础,重点剖析其提出的分类体系,并提炼核心内容。
本文提出并探讨了“智能体不平等”(agentic inequality)这一新概念,即因AI智能体的接入和能力差异而导致的权力、机会与结果上的不平等,并构建了一个包含可用性、质量和数量三个维度的分析框架,以系统性地分析和应对这一挑战。