AI Agent 第26页

Beyond Pipelines: A Survey of the Paradigm Shift toward Model-Native Agentic AI

近年来,AI领域的发展由生成式AI主导,但其本质上仍是被动响应。为了超越被动生成,实现自主行动,研究焦点正转向智能体AI (Agentic AI),它强调自指导行为、复杂推理和环境交互。智能体AI被广泛视为AI系统演化的下一阶段。

Internalizing World Models via Self-Play Finetuning for Agentic RL

本文提出了一种名为 SPA (Self Play Agent) 的智能体强化学习框架,它通过自我博弈(Self-Play)有监督微调(SFT),让大语言模型智能体在策略优化前先内化一个世界模型(World Model),从而显著提升其在分布外(OOD)环境中的学习性能和泛化能力。

What Limits Agentic Systems Efficiency?

本文对基于网络交互的智能体系统效率瓶颈进行了实证研究,并提出一个名为 SpecCache 的缓存框架,该框架利用推测性执行(speculative execution)来重叠模型推理与网络环境交互,从而在不降低任务性能的前提下,显著减少系统延迟。

A Multi-Agent Framework for Stateful Inference-Time Search

本文提出了一个无需训练的有状态多智能体进化搜索框架,通过结合持久化推理时状态、对抗性变异和进化式搜索,提升单元测试中边缘案例的生成能力和代码覆盖率。

Inefficiencies of Meta Agents for Agent Design

本文通过实验揭示了一类流行的元智能体(meta-agent)在自动化智能体设计中存在的三个核心问题:学习效率低下、生成的智能体多样性不足以及经济可行性有限,并发现进化式上下文策展策略可以有效提升性能。

QAgent: A modular Search Agent with Interactive Query Understanding

本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

本文提出了一种名为 的多智能体强化学习框架,该框架通过训练一个对话智能体和一个反馈智能体进行协作,将安全对齐问题转化为一个正和博弈,从而同时减少大型语言模型(LLM)的不安全响应和过度拒绝现象,提升了模型在有益性(helpfulness)和无害性(harmlessness)之间的帕累托前沿。

MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement Learning

本文提出了一种名为 MARS 的双系统多智能体强化学习框架,该框架通过模拟人类认知的双系统(系统1的快速直觉与系统2的审慎推理),让两个智能体协同解决需要外部知识的复杂推理任务,显著提升了模型在动态信息环境下的深度研究和推理能力。

Staircase Streaming for Low-Latency Multi-Agent Inference

Staircase Streaming通过流式协作降低多智能体推理的串行等待,让下游智能体在上游输出完整结果前开始处理。本文解读分块传递、流水线并行和前缀缓存优化,比较首Token延迟与回答质量的权衡,并说明实验设置及适用边界。

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

本文提出并形式化了“智能体强化学习(Agentic Reinforcement Learning, Agentic RL)”这一新兴范式,将其定义为将大语言模型(LLM)从被动的序列生成器转变为在复杂动态环境中进行自主决策的智能体,并通过一个围绕智能体核心能力(规划、工具使用、记忆、推理等)的...

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

本文通过将多轮智能体强化学习(multi-turn agentic reinforcement learning)的设计空间分解为环境、奖励和策略三大支柱,系统性地进行了实证研究,并最终提炼出一套用于训练大型语言模型(LLM)智能体的实用方法配方。

GEM: A Gym for Agentic LLMs

本文介绍了一个名为GEM(General Experience Maker)的开源环境模拟器,它旨在像传统强化学习领域的OpenAI-Gym一样,为智能体大语言模型(Agentic LLMs)提供一个标准化的训练与评估框架,从而推动研究从静态数据集学习转向基于环境交互的经验学习。

TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments

本文介绍了一个名为 TOUCAN 的大规模工具智能体数据集,包含 150 万条从近 500 个真实世界 MCP 环境中合成的轨迹,旨在通过提供多样、真实且复杂的训练数据,显著提升开源大型语言模型(LLM)的工具调用和智能体能力。

Effective context engineering for AI agents

本文提出了“上下文工程” (Context Engineering) 的概念,主张将 AI 智能体开发的重点从编写静态提示词(prompt)转向动态地策划和管理输入给模型的全部信息(即上下文),从而在模型有限的注意力预算下,实现更可靠、更高效的智能体行为。

MAPEX: A Multi-Agent Pipeline for Keyphrase Extraction

本文提出了MAPEX,一个用于关键词提取的多智能体协作框架,它通过为不同长度的文档设计动态的双路径策略(知识驱动与主题引导),显著提升了大型语言模型(LLM)在零样本场景下的关键词提取性能。