AI Agent 第27页

Online Process Reward Leanring for Agentic Reinforcement Learning

本文提出了一种名为在线过程奖励学习 (Online Process Reward Learning, OPRL) 的智能体强化学习信誉分配策略,该策略通过在线交替优化一个过程奖励模型和智能体策略,将轨迹级别的偏好无缝转化为密集的步骤级奖励,从而在不依赖额外数据或步骤标签的情况下,高效稳定地训练...

Tree Search for LLM Agent Reinforcement Learning

本文提出了一种名为 Tree-GRPO (Tree-based Group Relative Policy Optimization) 的方法,通过将传统强化学习中独立的链式轨迹采样替换为树搜索采样,从而在有限的 rollout 预算下为多轮智能体任务生成更多、更高质量的轨迹,并利用树结构从稀...

A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models

时间序列数据在金融、医疗、能源等领域无处不在,推动了监控、预测和决策等关键应用的发展。然而,许多新兴应用如个性化医疗、自适应风险管理等,要求模型不仅能预测,还能解释其输出、进行因果推理和决策。这突显了时间序列分析对结构化和可靠推理能力的迫切需求。

Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents

本文提出了一种名为“回合级评审强化学习” (Turn-level Adjudicated Reinforcement Learning, TARL) 的流程监督方法,该方法利用大型语言模型 (LLM) 作为裁判提供细粒度的回合级奖励,并结合混合任务训练策略,以解决长程交互中的信用分配和探索不足...

Virtual Agent Economies

随着自主人工智能(AI)智能体的迅速普及,一个全新的经济层面正在崛起。在这个层面中,智能体以超越人类直接监督的规模和速度进行交易与协作。本文提出了“沙盒经济”(sandbox economy)这一框架来分析这个新兴系统,并从两个关键维度对其进行刻画:其起源(自发涌现 vs. 有意设计)以及其与...

Architecting Resilient LLM Agents: A Guide to Secure Plan-then-Execute Implementations

本文提出了一种名为“规划-执行” (Plan-then-Execute, P-t-E) 的弹性LLM智能体架构指南,该架构通过解耦战略规划与战术执行来建立控制流完整性,从而天然地抵御间接提示注入攻击,并为在LangChain、CrewAI和AutoGen等主流框架中实现该架构提供了详细的安全蓝图。

Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents

本文提出了一种名为熵调制策略梯度 (Entropy-Modulated Policy Gradients, EMPG) 的框架,通过利用智能体在长时程任务中每一步的内在不确定性(熵)来动态调整策略梯度,从而有效解决了稀疏奖励下的信用分配难题,显著提升了大型语言模型(LLM)智能体的学习效率和最...

Dynamic Speculative Agent Planning

本文提出动态推测规划 (Dynamic Speculative Planning, DSP),一个通过在线强化学习自适应调整推测步骤(speculation step)的智能体规划框架,旨在实现无损加速的同时显著降低成本,并允许用户控制延迟与成本之间的权衡。

Reinforcement Learning for Machine Learning Engineering Agents

这项机器学习工程智能体研究通过强化学习(RL)更新模型权重,分析Qwen2.5-3B等小模型完成工程任务的能力。本文解读训练任务、奖励设计和评测结果,比较训练式改进与增加推理计算的路线,并讨论结果适用的资源条件。

Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers

本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。

Supporting Our AI Overlords: Redesigning Data Systems to be Agent-First

本文指出,未来的数据系统将主要服务于由大型语言模型(LLM)驱动的智能体,并提出了一种“智能体优先”(agent-first)的数据系统新架构,以高效处理智能体工作负载中普遍存在的高吞吐量、异构、冗余和可引导的“智能体推测”(agentic speculation)过程。

Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision

本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。

A Survey on Large Language Model based Autonomous Agents

LLM Agent全面爆发:人大重磅综述,一套统一架构读懂通往AGI的未来。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Reflexion: Language Agents with Verbal Reinforcement Learning

本文提出 Reflexion 框架,通过让语言智能体对过去的试错经验进行口头反思(verbal reflection)并形成文本记忆,从而在无需更新模型权重的情况下实现强化学习,显著提升了其在决策、推理和编程等任务上的表现。