AI Agent 第24页

Mathematical Framing for Different Agent Strategies

告别炼丹玄学:谷歌用概率统一AI Agent,提出“自由度”新思路。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

PPTArena: A Benchmark for Agentic PowerPoint Editing

PPT炼狱场来了!新Agent PPTPilot精准编辑,性能超越专有模型10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Prune4Web: DOM Tree Pruning Programming for Web Agent

LLM不读万行代码:Prune4Web让网页元素定位精度飙升至88%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

General Agentic Memory Via Deep Research

AI记忆革命GAM:用“即时研究”取代静态压缩,长文本任务准确率超90%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Budget-Aware Tool-Use Enables Effective Agent Scaling

AI Agent只会“挥霍”算力?谷歌BATS框架教它精打细算,成本性能双优化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

HaluMem: Evaluating Hallucinations in Memory Systems of Agents

AI Agent记忆也“幻觉”?HaluMem:首个记忆系统“CT扫描”基准,精准定位错误根源。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

GUI-360: A Comprehensive Dataset and Benchmark for Computer-Using Agents

本文提出 GUI-360,一个用于推进桌面级计算机使用智能体(CUA)的大规模、综合性数据集与基准测试套件,它通过一个由 LLM 增强的高度自动化流程构建,旨在解决真实世界任务稀缺、数据收集标注困难、以及缺乏统一基准的三大挑战。

Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation

本文识别并解决了多智能体 LLM 推理框架中的“懒惰智能体”问题,通过理论分析揭示其源于现有强化学习目标的内在偏差,并提出了一种名为 Dr. MAMR 的新框架,该框架利用夏普利启发的因果影响测量和一种可验证的深思熟虑(deliberation)奖励机制,以促进智能体之间更均衡、更有效的协作。

Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse

本文提出了一种名为 Tree Training 的新训练范式,通过将智能体交互产生的树状轨迹数据进行高效打包和计算复用,在训练的前向和后向传播中对共享的前缀(prefix)只计算一次,从而显著提升了智能体大语言模型(Agentic LLM)的训练效率。

What's the next frontier for Data-centric AI? Data Savvy Agents

近期,能够自主交流、与人类协作并使用多种工具的AI智能体 (agents) 的兴起,为各种真实世界场景解锁了巨大的机遇。然而,尽管这些基于大型语言模型 (LLM) 的智能体在自然语言理解和问题解决方面取得了显著进展,它们大多仍局限于具有预定义数据和结构化任务的受控环境中。

Dynamic Affective Memory Management for Personalized LLM Agents

本文提出了一种名为DAM-LLM的动态情感记忆管理系统,通过引入基于贝叶斯的更新机制和记忆熵概念,使智能体能够自主维护一个动态更新的记忆数据库,以解决传统静态记忆的冗余、过时和一致性差的问题,从而提供更具个性化的情感交互。