AI Agent 第17页

**AsmEvo:AMD突破无源码GPU优化!汇编级代理最高提速3.88倍**

在当今的高性能机器学习系统中,GPU内核的执行效率往往决定了整个大模型推理或训练的吞吐天花板。然而,在实际的工业部署环境中,开发者常常面临一个极为棘手的黑盒困境:那些真正跑在显卡上的算子,往往只是一团无法直接阅读和修改的编译后二进制文件。

AutoSaddler:微软基于执行追踪自动优化Agent框架,性能最高提升10个百分点!

随着大型语言模型(LLM)能力的飞速提升,我们见证了它们在诸多单步交互任务中展现出令人惊艳的表现。然而,当这些模型被真正放入自主代理(Agent)系统中,去执行需要长期规划、多步推理和复杂环境交互的任务时,一种被称为“参差智能”(JaggedIntelligence)的现象便会显现:它们在某些...

SSPO:步级自蒸馏机制,仅5%开销超越双倍训练步数GRPO

大型语言模型在处理现实世界任务时,正越来越依赖于多步推理与外部工具调用的结合。尤其是面对模糊、信息不全的用户查询,深度搜索智能体(DeepSearchAgents)需要在广阔的开放网络中主动探索,其交互轨迹往往会跨越数十个步骤。

KOPE:图记忆重塑算子优化,提速1.54倍且Token骤降93%!

硬件算子(HardwareKernel)的优化一直是一项高度依赖专家经验的密集型工程。为了充分榨取硬件性能,工程师需要综合考虑目标设备的内存层次结构、数据搬移策略、并行执行机制以及特定的硬件约束。每一次优化尝试,都必须经历编译、正确性测试、性能剖析(Profiling)和代码修订的漫长循环。

NVIDIA与CMU提出CAKE:Agent与编译器协同设计,前沿Kernel提速2.05倍!

在过去几年中,利用大型语言模型(Agent)来编写和优化底层GPU代码(Kernel)成为了提升AI计算效率的热门路径。然而,当前的大部分尝试都面临着一个难以逾越的瓶颈:Agent通常将编译器视为一个僵化的黑盒。它们提交代码、等待编译、运行测试,最后只能获得一个冰冷的报错信息或一个总体的执行延...

Scroll:阿里将上下文变可编程环境,长任务超最优37.4分

在大语言模型(LLM)逐渐从单轮问答转向执行长期复杂任务(如仓库级软件工程、开放网络深度研究)的今天,智能体(Agent)面临着一个不可回避的物理瓶颈:随着交互轮次、工具调用和观察结果的不断累积,会话历史的长度将不可避免地远超单一模型的上下文窗口上限。

EvolveNet:不是聚合数据而是聚合代码!协作式Agent进化机制提升5大场景

大语言模型(LLM)本身并不等同于一个真正可运行的智能体(Agent)。决定Agent最终能力边界的,不仅是底层的神经网络权重,更是包裹在模型外围的“控制程序(Harness)”——这套可执行代码负责构建多轮上下文、精准调用外部工具、验证中间推理结果,并在遭遇死胡同或运行崩溃时执行恢复策略。

HANDBOOK.md:65个长文档智能体任务,最强模型仅达36.2%

大语言模型智能体正在以前所未有的速度深入企业核心业务流。在真实的生产环境中,它们的部署模式通常遵循一种默认的“长期指令”架构:开发者会将一份系统提示词、一份企业合规文件或是一份厚厚的技能说明书塞进模型的上下文窗口中,并理所当然地信任智能体在后续所有的工具调用和多步交互中,都能严格受这些先决规则...

LabEvolver:无需训练的经验进化机制,湿实验耗时缩减48%!

当前的自动化科学发现正在向“第五范式”迈进,即依赖自动驾驶实验室(Self-drivinglaboratories,SDLs)通过机器人实现高通量实验。然而,在这个看似前沿的领域中,存在一个极为底层的痛点:绝大多数湿实验智能体仍停留在“无记忆”的静态执行阶段。

LEGO-RL:无缝桥接代码脚手架与强化学习,SWE-bench达70.4%!

随着大模型在复杂软件工程任务中的应用日益深入,针对代码智能体(CodingAgents)的强化学习正在成为前沿焦点。这类智能体在执行任务时,高度依赖长时间运行的智能体脚手架(AgentHarnesses)来管理工具集成、代码仓库上下文以及执行反馈。

LongHorizon-Harness:引入MEA循环,长周期Agent成功率升至80.7%!

随着大语言模型(LLM)能力的跃升,我们对自主智能体(Agent)的期待早已超越了简单的多轮对话或单步问答。如今的Agent被部署在软件工程、科学发现和通用桌面控制等复杂的真实世界场景中,这就要求它们必须具备执行长周期(long-horizon)任务的能力。

Skill Self-Play:用协同进化技能指导LLM自我对弈,工具调用提升42.9分!

大语言模型(LLM)的训练正在经历一次深刻的范式转移。过去的模型能力提升极度依赖于人类精心构造的高质量数据和海量手工标注,而如今的前沿研究已经将目光投向了由交互驱动的“自我进化”(Self-Evolution)。在这一维度上,自我对弈(Self-Play)成为了一项核心技术。

从Compaction Cliff到Knowledge Triage:Agent安全规则留存率提升2-4倍

在长期运行的AIAgent应用中,随着上下文历史不断积累,系统不可避免地会触发记忆压缩机制以适应大语言模型的Token预算限制。然而,现有的工业界压缩策略往往忽视了一个致命问题:一条生死攸关的安全规则和一行无关痛痒的系统执行日志,在Token预算溢出时,正以相同的概率遭到删改。

SRE-Bench:首个无污染逆向基准,最强AI仅解出31.5%

在过去一年里,具备自主运行能力的网络安全AI智能体(CybersecurityAgents)在漏洞挖掘和代码审计领域展现出了惊人的进展。然而,这种繁荣很大程度上建立在一个理想化的前提之上:智能体能够直接获取目标软件的源代码。

UC Berkeley提出表征引导:无需微调控制工具调用,准确率升至0.56!

让大模型从一个只会聊天的文本生成器,转变为能够解决实际问题的智能体(Agent),其核心跨越在于赋予模型调用外部工具的能力。不论是查询实时搜索引擎、运行Python脚本,还是发送邮件、执行SQL数据库操作,决定“在什么时候使用工具”不仅是智能体认知能力的核心体现,更是工业界落地时必须精打细算的...

BRACE:具身智能预算化重规划机制,SLO违规率降至4.7%

在具身智能(EmbodiedAI)的实际部署中,环境始终充满了不确定性。无论是执行过程中的物理偏移、传感器带来的部分可观察性,还是多智能体协同中的突发状况,都迫使智能体必须频繁地进行“重新规划(Replanning)”以纠正错误。

港科大揭露 Agent 回滚漏洞:KV Cache 残留致 25/63 测试翻车

对于构建大语言模型智能体(LanguageAgent)的开发者而言,有一个几乎成为本能的开发假设:如果模型在多步执行中走错了路,或者获取了不安全的工具返回结果,我们只需要“撤销”这一步,把有害内容从对话历史(Transcript)中剔除,Agent就能回到干净的状态重新思考。

ACM:CMU提出自主无损上下文管理,Agent长程搜索提升27%

在大型语言模型(LLM)驱动的自主智能体(Agent)研究领域,长程任务始终是一个难以逾越的物理与认知双重瓶颈。当智能体在真实环境中执行复杂的网络搜索或代码编写任务时,它们不可避免地会与环境进行多轮交互。

Agent Lightning v1.0:微软等破解带壳代理RL难题,SWE-bench提升14.6%

在当前的大模型应用生态中,现代智能体(Agent)早已不再作为裸露的语言模型独立运行。它们被包裹在复杂的智能体外壳(AgentHarness)中,这些外壳负责管理工具调用、执行环境、上下文窗口以及长程控制流。外壳决定了智能体如何观察环境、如何在长周期内采取行动以及如何从错误中恢复,构成了智能体...

清华ACID-Agent:为Agent引入数据库四大特性,提升10.6%

大语言模型(LLM)驱动的智能体正在经历一次关键的范式转换:从单轮对话助手,走向能够在真实环境中通过推理、工具调用和工作区操作来执行长周期任务的自治系统。然而,随着任务流程的拉长,现有智能体暴露出了致命的脆弱性。

人大 ClawGym II:前缀树黑盒RL框架,长任务提升14.8分

在构建能够处理长周期、复杂现实任务的通用智能体(Agent)时,研究人员和工程师们越来越依赖于成熟的“智能体执行框架”(AgentHarness)。像ClaudeCode、Codex或OpenClaw这样的生产级系统,将系统提示词、工具接口、上下文管理、工作流编排以及重试与恢复机制封装在了一个...