AI Agent 第16页

AgentMercury:从业务场景自生成交互环境,环境构建成功率达83%

在强化学习与智能体(Agent)研究领域,构建高质量、多样化且可交互的真实环境一直是最沉重的工程包袱。无论是经典的机器人仿真,还是如今风头正劲的代码编写与企业运维智能体,训练环境往往都是工程师手动用代码“硬抠”出来的,或者围绕某些固定基准测试集特异性拼装而成。

ClawSentry:四阶段渐进式防御,将Agent攻击成功率降至2.61%

在大模型技术从单纯的“聊天对话”向具备自主行动能力的“智能体(Agent)”演进的过程中,系统所面临的安全边界正在发生根本性的位移。当Agent获得了读取本地文件系统、执行Shell脚本、调用外部API以及加载第三方技能(Skills/Tools)的权限时,传统的提示词安全和输出内容审核立刻显...

EvoMal:自演化 Coding Agent 如何在模仿中“自我投毒”?

大模型编程智能体(CodingAgent)正在经历从“单次工具调用”向“自演化系统”的重要跃迁。像Voyager、MetaGPT等经典框架,以及兼容ModelContextProtocol(MCP)等工具生态的现代Agent,不再仅依赖预设的静态工具箱;它们能够在解决软件工程任务的过程中,将自...

NIS-Agent:打破自证偏见!阿里与浙大用上下文隔离节约33%Token

在复杂的信息检索与深度推理任务中,基于大语言模型(LLM)构建的深度搜索智能体(DeepResearchAgents)正在展现出惊人的自主规划能力。然而,许多工程师和研究人员在实测中都会遭遇一个令人沮丧的现象:当智能体一旦拟定了一个稍微偏离正轨的搜索关键词,或者在早期生成了某个并不严谨的子计划...

OBPE:不在Prompt里防越权,带外策略将Agent违规率压至0.2%

当开发者把一个具有广泛权限的系统凭据(Credential)交给自主运行的大语言模型Agent时,一个根本性的安全隐患就此埋下:Agent继承了人类在系统里的访问触达范围,却没有继承人类在具体场景中运用权限的审慎判断。

LUCAID:多模态智能体协同九大模块,前瞻临床验证达93%一致性

在肺癌精准医疗的实际诊疗中,病理评估早已超越单纯的“看切片定良恶性”。临床医生制定靶向治疗、免疫治疗或抗体偶联药物(ADC)方案,必须依赖组织形态学(H&E)、免疫组织化学(IHC)多标志物以及分子变异数据的深度整合。

LycheeMemory V2:告别逐轮蒸馏,写入Token骤降86%还拿下双榜第一

要让大语言模型(LLM)从只会单轮对话的聊天机器人,蜕变为能长期伴随用户的智能体,外部记忆系统不可或缺。然而,当前主流智能体记忆系统的运行逻辑存在一个隐形却极其昂贵的代价:每产生一轮对话,系统就急于调用一次LLM去抽取实体、总结事实并更新记忆库。

华为ScienceFlow:可恢复工作区加持,MLE-bench奖牌率达70.22%

长期以来,让人工智能代理(LLMAgent)像人类研究员一样自主开展科学探索与机器学习研究,一直是自主系统领域极具野心的目标。然而,当科研任务的跨度从几十分钟的单次代码生成,拉长到数小时乃至数天的连续实验时,现有的自动科研代理(AutoresearchAgents)往往会迅速陷入瓶颈。

SearchArt:华为提出长程搜索智能体训练框架,27B模型多项基准比肩顶尖闭源Agent

大语言模型(LLM)驱动的搜索智能体(SearchAgent)正从简单的单轮关键词检索,演进为需要多轮规划、长程探索与交叉验证的深度推理系统。然而,训练一个真正可用的长程搜索智能体始终面临结构性困难:现实中极度缺乏高质量、长周期的搜索与研究任务数据,人工标注完整轨迹成本高昂,且模型在多步工具调...

SKILL.state:用显式状态取代对话历史,Google将长程Agent复杂度降至O(T)

在构建自主智能体(AutonomousAgent)时,业界几乎默认遵循一种“对话式上下文累积”的运行范式:智能体每执行一步,就把环境观察、思考链(CoT)、工具调用参数和执行返回值,线性追加到上下文末尾。只要执行步骤变长,Prompt就会像滚雪球一样迅速膨胀。

SMA:无需微调与外接工具,程序性空间记忆让VLM提升16.4分

在具身智能、机器人规划和多模态助手的技术演进中,空间智能(SpatialIntelligence)正被视为大模型迈向物理世界的核心基石。然而,即便是当前顶尖的视觉语言模型(VLM),在面对三维空间关系推理、遮挡判断、坐标定位和深度估计时,依然暴露出明显的脆弱性。

清华等提出 TideRL:就绪感知破除 Agent 强化学习死等,训练吞吐提升 5.6 倍

大语言模型(LLM)正迅速从“单轮对话的文本生成器”迈向“多轮自主行动的智能体(Agent)”。在浏览网页(WebArena)、操控操作系统(OSWorld)或执行复杂代码任务时,模型需要不断输出动作指令、调用工具或系统API,并在等待外部环境反馈后将新的观察结果追加进历史上下文,开启下一轮推理。

openJiuwen:华为双层自适应架构,长程代码Agent双榜超榜首3.4分

大语言模型在软件工程领域的应用,正在经历一场从“单轮代码片段生成”向“长程(Long-Horizon)自主智能体”的范式转移。面对真实代码仓库中盘根错节的依赖、长达数十甚至上百步的探索轨迹,智能体脚手架(AgentHarness)的角色已经从最初薄薄的一层API封装,蜕变成为决定整个系统上限的...

从碎片化到全场景扩展!AgentOmnia将四榜宏平均提升至41.69%

大语言模型在智能体(Agent)方向的进化一日千里,但一个令许多开发者感到挫败的现象依然存在:在某个框架或基准测试中表现卓越的“高分智能体”,一旦被放入全新的工具生态、面对跨系统的长周期任务,或是遇到难以预测的用户追问时,往往会迅速崩溃。

AppDeltaWorld:基于增量代码机制的GUI世界模型,评测达73.5分

移动端GUI(图形用户界面)智能体正处于一个关键的演进节点。多模态基础模型的出现,使得智能体可以直接通过屏幕像素感知和触摸动作来操作智能手机。这种通用的交互范式使其能够跨越繁杂的应用边界,直接执行复杂长程任务。