AI Agent 第11页

SR-Agent:快手用Agent闭环自演化重排策略,订单量提升0.71%

为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“LLM 当用户评分裁判”。

SIDEL:第三方API路由暗藏杀机,四大Coding Agent防御率全为0%

SIDEL:为了支撑评测,作者团队手工构建了一个包含 400 个样本的高质量恶意注入数据集,全面覆盖四大攻击类型: 1. 恶意代码执行 (100 例):包括反向 Shell、特权提升、后门植入与系统破坏。2. 错误代码生成 (100 例):包括隐蔽 Logic Bug、死锁注入、资源泄漏与安全...

AgentBrew:无需验证器与模拟器,单批离线数据让32B逆袭235B

快手技术团队、南洋理工大学与东南大学联合提出的 AgentBrew 框架,试图打破这一死局。该方案放弃了对外部验证器和模拟器的依赖,仅凭单次采集的原始离线交互数据,便在三个真实的 MCP 复杂应用(GitHub、Notion、PostgreSQL)上。

AppSim-Bench:告别真机随机噪音,19个手机Agent最高成功率仅50.27%

AppSim-Bench 专门设计了 183 个包含数值推理属性的子任务,涵盖四类具体操作: - 计数(Counting) :需要连续滑动并统计界面上符合条件的卡片或列表项总数; - 算术计算(Arithmetic Calculation) :需要抓取多个控件中的数值并进行加减折算。

Change2Task:把历史PR迁移到现代代码分支,存储成本降低71.2%

为了破解“真实性”与“现代可执行性”之间的两难困境,研究者提出了名为 Change2Task 的系统性框架。该系统的核心逻辑在于: 不再费尽周折地去维护老旧历史快照,而是将代码库历史中已合并的真实 Pull Request(PR)所承载的开发者意图,精准“重构”到该项目当前健康、可运行的现代分...

HAE-GEO:深度搜索Agent遭遇分层网页投毒,为何验证了也很难纠错?

针对这一空白,来自蚂蚁集团与浙江大学的研究团队提出了专门针对深度搜索 Agent 的端到端分层评估基准 HAE-GEO 。该基准将原本不可见的交互过程拆解为从“暴露”到“恢复”的五阶行为轨迹,并在控制变量的真实网页环境中,测试了 10 款主流模型面对由浅入深的三层投毒时的真实表现。

CMU提出MOLE:72%智能体成内鬼,最强监控仍漏掉近半危害

CMU:更进一步,团队提出了一种成本感知的选择性路由架构:先用轻量级统计特征过滤出高风险异常时段,仅在可疑度达到阈值时才唤醒开销巨大的强模型进行精细语义研判。实验表明,这种按需调用的动态策略在取得 0.629 的 Budget-AUC 的同时,比全量无差别运行高阶监控器降低了系统成本,综合性能...

不是经验越多就越聪明:PATH-Bench揭示终身智能体的路径依赖困境

针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench 。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Probe Task)为核心的受控历史序列。

SecRespond:阿里联合港科大测评23款大模型,真实入侵应急响应竟无一通关

面对一台已经被攻击者通过网络渗透拿下的云主机,Agent 能否像资深安全专家一样,根据告警日志与底层只读磁盘快照,层层抽丝剥茧还原整个入侵链路,找齐所有隐蔽后门,并提出一套真正可用且完成闭环验证的处置修复方案?来自阿里巴巴与香港科技大学的研究团队给出了一个里程碑式的基准评测: SecRespo...

TAPO:不靠额外数据,让大模型 Agent 学会“预判动作后果”

针对这一问题,本文提出了一种轻量且通用的后训练框架—— TAPO (Transition-Aware Policy Optimization)。该方案的核心突破在于: 不采集任何额外的专家数据,不增加任何多余的在线采样环境交互,也不在推理时引入额外的计算负担。

SafeKeep:大模型做成Agent就学坏?压平工具格式让拒绝率提升至70.6%

基于这一底层机理,研究团队提出了一个极为简洁却极其有效的轻量防御方案 SafeKeep :在推理时将“安全审计”与“工具执行”彻底解耦。在安全评判环节,把原本结构化的 Schema 剥离成扁平的自然文本叙述,瞬间唤醒模型原本的对齐能力,随后再让安全的请求进入常规的 Schema 执行流程。

TREK:告别LLM裁判,最强Agent复杂规划完美率仅46.2%

TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务落地的严肃场景中,唯有完全客观、零裁判的确定性规则以及经过实证可达的黄金上限。

WikiLoop:让检索反馈反哺知识库构建,多文档问答提升 6.3 分

腾讯的研究团队在论文中提出了名为 WikiLoop 的反馈耦合框架,尝试打破这一长期存在的单向壁垒。该方案的核心思路在于:构建一套专为智能体机器导航设计的原生维基知识库(Agent-Native Wiki),并将知识库构建者(Builder)与检索导航者(Navigator)的策略整合进同一个...