SR-Agent:快手用Agent闭环自演化重排策略,订单量提升0.71%
为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“LLM 当用户评分裁判”。
为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“LLM 当用户评分裁判”。
为此,他们提出了 State-Path Tool Menu 框架,将工具菜单的本质重新定义为针对执行路径的“执行先验”(Execution Prior)。在完全不改动下游 Agent 架构、不调整在线执行循环、也不增加调用预算的前提下,仅靠重构 32 个槽位的候选菜单。
加州大学伯克利分校等机构的研究者在论文《Twin Agent: Context Residual Compression for Privilege Separated Agents》中提出了一个破局视角: 智能体的安全防御,本质上是一个“跨信任边界的信息流压缩问题” 。
很多团队寄希望于“等待下一代更强的前沿大模型来解决一切”,而企业级商业分析 Agent 公司 Leni 提出的研究却给出了不同的视角: 大模型的可靠性并不主要依赖模型本身的智商跃迁,而是取决于包裹在模型外部的架构设计 。
SIDEL:为了支撑评测,作者团队手工构建了一个包含 400 个样本的高质量恶意注入数据集,全面覆盖四大攻击类型: 1. 恶意代码执行 (100 例):包括反向 Shell、特权提升、后门植入与系统破坏。2. 错误代码生成 (100 例):包括隐蔽 Logic Bug、死锁注入、资源泄漏与安全...
针对这一根本瓶颈,这项最新研究提出了 工作流局部机制学习 (Workflow-Localized Mechanism Learning,简称 WML )。该框架告别了将技能当成整块文本或黑盒代码的盲目修改方式。
快手技术团队、南洋理工大学与东南大学联合提出的 AgentBrew 框架,试图打破这一死局。该方案放弃了对外部验证器和模拟器的依赖,仅凭单次采集的原始离线交互数据,便在三个真实的 MCP 复杂应用(GitHub、Notion、PostgreSQL)上。
针对这一核心瓶颈,最新研究提出了 AgenticRepair 框架。这项工作不单是在单 Agent 循环中添加更多工具,而是提出了 多维程序上下文工程(Multi-Faceted Program Context Engineering) ,通过拆分出三个专门的子智能体。
AppSim-Bench 专门设计了 183 个包含数值推理属性的子任务,涵盖四类具体操作: - 计数(Counting) :需要连续滑动并统计界面上符合条件的卡片或列表项总数; - 算术计算(Arithmetic Calculation) :需要抓取多个控件中的数值并进行加减折算。
为了破解“真实性”与“现代可执行性”之间的两难困境,研究者提出了名为 Change2Task 的系统性框架。该系统的核心逻辑在于: 不再费尽周折地去维护老旧历史快照,而是将代码库历史中已合并的真实 Pull Request(PR)所承载的开发者意图,精准“重构”到该项目当前健康、可运行的现代分...
ChronoMem 的提出,不仅为开源社区提供了一个开箱即用的工程插件,更指明了 Agent 记忆机制演进的必然趋势。以往的研究和商业实现,大多将重心放在了“如何让 Agent 记住更多、关联更广”,但忽视了“如何让 Agent 可靠地回退、精准地纠错”。
针对这一空白,来自蚂蚁集团与浙江大学的研究团队提出了专门针对深度搜索 Agent 的端到端分层评估基准 HAE-GEO 。该基准将原本不可见的交互过程拆解为从“暴露”到“恢复”的五阶行为轨迹,并在控制变量的真实网页环境中,测试了 10 款主流模型面对由浅入深的三层投毒时的真实表现。
为了彻底打破这种“自测自纠”中的共谋缺陷,来自佐治亚理工学院、微软研究院(MSR)和威斯康星大学麦迪逊分校的研究团队提出了 ExecCritic 。该工作将测试生成与代码修复彻底拆分为两个相互独立的智能体角色,通过硬核门禁机制冻结测试用例。
为此,研究团队提出了 FRAMES (Feedback-driven Reasoning with Adaptive Mutation and Evolution of Skills,自适应突变与技能演化的反馈驱动推理框架),旨在让大模型 Agent 在模型权重保持冻结的约束下。
针对这一矛盾,最新研究提出了 Meta-Task 框架,其核心哲学非常直接而巧妙: 与其用外部流水线生硬拼接任务,不如把“合成终端任务”本身定义为一个标准的 Terminal-Bench 格式任务(即元任务,Meta-Task) 。
CMU:更进一步,团队提出了一种成本感知的选择性路由架构:先用轻量级统计特征过滤出高风险异常时段,仅在可疑度达到阈值时才唤醒开销巨大的强模型进行精细语义研判。实验表明,这种按需调用的动态策略在取得 0.629 的 Budget-AUC 的同时,比全量无差别运行高阶监控器降低了系统成本,综合性能...
针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench 。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Probe Task)为核心的受控历史序列。
近期发表的这项工作提出了 SciDisco 框架,试图彻底改变这一现状。其核心思路不是在推理阶段堆叠复杂的 Prompt 工作流,而是构建了一个原生支持过程验证与多轮信用分配的训练闭环。
针对这一系列痛点,来自开源社区的研究者提出了 SearchMaster ,这是一个兼具“落地约束(Grounded)”与“行为规范(Regulated)”的搜索智能体自我博弈框架。
面对一台已经被攻击者通过网络渗透拿下的云主机,Agent 能否像资深安全专家一样,根据告警日志与底层只读磁盘快照,层层抽丝剥茧还原整个入侵链路,找齐所有隐蔽后门,并提出一套真正可用且完成闭环验证的处置修复方案?来自阿里巴巴与香港科技大学的研究团队给出了一个里程碑式的基准评测: SecRespo...
针对这一问题,本文提出了一种轻量且通用的后训练框架—— TAPO (Transition-Aware Policy Optimization)。该方案的核心突破在于: 不采集任何额外的专家数据,不增加任何多余的在线采样环境交互,也不在推理时引入额外的计算负担。
基于这一底层机理,研究团队提出了一个极为简洁却极其有效的轻量防御方案 SafeKeep :在推理时将“安全审计”与“工具执行”彻底解耦。在安全评判环节,把原本结构化的 Schema 剥离成扁平的自然文本叙述,瞬间唤醒模型原本的对齐能力,随后再让安全的请求进入常规的 Schema 执行流程。
TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务落地的严肃场景中,唯有完全客观、零裁判的确定性规则以及经过实证可达的黄金上限。
腾讯的研究团队在论文中提出了名为 WikiLoop 的反馈耦合框架,尝试打破这一长期存在的单向壁垒。该方案的核心思路在于:构建一套专为智能体机器导航设计的原生维基知识库(Agent-Native Wiki),并将知识库构建者(Builder)与检索导航者(Navigator)的策略整合进同一个...