SR-Agent:快手用Agent闭环自演化重排策略,订单量提升0.71%
SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation

在工业级电商推荐系统里,有一个长期被算法工程师默认接受、却又苦不堪言的维护痛点:排在整个推荐流水线最末端的“重排后策略”(Post-Ranking Strategies)。
ArXiv URL:https://arxiv.org/abs/2607.17719v2
通常,精排模型负责给海量商品给出点击率(CTR)或转化率(CVR)的分数,但真正呈现在用户屏幕上的列表,必须经过一层重排规则的精细修剪。这层策略负责控制品类打散、相似店铺去重、价格带分布、曝光疲劳度以及替代品多样性。如果完全放任精排模型发挥,系统很可能会在一屏内连续推出好几款高度相似的爆款鞋子,即便单品预测分数极高,也会直接毁掉用户的探索意愿。
这层机制简单、高效且推理成本极低,但现实中极难维护。线上的商品库每天都在变动,商家不断更新标题、改动主图、调整类目;用户的偏好和探索意图也在随时间漂移。原本设定的静态阈值和类目映射规则,上线几周就会逐渐失效。当线上出现糟糕的用户体验(Bad Case)时,传统的排查方式极其依赖人工:运营专家肉眼巡检截屏,跨团队反馈给算法工程师,工程师再根据经验修改某几个相似度阈值或打散窗口,测试无误后人工上线。这种“人肉修补”不仅反应滞后、人力成本高昂,而且改动的经验往往零散在不同工程师的脑海中,极难复用。

为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架:SR-Agent。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“LLM 当用户评分裁判”,而是首次在工业界大盘中跑通了一个完全闭环、带强力安全护栏、可自主演化的策略微调体系。在快手电商平台为期一个月的真实在线 A/B 测试中,SR-Agent 覆盖了约 6000 万用户与 7000 万商品,最终带来了订单量提升 0.71%、浏览深度提升 0.34%、点击品类多样性提升 0.48% 的全方位正向收益。
为什么大模型做推荐优化往往“不敢上实盘”?
近年来,关于大模型与推荐系统结合的探索层出不穷,但工业落地始终存在一条难以逾越的鸿沟。一类工作聚焦于构建 LLM 用户模拟器(如 Agent4Rec、SimUSER 等),通过给大模型赋予人设来模拟用户的点击、浏览或打分。这类模拟器通常只产出评估分数,无法直接输出可执行的工程级调整。另一类前沿研究则试图让智能体扮演全栈算法工程师,自动提出实验假设、修改训练目标甚至重写生产代码(例如 AgentX 等)。但在日活跃用户数以千万计的工业场景中,让大语言模型直接操作线上底层代码或随意生成无界参数,风险过高,工程团队绝不可能放任其在核心场景全自动演化。
快手团队在设计 SR-Agent 时做出了一个极具工业清醒感的取舍:冻结底层基座排序模型,把智能体的操作空间严格限制在强类型、有界的重排策略参数空间内。
在工业系统中,重排策略层恰恰是表达能力与安全边界平衡得最好的位置。它决定了最终呈现给用户的商品排列,直接掌管体验指标;同时它又是由清晰的规则、阈值、惩罚系数和白名单组成的。把 LLM 的推理能力从“写代码”收敛到“查问题、找根因、调参数”,既保证了策略的可解释性与可回滚性,又让全自动的演化闭环成为可能。
三位一体:巡检、归因与受控执行
SR-Agent 的核心运转机制由三个核心组件构成:负责体验巡检的 UserSim Agent、负责根因诊断的 Analysis Agent,以及负责执行与护栏拦截的 Strategy Refinement Harness。

首先介入的是 UserSim Agent。许多体验层面的缺陷往往难以直接通过全局聚合指标捕捉,因为每一个单独被曝光的商品可能都符合用户的短期兴趣,但组合起来却是一场灾难。UserSim 的定位不是预测用户未来的长期轨迹,而是带着当前用户的“行为画像与当下意图”,去审查已经生成的真实列表。它结合用户的近期点击、历史曝光偏好,对推荐列表中的商品图像、标题文本、店铺属性和类目层级进行多维度校验。
与通用的 LLM-as-a-Judge 仅输出抽象打分不同,UserSim 采用分阶段技能机制:它先分析曝光聚集模式,再推断商品间的细粒度关系(如属于同款替代品、功能互补品还是同类干扰项),最后结合上下文输出结构化的体验缺陷判定(Bad Case)。每一条判定都必须附带具体的证据链条 $e_b$ 和对应的商品集合 $I_b$。
紧接着,Analysis Agent 会对捕获到的 Bad Case 进行因果归因。在实际系统中,同一个前端表现可能对应着完全不同的底层成因。例如,推荐流前六个位置中连续出现了三双长相极其接近的运动鞋,这究竟是因为模型特征提取器的视觉相似度信号缺失?还是后台商品类目映射陈旧导致归组错误?亦或是重排打散规则的惩罚阈值设置过宽?
如果归因错误,后续的策略调整就会南辕北辙。Analysis Agent 通过多轮思维链推理,将表层的视觉与文本冲突映射到底层策略状态:它会判定缺陷是由动态替代品混淆、类目层级不匹配、阈值松弛,还是跨多刷的会话级累积曝光过密引起的。更关键的是,Analysis Agent 会将高频出现的同类失败模式抽象并固化到“诊断记忆库”(Diagnosis Memory)中,将一次性的排查经验转变为系统长期可用的先验知识。
最终,所有诊断结果被送入 Strategy Refinement Harness(策略调优装配器)。这是整个框架最核心的安全屏障。在这里,大模型不被允许编写任何脚本或修改模型损失函数,它面对的是一个预先定义好的强类型动作空间 $\mathcal{A}$。
具体而言,调优动作被严格限制在以下四种类型之中:
-
关系阈值微调:针对视觉、语义或替代品相似度阈值进行微调,且强制限定在如 $[-0.15, +0.15]$ 的极小浮动区间内;
-
冗余打散系数微调:仅允许在授权的商品组内微调打散惩罚权重 $\Delta\lambda$;
-
曝光限制微调:调整特定品类、店铺或价格区间的曝光滑窗大小与频次上限;
-
受控类目映射修正:对存在明显分类歧义的叶子类目执行合并、拆分或重映射,但涉及此类操作时必须进入人工白名单审查。
四阶段门禁与线上真实检验
生成候选动作后,系统绝对不会立刻下发线上,而是必须顺序通过一道四阶段的准入护栏:
-
坏案针对性重测:调用预置的规则脚本在历史坏案记忆库中重新跑一遍,如果该参数修改无法在定向场景中解决至少一部分已知缺陷,提案直接被否决。
-
历史流量回放:将候选参数放在更大规模的历史离线流量样本上进行批量重放,监控全量商品曝光分布与排序列表的变动幅度,确认该调整不会在解决局部问题的同时引发全量推荐的负向回退。
-
运营专家抽检与白名单核验:通过自动化离线双重门禁后,系统会将参数变更与诊断报告推送到后台,由人类专家进行低频审查。在快手的日常运行中,专家仅需抽检约 1% 的自动化诊断结果,极大解放了人工精力。
-
受控小流量在线 A/B 测试:只有通过前三步的候选策略,才会被部署进线上小流量分桶。若线上核心体验或业务指标产生不可预期的下滑,系统具备毫秒级的状态回滚能力。
快手将这套架构部署在真实的电商推荐流中,进行了为期一个月的严格 A/B 实验。实验组保持精排模型完全不动,仅由 SR-Agent 在后台持续迭代重排策略,对照组则使用线上长期演化而来的专家精调策略。
实验测得的数据证明了策略演化的商业价值与体验收益:在 2.5% 的测试流量中,SR-Agent 驱动的实验组相比基线,订单量增长了 0.71%,GMV 提升了 0.46%,点击商品量增长了 0.55%,同时用户的浏览深度增加了 0.34%,点击品类的丰富度提升了 0.48%。
这组数据在成熟的电商工业大盘上极其可观。通常情况下,单纯提升品类多样性往往会以牺牲短期点击转化率为代价;但 SR-Agent 实现了多样性指标与交易转化指标的同步上升。这说明它消除的正是那些“用户反感、毫无探索价值的机械重复”,让原本被冗余商品占用的黄金曝光坑位,替换成了真正契合用户多维兴趣的新选择。
坏案解决率的演化与经典实战案例
随着闭环循环的持续推进,系统的自我进化能力在数据曲线上展现得尤为清晰。论文统计了连续十次策略更新迭代中的关键指标:针对目标坏案的解决率从最初第 1 次迭代的 49.2%,一路攀升至第 10 次迭代的 83.1%,净提升了 33.9 个百分点。前几次迭代迅速修复了线上覆盖广、特征明显的普遍性冲突,后续更新则稳步攻克长尾复杂场景,线上分桶的浏览深度和点击率也同步保持了平稳上升的态势。

为了更直观地理解 SR-Agent 解决的实际问题,论文披露了一个典型的线上真实案例。
在一次用户的连续滑动浏览中,系统在位置 6、8、10、12、14 推荐了五款视觉和功能高度重合的同类型裤子。在传统的重排规则下,系统通常只配置了窗口长度为 2 的相邻打散规则(即相邻两个位置不能是同品类或高相似单品)。由于精排模型预测这几款裤子的单品点击率都极高,且在推荐流中它们恰好被单件无关商品交替隔开,传统的局部滑窗判定完全没有被触发。
从算法局部视角看,每一处相邻推荐都是合规的;但在真实用户的手机屏幕上,五件几乎一样的裤子在半屏内反复闪现,体验极其糟糕。
在人工维护阶段,这种跨坑位、散落式的体验缺陷极难被运营人员及时定性,因为规则窗口调大可能会误伤正常的对比购物需求。但在 SR-Agent 介入后,UserSim Agent 在会话级巡检中捕捉到了这种持续聚集的模式;Analysis Agent 迅速结合用户近期行为,判定该用户并没有强烈的“裤子同款比价”意向,归因出当前裤子品类的会话级曝光上限策略过于宽松;随后 Strategy Refinement Harness 提议收紧该类目在跨卡片滑窗内的曝光上限,经离线回放无回归后灰度上线,精准消除了这一类长期隐蔽的体验坏案。
工业启示:让 Agent 站在最稳妥的控制点上
快手 SR-Agent 的成功,给大模型时代工业落地推荐系统提供了一个极其重要的范式参考。
长期以来,很多团队尝试用 LLM 去直接颠覆端到端的推荐流程,或者试图让大模型直接充当代码生成的全能黑盒,往往因为延迟太高、成本不可控或工程风险极大而止步于原型阶段。SR-Agent 采取了一条非常务实的路径:承认传统轻量级策略层在工业 Serving 中的极低延迟与高效性,利用大模型的复杂推理与全局理解能力,在离线与近线侧充当“高级策略调优专家”。
大模型不负责处理毫秒级的高并发线上请求,而是通过观察线上真实产出的结果,把非结构化的视觉和上下文感知转化为结构化的根因诊断,最后收敛为严格有界的工程参数配置。这种将 LLM 限制在“可审计、可解释、可回滚”框架下的协同机制,既利用了大模型的推理深度,又坚守了工业级系统的可用性底线,为生成式智能体进入核心推荐工业流水线提供了极具操作价值的技术样板。