Shape Your Feed:Meta大模型主动推荐框架,对齐准确率达98.85%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Shape Your Feed:Meta大模型主动推荐框架,对齐准确率达98.85% 论文图示

现代工业级推荐系统长期建立在一个基本假设之上:用户的真实喜好可以通过其被动行为隐式推断出来。无论是点击、停留时长、完播率还是滑动翻页,推荐算法都在不断根据历史行为数据更新点击率预测模型。然而,这种被动建模范式在工业界正面临越来越突出的矛盾——用户在信息流中点开的内容,往往并不代表他们真正想看的内容。猎奇标题、算法争议点和成瘾性设计容易诱发大量即时点击与长时间停留,但事后带给用户的却是无尽的审美疲劳与算法茧房。

ArXiv URL:https://arxiv.org/abs/2608.06632v1

当用户产生强烈的纠偏意图,例如希望“少看热点八卦、多推硬核木工教程”,现有的推荐系统通常只提供极为粗糙的静态选项(如“不感兴趣”或“举报”),无法感知复杂的上下文语义,更难以根据自然语言指令动态调整信息流。虽然学术界在对话式推荐领域探索了多年,但以往方案多局限在电影、电商等静态库检索场景,面对吞吐量极高、延迟预算极紧的动态信息流时往往束手无策。

为了打破被动排名的局限,Meta 提出了名为 Shape Your Feed(简称 SYF)的大模型主动推荐系统。该系统让大语言模型扮演结构化控制器的角色,构建了包含感知、在线服务与自我进化的三层架构,打通了用户显式意图到传统重排流水线的端到端链路。离线评测显示,SYF 的语义对齐准确率达到 98.85%;在数月的大规模线上 A/B 测试中,该系统不仅大幅降低了用户的负向反馈,更在保证极低延迟增量的前提下,实现了信息流内容与用户显式意图的高精度共创。

Shape Your Feed 整体系统架构图

被动排名的瓶颈与大模型介入的工程边界

现代工业级信息流排序模型的核心目标,通常是计算用户 $u$ 在当前上下文 $\mathcal{E}$ 下对候选物料 $v$ 的被动交互概率 $\hat{y}{u,v} = f{\theta}(v, \mathcal{H}_u, \mathcal{E})$,其中 $\mathcal{H}_u$ 代表用户的历史隐式行为序列。这种机制对于维持平台的基础停留时长极其有效,但无法捕捉用户在时空维度上瞬息万变的显式诉求。

大语言模型(LLM)的出现为理解复杂的自然语言意图提供了天然的语义载体。但在真实的高并发推荐流中直接引入 LLM,面临着三大严苛的工程边界约束:

第一,目录受限(Catalog-Grounded)要求。LLM 极易产生幻觉,如果让大模型自由生成推荐建议,生成的物料很可能根本不在平台的有效库存池内,或者无法转化为合法的物料 ID。推荐模型必须被约束在已索引、可分发的内容库中进行受控决策。

第二,多轮时序状态追踪的复杂性。用户的交互是动态且包含混合意图的。用户可能在某一时刻提出即时降权要求(例如“接下来半小时不要推政治内容”),同时长期保留某个垂直兴趣(例如“长期关注开源大模型进展”)。系统必须显式维护一个持久化且可动态编辑的偏好状态。

第三,严苛的生产级延迟预算。工业级信息流服务对响应时间的要求通常在几十毫秒以内。引入参数量庞大的 LLM 进行在线实时打分和排序,极易导致主干链路超时崩溃。

SYF 的核心设计理念,正是通过解耦计算逻辑,把 LLM 放置在关键的决策节点上作为“结构化控制器”,既保留传统推荐模型高并发、低延迟的吞吐能力,又赋予系统理解多模态复杂意图、实时重塑信息流的能力。

三层协同体系:从多模态输入到信息流重排

为了在超高并发环境下平稳承载主动推荐逻辑,SYF 搭建了由三个核心流水线与一个集中式持久化记忆层构成的解耦架构。

整个架构的数据中枢是持久化记忆层(Memory Persistence Layer)。它维护了四组关键资产:

  1. 语义画像(Semantic Profile $S_t$):用半结构化自然语言实时记录用户的细粒度兴趣、负向偏好以及意图强度;

  2. 意图轨迹(Intent Trajectory $\mathcal{T}_t$):跨会话记录用户偏好随时间的演进过程;

  3. 候选池缓存(Candidate Cache $\mathcal{C}_{s,t}$):当检测到新的正向偏好时,后台异步召回高潜物料,避免挤占主请求链路的吞吐开销;

  4. 行为反馈日志(Behavioral Feedback $\mathcal{H}_{u,\mathcal{A}}$):记录用户在交互前端产生的细粒度操作,为后续策略迭代提供监督锚点。

基于这一持久化中枢,系统的三大工作流高效流转:

感知流(Perception Flow $\mathcal{A}_P$) 负责把用户端零散的多模态交互行为提炼为半结构化的语义画像。在客户端,Meta 提供了三种交互触点:针对单条帖子内容自动生成的上下文自适应胶囊按钮(Context-Aware Feedback Pills)、集中式的偏好设置中心(支持气泡选择与自由文本输入),以及整合了文本与语音交互的 MetaAI 助手。

当用户的输入转化为统一查询 $q_t$ 后,感知流中的编排器(Orchestrator)开始解析意图,判断是触发通用问答工具还是调用推荐工具链。一旦解析出新的正向偏好增量 $\Delta S_t^+$,系统便在后台异步拉取一批匹配的候选物料存入持久化缓存,同时由响应生成器向用户返回自然的确认反馈。

服务流(Serving Flow $\mathcal{A}_S$) 则坐落在关键的在线召回与精排链路上。它接收传统排序流水线输出的候选集,结合当前的语义画像 $S_t$,在线完成语义剪枝与融合打分。

自我进化流(Self-Evolution Flow) 则在离线与近线层运转。它不仅持续利用强化对齐手段更新大模型自身的判断策略,还将用户在智能体交互中沉淀的深层意图蒸馏为结构化先验,反哺给底层传统精排模型 $f_\theta$。这种双向信号传递,使得传统粗排与精排模型在初始阶段就能感知到显式语义特征,避免优质候选在漏斗前端被被动打分机制过早淘汰。

Serving Flow 的在线执行与重排流程

在线服务重排:语义映射与分值融合

传统推荐系统与大语言模型之间存在天然的表征代沟。在工业级推荐链路中,物料属性通常以高维稀疏特征哈希值或密集的向量嵌入(Dense Embeddings)形式存在,无法被语言模型直接理解。

服务流中的上下文生成模块(Context Generation) 承担了特征语义化转换的职责。它将待重排物料的原始属性解构为自然语言元数据(包括主题标签、创作者身份、正文关键语义等),并将其与用户当前的语义画像 $S_t$ 结合,组装成结构化对齐 Prompt:$\mathcal{P}_{align}$。

紧随其后的智能体精化模块(Agentic Refinement) 执行两步连续操作:

第一步是硬约束剪枝(Pruning)。如果候选物料与用户在语义画像中明确标注的负向偏好产生语义冲突,大模型将直接剔除该候选,防止引起用户反感的内容出现在最终信息流中。

第二步是显式语义对齐打分与融合(Alignment Scoring & Score Blending)。大模型对保留下来的候选物料计算其与正向语义偏好的契合概率 $\hat{y}_{v\vert{}S_t}$。为了平衡用户的瞬时显式诉求与长期隐式偏好,系统引入线性融合机制计算最终排序分值:

\[s_{final} = \alpha \cdot \hat{y}_{v\vert{}S_t} + (1 - \alpha) \cdot \hat{y}_{u,v}\]

在这一公式中,$\hat{y}_{u,v}$ 来自传统推荐模型根据隐式行为给出的预估分值,$\alpha$ 为动态可调的超参数权重。通过调整 $\alpha$,系统能够灵活掌控主动意图对信息流的干预烈度。若用户刚进行过明确的负反馈或主题筛选,$\alpha$ 将赋予语义打分更高的权重,确保信息流能够实时响应用户的操控。

双反馈策略对齐:从稀疏的人类信号到自动化蒸馏

在推荐系统中直接微调大语言模型,最大的难点在于监督信号的极度稀疏。绝大多数用户在刷信息流时依然处于被动浏览状态,主动给出精准负反馈(如点击“减少此类推荐”)或详尽自然语言指令的样本比例非常有限。若完全依赖人工标注或真实互动,训练样本量根本无法支撑大模型的泛化需求。

针对这一问题,Meta 提出了双反馈策略对齐(Dual-Feedback Policy Alignment) 框架,将稀疏的高保真真实行为数据与密集的大模型评审团(LLM-as-a-Judge)相结合,构建了“监督微调(SFT)+ 直接偏好优化(DPO)”的闭环迭代体系。

双反馈策略对齐框架

在 SFT 阶段,目标是让底座模型学会严格遵从推荐业务的结构化输出规范,并建立对垂直业务场景的基本语义感知。训练样本从历史信息流分发日志中采样,每条样本包含用户当前的语义画像与一组候选物料。由于真实的显式正负样本极度匮乏,这一阶段的获胜标签由 LLM-as-a-Judge 评审团打分判定,并通过更强的教师模型(Llama 4 Maverick)生成推理链条(Reasoning Path)作为思维链引导。需要强调的是,真实的用户显式反馈在此阶段被严格隔离,全部留存给后续阶段作为关键锚点。

在 DPO 阶段,系统开始迭代优化对齐打分模块的偏好边界。训练数据由两部分构建成“优选-淘汰”(Chosen-Rejected)偏好对:一部分来自真实线上日志中具有明确用户行为的上下文(例如用户主动点击“减少此类推荐”或划走屏蔽),另一部分在缺乏直接信号时由评审团自动推断补充。通过持续运行 DPO 闭环,系统在无需单独维护奖励模型(Reward Model)或执行高开销在线强化学习采样的情况下,稳固了大模型对微弱语义差异的判别边界。

在基座模型的选型上,研究团队进行了严谨的工程权衡。评测表明,1B 级别的紧凑模型在复杂的语义对齐与逻辑推理上表现严重退化,无法准确识别隐晦的负向意图;而 70B 模型虽然在精度上有微弱提升,但过大的内存占用与毫秒级服务流的延迟预算完全冲突。最终,Meta 选择了 8B 规模的 Llama 3 作为主干,在推理能力与生产延迟之间取得了出色的平衡。在配备 8 张 80GB GPU 的单一服务器上,SFT 单个 epoch 仅需约 2.5 个 GPU 小时;而 DPO 阶段在两台 8 卡 A100 服务器上运行 1 个 epoch,即实现了策略的快速收敛。

离线基准与线上 A/B 测试验证

为了验证 SYF 架构的有效性,研究团队不仅在离线基准上进行了细致的指标对比,更在 Meta 核心产品的实际生产流量中进行了长达数月的跨周期在线 A/B 实验。

离线评测聚焦于核心对齐打分模块的执行效果。基准对比显示,相较于少样本提示工程(Few-shot Llama3-8B),经过 SFT 调优后的模型在精确率和召回率上展现出了大幅跃升;在此基础上引入 DPO 优化,使 F1 分数进一步提升了 2.5 个百分点,整体对齐准确率达到了惊人的 98.85%。

更关键的验证来自一个独立的人工黄金测试集(Golden Set)。该测试集包含 1029 个完全由人类专家独立标注的样本,彻底隔离在 LLM 评审团流水线之外。评测结果显示,SYF 在人类黄金测试集上取得了 95.8% 的准确率,精确率达到 75.6%,召回率为 74.7%,F1 分数为 75.1%。这一结果证实了自动数据合成流水线提炼的先验与真实人类判断高度契合,并未发生模型自我强化导致的虚假对齐或合成噪声过拟合。

线上 A/B 测试则直接面向美国与加拿大年满 18 岁的高并发真实用户。实验设计了极其严格的对照环境:对照组使用标准生产推荐链路及原有的通用反馈入口;实验组则开启 SYF 链路。

实验揭示出数项具有工业指导意义的重要结论:

第一,上下文自适应胶囊的交互主导性。在保持曝光位置、视觉样式与静态入口完全一致的前提下,由 LLM 根据帖子内容动态生成的上下文反馈胶囊占据了用户显式互动总量的 76.02%。这表明用户过去并非没有干预信息流的愿望,而是传统系统提供的粗颗粒度标签(如“垃圾内容”)无法准确表达其细腻心智。当系统能够精准生成“减少政治类短视频”这类符合语境的选项时,用户的表达意愿得到了释放。

第二,显式负向反馈全面下降。在整个测试周期内,实验组在“隐藏帖子”(Hide Post)、“减少此类推荐”(Show Less)以及评论区负面情绪反馈等关键指标上,均出现了具有统计学意义的显著下降。这些指标是信息流推荐中表征不良用户体验的黄金代理变量,其同时回落证明了服务流中的剪枝机制与动态打分有效阻断了引发用户厌恶的内容分发。

第三,促进对全新兴趣的有效探索。传统基于协同过滤和被动点击优化的模型,往往把用户牢牢锁死在已有兴趣的局部最优解中。SYF 在测试中实现了新兴趣消费指标 +0.16% 的显著提升。这证明当显式语义通道建立后,系统能够顺畅解析用户的潜在探索指令,并借助持久化记忆中的候选缓存,帮助用户平稳建立起原本会被传统精排模型直接过滤掉的新内容消费习惯。

在线消融实验进一步厘清了交互组件与后端算法的贡献边界。当系统仅部署前端上下文反馈胶囊、而不启用后端的智能体重排流水线时,尽管 UI 点击量提升了 3.30%,但信息流的内容质量与负反馈率几乎没有任何改善。这证实了仅靠改进交互界面无法解决本质矛盾,前端收集的高阶信号必须通过深度的算法重排流水线执行落地,才能真正转化为体验提升。

在系统耗时方面,SYF 通过精细的工程解耦交出了一份符合生产要求的答卷。对齐打分模块的单次推理延迟控制在 323ms 左右,而得益于正向物料候选的异步拉取与多路并行架构,SYF 给整条关键路径(Critical Path)带来的延迟增量仅为 +0.043%,直连链路层延迟增量为 +0.412%。这意味着大模型的深度推理几乎完全被隐藏在主干服务耗时的波动窗口之内,没有对平台的承载吞吐造成损害。

从预测偏好走向人机协同编排

推荐系统在过去二十年间完成了从规则匹配到协同过滤、再到深度预估模型的数次蜕变,但其核心逻辑始终是单向的“系统猜测用户”。推荐系统把用户视为静态隐式特征的发射源,而用户则把信息流视为不可预测的黑盒。

Meta 通过 Shape Your Feed 证明:在大模型时代,工业级推荐系统完全有能力演进为人机协同编排(Co-curation)的新范式。通过把语言模型的语义推理、规划能力与高吞吐的工业级排序基础设施紧密结合,平台不仅能向用户提供即时可操控的自主权,更能消除由于点击陷阱造成的偏好错配。

不可否认,SYF 目前的设计依然存在依赖显式主动输入的局限。在实际运行中,那些从不点击偏好按钮、只被动滑动的沉默大多数用户,仍旧主要依赖传统排序系统为其分发内容。Meta 在论文中也指出,未来的演进方向将聚焦于在关键的用户旅程跃迁时刻,通过大模型主动、温和地引导用户表达偏好,并探索将少数高价值用户的语义画像先验向低信号群体泛化的技术路径。

无论如何,Shape Your Feed 已经为现代推荐系统的架构转型撕开了一个极具价值的切口:大模型不需要粗暴地推翻现有的推荐技术栈,而是能够作为高维控制器,让庞大而沉重的推荐流水线重新听懂人类的心声。