Microsoft发布AdsWorldEngine:中枢与工具协同进化,Copilot广告RPM提升22%
AdsWorldEngine: A Self-Evolving Conversational Advertising Agent through Orchestrator and Tool Coevolution

在大模型对话助手的商业化落地中,广告变现始终处于极其微妙的尴尬境地。传统的搜索广告机制相对简单:用户输入一个孤立且明确的关键词,系统在毫秒级内完成召回、粗排、精排与竞价拍卖,呈现出结构化的赞助商链接。但在多轮对话场景下,商业意图往往被深埋在长上下文甚至助手的回答细节中。如果用户追问一句“有没有更便宜的”或“附近有哪些”,没有前序上下文便根本无法理解其真实所指;更严峻的挑战在于,在不合时宜的对话轮次强行插入商业广告,会严重损害用户对智能助手的信任。
ArXiv URL:https://arxiv.org/abs/2608.13833v1
微软近日公开的工业级对话广告智能体框架 AdsWorldEngine,正是为了打破这一僵局。该系统没有将大模型简单当作一个文案生成器或固定的排序重排器,而是构建了一套兼顾“触发门控”与“广告版位生成”的复合智能体系统。其最具启发性的机制在于打破了“工具即固定基础设施”的传统假设,提出了中枢调度器与下游工具的双向协同进化(Actor-Tool Coevolution)机制:不仅让中枢智能体通过强化学习掌握调用工具的策略,更反向利用高质量的执行轨迹去反哺并重新训练检索与相关性工具。
在实际工业部署中,该系统已全面接入全球范围内的 Microsoft Copilot。线上长达 20 天的 A/B 测试结果显示,AdsWorldEngine 在保障用户体验的前提下,使千次展示收入(RPM)提升了 $22\%$,广告覆盖率(Ads Coverage)大幅提升了 $74\%$;离线评测中,最终选出的广告推荐组合相关性提升了超过 $80\%$,多样性提升超过 $60\%$。

从单轮关键词到多轮交互:对话广告的范式转移
传统搜索广告的核心假设是“短文本查询即意图”。用户搜索“轻薄笔记本电脑”,引擎直接围绕这个实体展开召回与竞价。然而,在以 Copilot 为代表的对话助手中,交互范式发生了三个根本转变:
首先是意图的隐含性与演进性。用户的商业诉求往往不是一次性给出的,而是在连续追问、对比或限定条件修正中逐渐浮现。一个只有三个词的追问,其真正的实体和约束条件可能全部挂载在五轮之前的历史记录中。
其次是助手回答的内容衍生性。很多时候,激发用户潜在商业兴趣的并不是用户自己的提问,而是大模型助手在上一轮回复中推荐的品牌、技术路线或具体型号。如果广告系统只分析用户的 query,就会完全漏掉上下文里最具转化潜力的锚点。
最后是极度敏感的体验侵入代价。在传统搜索引擎里,即使最前方的广告略有偏差,用户也已习惯滑过它去看自然搜索结果;但在对话流中,推荐位通常极为有限(AdsWorldEngine 严格限制最终仅呈现 3 个广告),一旦在纯粹寻求知识解答或敏感任务时弹出商业卡片,用户的负面感知会被急剧放大。这决定了对话广告系统必须具备极高精度的“拒答/静默”能力,即严格把控“何时展示”与“展示什么”的边界。
架构三元组:门控、中枢调度与离线评测
为应对这一复杂链条,AdsWorldEngine 在系统层面解耦为三个核心组件:机会门控(Opportunity Gate)、中枢调度器(Orchestrator)与离线评测器(Evaluator)。
整个在线服务流水线的第一道防线是 Opportunity Gate。它在接收到完整的对话历史、当前用户输入、可选的用户策略上下文以及助手刚生成的回答后,首先执行二元判定:当前轮次是否适合植入商业内容。如果门控判断不适合,系统主动放弃曝光(Abstain),完全不打扰主干对话;只有被门控放行的轮次,才会进入下游复杂的广告物料处理流程。
通过门控后,Orchestrator 正式接管执行。它扮演着执行中枢的角色,内部细分为三个串行阶段:
-
意图解析与生成(Intent Generator):结合上下文消解代词与隐式约束,提取出用户未明说的偏好,将其拆解并生成 1 到 3 个用于检索的结构化意图词(Ad Queries)。
-
工具调用(Tool Caller):将生成的意图分发给底层的广告专业工具箱,包括广告检索工具、相关性判定工具、精排模型、定价以及商业信号模型。
-
反思与版位组装(Reflection Module):对工具返回的候选广告池进行综合审查,剔除语义重叠或不符合历史约束的候选,最终筛选出且仅筛选出 3 个互补且高度相关的广告物料,组成最终的广告版位(Slate)。
与在线链路并行运行的是 Evaluator。这是一个完全运行在离线环境中的全景评估系统,不会给线上增加任何延迟。它从用户满意度(相关性与多样性)、广告主效益与平台长期健康度等多维度对呈现的版位进行打分,为整个系统的持续演进提供密集且可靠的奖励信号(Rewards)。
中枢与工具的协同进化:打破“固定工具”的局限
在大多数现有的 LLM Agent 方案中,中枢模型与外部工具的关系往往是单向割裂的:开发者假定外部检索器、排序 API 是性能固定不变的基础设施,中枢模型只需要通过 Prompt 或监督微调(SFT)学会正确的 JSON 调用格式即可。
微软团队在实践中发现,这种单向假设在工业广告场景下会遇到明显瓶颈。人类通过提示词让智能体“生成多样化的检索词”,智能体可能在字面语义上写出了两个看起来截然不同的 query,但由于底层广告索引的倒排特性或召回模型的偏置,这两个 query 最终拉回来的可能依然是同一个商家的同质化落地页。反之,两个字面接近的检索词,在底层库存分布下却可能命中完全互补的优质类目。中枢如果无法感知工具的底层脾气,生成的意图再优美也是徒劳。
为此,AdsWorldEngine 提出了中枢与工具的迭代联合优化范式(Iterative Actor-Tool Optimization)。这一循环由两个交替演进的飞轮组成:
第一个飞轮是中枢策略对工具特性的自适应。在工具集参数固定的情况下,中枢调度器不仅经历监督微调以掌握规范的轨迹格式,更进一步接入强化学习算法(GRPO)。此时的奖励函数直接锚定最终版位的落地表现——多样性不再依据智能体生成的意图词多样性给分,而是直接计算最终选出的 3 个广告嵌入向量之间的两两余弦相似度(Pairwise Cosine Similarity),仅当相似度低于 $0.3$ 时才给予多样性正向奖励。这逼迫 Orchestrator 学会调整自己的意图分解策略,生成那些真正能够激活下游检索器互补库存的查询词。
第二个飞轮是中枢高质量轨迹反哺工具升级。在 Orchestrator 强化学习探索的过程中,系统沉淀了大量的高回报版位与低回报版位。针对中枢生成的每一个意图 $q$,系统自动挖掘三元组偏好数据 $(q, a^+, a^-)$,其中 $a^+$ 来自离线高奖励版位中的优质广告,而 $a^-$ 则是来自低奖励版位的硬负例(Hard Negative)。
基于这些偏好对,系统利用带有参考模型正则项的偏好损失函数,专门重训底层的“意图-广告相关性模型”(Intent-to-Ads Relevance Model):
\[\mathcal{L} = -\mathbb{E}_{(q,a^+,a^-)}\log\sigma\Big(\beta\big[s_{\theta}(q,a^+) - s_{\theta}(q,a^-) - s_{\mathrm{ref}}(q,a^+) + s_{\mathrm{ref}}(q,a^-)\big]\Big)\]通过优化这一目标,底层工具不仅对传统搜索关键词敏感,更对智能体调度器特有的长尾意图表达产生了更强的判别力。更新后的工具随即接入下一轮中枢的强化学习环境中。在这个自进化闭环中,中枢学着用工具,工具则从中枢的行为结果中不断进化,两者在三轮迭代中展现出了极其显著的协同增益。
成本敏感 GRPO:破解非对称生产惩罚
在广告业务中,错误绝不是对称分布的。对于 Opportunity Gate(门控)和版位相关性判定这类二元决策来说,“假阳性”(False Positive,在不该触发时强行插广告,或将无关广告混入展示位)会对用户体验造成不可逆的伤害,可能导致用户流失;而“假阴性”(False Negative,漏掉一次商业推荐机会)通常只是少赚了一次点击的收入。换言之,错推的代价远高于漏推。
现有的通用大模型评测往往依赖 Prompt 驱动的裁判(LLM-as-a-Judge)或常规 RLHF 奖励模型,但这些方法很难精确调控工业界极端严苛的查准率(Precision)要求。为此,微软提出了基于标签锚定的判断建模(Label Grounded Judgment Modeling),从数据合成与强化学习两个层面重构判定模型。
在数据侧,团队制定了极其详尽的生产标注规范,并收集了数万条由人工严格判定的真实多轮对话数据。随后,大模型在已知人工金标和规范的前提下,反向生成一条包含推理路径的思维链(Thinking Trace),解释为什么这一场景适合或不适合商业推广。随后引入“反思检验”机制,自动剔除那些逻辑与人工标签相悖或存在无端假设的样本。这种用显式规则反向推导思考路径的模式,避免了大模型凭空发散带来的幻觉。
在模型训练阶段,针对这类决策中严重的非对称损失,团队对群组相对策略优化(GRPO)进行了成本敏感改造。传统的 GRPO 在计算组内优势函数时,会除以组内奖励的标准差 $s_R$ 进行归一化:
\[A_i^{\mathrm{scaled}} = \frac{R_i - \bar{R}}{s_R + \epsilon}\]但在二元或极度非对称的奖励矩阵设计中(例如预测正确奖励为 $+1$,普通漏推扣除 $-1$,但在不合时宜场景强推广告则重罚 $-2$),除以组内标准差会抹平不同任务场景下的绝对惩罚差距。当组内只出现微小波动时,标准差归一化甚至会人为放大不重要的微小差异。
AdsWorldEngine 采用的非缩放优势函数直接保留了未归一化的原始奖励差值:
\[A_i^{\mathrm{none}} = R_i - \bar{R}\]这一细微但关键的算法改动,确保了系统对“高代价错误”的惩罚力度在反向传播中得到原汁原味的保留。实验证明,经成本敏感 GRPO 优化后的 30B 门控模型,相比单纯采用 SFT 的模型,在完全维持召回率(TPR 变动为 $0.00\%$)的前提下,将假阳性率(FPR)大幅压降了 $39.07\%$,整体平衡准确率反超了基于超大模型 Prompt 的裁判系统,且推理吞吐量完全满足毫秒级在线网关的要求。
实验结果与消融剖析:协同迭代如何带来系统飞跃
为了验证系统各组件的实际效能,论文公开了大量离线迭代指标与线上真实流量对比。
在离线迭代实验中,以 Qwen3-30B-A3B-Thinking 为基础模型的中枢调度器展现出了清晰的进化阶梯。以当前线上实际服役的生产系统为基准(Baseline),仅经过带有思维链监督预热(Warmup,即第 0 轮)的调度器,多样性与相关性分别录得 $+15.31\%$ 和 $+49.37\%$ 的初始增幅。
在随后开启的中枢与工具交替优化循环中,性能提升迅速拉升:
-
第 1 轮:经过固定工具下的 GRPO 强化学习,多样性提升跃升至 $+29.24\%$,相关性提升达到 $+53.15\%$;随后,利用这一阶段轨迹微调底层相关性工具并重新挂载,多样性与相关性立刻迎来一次跳跃式爆发,分别达到 $+53.90\%$ 与 $+70.07\%$。这有力地印证了“工具能力进阶直接撑大了智能体行动空间”的核心论点。
-
第 2 轮与第 3 轮:随着智能体与工具的协同适应,边际效益逐渐收敛,但系统依然稳步攀升。到第 3 轮工具迭代完成时,最终系统相较基准生产系统,在多样性指标上取得了 $+62.87\%$ 的相对增益,在全对话层面的广告相关性上更是取得了 $+82.26\%$ 的惊人飞跃。
论文中的一个典型案例形象地揭示了强化学习究竟重塑了智能体的什么能力。在面对一段关于“两款特定车型对比与购车选择”的上下文时,仅经过 SFT 的中枢往往会习惯性生成两个高度相似的比较型 query(例如两款车型的对比评测关键词)。这种 query 在语义上完全贴合对话,但极难适配底层以单品/落地页为维度的广告库存,召回的大多是内容重合的导购综述页面。
而经过 GRPO 训练后的 Orchestrator 展现出了高度的“工具感知性”:它敏锐地将对话拆解为针对两款具体车型的独立查询,精准调用底层工具分别拉取各个品牌旗下的专属物料,最后在反思阶段把控整体配比。这种在中间阶段主动解耦、主动迁就下游检索器特性的策略,正是纯提示词工程或传统单向流水线难以企及的。
商业化 Agent 的未来路径
AdsWorldEngine 的落地不仅是一个具体工业业务的性能刷榜,更为大模型时代“复合智能体系统(Compound AI Systems)”的构建提供了一个极具参考价值的工程样本。
长期以来,业内在讨论智能体落地时,注意力大多集中在规划(Planning)、记忆(Memory)或反思提示词的设计上,工具往往被放置在被动调用的客体位置。微软在 AdsWorldEngine 中给出的答案是:真正高性能的智能体系统,其内部构件绝不应是单向线性的调用关系,而必须演进为双向依存的动态闭环。当调度器的探索数据能够成为工具进化的养料,工具的增强又能反过来解放调度器的决策自由度时,整个系统才真正具备了持续自我迭代(Self-Evolving)的生命力。
面对日益普及的多轮对话与个人助理产品,如何在保护用户交互尊严的同时发掘高价值商业连接,是横亘在所有大模型商业团队面前的必答题。AdsWorldEngine 通过前置严格的非对称门控、中间层 Actor-Tool 的协同进化以及后验严苛的版位约束,证明了精准、克制与高商业回报完全可以兼得。这一系统设计范式,势必会对后续生成式搜索、任务型智能体以及下一代计算广告引擎的架构设计产生持久的影响。