SSO:无标注也能自我进化?行为级证据聚合逼平有监督优化

Self-Supervised Skill Optimization

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在赋予大模型(LLM)更强大的自主代理(Agent)能力时,工程界和学术界正逐渐形成一个共识:不需要每次都微调模型底座权重,通过维护一份可复用的“技能文档(Skill Document)”,就能为 Agent 注入清晰的操作规范、工具调用准则与容错逻辑。这种技能文档本质上是自然语言写成的程序性指南,能够随着任务执行不断积累、迭代与修改。

ArXiv URL:https://arxiv.org/abs/2607.28777

然而,现有的技能优化方法几乎都重度依赖“真实标签(Ground-Truth, GT)”。以主流的 SkillOpt 为例,它必须依赖标准答案或任务专用的打分器来给执行轨迹打分,根据得分高低来决定如何修改技能文档、是否采纳新版本。现实中的大多数真实场景——例如企业内部基于异构文档的复杂检索、跨系统表格操作、开放式多轮对话——往往根本没有预先标注的标准答案,也缺乏绝对可靠的自动化评测器。一旦脱离了 GT 标签,现有的技能优化管道就会瞬间失效。

这项最新工作直接击中了这一痛点,提出了首个无须真实标签的自我监督技能优化框架:SSO(Self-Supervised Skill Optimization)。SSO 完全依靠未标注的任务实例,通过在当前技能与多个“探针技能”之间展开成对比较,解耦出微观的“行为差异”,并聚合跨实例的正负证据,最终渲染出全新的全局技能。在六大严苛的闭卷基准测试中,SSO 在完全不使用任何 GT 反馈的情况下,不仅大幅甩开现存的无监督 Prompt 优化器,甚至逼平、并在部分模型上反超了依赖真实标签的强监督方法 SkillOpt。

从“选候选者”到“解剖行为”:无监督优化的逻辑跃迁

在没有外部标准答案时,大模型应该如何判断自己做得更好还是更差?以往的无监督 Prompt 优化方案(如 SPO 或 PDO)借鉴了大模型作为裁判(LLM-as-a-judge)的相对评估思路:给模型两个 Prompt,让它们在同一输入下跑出两个结果,由裁判模型比较哪个输出质量更高,进而整篇保留或淘汰表现更好的 Prompt。

这种整篇候选(Candidate-level)的筛选逻辑,在简单的单轮问答或文本摘要任务中行之有效。但在处理需要多步推理、环境交互、工具调用和生成复杂工件(Artifact)的 Agent 任务时,这种做法却极其粗糙。一个包含了数十条规则的技能文档,可能整体执行效果更好,但其中混杂了某些不良操作习惯;相反,一个整体表现稍逊的技能,却可能在某个具体工具的调用边界上处理得极为漂亮。如果只是在完整文档之间做“非黑即白”的选择,不仅无法有效组合不同尝试的优点,还会引入大量偶发噪声。

SSO 的核心洞见在于:优化的最小单位不应该是完整的技能文档,而应该是技能在执行中激发的具体行为(Behaviors)。

SSO 并不把生成的候选技能直接当成最终采纳的目标,而是将它们视作“探针(Probes)”。探针的核心使命不是取代当前技能,而是通过扰动执行策略,在未标注的任务上把潜在的备选行为激发出来。随后,系统通过将执行差异分解为独立的行为单元,跨越多个任务实例去汇总针对每个行为的正反证据。最后,再将高置信度的正向行为融合回原技能中,渲染出一份全新的全局技能。

这一思想将无监督优化的颗粒度从“粗粒度文档级”推进到了“细粒度行为级”,从根本上解决了复杂轨迹对比中因果关系混乱的问题。

双盲与解耦:SSO 的核心闭环机制

为了在没有标准答案的环境下稳妥地迭代技能文档,SSO 构建了一个高度解耦、互相校验的优化闭环。整个流程包含四个关键阶段,每个阶段在信息交互上都被施加了严格的隔离约束,以杜绝大模型的自洽偏差(Self-serving bias)与确认偏误。

1. 生成探针与锚定对比

在每一轮迭代中,SSO 从无标注的训练集中抽取一个批次任务。当前保留的基线技能被称为锚点技能 $S_t$,它在当前批次上执行生成基准轨迹。随后,系统从当前技能的执行历史中抽取部分实例,促使生成模块产生 $K$ 个截然不同的完整技能探针。

这些探针技能随后在同一个任务批次上全部运行一遍。此时,评判模块(LLM Judge)出场,它针对每一个任务实例,将每个探针生成的轨迹与锚点技能的轨迹进行成对对比(Anchored Comparison)。评判模块输出胜、负或平局的结果。为了彻底消除大模型常见的输出位置偏见,输入给评判模块的轨迹顺序完全随机化。值得注意的是,所有探针都只与当前的锚点技能对比,探针之间不发生横向对比,这既将比较复杂度控制在线性量级,又确保了所有评价基准始终与当前版本保持一致。

2. 双盲行为抽取与语义聚类

如果让评判模型一边决定谁胜谁负,一边总结胜负原因,大模型往往会产生“事后合理化”的幻觉,编造看似合理却缺乏因果支撑的行为解释。SSO 在这里引入了一个至关重要的设计:双盲抽取(Double-blind Extraction)。

负责抽取行为差异的行为抽取模块(LLM-based Behavior Extractor)只能看到具体的任务输入、锚点轨迹以及各个探针的执行轨迹,它完全看不到评判模块给出的胜负裁决。它的唯一任务是像一个客观的中立观察员一样,记录下探针与锚点之间客观存在的行为差异:例如“在执行 SQL 查询前主动检查了数据表头”,或者“没有验证文件路径是否存在就直接调用写操作”。抽取器为每个任务标记这些行为是否存在于对应的轨迹中。

随后,独立的聚类模块介入,将跨任务、跨探针抽取的自然语言行为描述进行语义聚类。聚类模块同样对评判胜负一无所知,它仅依据行为描述的字面与语义相似度进行聚类,并将同一簇内的描述归结为一个标准行为标识。

3. 证据聚合、权重归一与行为排序

至此,系统拥有了两组独立的数据:一组是评判模块给出的客观胜负标签,另一组是抽取模块记录下的中立行为激活状态。SSO 在这一阶段将二者交汇,进行数学上的证据聚合。

对于某一次具体的轨迹对比,如果探针战胜了锚点,那么探针独有的行为获得正向证据,锚点独有的行为受到负向惩罚;反之亦然。为了防止单次对比中因为模型“话痨”抽取出过多零散行为而稀释或扭曲全局判断,SSO 实施了严格的证据归一化(Evidence Normalization):每一次成对对比所能贡献的绝对证据总量被硬性限制为 1 个单位,均分给该对比中产生明确状态变化的所有行为。

遍历整个训练批次后,系统对每一个聚类后的行为计算累计净证据值 $Q_c$ 与总证据强度 $E_c$。净证据值大于零的行为被标记为需要“鼓励(Encourage)”,小于零的被标记为需要“抑制(Suppress)”。系统依据证据强度挑选出最值得信任的少量关键行为,形成明确的更新指令集。

4. 全局技能渲染与无标注验证门控

拿到行为级的正负向指令后,渲染模块(LLM-based Renderer)并不是机械地在文档末尾拼接规则,而是通读当前的基线技能文档,根据指令进行全局重写与局部重构,最终生成一个完整、通顺的新技能候选版本。

这个新版本能否被真正采纳?在 GT-based 方法中,通常会运行一个带真实标签的验证集;而在 SSO 中,系统设立了一个无标注验证门控(Unlabeled Validation Gate)。新生成的候选技能文档与原技能文档在完全隔离的无标注验证批次上同时运行,并再次由评判模块进行多样本的成对盲测。唯有新技能在验证集上取得的胜场数明确大于败场数时,更新才会被正式接受并替换基线技能;若未通过,则放弃该候选版本,保留当前基线进入下一轮循环。这一门控机制为算法的持续单调演进提供了坚实的防御屏障。

实验见证:无标注优化如何逼近甚至超越有监督基线

研究团队在六大闭卷基准与三大开卷基准上进行了严谨的横向测评。涵盖的模型包括 GPT-5.5、GPT-5.4-mini 以及开源模型 Qwen3.5-4B,评测的任务类型跨越极广:从多步检索(SearchQA)、复杂表格交互(SpreadsheetBench)、严肃企业问答(OfficeQA),到多模态图表理解(DocVQA)、高难度奥数推理(LiveMathematicianBench),以及具身决策(ALFWorld)。

在所有这些任务上,SSO 的表现彻底打破了“无监督优化必然大幅逊色于监督优化”的固有认知。

在闭卷基准的平均准确率上,与完全不带技能的裸模型(No skill)相比,SSO 在 GPT-5.5 上带来了 20.4 个百分点的巨大增益,在 GPT-5.4-mini 上提升了 16.6 个百分点,在 Qwen3.5-4B 上提升了 14.2 个百分点。这一表现全面压制了以往最强的无监督 Prompt 优化器:以 GPT-5.5 为例,SSO 比 SPO 高出整整 9.8 个百分点。

更震撼的对比在于与有监督方法的较量。在闭卷测试中,SSO 在完全没有任何真实标签、奖励函数或任务评估器参与的情况下,使用 GPT-5.5 成功恢复了当前强监督技能优化 SOTA(SkillOpt)整整 86.8% 的性能提升;而在 GPT-5.4-mini 上,SSO 的平均表现甚至反超了依赖 GT 反馈的 SkillOpt 1.2 个百分点。在涉及代码操作的 Codex 环境下,SSO 距离依赖完美真实标签的 SkillOpt 也仅仅落后 1.9 个百分点。

在没有参考答案、无法进行数值评判的多轮开放式对话基准(MT-Bench-101 中的上下文记忆、内容改写、主动交互任务)上,SSO 同样展现了极强的统治力。面对未优化基线以及 SPO、PDO 等无监督方案,SSO 在各类模型上的两两对决胜率均稳定在 62% 至 64% 之间,充分证明了其在非结构化、主观性强的任务空间中稳定捕捉优质行为的能力。

消融实验:为什么解剖行为与严格门控是必选项?

SSO 的优异性能是由其各个精密啮合的模块共同保障的。为了量化每个设计决策的价值,论文在 GPT-5.4-mini 驱动的多个任务上进行了详尽的组件剥离实验。

当剥离“行为抽取与聚类”流程、退化为直接在训练批次上根据评判得分挑选胜率最高的探针(Direct probe selection)时,模型在基准任务上的平均表现遭遇了断崖式下跌,性能骤降 8.5 个百分点。这一结果雄辩地证明:单次生成的探针技能往往包含过多偶发缺陷,根本不具备全局采纳的鲁棒性;唯有将探针视作“行为采样器”,打碎重构提炼行为证据,才是通往高质量进化的正确路径。

同样的,如果去除证据归一化机制,允许某次对比中的大量细碎行为无节制地瓜分和膨胀权重,性能会出现 1.2 个百分点的回落;若取消行为聚类,让每个任务的描述各自为战,性能则下滑 2.2 个百分点。如果采用随机采样行为替代基于证据权重的排序选择,性能损失则达到 6.1 个百分点。

超参数敏感度分析

超参数的鲁棒性分析同样印证了设计的合理性。从超参数敏感度曲线中可以看出,系统在每次迭代生成的探针数量 $K$、用于生成探针的上下文实例数以及每次更新采纳的行为数量限制上,表现出了高度的平稳性。默认选取的适度探针数量与紧凑的行为更新预算,既保证了探索空间的充分暴露,又避免了向渲染器灌入过多冗余信息导致生成退化。

优化动态与探针对比

更为直观的证据体现在系统的优化动力学曲线中。在 SpreadsheetBench 和 OfficeQA 的多轮迭代监控中,研究团队将 SSO 渲染出的候选技能与“事后通过测试集真实标签选出的最优单体探针(Post-hoc best probe)”进行了全程追踪对比。

实验展现出两个极为深刻的现象:第一,在绝大多数迭代步中,经过行为聚合和全局渲染后的候选技能,其真实测试准确率显著高于当轮任何一个单体探针的表现。这意味着 SSO 真正做到了“集百家之所长”,提炼出了单一探针所不具备的高级行为组合;第二,验证门控机制起到了决定性的防线作用——星号标记的成功晋级节点无一例外地驱动着技能性能台阶式上升,而当渲染模型偶尔产生退化候选时,无标注验证门控能够准确识别并果断将其驳回,从而确保了技能在整个生命周期中的单调演进。

技术启示:Agent 自主进化的新范式

SSO 的提出,给大模型 Agent 乃至自动化提示工程领域带来了极具实用价值的技术启示。

长期以来,工业界在落地复杂 Agent 时面临的最大瓶颈不是模型不够聪明,而是“评价链路太贵”。为每一个垂直业务流程标注大量金标数据、编写精密的评估器,往往比开发 Agent 本身还要耗时耗力。这导致许多系统在上线初期缺乏持续迭代的动力。

SSO 证明了一条全新路径的可行性:即便是复杂的程序性逻辑与跨步骤交互,也可以通过未标注数据配合精巧的成对对比机制实现高度自主的自监督进化。通过将评估对象从“静态文档”下沉到“动态行为”,再利用归一化证据实现统计学上的去噪与聚合,大模型完全具备在没有人类介入的情况下“自我拔高”的能力。

这种范式有望直接迁移到诸如企业级自动化工作流优化、代码库专属协同规范沉淀、复杂 API 调用链自愈等缺乏即时标签的工业深水区。它不仅让 Agent 具备了更强的冷启动与自适应能力,更为迈向真正自演进、自维护的通用具身与软件智能系统,拼上了一块至关重要的拼图。