RHO揭秘:零标注驱动Agent复盘,代码基准通过率暴增19%
Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts
在真实世界的部署中,AI智能体往往面临一个尴尬的困境:随着任务越来越复杂,它们急需升级自己的工具库。
ArXiv URL:http://arxiv.org/abs/2606.05922v1
然而,传统的优化方法大多依赖于带有标准答案的“验证集”。但在实际业务中,收集大量带有真实标签的未来任务数据,既昂贵又极其困难。
能否让智能体仅仅通过回顾自己过去的“工作录像”,就能自动发现问题并完成自我进化?
来自香港城市大学与微软研究院的研究人员,在最新论文中给出了肯定的答案。该研究提出了回顾性装备优化(Retrospective Harness Optimization, RHO)算法。
这是一种完全无监督的自我进化方法。它不需要任何外部评分或真实标签,仅靠智能体对历史轨迹的“自我复盘”,就让其在极具挑战的SWE-Bench Pro基准测试中,将通过率从59%直接拉升至78%。
本文将深度拆解RHO的底层机制,看看这种零标注的自我进化是如何实现的。
问题设定:智能体的“探险装备箱”
为了理解RHO,我们需要先明确一个核心概念:装备(Harness)。
如果把智能体比作一名探险家,那么装备 $h$ 就是它随身携带的“探险装备箱”。这个箱子里装满了工具脚本、系统提示词以及各种技能指令。
当智能体面对一个任务 $t$ 时,它会利用装备箱 $h$ 进行思考、行动和观察。这个多步交互的完整过程,就会生成一条包含阅读信息、思维链、工具调用和最终输出的轨迹 $\tau$。
我们可以用公式表示为: $\tau=\mathrm{solve}(h,t)$。
随着探险的深入,智能体会积累大量历史轨迹。传统方法需要“上帝视角”(外部验证集)来指导智能体更换装备。
而RHO的机制则是:让探险家在营地里,独自翻看过去失败和成功的探险录像。通过分析录像找出装备箱里的短板,然后自己打造新工具,重写生存指南。

RHO的三阶段进化机制
RHO的优化过程完全摒弃了真实标签,主要由三个精心设计的阶段构成。

第一阶段:核心集采样,兼顾难度与多样性
智能体过去积累的轨迹数据浩如烟海,如果对每一条轨迹都进行复盘,不仅计算成本难以承受,关键的改进信号也会被海量的琐碎日常淹没。
因此,该研究引入了行列式点过程(Determinantal Point Process, DPP)核函数,用于从全局数据中提取一个极具代表性的核心集。
探险家复盘时,不能只看同一种陷阱的录像。DPP的作用,就是确保选出的任务既“困难”又“多样”。具体而言,研究人员首先用语言模型评估每条轨迹的难度得分 $r_i$,并提取文本描述。
接着,计算这些描述的嵌入向量,以此构建相似度矩阵 $S$。随后构建核矩阵:
\[K=\mathrm{diag}(\widetilde{r})\,S\,\mathrm{diag}(\widetilde{r})\]在这个公式中,参数 $\alpha$ 受超参数 $\theta$ 控制,用于调节难度与多样性的相对权重。实验表明,当 $\theta=0.7$ 时,采样出的核心任务能够最均衡地覆盖各类长尾失败模式,为后续优化提供最高质量的靶标。
第二阶段:分组推演与诊断,从内部找寻信号
选出核心任务后,智能体如何知道错在哪?
该研究采用了一种极其巧妙的对比机制:让智能体对核心集中的每个任务进行 $G$ 次并行重新求解,生成一组平行轨迹。
通过对比这些平行时空中的“自己”,智能体能提取出两个关键的诊断信号:
- 自我验证(Self-validation):轨迹内部的逻辑断裂。例如,在某一步执行脚本报错,但智能体未做处理就直接跳过。
- 自我一致性(Self-consistency):平行轨迹之间的结果分歧。如果面对同一任务,多次尝试得出了完全不同的结论,说明当前的装备箱在处理该类问题时存在系统性盲区。
基于这两种信号,智能体能够自动生成针对性的“装备改进说明”。
第三阶段:最优装备提案,基于自偏好的沙里淘金
有了改进说明,智能体就可以着手修改装备箱(比如编写新脚本或修改系统指令)。
但代码修改往往充满随机性,改了可能反而更糟。为了防止“负优化”,RHO引入了基于自偏好的最佳候选选择(Best-of-N)机制。
具体来说,系统会并行执行 $N$ 次优化,生成 $N$ 个候选的新装备箱 $h_1$ 到 $h_N$。
随后,智能体用这些新装备重新挑战核心任务,并与原始轨迹 $\tau_t^{(0)}$ 进行两两偏好对比打分。只有得分最高,且相对优势得分 $S_j$ 大于零的新装备,才会被最终采纳:
\[S_j=\frac{1}{|\mathcal{D}_{\mathrm{core}}|}\sum_{t\in\mathcal{D}_{\mathrm{core}}}\mathrm{rank}\!\left(t,\tau_t^{(j)},\tau_t^{(0)}\right)\]实验验证与行为偏移
该研究在软件工程(SWE-Bench Pro)、技术运维(Terminal-Bench 2)和知识工作(GAIA-2)三大领域的基准测试中对RHO进行了全面评估。
最令人瞩目的结果出现在SWE-Bench Pro上。仅仅进行了一轮RHO复盘优化,智能体的代码任务通过率就获得了19%的绝对提升。相比之下,传统的动态备忘录等基准方法,收益微乎其微。
那么,这个优化后的“装备箱”里到底多了什么?
通过检查生成的神器(Artifacts),研究人员发现,智能体不仅重写了指令,还为自己打造了针对历史失败模式的专用工具。
例如,在SWE-Bench Pro中,智能体过去经常因为找不到非标准路径下的Go工具链而任务失败。复盘后,它直接写了一个定位脚本;此外,它还学会了在生成代码对比文件(diff)前,先清理Python缓存目录,从根源上解决了补丁应用失败的问题。
更深层次的改变,发生在了智能体的行为模式上。

如图4所示,优化后的智能体,在长周期任务中的成功率显著上升。
仔细分析其动作占比可以发现,智能体变得更“谨慎”了。在软件工程任务中,它大幅增加了验证动作(Verification)的调用频率,从过去的“写完就跑”变成了“写完必测”。这种行为偏移,正是应对复杂长期任务的关键。
局限性与工程启示
尽管RHO展示了无监督进化的巨大潜力,但该研究也坦诚了其局限性。
首先,第二阶段的分组推演依赖于环境可以被“干净地重置”。对于那些不可逆的、一次性的任务(例如直接向真实用户发送邮件),这种多次试错的推演机制并不适用。
其次,如果智能体本身的评估能力存在严重的价值观偏差,这种不受外部纠正的自我闭环,可能会放大错误偏好甚至生成不安全的规则。
但无论如何,RHO为LLM智能体的持续学习提供了一条极具工程价值的路径。
在真实业务落地中,标注数据极其稀缺。该研究证明了,智能体自身过去失败的日志,就是一座未被充分挖掘的金矿。只要设计好科学的复盘机制,AI完全有能力在无人监督的黑夜里,自己磨砺出更锋利的剑。