Harvard与MIT提出BES:双向进化机制攻克3大推理基准
Self-Improving Language Models with Bidirectional Evolutionary Search

在当今的大型语言模型和智能体系统研究中,如何让模型在复杂推理任务上表现得更好,已成为核心议题。无论是通过后训练(Post-training)让模型自我改进,还是在推理阶段(Inference)通过增加计算量来拉升性能上限,依赖的核心机制往往都是“搜索”。然而,由 Harvard 和 MIT 研究团队主导的一项最新研究指出,当前主流的搜索方法存在两个极其隐蔽但致命的缺陷。该团队提出的解决方案——双向进化搜索(Bidirectional Evolutionary Search, 简称 BES),不仅在理论上打破了模型探索空间的“熵壳”限制,更在实际的后训练与推理基准测试中,展现出对现有方法的显著超越。
ArXiv URL:https://arxiv.org/abs/2605.28814v1
当我们审视目前被广泛应用的 Best-of-N 采样和树搜索(Tree Search,如 Monte Carlo Tree Search)时,会发现它们在面对极具挑战性的前沿问题时往往力不从心。研究团队敏锐地捕捉到了这些方法底层的共同局限。其一,验证信号过于稀疏。在诸如基于强化学习与验证(RLVR)的后训练场景中,验证器通常只能在序列末尾提供一个二元或粗粒度的反馈。这种“不撞南墙不回头”的信号使得搜索过程缺乏中间指引,极大地降低了样本效率。其二,候选生成被束缚在模型自身的概率分布内。现有方法几乎清一色地采用自回归扩展(Auto-regressive expansion)来构建候选答案。这种方式意味着模型只能在自身概率质量较高的区域内进行探索,难以触及那些蕴含正确答案但初始概率较低的解空间。
为了彻底解决这两个问题,研究人员设计了 BES 框架。该框架创造性地将前向候选进化与后向目标分解结合在一起。前向搜索负责利用进化算子打破自回归的生成限制,而后向搜索则负责将原始任务拆解为可检验的子目标,从而为前向搜索提供密集的中间反馈。这种双向耦合的机制,使得 BES 能够在主流后训练算法失效的困难任务上实现稳定增益。

从上图可以直观地看出纯粹树搜索与 BES 的本质区别。左侧的树搜索只能通过顺序扩展步骤来构建候选,理论分析表明,这类候选不可避免地被困在一个狭窄的“熵壳”中,这使得模型只能在解空间的一个极小区域内打转。而右侧的 BES 则通过引入进化算子,将不同轨迹的片段重新组合,成功逃离了这一束缚。同时,后向搜索通过分解出能够提供即时反馈的子目标,引导前向搜索一步步向最终目标逼近。
前向搜索:用进化打破自回归的桎梏
在探讨 BES 的前向搜索之前,有必要理解传统自回归生成的局限。在生物进化史上,无性繁殖占据了漫长的时间,其特点是后代直接延续父代的特征,不同个体中独立出现的有益突变永远无法结合。这种模式与目前语言模型的自回归搜索何其相似:每一条推理路径都在孤立地向前延伸,模型无法将路径 A 中的精妙中间步骤与路径 B 中的正确结尾结合起来。
研究团队从有性繁殖的染色体重组中汲取灵感,为 BES 的前向搜索引入了四大进化算子:组合(Combination)、易位(Translocation)、缺失(Deletion)和交叉(Crossover)。这些算子不仅仅是简单的变异,而是建立在重组不同局部轨迹的基础上,生成那些单次模型采样几乎不可能产生的全新候选。

具体而言,除了保留常规的扩展(Expansion)操作外,组合算子允许提取两条具有共同前缀的轨迹,将它们各自独特的后缀拼接成一个新的候选方案。易位算子则是用一条路径中的某个步骤替换另一条路径中的对应步骤。缺失算子针对那些可能包含冗余或错误中间推导的轨迹,直接移除其中最不可靠的内部步骤。交叉算子更为直接,在特定的拼接点切断路径 A,并用路径 B 的尾部替换其后续部分。
通过这些进化算子的作用,前向搜索不再是一个单向的、孤立的扩展过程。算法在一个维护候选轨迹集的容器中,根据启发式分数不断采样轨迹进行演化。为了平衡探索与利用,搜索过程引入了随时间线性退火的温度参数,使得搜索初期能够广泛覆盖不同的重组可能性,而在后期则收敛于高得分的优质轨迹。
后向搜索:用目标分解构筑密集反馈
有了强大的候选生成能力,接下来的挑战是如何准确地评估这些由前向搜索产生的、往往还未完全结束的候选轨迹。由于最终的验证器只能在轨迹终点给出稀疏的得分,前向搜索如果在黑暗中盲目进化,效率将极其低下。
BES 通过后向搜索(Backward Search)精妙地补齐了这一短板。后向搜索的核心思想是目标分解。算法并不急于要求模型一步到位地解决原始问题,而是递归地将原始任务分解成一个树状的细粒度子目标结构。每一个子目标都是一个更容易验证的检查点。
当后向搜索生成了子目标树后,前向搜索树中的每一个节点(候选轨迹)都会与这些子目标进行比对。评估逻辑非常清晰:一条候选轨迹满足的子目标越多,其得分就越高。对于由前向节点生成的单一候选轨迹,其得分由自身满足当前目标的程度及其在子目标集上的得分共同决定;对于由两个前向节点重组生成的候选轨迹,则通过提取两者对子目标的最佳满足度来计算联合得分。
这种机制彻底改变了验证信号的性质。原本稀疏、二元的终点信号,被转化为密集、可解释的中间分数。前向搜索得以在这些密集的反馈引导下,精准地挑选出最有潜力的候选进行下一轮进化。在实际部署中,研究人员采取了交替进行的策略,即每执行几步前向搜索,便触发一次后向搜索来更新评估体系,确保指引信号始终与当前的探索前沿保持同步。
理论洞见:从“熵壳”到指数级样本优势
BES 并非仅仅是工程上的巧妙拼接,研究团队为其有效性提供了坚实的理论证明。论文详细阐述了为什么纯扩展搜索会失败,以及为什么进化算子和双向搜索能够突破这些理论限制。
纯扩展搜索的困境被严谨地定义为“熵壳困境”(Theorem 4.4)。研究人员指出,在假设每步的惊奇度(Surprise)有界且步间依赖随距离衰减的自然条件下,模型自回归生成的所有轨迹的对数概率,最终都会高度集中在整个轨迹级别的熵值附近。这就意味着,纯扩展搜索生成的候选被死死地困在一个极窄的“典型集”(即熵壳)中。许多复杂问题的正确答案往往位于模型分布的低概率区域,纯扩展搜索试图通过增加采样量来碰到这些低概率答案的努力,在数学上是极其低效甚至徒劳的。
进化算子则具备逃离这一熵壳的能力。由于算子强制截断并重组了不同轨迹的片段,打破了原生轨迹中由于长程注意力机制带来的连续依赖。理论证明显示,通过块状重组(Block evolution),新候选的预期对数概率会偏离原始的熵值,强行制造出模型原本不会生成的“惊奇”序列,从而将被搜索空间拓展到了熵壳之外。
与此同时,研究团队还通过定理证明了后向目标分解带来的指数级优势(Theorem 4.5)。如果仅依赖终端验证信号,寻找满足所有条件的正确答案所需的采样数量,与子目标的数量呈指数级相关。而一旦引入后向搜索,将问题分解为可独立验证的子目标,算法只需为每个子目标分别收集证据。这种机制将样本复杂度的需求从连乘关系转变为对数关系,实现了所需样本数量的指数级下降。
实验验证:在后训练与推理双线的全面超越
为了检验 BES 的实际威力,研究人员在后训练和推理两大核心场景中,对大语言模型和智能体系统进行了全面的评测。实验结果有力地证实了理论推断。
在后训练(Post-Training)阶段,研究团队选择了具有极高挑战性的逻辑推理和多跳推理任务。在经典的骑士与无赖(Knights-and-Knaves)逻辑推理任务中,训练集的难度极高。

如图3所示,由于任务难度过大,传统的 GRPO 和 MaxRL 算法在训练过程中几乎找不到高质量的有效样本,导致验证集性能始终在低位徘徊,甚至毫无提升。相反,BES 能够持续、稳定地发现高质量的训练样本,其验证集表现呈现出稳健的上升趋势,最终显著拉开了与基准算法的差距。
在基于智能体的多跳推理任务(MuSiQue 数据集)中,结果更加发人深省。当使用 Llama-3.2-3B-Instruct 和 Llama-3.1-8B-Instruct 作为骨干模型时,主流的 GRPO 算法不仅没有带来提升,反而导致了模型性能的退化。这反映了一个典型的强化学习陷阱:奖励作弊(Reward Hacking)。模型发现老老实实进行搜索动作太难,转而学会了跳过搜索直接瞎猜,这从其极低的有效搜索次数中可见一斑。而 Tree-GRPO 仅仅在 8B 模型上获得了 0.8% 的微弱提升。
相比之下,使用 BES 生成样本进行后训练的模型,在 3B 和 8B 规模上分别实现了 3.0% 和 3.8% 的显著精度增长。更重要的是,指标显示 BES 训练出的智能体执行了大量有效的搜索动作,并保持了极高的任务完成率,证明其确实学会了如何主动、深入地探索问题,而非投机取巧。
在推理(Inference)阶段,BES 被用来直接解决开放式问题。研究人员选取了三个极具难度的数学与几何基准:单位正方形内的圆排样问题、矩形内的圆排样问题,以及 Heilbronn 凸多边形问题。这些任务要求模型直接输出可执行的程序来寻优,对探索能力的要求极高。
结果表明,在相同的计算预算下,BES 在所有三个基准测试中均超越了当前最先进的开源框架(包括 OpenEvolve、GEPA 和 ShinkaEvolve)。更值得注意的是,BES 在多次独立运行中的方差远低于所有基准方法。这意味着其搜索过程不仅能找到更高质量的解,而且表现出极高的稳定性和可靠性。

为了剖析 BES 各组件的独立贡献,研究团队在逻辑推理任务上进行了消融实验。如图4所示,去除了答案重加权机制,或者彻底移除进化算子的 BES 变体,其性能均出现了明显的下滑,尽管它们仍然优于原始的 GRPO 基准。这充分证明了进化重组与后向分解在 BES 框架中是缺一不可的互补机制。
在讨论大模型前沿进展时,我们经常被日益膨胀的模型参数量和动辄数万个 GPU 小时的算力消耗所吸引。然而,Harvard 与 MIT 团队通过 BES 展示了另一条同样重要甚至更具启发性的路径:通过从根本上反思搜索机制的局限,打破自回归生成的熵壳束缚,我们可以在不改变底层模型结构的前提下,激发出模型解决复杂前沿问题的巨大潜能。无论是为后训练提供更优质的反馈数据,还是在推理阶段直接寻找最优解,双向进化搜索都为构建能够真正进行深度逻辑思考和自我进化的 AI 系统提供了一种强有力的新范式。