EEVEE:路由协同进化机制,DeepSeek多基准得分提升24.32分
EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents

测试时提示词学习(Test-time prompt learning)为基础模型的部署后适配提供了一种轻量级机制。与传统的权重微调不同,这种方法通过更新提示词来应对新输入、分布偏移和失效模式,特别适合通过与环境交互来自我优化的智能体(Self-Improving Agents)。然而,现有的前沿方法大多针对单一数据集或单一基准进行设计。当模型被部署到真实的复杂应用中时,面对的往往是来自多个数据集、多个领域和多种任务分布的异构输入流。
ArXiv URL:https://arxiv.org/abs/2606.11182v1
普林斯顿大学与上海交通大学的研究团队指出,在面对混合任务流时,现有的测试时提示词学习方法会遭遇严重的跨数据集干扰。为了解决这一痛点,研究团队提出了首个面向多数据集测试时提示词学习的框架 EEVEE。该框架通过引入路由机制将输入划分到不同的任务簇,并分配给最合适的提示词配置。更关键的是,EEVEE 采用了一种创新的路由-提示词协同进化策略,在多个基准测试中实现了显著的性能飞跃:在 Qwen3-4B-Instruct 和 DeepSeek-V3.2 模型上,多基准平均得分分别提升了 10.38 分和 24.32 分,最高超越了当前 SOTA 方法 GEPA 和 ACE 达 48.2%。
本文将深入解析 EEVEE 框架的核心机制、三阶段训练设计以及其在异构数据流中的关键实验结论。
异构数据流下的跨数据集干扰危机
在真实的部署环境中,大语言模型接收到的查询往往具有高度的异构性。比如,上一秒模型还在处理复杂的数学公式推理,下一秒就需要生成特定格式的计算机代码,接着可能又要回答闭卷知识问答。研究团队将这种场景形式化为多数据集测试时提示词学习:模型接收的示例流来自多个数据集和领域,而非单一稳定的来源。
这种设定直接暴露了现有方法的致命缺陷——跨数据集干扰。现有的提示词学习方法通常假设存在一个统一的适应目标或固定的提示空间,它们仅从一个基准中获取反馈。这意味着,当模型为了适应某个特定领域的任务而更新提示词时,这种更新往往会破坏模型在其他领域的表现。

上图直观地展示了这种破坏性干扰。随着更多不同类型的任务(如 GPQA Diamond、Formula、TheoremQA、HumanEval)依次加入适应流,现有的强基线方法 GEPA 和 ACE 在早期任务上的保留率出现了明显的负增长。图中向下的阴影方块代表负的保留损失,这表明单一的演化提示词难以在吸收异构反馈的同时,保持针对特定任务的行为能力。当所有四个任务全部引入后,GEPA 和 ACE 的累积保留增益分别跌至 -15.36 和 -18.58。这一现象揭示了一个核心矛盾:要从混合任务流中学习,就必须找到一种能够保护任务特化的新架构。
路由与提示词的协同进化架构
为了在混合任务流中保护各个领域的专业化能力,EEVEE 框架摒弃了让所有输入共享同一条适应路径的做法。相反,它引入了一个路由器(Router),并在底层维护了一组专业化的提示词集合。
具体而言,假设提示词集合为 $\mathcal{P}={p_{1},\ldots,p_{K}}$,路由器为 $R$,目标模型为固定的 $M$。对于任何一个输入 $x$,前向推理过程可以表示为:
\[z=R(x;\mathcal{P})\in\{1,\ldots,K\},\qquad\hat{y}=M(x;p_{z})\]在这个架构中,路由器负责评估当前输入最适合由哪个提示词槽来处理,从而阻断了不同领域数据在单一提示词更新时的相互污染。

然而,设计这样一个路由器充满了挑战。如果路由器是刚性且固定的,它将无法捕捉复杂多变的任务结构;如果路由器过于不稳定,又会干扰底层提示词的优化。更重要的是,提示词学习器和路由器之间存在深度的相互依赖关系:路由策略决定了每个提示词能够从哪些样本中学习,而提示词的实际表现又反过来决定了哪种路由策略才是真正有效的。
为了打破这种死锁,EEVEE 引入了路由-提示词协同进化(Router-Prompt Co-evolution)策略。在混合适应数据被划分为训练集 $\mathcal{D}{\mathrm{tr}}$ 和验证集 $\mathcal{D}{\mathrm{val}}$ 后,每一个协同进化周期都会交替执行两步操作。
在路由进化阶段,框架固定当前的提示词集合 $\mathcal{P}{T}$,并搜索一个更好的路由器 $R{T+1}$。框架会初始化一个临时的路由器池,并从中采样参考路由器进行变异。为了确保评估的准确性,框架只从至少有一个当前提示词能够解决的训练样本中采样。路由器的评分函数 $S_{R}(R)$ 综合考量了下游准确率、标签一致性以及负载均衡性,从而引导搜索过程重塑路由规则,而不是仅仅微调现有规则。
在提示词进化阶段,框架固定刚刚更新的路由器 $R_{T+1}$,利用其将全部数据路由到特定的槽位分组中,然后对每个提示词槽 $p_{k,T+1}$ 进行更新。这一阶段采用了基于帕累托前沿(Pareto-front)的选择规则,同时引入了一个空提示词基线来过滤掉无效的修改。当所有非空槽位的表现趋于平稳时,提示词进化阶段结束。通过这种交替机制,路由决策和提示词特化不再是孤立优化的组件,而是能够相互促进、共同演进的有机整体。
三阶段训练流水线设计
为了使上述协同进化策略在实际应用中兼顾效率和收敛性,研究团队为其量身定制了一个精巧的三阶段训练流程。这三个阶段各自承担着不可替代的职能,确保了模型从无到有构建稳定路由策略的过程。

第一阶段被称为初始化(Initialization)。在启动路由进化之前,框架必须先拥有一组具有基本区分度的提示词集合。如果初始提示词毫无用处,那么准确率的波动将主要反映提示词本身的缺陷,而不是路由分配的质量,这就使得路由器无法获得有效的梯度信号。因此,EEVEE 首先在混合训练集上运行全量提示词学习,并保留一个帕累托前沿池。通过一种基于贪心覆盖率的规则(如上图右侧公式所示),框架从池中挑选出那些能够覆盖互补样本的前 $K$ 个提示词,形成初始提示词集 $\mathcal{P}^{0}$。这些初始提示词为后续构建路由规则提供了必要的行为特化基座。
第二阶段进入探索(Exploration)。该阶段从初始化的路由器和提示词集出发,在较轻量的计算预算下,高频交替执行路由进化和提示词进化。高频切换在这里是至关重要的设计权衡:如果在路由器尚不稳定的情况下投入大量资源充分优化提示词,会导致计算预算的严重浪费;反之,如果针对已经过时的提示词行为来过度优化路由器,则会导致路由策略发生严重过拟合。在探索阶段,EEVEE 还启用了一种退火机制,逐渐将路由评分权重的重心从一致性和平衡性转移到绝对准确率上。这种设计确保了早期搜索能够保留多样的路由行为,而后期能够锁定精确且稳定的路由分区。
第三阶段是收敛(Convergence)。由于探索阶段必须频繁切换上下文,没有任何一个提示词槽能够在这个过程中被彻底优化。一旦退火过程和交替更新找到了一个相对稳定的最优路由器 $R^{\star}$,收敛阶段就会将该路由器彻底固定。随后,框架使用固定的路由器对所有数据进行最终的重新路由,并在每个固定的槽位内投入更大规模的提示词学习预算。这种设计使得 EEVEE 能够在一个稳定的分区边界内,挖掘出极具竞争力的强提示词策略。
异构任务上的性能飞跃与泛化能力
研究团队在四个核心基准上对 EEVEE 进行了全面的多数据集测试时提示词学习评估。这四个基准涵盖了截然不同的领域:GPQA Diamond 侧重于闭卷高难度知识问答,Formula 和 TheoremQA 考察深度的数学与符号推理,而 HumanEval 则是经典的机器代码生成测试。
实验数据充分证明了 EEVEE 架构的优越性。在 Qwen3-4B-Instruct 模型上,EEVEE 的四项平均得分达到 51.75,相较于未适配的基础模型大幅提升了 10.38 分,并且比之前最强的基线方法 GEPA 和 ACE 分别高出 14.02 分和 16.83 分。特别是在代码生成任务 HumanEval 上,其单项得分达到了 72.63,相较基础模型暴涨 23.17 分。
当底层模型替换为更强大的 DeepSeek-V3.2 时,EEVEE 的性能潜力得到了进一步释放。多基准平均得分攀升至 64.07,相较基础模型获得了惊人的 24.32 分绝对提升。在 Formula 测试中提升 30.55 分,在 HumanEval 测试中更是达到了 92.82 的极高分数水平,完全碾压了基于单一提示词更新的现有框架。

为了探究 EEVEE 性能优势的边界,研究团队进一步实施了任务规模扩展分析。在退回到传统的单基准环境时,EEVEE 依然能够保持与 GEPA 和 ACE 相当甚至略微领先的竞争力。这证明了其内置的提示词进化机制本身就是极其高效的。然而,真正的鸿沟出现在多任务混合规模扩大的时候。如同前文提到的保留率统计所示,当四个任务全部混合后,单一提示词系统不可避免地陷入了负保留的泥潭,而 EEVEE 凭借路由条件的隔离,最终维持了高达 +41.53 的累积保留增益。这说明,任务池越庞杂、异构性越强,路由-提示词协同进化的价值就越凸显。
此外,该框架展示出了令人瞩目的跨模型泛化能力。实验表明,使用 Qwen3-4B-Instruct 学习到的提示词,如果直接零样本迁移到 DeepSeek-V3.2(无思考模式)上,依然能将后者的平均得分从 39.75 提升至 54.10。这意味着 EEVEE 捕获的并非仅仅是特定模型权重的局部怪癖,而是某种具有高度通用性的任务解决范式。在跨任务泛化中,这些提示词在未见过的代码数据集 MBPP 上同样实现了性能提升,表现出良好的领域内鲁棒性。
兼顾效能的轻量级计算开销
在评估复杂框架时,推理时期的 Token 消耗往往是决定其能否落地的核心指标之一。由于 EEVEE 在生成最终答案之前插入了一层路由推理,这难免让人担忧其会不会带来不可接受的延迟和成本膨胀。

上图展示了不同方法在完成测试时提示词学习后的平均 Token 消耗对比。结果令人惊喜:在包含输入和输出的完整交互中,EEVEE 平均每个样本仅消耗 4.32k Token。这一数字虽然略高于 GEPA 的 3.47k,但却远远低于 ACE 夸张的 21.30k。
这种巨大的效率差异源自底层架构设计的本质区别。ACE 采用的是一种增量编辑“运行手册(Playbook)”的机制。随着任务类型的增加和数据的不断累积,这种运行手册不可避免地会堆积大量冗余条目,导致输入上下文在后期呈爆炸式增长。相比之下,EEVEE 利用路由器在推理时进行硬选择,每次只将当前输入送入唯一一个最匹配的提示词槽中。这种基于分配而非拼接的策略,使得框架在获得强大异构适应能力的同时,总体 Token 消耗维持在极低的水平,较 ACE 缩减了近 5 倍。
总结与展望
在面向真实世界的复杂任务流时,基础模型仅靠单一的上下文演化注定会陷入顾此失彼的跨领域干扰。普林斯顿大学与上海交通大学提出的 EEVEE 框架,通过引入一个灵活的路由器来管理专业化提示词簇,为大语言智能体的自我进化提供了一条全新的突围路径。
其创新的三阶段路由-提示词协同进化机制,不仅在算法层面上优雅地解开了路由分配与提示词质量之间的相互依赖死锁,更在工程实践中以极低的 Token 开销换取了 DeepSeek 等前沿模型在多基准上的巨大性能飞跃。进一步的案例分析还揭示了一个关于提示词学习本质的重要洞察:这种基于反馈的优化过程,最擅长捕获的是那些高度可复用的操作程序、输出契约以及通用解题策略,而非单纯的领域知识灌输。
尽管 EEVEE 仍依赖于部分带有真值或规则标签的数据来进行离线迭代,尚未能做到完全的无监督在线学习,但它无疑为下一代能够在复杂现实中持续、稳定自我强化的智能体,奠定了坚实的架构基础。