ToE:将智能体经验拆解为推理树,复杂任务准确率提升31.4%
Tree-of-Experience: Hierarchical Experience Management for Self-Evolving Agents
在大模型驱动的智能体(LLM Agent)研究中,“自主进化”始终是一个极具诱惑力却又充满陷阱的命题。人们普遍希望智能体在与复杂环境不断交互的过程中,能够像人类专家一样从错误与成功中提炼出可复用的经验,实现能力的持续跃升。然而现实往往令人沮丧:在复杂的推理任务中,很多看似精妙的经验记忆机制,运行一段时间后不仅未能提升智能体的胜率,反而常常比没有任何历史记忆的“裸跑”基线表现更差。
ArXiv URL:https://arxiv.org/abs/2608.09044v1
这种“越学越倒退”的根本症结,在于现有框架对经验的组织方式与模型的实际推理路径发生了割裂。无论是针对单条轨迹反思修正的局部记忆,还是跨轨迹提取共性特征的归纳机制,都倾向于将整个交互过程打包为一个不可分割的黑盒。一旦环境只给出一个综合性的结果反馈(Outcome-level Feedback),模型根本无法厘清究竟是哪一步推导、哪一个分析维度起到了正面或负面作用,最终导致错误的归因与伪经验的恶性累积。针对这一痛点,一项名为 Tree-of-Experience(ToE)的新研究提出了全新的解题思路:它不再将经验平铺或聚类,而是直接将经验镜像构建为一棵与模型思考方式同构的“层次化分析视角树”。
该框架在数学推理任务 Game of 24 以及极具挑战性的低复现金融预测基准 FinEvolveBench 上进行了验证。在 Game of 24 中,引入 ToE 的智能体相较于无经验的思维树(ToT)基线取得了 31.4% 的相对准确率提升(绝对准确率达到 85.3%),同时将大模型调用次数大幅缩减了 78.7%;而在环境反馈高度延迟且充满噪声的 FinEvolveBench 上,传统经验管理方法普遍跑输基线,ToE 却在 12 种评测设定下实现了时间序列信息系数(tsIC)平均 41.24% 的显著增长。这一成果不仅证明了结构化经验管理的有效性,也为长期困扰具身智能与自主决策系统的“信用分配难题”提供了极富启发性的工程范式。

传统经验机制的失灵:为什么智能体会“越学越蠢”?
要理解 ToE 的独创性,首先需要审视大模型智能体管理历史交互的两大主流范式。第一种是“轨迹内转换”(Intra-trajectory Transformation),代表方案包括 Reflexion、MemRL 和 ReMe 等。这类方法的核心逻辑是事后反思:当一个任务失败后,模型对当前交互轨迹进行局部改写或错误纠正,然后存入向量数据库中;下次遇到语义相似的任务时,再通过检索把当年的踩坑教训作为少样本示例塞入上下文。这种机制的弊端显而易见——生成的经验高度碎片化,且极度依赖具体的上下文语境。在许多多步骤、多变量的任务中,表面上完全相同的任务输入,其背后需要解决的局部子问题可能大相径庭;机械匹配整条历史轨迹,反而会向提示词中注入大量与当前局势无关的噪音甚至幻觉。
第二种路径则是“轨迹间归纳”(Inter-trajectory Induction),例如 FLEX、SkillGen 以及 SkillRL。这类方法尝试跨越单条轨迹的狭隘视野,聚合多条相似历史记录,归纳出更高层级的抽象技能或策略先验。虽然这在一定程度上改善了对未见场景的泛化能力,但其对经验的抽象依然停留在“问题—完整方案”的整体映射层面。一旦面临任务复现率极低、因果链路复杂的非确定性环境,模型便会遭遇致命的归因困境(Attribution Failure)。
以复杂的逻辑推理或金融市场分析为例:智能体最终做出的判断是正确的,究竟是因为宏观视角的把握精准,还是微观数据分析得当,抑或是某一步偶然的逻辑代偿抵消了前面的严重误判?现有的轨迹级归纳机制无法细分每个推理组件的贡献度。当环境仅回传一个标量奖励或最终成败时,传统方法往往无差别地奖励或惩罚整条决策链路。这导致不可靠的推理步骤被盲目强化,产生虚假自信;反之,某些极具价值的子步骤也可能因为全局失败而被连坐抹杀。正是这种归因能力的缺失,导致传统智能体在经历大量环境交互后,经验库充斥着互相冲突、逻辑脆弱的模式,最终在推理阶段彻底扰乱了基座模型的底层逻辑。
作者在此明确指出了一个高效经验系统必须满足的四个支柱属性:可归因性(Attributability),即能够把全局结果精准切分并回传给各个关键决策要素;可迁移性(Transferability),能抽取跨任务复用的底层分析原则而非表面文本匹配;可演化性(Evolvability),支持随环境反馈对经验进行渐进式的校准、融合与淘汰;以及极高的运转效率(Efficiency),绝不能在推理时因为检索和遍历海量上下文而造成不可承受的计算开销。
镜像思维过程:Tree-of-Experience 的架构设计
ToE 的核心洞察在于:经验在本质上并不是静态的历史档案,而是未来推理过程的动态指引。既然模型在解决复杂问题时依赖层次化的思维展开(正如思维树 Tree of Thoughts 所展示的那样),那么经验本身的组织拓扑就应当与这种分层推理结构完全同构。

如上图所示,ToE 将整个经验库 $\mathcal{E}$ 构建为一棵深度受控、宽度可自主拓展的层次树:
\[\mathcal{E}=\left\{\Big(\mathbf{\Pi}_{i},\mathbf{Q}_{i},\mathbf{M}_{i}\Big)\right\}_{i=1}^{\lvert \mathcal{E} \rvert}\]在这套表征中,根节点对应着任务的总体目标或问题大类,而非根节点则承载着特定的“分析视角”(Analytical Perspective)。从根到叶的树状展开并不是死板的模板堆砌,而是体现了认知逻辑由抽象到具体的演进过程。父节点捕捉宏观通用的分析维度,子节点则将其进一步细化、分支为具体的分析路径 $\mathbf{\Pi}$。每个经验单元还严格绑定了其经受环境检验后的可靠度向量 $\mathbf{Q}$ 以及维护元数据 $\mathbf{M}$(包含召回频次、命中次数和时间戳等)。
当智能体接手一个全新任务输入 $x_t$ 时,ToE 并不进行全局的文本相似度检索,而是伴随着大模型逐步展开的推理过程进行同步下潜。在当前层级 $l$,智能体结合当前上下文 $H_l = (x_t, \Pi^{l-1})$,递归地从经验树的候选分支中挑选与当前推理节点相匹配的视角:
\[\mathcal{C}_l = \operatorname{Retrieve}\left(H_l, \mathcal{E}\right) = \operatorname{TopK}\left(f_\theta^{\mathrm{rerank}}\left(H_l, \operatorname{Children}(p^{l-1})\right)\right)\]如果现有树结构中缺少合适的分析视角,内部集成的 Proposer 模块会依据当前任务特征动态萌生出新的候选视角集合 $\mathcal{A}_l$;与此同时,为了防止经验树在持续运行中出现无节制的语义膨胀与冗余,Merger 模块会利用表征检索并借助大模型判断,将语义高度重叠的兄弟节点进行同类合并。
这种树状设计的精妙之处在于它在“分析视角层级”实现了跨任务的真正迁移。在低复现度任务中,两个问题从表面文字上看可能毫无重合点,但人类专家之所以能应对自如,是因为处理问题的“分析骨架”是相通的。例如面对两则完全不同的产业突发事件,底层的供应链影响、估值波动以及宏观关联等分析维度完全一致。ToE 沉淀并复用的是“如何分析一个问题的方法学”,而不是“曾经做过哪道类似题目”。在完成多路径或分步推理后,模型将任务输入、筛选出的最佳分析路径及其可靠度状态整合为终极经验集 $\mathcal{E}t = {\Pi_L, Q(\Pi_L)}$,最终生成决策动作 $a_t = f\theta(x_t, \mathcal{E}_t)$。
信用分配与软遗忘:经验可靠性的动态校准
拥有了同构的树状结构,环境结果反馈的归因便有了明确的锚点。当智能体执行动作并从环境中接收到延迟的成败反馈 $r_t = \psi_\tau(a_t, o_{t+h})$ 时,这一标量信号便无需在黑暗中盲目均摊,而是直接沿着本次决策所实际激活的那条分析路径,逐层反向渗透并校准该路径上各节点的可靠度评分 $Q(e)$。
在具体的更新算法上,论文对比并设计了两种机制:LLM 驱动更新与公式化驱动更新。尽管利用大模型根据结果提示词直接对各个节点打分能够实现极细粒度的信用分配,但在高度复杂的非确定性环境中,大模型本身的评估主观偏差容易导致误差累积。因此,研究团队提出了一种更为稳健、具备自适应边界约束的公式化更新规则:
\[\mathbf{Q}(\mathcal{E}_t) \leftarrow \mathbf{Q}(\mathcal{E}_t) + \eta \frac{1 - \left(\frac{\mathbf{Q}(\mathcal{E}_t) - q_0}{q_0}\right)^2}{1 + \log(1 + n_{\text{hit}})} \cdot r_t\]这个看似简单的更新公式,蕴含了数个极具洞察力的设计考量:
首先,参数 $q_0$ 设定了一个中性先验,$Q$ 值的整体波动区间被严格限制在 $[0, 2q_0]$ 内。分子中的二次项构成了边界感知因子——当一个经验节点的可靠度处于中性先验附近时,该因子的值接近 1,系统给予较大的探索步长;而当可靠度逐渐逼近 0 或 $2q_0$ 这两个极端上限与下限时,边界因子的导数迅速收缩为 0,防止由于偶发的极端环境噪声导致节点的信誉瞬间崩溃或失控膨胀。
其次,分母中的 $1 + \log(1 + n_{\text{hit}})$ 巧妙地引入了经验历史置信度的衰减机制。随着某个分析视角被调用和验证的次数不断增多,单次偶发反馈对该节点全局信誉的影响权重逐步递减,展现出类似于贝叶斯更新的渐进稳定性。
最重要的一点在于,ToE 并不会因为某个节点可靠度过低就将其直接从树中硬性剪枝删除。低分节点在参与推理时虽然其激活权重被大幅削弱,但它们作为“确凿的负面经验”依然被系统完整保留。智能体通过检索感知到这类低分路径,能够主动规避已知的认知盲区与思维死胡同,真正实现了基于“软遗忘”(Soft Forgetting)的稳健进化。
严苛评测下的性能突围:确定性与非确定性双重验证
为了全方位检验 ToE 的真实成色,研究团队特意选取了两个极端对立的测试基准:一个是具备严格封闭解、因果链路完全确定但多步搜索极其繁琐的数学符号任务 Game of 24(24点游戏);另一个则是任务绝不重复、信息高度碎片化、市场反馈延迟且充满非理性噪声的真实金融情感推断基准 FinEvolveBench。实验的主干基座模型采用了 DeepSeek-V4-Flash,并在消融实验中引入了 Qwen3.6-35B-A3B 进行跨模型验证。
在 24 点任务中,智能体需要在加减乘除四则运算约束下将给定的 4 个数字组合成 24。在这一设定下,分析视角具体化为数值分组策略与运算符优先级选择。评测结果展现出令人深思的现象:传统经验管理方法由于缺乏精细归因,将大量无用的中间搜索状态与终局答案强行打包,导致 Mem0、MemRL 和 ReMe 等知名框架的最终解题胜率全部落后于没有任何外部经验库的原始 ToT 基线。反观搭载了 ToE 的系统,其解题准确率从基线的 64.9% 跃升至 85.3%,实现了高达 20.4 个百分点的绝对增长,相当于 31.4% 的相对增益。更为惊人的是,由于树状结构在每一层精确剪除了毫无希望的运算组合,智能体与大模型的交互调用总次数锐减了 78.7%。这意味着智能体不仅思考得更准确,而且远比过去更轻盈。

如果说 24 点验证了 ToE 在确定性强逻辑任务中的剪枝与模式复用能力,那么 FinEvolveBench 则是对其在真实开放非确定性环境中抗噪能力的终极考验。该任务要求智能体解析具有时间序列特征的中国 A 股行业金融新闻,预测未来多个时间跨度内行业指数的市场情绪走向。这里几乎不可能遇到重复的新闻内容,且市场实际走势常常掺杂情绪扰动,归因极其隐晦。
实验分别在 10、20、40 个交易日的预测窗口下展开,贯穿模型的探索期(Exploitation)与全生命周期(Overall)。在全部 12 项细分评测设定中,传统经验管理组件再次遭遇滑铁卢——其预测的信息系数指标频繁录得负值或显著弱于无经验基线,表明未经分层解耦的经验在面对宏观复杂系统时基本沦为了有害干扰。而 ToE 无论在 10 日短周期还是 40 日长周期下,均保持了极其稳健的正向增益,整体时间序列信息系数(tsIC)平均提升达到 41.24%。配合上方雷达图的评估数据可以看出,ToE 在可维护性、跨领域泛化和推理吞吐等多个维度上,全方位拉开了与现有前沿经验框架的代际差距。
针对可靠性更新机制的深度消融同样印证了作者的设计直觉。在 20 个交易日的预测基准下,对比公式驱动与纯大模型提示词驱动的更新策略,公式驱动策略展现出了更强的稳定性和更优的综合表现。实验表明,大模型在面临复杂的金融归因时容易产生认知幻觉与过度拟合,而基于自适应步长与历史频次惩罚的数学约束,有效平抑了高噪环境中的方差冲击,为系统的长期平稳自演化构筑了底线保障。
走向真正的自主进化系统
回顾自主智能体系统的演进历程,如何从交互轨迹中沉淀出智慧一直是通往通用人工智能(AGI)的核心阻碍。过去业界往往陷入两个极端:要么将所有历史数据直接倾倒进长文本上下文,寄希望于大模型自行融会贯通;要么将复杂的思考片段压成不可穿透的向量切片,在表层语义的浅水区做低效打捞。
Tree-of-Experience 的核心价值,在于它指明了一条将“认知推理架构”与“记忆存储机制”进行深层统一的演进路径。它通过树状拓扑将大模型面对复杂问题时的多维拆解视角具象化,使环境反馈不仅能够作用于“结果”,更能够穿透到“思考过程本身”。这种将分析范式沉淀为经验单元的范式转换,使智能体即便在面对全新、未知的复杂业务场景时,也能迅速调动起成熟的方法论骨架,完成高质量的自适应推理。
对于从事 Agent 系统研发、量化投资策略设计乃至复杂决策支持系统的工程师而言,ToE 提供了一个极为清晰且具备极高落地可行性的工程蓝本:不要试图教智能体去“死记硬背”曾经发生过的具象历史,而是应当构建能够精准归因并自我校准的经验树,让智能体真正学会“如何结构化地思考与反思”。这才是大模型自演化系统从机械模仿迈向真正认知升维的必由之路。