FinEvo-Bench:金融Agent自演化纵向基准,留存经验最高涨19分
FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows

绝大多数大语言模型 Agent 的评估基准,在设计逻辑上都有一个隐形假设:每个任务都是孤立发生的。Agent 面对一个任务,调动工具、推理规划、输出结果,随后环境刷新,上下文清空,一切归零。
ArXiv URL:https://arxiv.org/abs/2608.06144v1
但现实世界中的专业工作流绝非如此。一名初入职场的金融分析师在完成第一份财报分析或信贷审查时,往往会因为疏漏合规边界或排版逻辑被导师打回修改;当他做到同类业务的第四、第五个案例时,过往踩坑积累的经验规则就已经内化为工作习惯。如果智能体具备持续自演化(Self-Evolution)的能力,那么真正考验它的不是单次静态输出的上限,而是它能否将前序任务的试错反馈沉淀为长期状态,并在后续完全不同的新案例中持续兑现这种成长。
阿里与北京航空航天大学的研究团队联合推出了首个面向专业金融工作流的纵向自演化评测基准——FinEvo-Bench。该研究直面了一个长期被忽视的核心问题:当 Agent 面对高度依赖专业规程、交付物开放且强合规约束的实际场景时,保留下来的经验到底是在帮助它,还是在带来负迁移与检索干扰?
实验给出了非常明确且具启发性的信号:在统一使用 $Qwen3.7\text{-}Max$ 作为底座的严格对照下,引入经验留存与自我演化的框架相较于每轮重置状态的对照组,任务质量评分提升了 $9.33$ 至 $19.37$ 分,合规问题下降了 $0.12$ 至 $0.44$ 个。其中,Codex 框架斩获了高达 $+19.37$ 分的最大净演化增益,而 Letta 则跑出了 $91.65$ 分的演化后最高综合表现与极低的违规率。更反直觉的是,在演化载体的对比中,“只提炼技能(Skill-only)”的表现全面碾压了“记忆机制(Memory-only)”以及“技能加记忆的无约束组合”。

为什么专业金融工作流是自演化的“试金石”?
现有的自演化或终身学习基准,要么局限在简单的代码生成、顺序工具调用上,要么直接使用有确定标签的单轮问答。这类设计很难评估真实的专业场景。
金融业务具有极其鲜明的双重属性。一方面,同一业务场景(如企业信贷审查、投行估值建模、保险理赔判定)共享高度标准化的专业规程(Procedure)、分析顺序以及极其严苛的合规红线,例如严禁对收益率给出确定性承诺、严禁在无证据时下达越权审批结论。另一方面,同一场景下的每一个具体案件,其企业背景、财报数据、财务勾稽关系和核心风险点又完全不同。这就对智能体的自演化提出了苛刻要求:Agent 必须学会将前序任务中的“通用规程沉淀”与“特定案例事实”彻底解耦。如果智能体只是囫囵吞枣地记住了上一个客户的负债率,并错误地套用到下一个客户身上,就会引发严重的幻觉和合规灾难。
为了支撑这一设定,FinEvo-Bench 建立了涵盖 6 大金融领域、20 个核心业务场景的评测集。每个业务场景包含 6 个真实机构脱敏或公开披露的高复杂度案例,总计 120 个多文件任务,平均每个任务包含 $6.46$ 个输入文件(最多达 11 个),涵盖财报、交易流水、合规条例及业务记录。
这些任务交付物都是完全开放的专业分析报告、风险备忘录或审查意见书。为了准确评估此类开放交付物,研究团队为每个业务场景设计了 100 分制的专家级评分细则(Rubric),不仅考察事实证据引用、分析计算深度和结构完整性,还将金融合规设为独立扣分维度。在人工校验阶段,基于 Claude Opus 4.6 驱动的独立自动化评分器与专业金融分析师打分取得了 $\mathrm{ICC(A,1)} = 0.95$ 的极高绝对一致性(平均分差仅 1.6 分),确保了大规模长程纵向评测的可信度。

纵向交错流与配对对照:如何剥离“真演化”与“底座强”?
如何证明 Agent 分数的上升是因为“从历史中吸取了经验”,而不是碰巧底座模型擅长某些任务?
FinEvo-Bench 引入了严谨的配对对照实验协议(Paired Longitudinal Protocol)。评测并未采用先跑完 A 场景 6 个任务再跑 B 场景的简单分块做法,而是将 20 个场景的 120 个任务进行 3 次独立的全局全局混洗(Globally Interleaved Streams)。这意味着 Agent 在刚处理完一笔企业信贷分析后,下一道题可能跳到了股票技术面走势判断,几轮之后又切回信贷业务。这种交错流极大模拟了实际业务中多任务交织的环境,迫使 Agent 建立准确的索引与检索机制,在无关干扰任务之间准确唤醒对应的场景经验。
每个任务经历“执行 $\rightarrow$ 打分与诊断反馈 $\rightarrow$ 反思与经验沉淀”三个阶段。每轮任务结束后,原始对话历史(Raw Context)全部被强制清空,Agent 只能通过外部持久化存储(如 Skill 库、Memory 区块或索引文档)将经验传递给后续任务。
最为关键的是,研究团队设立了绝对同构的“非演化对照组(State-Reset Control)”:在相同的任务乱序流、相同的模型底座(统一采用 $Qwen3.7\text{-}Max$)和解码参数下,对照组在每道题开始前将持久化状态彻底清零。通过计算同一框架在演化态与重置态下的得分差值 $\Delta\mathrm{Score}$ 和合规问题减少量 $\Delta\mathrm{Comp.}$,研究人员首次将“智能体本身的原始能力”与“跨任务自我演化带来的净增益”清晰地分离开来。
评测覆盖了业界代表性的四大开源与商用自演化架构:
-
Claude Code:支持将经验提取为结构化技能(Skills)或项目级/全局级记忆;
-
Codex:具备类似经验沉淀逻辑的代码与工程级智能体框架;
-
Letta:采用类似 MemGPT 的常驻内存块设计,每次推理自动全量挂载核心记忆,并通过专用工具进行动态读写重写;
-
GenericAgent:将任务经验沉淀为 Markdown 经验文件,仅在系统提示词中常驻标题级 L0 索引,按需加载详情。
越做越熟练:后发任务净收益大幅超越先发任务
实验结果证实了经验沉淀在长程任务流中的显著价值。四种架构在演化模式下的综合表现均大幅甩开各自的对照组:总分提升了 $9.33$ 到 $19.37$ 分,平均每个任务触发的合规缺陷下降了 $0.12$ 到 $0.44$ 次。
但更有意思的发现隐藏在框架特性和演化曲线上。
首先,最终成绩排名与演化能力排名发生了分离。Letta 取得了全场最高的终态演化得分($91.65$ 分)和最低的违规率(每任务仅 $0.09$ 次问题),这得益于其独特的常驻记忆块机制,底座模型时刻能感知到此前梳理出的高标准框架;然而从净增长幅度来看,Codex 却以 $+19.37$ 分的净增益夺冠,展现出极其惊人的经验吸收与纠偏能力。相反,依赖轻量 Markdown 经验文件与标题索引的 GenericAgent,无论在最终得分还是净增益上均位列末席,反映出简单的文本文件检索在应对复杂交错业务流时的局限性。
其次,“经验累积效应”在统计上呈现出扎实的单调递增规律。研究团队追踪了每个业务场景内部第 1 至第 6 次出现的任务得分差值。结果显示,对于所有被测框架,在场景内后半程(Rank 4–6)获得的演化净收益,均比前半程(Rank 1–3)高出 $6.10$ 至 $8.70$ 分。这有力地排除了“模型只是碰巧蒙对”的质疑,直接证明智能体确实在纵向推进中吸收了同类场景前序任务的教训,形成了渐进式的认知滚雪球效应。
在经验命中率分析中,具备选择性检索机制的框架(Claude Code、Codex、GenericAgent)在主动调用已沉淀经验的任务上,得分比未调用经验的任务高出了 $8.31$ 至 $9.06$ 分。耐人寻味的是,即便在未唤醒历史经验的任务子集上,这些框架的得分依然比完全不演化的对照组高出 $3.97$ 至 $12.31$ 分。这表明智能体在某些案例中即便没有显式拉取经验文档,其前序反思更新所带来的工作流微调,依然对后续决策起到了潜在的正向规整作用。
为什么技能(Skill)击败了记忆(Memory)?
在自演化系统的底层设计中,经验应当以何种载体存在,一直是学术界与工程界激烈争论的话题。是用向量数据库或自由文本记录记忆点(Memory),还是将工作流程抽象为可调用的执行手册与动作技能(Skill)?
研究团队在 Claude Code 框架下进行了极具深度的消融实验,分别对比了“纯记忆演化(Memory-only)”、“纯技能演化(Skill-only)”、“无约束的记忆+技能混合”,以及人工编写的“静态专家技能”与“无演化基线”。
测试结果打破了很多人对“机制越多越好”的直觉:Skill-only 取得了全场最佳的战绩,终态得分高达 $93.71$ 分,合规问题降至每任务 $0.05$ 次的极低水平。
纯记忆机制(Memory-only)虽然也大幅优于不演化基线,但在灵活性和精确性上明显落后于纯技能演化。而将记忆与技能双管齐下的混合演化模式,不仅没有产生协同效应,反而让模型出现了困惑——得分和合规性均劣于纯技能模式。执行追踪揭示了背后机理:在混合模式下,反思阶段系统会同时向记忆区和技能区写入内容,但在后续任务执行检索时,模型往往只提取了其中一方,造成了上下文碎片化与指示冲突。
此外,在消耗的 Token 成本上,纯记忆模式的反思开销最低(每任务 $26.18 \times 10^4$ Tokens),纯技能模式居中($44.03 \times 10^4$ Tokens),而混合模式则飙升到了 $60.19 \times 10^4$ Tokens。纯技能演化不仅在性能上拔得头筹,在计算效费比上也远胜复杂的混合设计。
这一现象在金融场景下极其合逻辑:金融业务中最需要跨案例复用的是“分析套路与合规防线”(例如:检查审计意见 $\rightarrow$ 核对三表勾稽 $\rightarrow$ 测算偿债指标 $\rightarrow$ 遵循谨慎措辞)。这些程序性知识天生适合被沉淀为模块化的技能脚本(Playbooks/Skills);反之,松散的记忆描述容易夹杂特定案例的数值琐碎,在后续检索时不仅容易带来上下文污染,还可能误导通用推理。
评分细则反馈 vs 参考答案反馈:Agent 究竟需要什么样的养分?
另一个极具实践指导意义的发现,来自于智能体接收的反馈形式。许多开发者习惯于在 Agent 训练或反思环节直接喂入“标准答案(Ground Truth/Reference Answer)”,期望模型通过对齐标答来自省。
研究团队进行了严谨的受控实验:让四种框架分别基于“Rubric 细则问题诊断反馈(指出报告缺失什么分析、违反了哪条合规要求及具体原因)”与“完整参考答案”展开反思演化。
结果呈现出压倒性的一边倒:在所有框架中,接收 Rubric 细则反馈相比接收参考答案,最终得分显著高出 $3.95$ 至 $7.93$ 分,合规问题额外减少了 $0.06$ 至 $0.14$ 个,且在按需检索框架中触发了更多的有效经验唤醒。
这揭示了大模型自演化过程中的深层认知机制:给 Agent 塞一份写得天花乱坠的参考答案,它很难分辨出哪些是由于该案例特定数据引发的特异性论述,哪些是跨案例通用的工作原则,极易导致过拟合与死记硬背。相反,基于评分细则生成的结构化诊断反馈,精准点破了“缺少前瞻性假设校验”、“结论越权代行了投委会决策”等规程性漏洞。Agent 据此反思提炼出的,是高度泛化的高阶方法论,因而在面对全新的未知案例时,能展现出强大的迁移与防御能力。
在对五大细分能力维度的进一步拆解中,演化机制在“报告整体质量(格式排版、要素覆盖)”上带来的增益最为迅猛,各框架提升幅度在 $6.85$ 至 $18.17$ 个百分点之间;而涉及特定案件数字推理的“分析与计算”、“证据利用”提升幅度相对平缓。这再次印证了自演化在规范专业交付物形态上的卓越价值。
跨业务混杂,会导致经验中毒吗?
现实业务中,智能体的大脑往往要同时处理多种维度的业务。当 20 个互不相关的金融场景全局交织在一起时,前一个业务的经验会不会污染后一个业务?
研究团队抽取了 5 个场景共 30 个任务,对比了“全局交错流”与“场景完全隔离(每个场景独立使用干净状态演化)”的差异。令人意外的是,隔离场景并没有在最终分数上带来确定性的优势:Claude Code 和 Letta 在场景隔离后分数反而微跌了 $0.84$ 与 $1.00$ 分,而 Codex 和 GenericAgent 则微涨了 $0.46$ 与 $1.63$ 分。
更值得关注的是合规维度的表现:所有框架在隔离场景下,每道题的合规缺陷反而上升了 $0.01$ 到 $0.05$ 个。
这说明金融领域的某些底层合规直觉——例如保持谨慎性表述、严禁给出绝对收益承诺、重视一手数据核验——具有跨场景的普遍通用性。全局交错的任务流不仅没有让智能体发生灾难性遗忘,反而在多领域的交替锤炼中强化了通用的合规反射弧,让 Agent 形成了更加稳健的职业防御姿态。
从静态评测走向“能成长的系统”
FinEvo-Bench 的核心贡献不仅在于公布了一套包含 120 个真实复杂案例和 775 份金融底稿的权威数据集,更在于它为大模型 Agent 确立了面向真实工程落地的评测新范式。
过去的 Agent 评测大多像一次性的高考,分数只代表模型在静态切片下的知识储备;而 FinEvo-Bench 衡量的是智能体的“学习转化率”——在给定的框架脚手架与反馈机制下,Agent 到底能不能将昨天的踩坑记录,转化为明天的生产力。
实验给出的一系列技术结论为落地下一代专业智能体提供了清晰的工程路标:
-
在专业工作流场景中,优先构建基于结构化 Skill 的经验萃取机制,谨慎引入松散的无约束长程记忆;
-
构建高质量的诊断型反馈生成器(指出错在哪、为何违规),比直接提供标答更能激发 Agent 的跨任务迁移能力;
-
建立端到端的自演化闭环,完全能够让大模型在不重新微调权重(Non-parametric)的前提下,实现类似资深员工般的业务熟练度跃升。
当大模型逐步接管复杂的现实工业与商业流程,我们不再需要一个每次都被“格式化重启”的冰冷推理机,而需要一个能够在工作流中日拱一卒、持续进化的数字专家。FinEvo-Bench 无疑为丈量这种进化能力,立下了一把严密而有力的标尺。