FrontierFinance:当金融Agent走出查表,最强模型全流程得分仅56%

FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

FrontierFinance:当金融Agent走出查表,最强模型全流程得分仅56% 论文图示

在过去两年中,大语言模型在金融领域的应用评测几乎陷入了一种“虚假的繁荣”。翻开绝大多数金融评测榜单,模型在 FinQA、TAT-QA 或 FinanceBench 上的准确率动辄高达 80% 甚至 90% 以上。然而,如果拿着这些高分模型去辅助真正的买方(Buy-side)投资经理或卖方(Sell-side)行研分析师,绝大多数从业者会迅速发现这些系统在面对真实工作流时的巨大脱节。原因非常纯粹:现有的绝大多数公开金融基准,本质上只是把金融简化成了“有界文档内的单点数据提取”与“表格加减乘除”,一旦脱离了给定的财报段落,让 Agent 像人类分析师一样自主寻找证据、研判行业催化剂、跨宏观与微观数据进行综合归纳,模型往往会立刻漏洞百出。

ArXiv URL:https://arxiv.org/abs/2608.11683v1

针对这一行业断层,来自金融 AI 研究机构 Samaya AI 的研究团队推出了全新的金融 Agent 评测基准 FrontierFinance。该研究由具备顶尖买方、卖方和投行背景的专业金融团队设计,完全摒弃了单篇文档查表的玩具式测试,转而涵盖投资研究全生命周期的六大核心场景。通过 220 个专家级复杂研究查询以及高达 11,543 条具备信源归因的细粒度评测准则,FrontierFinance 第一次为金融领域的 Agent 系统建立了一面严苛的“照妖镜”。实验结果表明,即便是目前最顶尖的模型与系统,其平均表现也仅仅处于刚及格的边缘;更重要的是,研究揭示出一个长期被低估的技术事实:在复杂的金融任务中,Agent Harness(工具集成与编排系统)的设计对系统上限的影响,甚至不亚于底层模型本身的智力。

FrontierFinance 覆盖的六大金融投资场景

从“单表查数”到“全流程投研”:金融评测的断层有多深?

要理解 FrontierFinance 的价值,首先必须剖析传统金融评测基准为何在现实中失真。在过去数年里,主流评测集如 FinQA 和 TAT-QA 将任务形式严格限制在“给定一段财报文字和一个小表格,计算某个增长率或毛利率”;FinanceBench 稍微进了一步,将范围扩大到整份 10-K 年报,但其核心仍然是单点事实检索。这些基准固然验证了模型的符号推理和局部信息提取能力,但也带来了两个无法忽视的致命问题:其一,由于数据形式高度静态且集中在知名上市公司年报中,主流模型在预训练阶段极有可能已经通过参数化记忆将答案死记硬背,造成了“测试集泄露”的假象;其二,真实的投资工作根本不是做单选题,一名分析师面对的研究问题往往是高度发散且跨模态的。

例如,一位基金经理不会问“某公司 2023 年营收是多少”,而是会问“比较三家特定半导体设备厂商在先进制程上的扩产进度与供应链抗风险能力,并结合最新财报指引和产业上下游动向给出风险提示”。回答这样一个问题,需要先自主拆解逻辑、检索多方信息源(包括 SEC 监管文件、财报电话会纪要、行业专刊、宏观数据甚至管理层即时发言)、核验事实一致性,最终撰写出结构严谨、逻辑自洽的深度研报。现有的金融评测对此几乎处于空白状态。

FrontierFinance 的立论起点正是重塑这一评价体系。它将投资者的全流程工作流明确划分为六大核心场景:标的筛选与发现(Screening & Discovery)、行业与宏观研究(Sector, Industry & Macro)、公司基础研究与竞品分析(Company & Competitive Intelligence)、财报与业绩追踪(Earnings & Filings Analysis)、重大催化剂与事件监控(Catalysts & Events Monitoring),以及财务数据深度抽取(Financial Data Extraction)。在这六大场景中,传统的财务数据抽取仅占其中一隅,其余五大场景均属于强开放性、高度依赖外部多信源交叉验证的现实投研难题。

更重要的是,为了在长篇、开放式的研报生成中实现客观、可复现的自动化打分,研究团队放弃了粗暴的“单一参考答案匹配”或未经约束的“LLM-as-a-Judge”。他们提出了“细粒度、源头可归因准则”(Source-Attributed Rubrics)评分机制。每一个复杂查询都被专业金融专家拆解为数个到数十个必须满足的事实判断准则,总计构成了 11,543 条二元判据。每条准则不仅清晰定义了“合格”与“不合格”的边界,而且必须明确回溯至公开可查的权威数据源。在评估阶段,系统调用三个独立的顶尖大模型担任裁判进行多数表决(Majority Voting),从而在保留开放式长文本评估灵活性的同时,最大限度压低了打分的随机性与模型偏见。

难度量化:为什么现有基准在它面前全成了“送分题”?

为了定量证明 FrontierFinance 的难度究竟提升了多少,研究团队引入了类似于竞技排名的 Bradley-Terry(BT)潜变量模型。在对齐训练(如 DPO)和 Chatbot Arena 模型竞技场中,BT 模型通常用来通过两两对决评估模型的优劣;而在 FrontierFinance 中,研究者创新性地将这一机制反向用于评估“任务的难度”。

具体而言,团队构建了由三个独立大模型组成的裁判团,围绕五个核心维度对两两匹配的任务查询进行成对比较:检索广度(Retrieval Breadth,回答该问题需要跨越多少完全不同的独立信息源)、推理深度(Reasoning Depth,需要多大程度的因果推导与跨期比较)、实体范围(Entity Scope,涉及单家公司、多家同行还是整条供应链)、时间跨度(Time Scope,是静态切片还是跨越多年的周期性分析),以及定性模糊度(Qualitative Ambiguity,任务边界的开放与定性主观程度)。基于近 4,000 个内部查询所产生的约 77,000 次两两对比,团队拟合出了一个置信度加权的 BT 难度评分标尺。

随后,研究团队将经典的 FinanceBench、BigFinanceBench 以及 Finance Agent Benchmark v2 中的典型问题,通过锚定比较(Anchor Pairings)映射到了同一条 BT 标尺上。对比结果呈现出极度悬殊的极化趋势:

现有的代表性公开基准几乎全军覆没在“简单(Easy)”和“中等(Medium)”区间。特别是此前被广泛测试的 FinanceBench,由于绝大多数任务本质上只是单个 10-K 文件的单点事实检索,在 BT 标尺上几乎 100% 落在最简单的区间;即便是较为复杂的 Finance Agent v2 和 BigFinanceBench,也仅有 0% 至 2% 的任务能够触及“高难(Hard)”门槛。

与之形成断层反差的是,FrontierFinance 展现出了极宽的难度分布与极高的中位数。在 FrontierFinance 的全部查询中,高难度任务占据了主力部分,其背后的根源就在于多源信息综合与长程因果逻辑的深度耦合。在数据源分布上,FrontierFinance 也打破了“万物皆看 10-K”的刻板印象:尽管 SEC 监管文件依然是最大的单一来源,但也仅占总体准则信源的 39%,其余 61% 的证据分散在公司官方声明、财报电话会议实录、第三方行业数据库、权威金融新闻以及政府宏观统计平台中。这意味着,任何试图依靠局域 RAG 或者死记硬背 SEC 文件的 Agent,在 FrontierFinance 面前都会立刻暴露出致命的视野盲区。

实验结论:Harness 决定下限,开源模型惊艳追平

在严格限制使用公开互联网数据的标准化测试环境下,研究团队对国内外主流前沿模型与 Agent 编排框架展开了全面的质量、成本与延迟三维评测。评测指标以准则通过率(Rubric Qualification Rate, $R_{\text{all}}$)为核心,同时记录对必须覆盖的关键信息项的通过率($R_{\text{must-have}}$)。

整体实验结果为业界敲响了警钟,同时也指明了 Agent 系统的工程优化路径。所有受测系统中最显著的结论包括以下几个层面:

其一,自研系统全面领跑,系统编排对效能的塑造超越了纯模型能力。Samaya 的内部专有 Agent 系统取得了全场最高的 56.0% 准则通过率,不仅位列第一,而且在绝对质量上超越了使用标准开源 Harness 调用的最强闭源前沿模型 Claude Fable 5(49.2%)。更为关键的是成本维度的差距:在实现更高综合质量的同时,Samaya 系统单次查询的平均 Token 消耗和推理成本,比搭载 Claude Fable 5 的开源通用系统低了约 2.2 倍。这有力地证实了一个前沿工程观点:当面对开放域长程研究时,单纯依赖一个极度聪明的通用模型去“盲目思考”是低效的;由高质量工具链、精准的上下文检索窗口管理、以及专为金融场景定制的确定性流程(Deterministic Workflow)构成的 Harness,才是压降推理幻觉与系统成本的核心杠杆。

其二,开源及开放权重模型展现出惊人的性价比替代能力。在所有开源与开放权重模型阵营中,国产模型 Kimi K3 表现异常亮眼,取得了 46.4% 的综合准则通过率,几乎在水准线上直接逼近了最顶级的闭源旗舰模型(与 Claude Opus 4.8 和 GPT 5.6 等模型处于同一梯队)。但在单次查询成本上,Kimi K3 展现出极其惊人的效率优势——其平均成本比最具竞争力的专有商业模型足足降低了 4.5 倍。这表明在特定复杂的长文本理解与工具调用链条中,顶尖的开放权重模型配合良好的工程上下文注入,已经具备了在专业垂直领域对高昂商业 API 实施平替的现实能力。

其三,整体得分刚过半程,金融深度研报仍是远未解决的学术与工程天堑。即使是表现最佳的 Samaya 系统,其 56.0% 的总得分也意味着仍有超过四成的事实与逻辑准则无法达标;而行业普遍采用的标准前沿模型在通用开源框架下的平均得分普遍徘徊在 40% 左右。更具深意的是分场景表现的巨大断层:在诸如财报数据抽取、公司基础信息整理等偏向结构化的任务中,领先模型能够拿到相对较高的准则覆盖;但在最为核心的两个开放式场景——“标的筛选与发现”(Screening & Discovery)以及“行业与宏观研究”(Sector, Industry & Macro)中,全部模型均遭遇了断崖式溃败。在标的筛选场景下,即便是全场最优系统也仅仅录得 33% 的准则通过率;在宏观与行业研究中,最高得分也只有 39%。这两个场景不仅需要横向对比大量可能不存在直接关联的离散主体,更依赖于非线性的定性归纳,目前的 Agent 架构在处理此类全景扫描式任务时,依然显得捉襟见肘。

轨迹深剖:盲目“硬编码”URL 导致的上下文污染陷阱

除了宏观的分数与成本对比,论文中最具技术启发性的部分在于团队对 Agent 执行轨迹(Trajectories)的微观行为学剖析。研究人员追踪了所有系统在开源 Finance Agent v2 框架下调用工具的完整上下文流,并提炼出了金融研究 Agent 的典型行为模式与典型故障模式。

分析显示,几乎所有系统在面对长文本金融研报任务时,都会自发收敛至一种清晰的三阶段(Three-phase)行动演化:

前期是高密度的“纯数据收集期”,模型集中调用搜索与网页爬取接口;中期进入“边检索边合成的混合分析期”,模型开始在上下文中梳理因果框架,并根据已有线索发起补充定向检索;后期则彻底进入“答案成文期”,停止绝大多数外部网络交互,集中进行结构化长文本渲染。这一行为收敛证明,赋予模型自主规划步骤的工具环境,能够在一定程度上自涌现出贴合人类行研逻辑的工作范式。

然而,微观轨迹也揭示出了一个极其致命的模型内部偏见:过于自信的参数化记忆,反而成为了拖垮 Agent 的毒药。

研究团队量化分析了模型尝试爬取和解析的每一个 HTML 链接的来源,将其严格二分为两类:一类是通过先前的网络搜索引擎结果所发现的真实链接(Search-discovered URLs);另一类则是完全脱离当期搜索记录、由模型自身的先验知识直接“脱口而出”凭空生成的域名与链接(Parametric Knowledge URLs)。

数据追踪展现出了令人震惊的分化:两款 Claude 系列模型以及 Kimi K3 表现出了极强的“自作聪明”倾向。在 Claude Fable 5 的全部解析行为中,高达 26.7% 的网页链接是它未经任何前置搜索、凭借自身模型记忆直接编造或者“硬编码”出来的权威金融域名(如直接敲出 sec.gov 的某层特定路径、美联储宏观数据库 fred.stlouisfed.org 或是 macrotrends.net 的历史变迁页);Kimi K3 与 Claude Opus 4.8 凭记忆直接导航的比例也接近其一半。相比之下,其他大部分受测模型这一比例均在 5% 以下,例如 Gemini 3.6 Flash 在 1,093 次网页解析中,自生域名的次数为零,完全依赖搜索引流。

直接凭记忆访问权威数据库看似是一种“专家直觉”的高级体现,但在工程实践中却带来了灾难性的连锁反应。轨迹错误日志显示,这些脱离搜索引导、直接由参数化记忆生成的复杂长 URL,遭遇了极高概率的访问崩溃——要么是因为模型幻觉凭空捏造了不存在的二级路径(HTTP 404),要么是触发了高阶金融数据库严密的反爬与验证码机制(HTTP 403)。更糟糕的是,当 Agent Harness 不断将这些失败的请求报错注入交互上下文时,会产生严重的 Token 浪费与不可逆的“上下文污染”(Context Pollution)。模型在后续的推理步中往往会陷入反复重试错误链接的死循环,或者因上下文充斥着大量报错 HTML 代码而丢失最初的研究主线,最终导致研报质量的骤降。这一发现深刻警示了未来的 Agent 研发者:如何通过 Harness 在运行时适度抑制模型“凭空猜测深层 URL”的冲动,强制建立基于搜索验证的证据链闭环,将是提升 Agent 鲁棒性的关键一环。

金融智识的前沿演进与未来注脚

FrontierFinance 的发布,标志着金融大模型评估正在经历从“考察答题准确率”到“考察端到端专家级生产力”的根本范式转移。它不仅为学术界和产业界撕开了传统刷榜基准下的虚假安全感,也为下一代专业金融 Agent 的落地提供了清晰的路线图。

从现实角度审视,FrontierFinance 同样具有技术局限性。正如作者团队在论文中所坦诚指出的,基准中为了保证测试的确定性,为每个问题绑定了固定的历史基准时间戳。然而随着基座模型的代际更迭,未来的基础模型在预训练或后期对齐阶段,必然会接触到晚于这些基准时间点的海量互联网语料。届时,模型究竟是在依靠动态工具链进行多跳推理,还是在无意识地泄漏参数记忆,将变得更加难以厘清。为了应对这一挑战,定期的专家基准动态滚动作业将不可或缺。此外,在标的筛选等本质上存在多解性的主观场景下,未来还需要探索“多重专家准则集”来更宽容地度量不同合理投资风格的模型方案。

但无论如何,FrontierFinance 所确立的方法论已经成为一个鲜明的行业注脚:评测金融 Agent 的智能,核心不在于它能在多短的时间内背出某家公司去年的净利润,而在于当面对充满迷雾、多源冲突与跨周期的现实商业世界时,系统能否像一名训练有素的人类专家那样,审慎检索、剔除杂音、交叉求证并构建起经得起推敲的洞察框架。在这个终极目标面前,仅有 56% 的天花板得分恰恰说明,金融 Agent 的进化之路才刚刚越过真正意义上的地平线。