FinanceHarness:顶尖大模型得分不足45%,金融深度研究为何需要时序沙箱?

FinanceHarness: Autonomous Financial Deep Research Framework

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

深度研究(Deep Research)正在成为大语言模型落地最具代表性的 Agent 形态。从自动化网页搜寻、多源交叉验证到生成结构化的长篇综述,通用 Agent 已经能在许多日常咨询和信息整理任务中达到甚至超过普通分析员的水平。然而,当这类系统被直接推向金融投研场景时,往往会暴露出本质层面的水土不服。

ArXiv URL:https://arxiv.org/abs/2607.27853

专业的金融深度研究不仅要求从海量财报和资讯中精准抽取数据,更要求分析师理清实体与事件之间的深层因果链,并基于历史事实对未来的宏观走势、行业竞争与公司业绩作出前瞻性推演。现有的通用深度研究系统通常依赖无约束的实时网页检索,这在金融任务中极易引发严重的“未来信息穿越”(Point-in-Time 泄漏)——Agent 表面上做出了精准的行业预判,实际上只是在搜索引擎中检索到了事后写就的新闻与财报。

为了打破这种“评估失真”与“缺乏金融专业工作流”的困境,研究团队推出了 FinanceHarness 框架以及配套的评测基准 FinanceGym。该工作构建了一个严格限制信息时间戳的万亿级时序搜索沙箱,并设计了专为金融研报打造的分层 Agent Harness。实验表明,即便换上顶尖的闭源基础模型(如 Opus-5),在 FinanceGym 上的综合得分依然低于 45%,暴露了金融研究对于复杂逻辑推理的苛刻要求;而借助 FinanceHarness 的专业分层设计,同尺寸开源基座模型的研报质量基准得分直接从 25.3% 跃升至 32.4%。

基准与沙箱端到端构建流程

为什么通用的 Deep Research 无法直接迁移到金融投研?

通用深度研究与专业金融分析之间的鸿沟,主要体现在信息检索机制、时间约束与推理验证三个维度。

在信息形态上,普通用户让大模型调查一个科技概念或行业动态,模型只需收集公开事实并整合归纳。但金融分析师针对某家半导体企业发起调研时,必须在同一时间切片内对比历史多期财报数据、剖析上下游供应链挤压风险、推演竞争对手扩产带来的边际毛利波动,并最终给出严密的评级结论。通用 Agent 缺少对资产估值、可比公司分析、情景测算等专业工具链的直接调度能力,生成的报告往往浮于宏观叙事,充斥着正确但无用的泛化描述。

更严重的致命伤在于时间维度的未来信息泄漏。学术界常用的各类研究基准,通常允许 Agent 访问全网数据或固定的最新快照。但在金融投资中,“根据过去推断未来”是唯一的商业现实。如果允许 Agent 在回答 2022 年关于某新能源车企的产能扩张前景时查阅到 2023 年甚至 2024 年的事后复盘报告,评测得出的“强推理能力”就完全成了记忆复读的幻觉。

此外,传统的金融自然语言处理(NLP)评测长期停留在单一子任务上,比如文本情感分析、命名实体识别,或者针对 SEC 文件单点数字的短文本问答。这些基准既不能衡量 Agent 长程收集证据的能力,也无法评判其撰写严密投资论点(Investment Thesis)的综合推演水平。

FinanceGym:基于时间切片沙箱与真实图谱的情境驱动基准

为了建立一个经得起机构级审视的评测环境,研究团队首先构建了一个包含超过一亿篇公开网页文章的底层检索库。与常规语料库不同,该系统对每篇文章都用专有工具提取了可靠的发布时间,并基于 Qwen3-Embedding-4B 构建了带严格时间准入控制的 FAISS 稠密向量检索引擎。当评测任务指定一个截止日期(Cutoff Date)时,检索沙箱会无条件拦截所有晚于该时间戳的文章,杜绝未来信息输入。

单纯有时序沙箱还不够,金融问题本身不能靠人工凭空臆造。团队利用模型在千万级图谱边中提取实体与事件关系,设计了三种贴合资深分析师思维习惯的情境挖掘(Situation Mining)模式:

  1. 跨类别网络关联(Multihop Linkages):追踪企业、宏观指标与具体政策之间的间接传导链。

  2. 时间叙事弧(Temporal Narrative Arcs):围绕核心资产在关键周期节点上的演化轨迹生成问题。

  3. 极性分歧与张力(Polar Divergences):捕捉市场上看多与看空评级对立、盈利预期大幅超预期或不及预期的强博弈场景。

每一道生成的题目,均包含一份参考投资论点(Thesis)以及最为核心的双层评分细则(Two-Tier Rubrics)。这种双层设计是 FinanceGym 评测的核心机制:

生成后的问题池经过严格的质量过滤与整数线性规划(ILP)配比,涵盖了科技、消费、医疗、能源、宏观固收等 11 个核心金融板块以及 12 个不同跨度的月度时间切片。最后,外部专业金融数据团队以平均每题耗时 1.2 小时的标准完成人工复核,最终筛选出 400 道高难度研究题目与 2464 条经专家校验的细粒度评分准则,整体人工通过率达到 82%。

FinanceHarness 架构:分层工具、专家技能与严格防线

面对苛刻的时序检索沙箱与双层评分体系,单纯依靠一个 ReAct 提示词循环加上网页搜索插件,极易在几轮无序翻找后迷失在杂乱的上下文里。FinanceHarness 针对这一缺陷,引入了标准的分层运行架构。


+-------------------------------------------------------------+


|                     Serving / Model Layer                   |
|   (Orchestrator Backbone + Document Evidence Reader)        |

+-------------------------------------------------------------+

                              |
+-------------------------------------------------------------+


|                         Runtime                             |
|  - Bounded Execution Loop       - Schema Validation         |
|  - Context Budget & Truncation  - Multi-tier Tool Catalog   |
|  - Grounding Review Pass        - Citation Finalization     |

+-------------------------------------------------------------+

                              |
+-------------------------------------------------------------+


|                      Tiered Tool Surface                    |
|  [Always-Loaded Tier] PIT Search, Source Read, Citation     |
|  [Deferred Tools Tier] Financial Metrics, Valuation, Comps |
|  [Extension Tier]     MCP Connectors, Enterprise APIs       |

+-------------------------------------------------------------+

整个系统的基础是模型服务层与运行时的严格解耦。核心模型只面对标准的请求与响应规范,不绑定任何特定厂商的模型 SDK,这使得开源模型(如 Qwen 系列)与顶尖闭源模型可以在同一套脚手架下实现无缝横向替换。

处于控制中枢的运行时层(Runtime),承担了所有确定性工程控制任务。它不仅管理步数受限的推理循环,更维持着严格的跨层不变量:参数结构校验、调用链路溯源、上下文窗口预算分配,以及研报出具前的引用完备性检查。

为了兼顾提示词的精炼度与专业金融工具的丰富度,FinanceHarness 采用了分层工具表面(Tiered Tool Surface)策略:

与工具配合的是专家工作流技能(Workflow Skills)机制。Agent 不仅能直接发起原子级工具调用,还可以选择挂载一段预先封装好的结构化分析流程。系统提供了“偏重证据搜寻的研报模式”与“偏重测算推演的分析模式”,在整个调度周期内统一注册表,避免在模式切换时出现上下文断层与非法指令。

为了确保研报的严肃性,FinanceHarness 内置了真实性校准机制(Grounding Review)。在最终成文阶段,系统会强制执行轻量级事实验证逻辑,要求模型复核报告中的每一个关键论据是否拥有真实的阅读文档支撑;未能锚定原始事实的主张会被要求淡化语气或直接移除。在工程稳定性方面,框架还引入了 URL 预检机制。消融实验显示,如果去掉这一过滤防线,无效文档访问报错率将从 $2.1\%$ 飙升至 $39.4\%$。虽然基础模型在出错后往往能自我修复,但多次试错会使上下文 Tokens 迅速膨胀,大幅增加调用成本。

实验与前沿边界:顶尖模型依然面临“研究深水区”

在统一的 PIT 检索引擎与 FinanceGym 评测标准下,团队测试了包含专用研报模型、通用前沿模型以及不同架构 Agent 在内的 23 个基准系统。

从评测结果可以清晰地看到金融深度研究任务的断层级挑战:在 5 分制评分转化为百分制后,几乎所有现存的主流 Agent 和通用 LLM 基准得分都在 40% 以下徘徊。这表明,即便基础模型拥有出色的通识逻辑,在面对需要交叉验证多方利益冲突、推导滞后商业影响的真实研报任务时,依然存在严重的推理短板。

各类系统在 FinanceGym 上的成本与质量前沿分布

从成本-质量前沿分布图(Cost-Quality Frontier)可以看出几个具有明确指导意义的行业技术趋势:

通用商业 Agent(例如通义深度研究专用模型 Tongyi-DR 或 MiroThinker)在原生的实时网络环境中表现亮眼,但迁移到严格的时间切片沙箱中时,得分出现了一定程度的下滑。这证明专用训练的搜寻策略往往对特定的外部搜索引擎 API(如 Serper、Jina)存在分布依赖;一旦失去无死角的互联网补充,系统在前瞻性推断上的鲁棒性便会打折扣。

与此相对,分层 Harness 展现出了对底层模型显著的赋能价值。在保持 27B 这一级别的开源权重基座不变的前提下,裸跑或采用普通 ReAct 包装的模型得分通常仅有 25.3%,但在套用 FinanceHarness 框架后,研报得分直接攀升到 32.4%,拉开了极为明显的代差。这一提升甚至超越了某些参数量更大、但仅采用简单单层搜索架构的系统。

而在所有参评模型的最顶端,挂载 FinanceHarness 的 Opus-5 达到了 44.9% 的全场最高分,牢牢占据了帕累托最优前沿。但即便如此,44.9% 的成绩依然意味着它距离完美解决前瞻性金融推演还有很大的空间。

值得关注的是搜索预算对最终质量的影响。消融实验显示,强行增加检索轮数并不能无脑推高研报质量。过度的网络搜寻往往只是模型在面对极其困难、无法理顺因果关系的题目时产生的“迷茫行为”。因此,限制搜索预算主要起到了控制 Token 消耗和财务成本的作用,而真正决定研报评分上限的,是 Agent 能否在有限的高质量证据中提炼出合乎商业逻辑的因果链路。

对未来金融垂类 Agent 研发的技术启示

FinanceHarness 与 FinanceGym 的实践,为垂直领域智能体系统的设计提供了三个具有普适性的经验参考。

其一,垂直领域深度研究评测,必须防范时间泄漏导致的虚假繁荣。无论是金融、法律还是前沿科技预判,脱离了 Point-in-Time 时间沙箱的“事后诸葛亮”式评测,无法反映模型的真实研报水准。构建带严格时序访问控制的环境,将成为垂类评测基准的基础设施标配。

其二,长文本不能取代结构化的上下文分层管理。虽然现代大模型的上下文窗口动辄几十万甚至上百万 Tokens,但在深度研究任务中,把大量金融财报和无序网页全部塞进提示词,不仅成本高昂,更会导致模型的关键注意力和遵循能力衰减。通过常驻工具与按需加载工具的解耦,配合轻量级阅读器过滤无关文本,才是长程研究任务走向商用的经济路线。

其三,评估标准必须实现“事实检索”与“前瞻推断”的显式分离。金融研报的真正价值从来不是复述已经发生的财报数字,而是在事实发生前评估未来的不确定性。将评测指标解构为前截止期(搜寻能力)与后截止期(推断能力),不仅能精准定位系统的能力短板,更指明了未来利用强化学习微调垂直研究模型时的奖励函数方向。

随着以 FinanceHarness 为代表的受控执行框架与可审计评测基准开源,深度研究智能体正逐步走出“泛泛而谈”的演示阶段,开始真正进入对因果逻辑与推演严密性要求极高的产业纵深地带。