GAUGE:大模型做金融估值为何建表93分、商业判断仅78分?
GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

在大模型逐步走向长流程、复杂工具调用的今天,让 Agent 像初级分析师一样搭建一份完整的估值财务模型(Financial Valuation Model),被视为 AI 进军专业金融领域的核心里程碑。然而,如何评估 Agent 搭建的模型究竟合不合格,一直存在一个隐秘却致命的盲区:传统的评测基准普遍习惯设立一个“专家标准答案”(Golden Answer),并将 Agent 的输出与该参考答案逐一比对。
ArXiv URL:https://arxiv.org/abs/2607.24889v1
这种单点容差的评测逻辑在基础代码生成或单选题问答中行之有效,但在金融估值场景下却与现实严重脱节。清华、北大、上交大、新加坡国立大学(NUS)与阶跃星辰(StepFun)等机构的研究人员在一项新研究中揭示了一个残酷的事实:哪怕让两位来自顶级机构的专业人类分析师为同一家公司的同一财年独立建模,其隐含目标股价的差异也从未小于 $10\%$。如果用传统的“单点金标准”互相评测,分析师之间的互评分数中位数仅有令人咋舌的 $0.33$(满分 1.0),超过 $92.6\%$ 的专业模型对评得分低于 $0.70$。换言之,旧有的评测体系并没有真正测出 Agent 的能力,而是在机械地惩罚金融领域原本就广泛存在的专业合法分歧。
为打破这一死结,研究团队提出了针对 Agent 端到端金融估值建模的全新评测基准 GAUGE。该基准不再依赖单一分析师的单点数值,而是构建了基于行业实践分布的“三层观察实践包线”(Observed-Practice Envelope),结合 56 个细粒度可审计切面与 8 道有效性门控,对 24 款主流大模型 Agent 进行了深度“体检”。
评测结果揭示了一个耐人寻味的行业现状:当前的头部模型(如 Claude Fable 5、Claude Opus 4.8)在机械性建模(三张表配平、公式勾稽、数据抓取)上已经能够拿到 93% 的惊人高分,但在需要商业洞察与风险权衡的估值判断上,得分骤降至 78%,全舰队中位数差距更是高达 26 个百分点。大模型虽然已经全面超越金融专业学生的平均水准,但依然无法匹敌初级分析师,更无法跨过资深分析师的门槛。大模型已经学会了“画出完美的表格骨架”,却依然缺少“理解生意的商业灵魂”。

黄金答案的陷阱:分析师之间的“合法分歧”
在量化金融与企业估值中,一份估值模型通常包含两套截然不同的逻辑体系。第一部分是机械性与会计事实:历史财报数据录入必须精确,资产负债表必须左右配平($TA = TL + TE$),现金流量表的期末余额必须无缝勾稽到资产负债表的现金项。这些属性是非黑即白的,存在绝对客观的标准答案。
但第二部分则是前瞻性的商业判断:未来的收入增速设定为 $8\%$ 还是 $12\%$?长期的折旧摊销节奏如何演变?基于资本资产定价模型计算加权平均资本成本(WACC)时,贝塔系数该如何选取?永续增长率到底锚定宏观通胀率还是行业均值?
不同投资机构的分析师基于不同的风险偏好、调研渠道和行业理解,必然会得出迥异的预测。研究团队从收集的 1,001 份分析师真实 Excel 工作簿中,筛选出 65 家拥有多份同向覆盖报告的公司,共组成 108 组分析师对标样本。结果显示,对于同一家公司,两位专业分析师给出的 WACC 绝对差异中位数达到了 147 个基点(90分位点高达 374 个基点);而对于自由现金流贴现模型(DCF)算出的隐含目标价,差异中位数更是高达 $25\%$,90 分位点达到了惊人的 $107\%$。在所有配对中,没有任何两份模型的目标价差距在 $10\%$ 以内。
如果在评估时将某一份分析师模型奉为唯一的金标准,那么另一位同样优秀的分析师就会被系统判定为“充满低级错误”。现存的多数金融 Agent 基准无意中陷入了这一陷阱:它们不仅未能客观衡量 Agent 是否具备专业金融思维,反而在惩罚 Agent 探索不同合理商业假设的能力。
GAUGE 的重塑:从单点对齐到“三层实践包线”
为了让评测逻辑回归金融行业本质,GAUGE 颠覆了单参考点机制,构建了一套兼具确定性事实校验与弹性专业判断的评测体系。
基准建立在覆盖 922 个股票代码、25 个全球行业分类标准(GICS)子行业的 1,001 份专业工作簿之上,提取出 196 个严格校验的端到端任务。输入端向 Agent 提供目标公司连续三年的历史原始财务数据、业务分部框架和基准日期指引,但严格隔离分析师的一致性预测;Agent 必须在 1,800 秒的时限内,端到端交付包含动态 Excel 模型、估值敏感性测试、假设文档与投资备忘录在内的完整交付包。

在评估最核心的前瞻性假设时,GAUGE 引入了三层观察实践包线(Observed-Practice Envelope)。对于某个特定的估值指标(如折现率或终值倍数),系统并不要求 Agent 命中单一数值,而是划定合理的接受区间:
-
核心参考带 $E_f$:综合目标公司的历史多分析师区间与同行业主流实践分布,落在该区间内即判定为极具合理性,获得满分(2分)。
-
容差扩展带 $\widetilde{E}_f$:将核心区间向外拓宽至跨分析师分歧的 90 分位边界,落在此区域代表假设虽有激进或保守倾向,但仍属于业界合理探索范畴,获得基本分(1分)。
-
荒谬区:完全超出专业实践区间的数值(如无理由的 $1\%$ 极低折现率或 $50\%$ 的永续增长率),则直接打为 0 分。
与此同时,GAUGE 设计了由 56 个细粒度切面(Facets)组成的立体评分栈,涵盖 5 大支柱与 21 项子能力。其中 29 项属于确定性程序检查(如报表公式有效性、单元格绝对引用)、4 项直接数值规则,以及 23 项由大模型裁判经由 5 次独立多数表决判定的质性逻辑切面。
更关键的是,GAUGE 设立了 8 大“一票否决”的有效性门控(Validity Gates)。在过去的基准中,一个模型哪怕资产负债表相差数亿元没配平,也能凭借其他局部文本匹配拿到及格分。但在 GAUGE 中,一旦触发布局完全损毁、报表未配平、循环引用报错或关键估值链条断裂等硬伤,总分就会直接被强制封顶在 40 分以下。这一设计彻底堵死了 Agent “靠局部刷小分蒙混过关”的评测漏洞。
舰队实测:机械建表狂飙,商业判断失控
在 GAUGE 选定的 48 项核心评测基准下,研究团队对 24 款国内外代表性 Agent 进行了 1,011 次端到端生成测试,并引入了 55 名人类被试(包括 12 名资深分析师、18 名初级分析师和 25 名金融专业学生)进行严格的盲测对齐。
评测采用将未完成任务计为 0 分的严苛真实得分 $\phi_0$。人类组的得分展现出极强且清晰的专业梯度:资深分析师平均斩获 88.3 分,初级分析师平均拿到 66.0 分,而金融专业学生仅有 43.2 分。
反观 AI Agent 舰队,表现呈现出显著的断层式分布:

整体表现最好的全栈 Agent 是 Claude Fable 5,综合得分 $\phi_0$ 为 53.4,虽然稳稳超越了金融学生的平均分,但在绝对得分上仍落后于所有资深分析师与绝大多数初级分析师。紧随其后的是 Claude Opus 4.8(49.6 分)与 GPT-5.6-sol(46.5 分)。值得注意的是,尽管部分模型的生成看似完整,但在 8 大有效性门控前露出了原形——GPT-5.6-sol 的门控触发率高达 $46\%$,而 Fable 仅有 $10\%$。许多模型生成的 Excel 看似花团锦簇,但内部公式错漏百出,一旦审计机制介入,虚假繁荣瞬间破灭。
更深刻的洞察在于能力维度的巨大撕裂。如上图所示,全 fleet 24 款 Agent 无一例外表现出“机械构建能力远胜商业估值判断”的统一特征。在完成的模型中,最顶尖的 Agent 机械切面通过率达到了惊人的 $93\%$,但在判断切面上仅有 $78\%$;而在整个模型舰队中,机械通过率与判断通过率的中位数差距更是达到了夸张的 26 个百分点。
大模型可以极其娴熟地编写 Python 脚本、调用 openpyxl 建立多工作表交互、甚至精准配置字体颜色与边框样式。但一旦涉及核心商业变量的设定,AI 就开始显露疲态。
AI 分析师的致命软肋:教科书教条与缺乏常识
通过对 532 份成功交付模型的底层参数进行微观解剖,研究团队进一步抓住了大模型在金融认知上的固有病灶。
在折现率设定上,人类分析师往往会根据企业的债务成本、税率变化、流动性折价等因素,进行精细到个位数的基点(bp)计算。在 120 份真实分析师底稿中,只有 $12\%$ 的 WACC 恰好落在 50 个基点的整倍数网格上,落在 100 基点网格的仅有 $7\%$。然而在大模型构建的模型中,多达 $40\%$ 的 WACC 被设定为 50 基点的整倍数(如 8.5%、9.0%),更有 $27\%$ 直接粗暴地填上 100 基点的整数值(如 8.0%、9.0%、10.0%)。
这表明当前的 Agent 并没有像真实分析师那样基于基本面去推演资本成本,而是频繁掉入预训练语料中的“教科书例题直觉”。一旦缺乏细颗粒度的引导,Agent 就会本能地搬出教科书式的通用假设,给出失真的粗糙结论。
不过,实验中也出现了一个令人欣慰的信号:Agent 为不同公司评估风险溢价的相对排序能力并不弱。Agent 产出的 WACC 跨公司相对排序与参考工作簿的相关系数达到了 $\rho = 0.36 \sim 0.42$,这与人类分析师之间交叉比对的吻合度($\rho = 0.38$)高度一致。换言之,Agent 其实大致知道哪家公司比哪家公司风险更高,但它们极度缺乏将这种抽象相对认知锚定到具体绝对数值上的商业校准能力。
给未来金融 Agent 带来的启示
针对这一缺陷,研究团队还验证了不同的训练信号对 Agent 商业直觉的重塑效果。实验发现,如果仅仅在提示词中给 Agent 投喂所谓的“模范案例卡片”(Exemplar Cards),对判断分数的提升微乎其微(仅增加 1.0 分,无统计显著性);但如果向 Agent 注入经过去偏处理的同行业实践分布表(E-industry tables),Agent 的估值判断子项得分在无数据泄露的前提下显著提升了 4.0 分。此外,在 146 条高质量专家轨迹上进行微调,也带来了 8.4 分的判断力跃升。
这一发现为下一代垂直领域 Agent 的研发指明了清晰的方向:单纯增加上下文示例,无法赋予模型深层的领域判断力;真正有效的途径,是让模型学习到行业内经过时间沉淀的“实践分布先验”,使其理解在不同的商业模式、不同经济周期下,参数落在哪一个波段才合乎商业常理。
GAUGE 的出现不仅打破了金融 AI 领域长期以来的“单点金标准迷信”,更确立了一套从格式校验、逻辑审计到实践包线约束的科学评测框架。它向整个行业宣告:让大模型吐出一份格式规整、公式联动的财报模型并不算真正的通关,如何让 AI 学会像人类资深专家一样在充满不确定性的市场中做出审慎、自洽且经得起推敲的商业判断,才是大模型走向专业生产力的决胜战场。