ShiJianBench:评测AI投顾不能只看回复,7199人校准的长程决策新基准
ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors
在金融理财场景中,将大语言模型包装成“AI 投资顾问”正成为越来越多金融科技平台的核心叙事。然而,评估一个对话式投顾模型的能力极其棘手。以往的做法往往退回到通用的自然语言评估范式:让模型回答若干金融问答,检查事实是否准确、语气是否合规、措辞是否富有人文关怀。
ArXiv URL:https://arxiv.org/abs/2608.01204
但这远远脱离了真实投资的本质。在真实的资产管理中,投顾的一句话从来不只是信息展示,而是一次干预。面对市场大跌,顾问一句看似四平八稳、免责合规的安慰,可能让一位风险厌恶型投资者误以为“反弹在即”而盲目死扛,最终割肉在最低点;也可能因为过于保守的机械劝退,让投资者完全错过后续的修复行情。评测 AI 投顾的核心矛盾在于:一次单轮打分极高的“专业回复”,在用户长达数月乃至数年的动态交互与市场震荡中,真的能导向一个更好的决策结果吗?
由于真实业务日志中永远无法观测到“如果当时顾问说了另一句话,用户后续会怎么操作”的反事实路径,单纯依赖历史回溯无法客观衡量投顾的长期有效性。为了破解这一困境,研究者推出了 ShiJianBench(识鉴基准)。这项工作不再局限于静态的文本问答测评,而是首次构建了以用户心理状态演化为中介、在固定历史市场真实回放下进行长程反事实对比的 AI 投顾评测框架。

该基准基于 2021 年至 2026 年中国公募基金市场的真实走势(覆盖约 2000 只基金,完整经历熊市、震荡市与牛市),并借助 7,199 名真实投资者的群体行为特征对模拟器进行了深度校准,在严格的硬合规门禁下对多个主流大模型投顾展开了长程评测。
为什么评测投顾不能停留在“单次回答”?
金融对话与客服问答存在根本性差异。当用户就基金亏损向 AI 提问时,AI 传递的信息会被用户吸收,转化为对其内部隐变量(信念、风险感知、信任度、情绪以及心理账户)的修正。这些隐变量并不直接外显,而是会随着随后的市场走势、账面浮亏浮盈以及下一次突发事件反复发酵,最终在某一个交易日外化为买入、补仓、赎回或观望的实际动作。
如果评测体系只考察“回答本身是否优雅合规”,就会产生严重的系统性偏差。模型完全可以生成一段无懈可击、挑不出法律漏洞的“正确的废话”,在静态评测中拿到满分,但在实际引导中却对用户的恐慌情绪毫无抚慰,或者对错配的资产风险只字不提,任由投资者在随后的震荡中做出自毁式的非理性交易。
要真正评估投顾的长期价值,必须把“对话(Dialogue)”与“决策(Decision)”打通。这需要一个高度逼真、能够对顾问建议产生内生心理反应并在时间跨度上持续演化的模拟环境。
多智能体协作下的投资者模拟:从内部分歧到最终决断
为了复现真实人类面对金钱诱惑与亏损恐惧时的复杂心理,ShiJianBench 没有采用常见的单一静态 Prompt 角色设定(Persona),而是提出了一个结构化的多智能体投资者模拟器(Multi-agent Investor Simulator)。
人类在做投资决策时,内心从来不是单一维度的。模拟器将单个投资者在每个决策日的心理博弈拆解为四个各司其职的 LLM 子智能体:
-
Sentinel(哨兵):极度关注下行风险与资本金安全,对亏损与市场下挫极其敏感;
-
Hedonist(享乐/追逐者):紧盯潜在收益与动量红利,在市场上涨时倾向于博取更高弹性;
-
Socialite(社交/从众者):高度关注羊群效应与外部舆论信号,容易受到市场普遍情绪的影响;
-
Executive(执行协调者):负责主持内部仲裁,根据当前的心理账户背景,将前三者的冲突诉求整合为最终行动。

在每一个交易日,前三个子智能体根据其特定认知偏好对市场信息进行选择性感知,生成包含行动偏好概率分布、置信度以及论据的提议。系统通过结构化的跨智能体交互质询(Cross-examination)更新彼此的倾向,最后由 Executive 按照情境权重进行归一化仲裁:
\[\bar{q}_{t}(a) \propto \sum_{k \in \mathcal{K}} w_{k}(c_{t}) \, \tilde{\alpha}_{t}^{(k)} \, \tilde{q}_{t}^{(k)}(a)\]其中 $c_t$ 为投资者的心理账户上下文,$w_k(c_t)$ 代表各心理子角色的动态权重,$\tilde{\alpha}_t^{(k)}$ 为质询后的置信度。当内部角色分歧剧烈、仲裁后的概率无法拉开差距时,模拟器就会自然触发犹豫状态,转而输出持有(Hold)或咨询(Consult)动作。
一旦进入咨询环节,系统便开启日内的投顾交互子循环:投资者向待评测的 AI 投顾提出当前困惑,AI 投顾依据历史对话上下文与市场数据给出回复。模拟器基于该回复抽取认知更新,调整其内部信念分布,随后在闭盘前完成当天的最终操作。
为了避免“单日孤立决策”,模拟器设计了多时间尺度的记忆与反思模块:情绪与即时置信度随每日市场盈亏高频刷新,而整体风险偏好与投资习惯等长期特征则通过周期性反思(Periodic Reflection)低频演化。这使得模拟投资者不仅能听懂当下的建议,还会将建议沉淀为对该投顾的信任与长期行为惯性。
真实性校准:用 7,199 名真实投资者锚定仿真边界
任何模拟器如果无法自证真实性,其评测结论就会沦为空中楼阁。ShiJianBench 的关键突破之一,在于其模拟器的动力学参数全部经过真实金融行为数据的严密对齐。
研究团队获取了 7,199 名真实公募基金投资者的脱敏交易与持仓样本,并按照 80/20 的比例划分为互不相交的校准集与测试集。校准过程不是为了拟合某几个具体案例,而是对齐群体的宏观行为动力学,核心锁定三项金融行为指标:
-
组合风险分布(RiskIndex Distribution):投资者在不同市场阶段持仓组合的真实波动与风险暴露;
-
买入弹性(Buy Elasticity,$\beta_{\text{buy}}$):面对行情上涨或下跌时,投资者的加仓敏感度;
-
卖出弹性(Sell Elasticity,$\beta_{\text{sell}}$):面对浮盈浮亏时,投资者的止盈止损行为倾向(如处置效应)。
参数优化算法在多维空间中搜索最优参数 $\theta^\star$,最小化模拟群体统计特征与真实群体之间的分布距离。实验表明,校准后的模拟器在未见过的测试集上达到了高达 $0.884$ 的总体真实度对齐得分(Alignment Score)。
在针对模拟器架构的消融实验中,如果剥离掉多子智能体讨论、心理账户模块或选择性感知机制,模拟器的行为保真度会出现显著滑落(真实度得分下降 0.125 至 0.165 不等)。这证明了投资决策中的非理性与犹豫,必须通过这种显式的认知动力学解耦才能被有效复刻。
配对反事实推演:如何科学评估顾问净收益?
在具备了高拟真度的动态模拟器后,ShiJianBench 采用严格的配对反事实回放(Matched Counterfactual Rollouts)进行投顾政策评测。
对于每一个评估样本,系统固定相同的历史市场轨迹(如 2021 至 2026 年真实的每日基金净值与大盘走势)、相同的初始资金体量以及相同的投资者初始画像(涵盖保守/稳健/积极等 27 种因子组合)。在控制变量完全一致的沙盒中,系统分别运行“基准策略(无投顾介入)”与“待评测 AI 投顾介入”两条时间线:
\[\delta_{i}^{g}(\pi^{A}) = g(\tau_{i}^{A}) - g(\tau_{i}^{0})\]通过对所有测试者轨迹的增益求均值,计算出该投顾相较于自然状态的净提升幅度 $\Delta g(\pi^A)$。评估框架由三大维度的综合评分驱动,同时施加了严格的合规性约束:
-
硬合规门禁(Compliance Gate):合规是金融底线。任何给出违规承诺收益、夸大宣传或诱导过度风险的建议都会触发一票否决($C=0$ 则总分直接归零)。
-
投资者端成效($S_I$):追踪长程轨迹中的年化收益、最大回撤控制、夏普比率以及逆向追涨杀跌行为的抑制程度。
-
平台商业价值($S_B$):评估投顾对用户留存率、资金周转合理性以及资产沉淀等健康商业指标的带动。
-
对话内容质量($S_{\text{Content}}$):结合准确性($S_{\text{Acc}}$)与个性化匹配度($S_{\text{Pers}}$)进行事后离线评审。
最终总分定义为在合规达标前提下的多目标加权:
\[S_{\text{Total}} = \begin{cases} 0, & C = 0 \\ w_{I}S_{I} + w_{B}S_{B} + w_{C}S_{\text{Content}}, & C = 1 \end{cases}\]这种评分体系彻底终结了“只凭单条金句论英雄”的传统套路,要求模型必须在多轮、跨周期的博弈中展现出可持续的正向干预能力。
实验发现:高分回答,为何换不来优秀的长期净值?
在 2021 至 2026 年横跨熊、震、牛的真实基金行情测试中,不同大模型底座驱动的投顾展现出了深刻的能力分化。
最引人深思的实验结论在于:生成高水准、高度个性化且完全合规的文本,并不必然带来同等比例的投资者长期净值改善。
在传统问答打分中,部分开源与闭源模型在个性化($S_{\text{Pers}}$)和金融问答准确度上得分非常接近,措辞工整、分析透彻。然而一旦进入为期数年的长程投资轨迹,其对用户最终决策轨迹的干预成效却拉开了显著差距:
-
面对单边下跌市(2021-2022):平庸的投顾往往陷入“机械复读风险提示”的陷阱,过度抑制了投资者的合理再平衡动作,或者因缺乏针对投资者恐慌情绪的深层梳理,导致模拟器中的“哨兵”最终被恐慌吞噬,在市场底部割肉清仓;而第一梯队的投顾能够通过长程交互稳固投资者的心理账户,大幅降低极端行情的最大回撤。
-
面对结构性震荡与单边反弹(2024-2026):部分仅在回复质量上占优的模型展现出明显的“顺周期谄媚”倾向,极易被用户内部的“享乐/追逐者”带偏节奏,给出助推追涨的建议;表现最优的投顾模型则能兼顾个性化安抚与客观纪律约束,在提供情绪价值的同时,使投资组合在长周期内的复合表现显著超越无投顾的基准线。
此外,与静态规则基准(如基于确定性风险矩阵的 Rule-based 投顾)相比,大模型投顾的最大优势在于非标准化意图的精准承接。规则系统在极端行情下往往因为触发硬性风控逻辑而失去与用户的沟通弹性,导致模拟用户在遭遇强烈认知失调时放弃咨询;而顶级 LLM 能够在对话中逐步化解用户的极端偏执,完成高质量的长线心理疏导与策略引导。
从静态评审迈向轨迹智能
ShiJianBench 的落地不仅为金融领域的对话式 Agent 提供了一套高拟真的长程测试床,更对大模型在复杂垂直场景中的评测范式带来了重要启发。
在医疗健康、法律咨询、心理陪伴以及财富管理等涉及重大利益与长期反馈的场景中,大语言模型早已脱离了单纯的“检索生成器”定位。它们的每一句话都在介入用户的信念网络,改变用户对外部环境的理解与预判。如果在评估这些系统时依然只停留在“单次输出是否优美顺畅”,无异于管中窥豹。
从文本对齐走向决策对齐,从单轮交互走向长程反事实轨迹评估,ShiJianBench 搭建的不仅是一个包含 2000 只基金、跨越 5 年周期的投顾竞技场,更是面向下一代“行动导向型 Agent”的严谨方法论探索。它让技术开发者与金融监管机构清晰地看到:真正优秀的 AI 顾问,不在于瞬间的语惊四座,而在于岁月沉浮中,能够稳定地帮人守住底线、穿透周期。