Agent可靠性来自哪里?Leni系统拆解:验证闭环只贡献1.5分却决定胜负

Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Agent可靠性来自哪里?Leni系统拆解:验证闭环只贡献1.5分却决定胜负 论文图示

在面向企业的长流程大模型应用中,Agent 最致命的缺陷并非“不会做”,而是“不知道自己做错了”。单次前向推理(Single-pass Inference)在敲定答案与最终提交之间,缺乏任何确定性的安全检查点。调用单一工具时系统往往运转良好,两步推理也能勉强维持;但只要链条延伸到第五步,或者遇到一个隐蔽的公式计算错误、一段带有虚构前提的用户提问,Agent 就会以极其流畅、笃定的语气给出一个完全错误的答案。

ArXiv URL:https://arxiv.org/abs/2607.17044v1

在消费级对话场景中,这种幻觉或许只是谈资;但在财务关账、合同审查、尽职调查等企业级后台工作中,错误的输出会直接写入下游财务底稿与法律文书,引发真实的商业损失。很多团队寄希望于“等待下一代更强的前沿大模型来解决一切”,而企业级商业分析 Agent 公司 Leni 提出的研究却给出了不同的视角:大模型的可靠性并不主要依赖模型本身的智商跃迁,而是取决于包裹在模型外部的架构设计

Leni 将其未做基准特化的生产环境系统推向了三个侧重不同故障模式的公开基准:测试静默计算错误的 SpreadsheetBench Verified、测试前提虚构的 BullshitBench v2,以及测试长链路级联故障的 GAIA 验证集。在 Claude Opus 4.6 作为基座模型的条件下,该系统在 SpreadsheetBench 上取得了 91.25% 的准确率,相比裸模型基线提升了 11.0 个百分点;在 BullshitBench 上达到了 98% 的正确拒绝率(提升 7 到 10 个百分点);在 GAIA 验证集上的 pass@1 则从基线的约 60% 跃升至 75.2%(best-of-$k$ 达到 83.0%)。

比跑分更关键的,是作者对这一可靠性增益进行的精准归因分解。实验表明,绝大部分性能提升实际上来自脚手架(Scaffolding)、工具流编排与专家模型路由,而业界寄予厚望的“自我纠错验证闭环”,其孤立贡献仅有看似微不足道的 1.5 个百分点。然而,正是这 1.5 个百分点,精准撬动了此前无法攻克的长尾顽疾,成为系统从中游迈向顶尖的胜负手。

拆解验证闭环:四步流程与三大真相来源

在控制工程中,任何没有反馈回路的开环系统都是脆弱的。论文首先将企业级 Agent 的安全防护抽象为一个标准的验证闭环(Verification Loop)。该闭环由四个阶段串联而成:执行(Execute)、独立观察(Observe)、比对预期(Compare)以及修正重试(Correct)。其中最关键的控制点在于,修正动作发生后,系统不能直接重新提交执行结果,而是必须重新进入观察阶段,直至通过比对。

决定验证闭环能力上限的,并非提示词写得有多华丽,而是比对阶段所依赖的“真相来源”,即验证预言机(Verification Oracle)。论文根据工程实现的确定性程度,将预言机划分为三类不同的层级:

第一类是确定性预言机(Deterministic Oracle)。它代表了最坚固的客观约束,通过外部代码环境、测试用例或符号执行引擎重新运行生成物,获得明确的状态判定。在电子表格处理场景中,LLM 编写的 Python 脚本通常依赖 openpyxl 写入公式,但该库并不负责计算公式结果。如果公式存在跨表引用错误或语法不兼容,写入过程完全不会报错。Leni 在沙箱中引入无头的开源办公套件 LibreOffice 进行后台重算,强制将静态文本刷新为真实数值,构成了不受模型主观意识干扰的客观真理。

第二类是自省式预言机(Self-reflective Oracle)。面对完全开放、缺乏外部可执行环境的问题——例如用户带着伪造的技术概念或虚假法律先例提问时,系统无法通过调用计算器来鉴伪。此时系统必须构建一道“认知防火墙”(Epistemic Firewall),通过结构化分解,将问题拆解为原子断言,并强制由专用分类器判定断言的真实性。一旦检测到虚构前提,系统将直接触发建设性拒绝(Constructive Rejection),向用户指出前提冲突并给出合理修正方向。

第三类是规划器介导的预言机(Planner-mediated Oracle)。在多步骤的长程任务中,直接依赖自由文本会导致信息熵迅速膨胀,最终引发级联崩溃。该机制强制所有执行器返回强类型的结构化制品(Typed Artifacts),包含具体数值、证据溯源、置信度标签与错误类别。中央规划器不审阅冗长的文本,而是比对结构化字段与原始意图的一致性,在局部步骤偏航时动态插入回退或重试逻辑。

谁在观察至关重要:自检失效与轻量专家矩阵

在明确了验证闭环的结构后,工程上面临的核心矛盾是推理成本与观察者偏差。如果闭环中的每一个观察与比对动作都调用最顶级的昂贵大模型,调用延迟与账单成本在商业上根本无法承受;更致命的是,前沿大模型存在根深蒂固的“自我合理化偏差”(Self-preference Bias)。

认知科学与近期的评估研究早已证明,要求一个模型审查自己刚刚写出的代码或推理,它往往会顺着最初的逻辑漏洞继续编造借口。为了打破这一僵局,系统构建了一组参数量在 0.5B 至 4B 之间的轻量级后训练专家模型,全部基于开源的 Qwen3 系列底座微调而成:

专门负责单元格数值审计的 Leni-Cell-S(约 1.7B 参数),通过强化学习(RLVR/GRPO)专门训练对比 LibreOffice 读回值与目标单元格的一致性;负责认知防火墙初筛的 Leni-Triage-S(约 4B 参数),经过偏好对齐(DPO)训练,学会对输入断言给出干脆的二元判定,绝不顺从用户产生谄媚式幻觉;负责将工具输出转换为标准化字段的 Leni-Parse-S(约 1.5B 参数)以及负责动态路由的 Leni-Route-XS(约 0.5B 参数),则保障了流水线在极低延迟下流转。

这些轻量级专家在训练时严格采用蒸馏自前沿大模型的思维链,并在具有确定性反馈的沙箱中通过强化学习进一步对齐。论文进行了一项极其关键的专家替换消融实验(Specialist-swap Ablation):当研究人员把负责“观察/比对”的轻量专家模型撤下,换回负责生成内容的顶级前沿大模型自身来进行自检时,系统的救援能力出现了戏剧性暴跌。

在 SpreadsheetBench 的测试中,由独立小专家把关时,验证闭环成功挽救了 6 个原本失败的复杂任务;而一旦换由生成模型自我审查,成功挽救的任务数立刻缩减至 2 个。在 BullshitBench 的伪前提识别中,让前沿模型自省同样导致正确拒绝率下滑了 4 到 5 个百分点。这一实验给出了一个极具实践意义的技术结论:验证机制的有效性,本质上取决于观察者的独立性。一个参数量仅 1.7B 但经过专用验证训练的独立模型,在抓取错误方面的表现,远比一个 100B+ 却存在自负倾向的通用前沿大模型更可靠。

复合可靠性模型与生产环境混淆矩阵

为了从理论上量化闭环的价值,作者建立了一个引入不完美验证器的复合可靠性模型。假设一个任务包含 $n$ 个相互依赖的离散步骤,每个步骤在没有干预的情况下的基础成功率为 $p$。若采用端到端的开环单次推理,全流程成功率将随步骤增加呈几何级数衰减:

\[R_{\text{base}} = p^n\]

如果每个步骤的单步成功率为 $p = 0.95$,在没有任何故障拦截机制的情况下,一个看似简单的 10 步任务,其最终端到端可靠性将骤降至约 $60\%$。

在引入验证器后,单步的实际成功率 $p’$ 可以精确分解为两部分:原本就正确的步骤在经历检验后存活下来的概率,加上原本错误的步骤被发现并成功修复的概率:

\[p' = \underbrace{p\,(1 - f\,b)}_{\text{正确步骤在误报中存活}} + \underbrace{(1 - p)\,c\,r}_{\text{错误步骤被捕获并修复}}\]

在这个公式中,作者形式化定义了验证器的核心行为参数:

公式清晰地揭示了工业界构建验证闭环时的两难处境:如果设计了一个极其敏感的检查机制,虽然 $c$ 提升了,但若伴随较高的假警报率 $f$,系统就会在自我怀疑中频繁将原本做对的步骤改错,导致 $1 - f\,b$ 大幅拉低,最终端到端表现甚至不如没有验证机制。

得益于对 SpreadsheetBench 400 个真实运行轨迹的全链路插桩打点,论文首次公布了工业级确定性验证器的真实混淆矩阵经验参数:

尽管 $20\%$ 的捕获率在直觉上并不惊艳,但由于其极高的修复转化率以及完全杜绝了误报破坏($f \approx 0$),该闭环在工程上构成了纯粹的正向增益,为长程链路提供了稳定的数学兜底。

增益分解:打破“自纠错万能”的工程幻象

本篇论文最具说服力的贡献,是对 Agent 系统的性能提升进行了无死角的解构。在以往的 Agent 研究中,团队往往将完整的框架(提示词工程、格式规范、沙箱代码环境、多次反思循环)作为一个整体与裸模型对比,并将动辄十几个百分点的提升全盘归功于“反思机制”或“Agent 智能”。

在 SpreadsheetBench 的 400 道高难度验证子集上,完整 Leni 系统相比于直接调用 Claude Opus 4.6 裸模型的提升为 $+11.0$ 个百分点(从 80.25% 提升到 91.25%,$p < 0.001$)。然而,当实验人员剥离掉重算验证闭环,仅保留基础代码生成脚手架、类型转换逻辑与针对性系统提示词时,系统的表现就已经达到了 89.75%。

也就是说,整整 9.5 个百分点的提升是由严谨的工程脚手架贡献的,闭环本身的直接贡献只有看似边缘的 1.5 个百分点

这是否意味着验证闭环可有可无?事实恰恰相反。在顶尖模型的基准评测中,从 80 分提升到 90 分往往只需要规范输入输出格式和注入领域常识,但要从 90 分进一步跃升到行业顶尖水平,遇到的全都是极度隐蔽的边界用例。这 1.5 个百分点对应的正是那 6 个因复杂公式嵌套、隐式类型错位而导致单次生成必然暴毙的任务。没有确定性闭环的强行拦截与修正,系统将永远被困在天花板之下。

在 GAIA 复杂工具链评测中,增益的分布同样印证了这一规律。GAIA 涵盖大量复杂的外部工具检索与跨格式解析任务。论文测得的完整系统 pass@1 达到 75.2%,相较基座模型的提升约为 15 个百分点。通过分层追踪发现,约 38% 的 GAIA 任务触发了重规划逻辑,但这些重规划动作绝大多数是在弥补低质数据源或解析格式漂移,属于脚手架调度层的自愈,而非单纯的思维链修正。

在 BullshitBench 的 100 道欺骗性测试题中,系统的正确拒绝率稳定在 98%。为了排查认知防火墙是否存在“草木皆兵”式的过度拒绝倾向,研究团队设计了一组包含 100 个高难度专业合法问题的对照实验。测试表明,在防火墙全程开启的监控下,合法问题的误拒率为 0,将系统在合法分布下的假阳性率上限压制在 $3.6\%$ 以内。

企业级 Agent 的工程底色

这项研究为喧嚣的 Agent 领域提供了一剂清醒剂。它用冷峻的实验数据证实:大模型的可靠性无法脱离系统工程而独立存在。单靠提示词引导模型“再想一想”或“自我反思”,不仅难以纠正本质上的逻辑死结,反而容易诱发更隐蔽的自我辩解。

真正的系统可靠性,源于严丝合缝的体系分工:

  1. 重构底座认知环境的工程脚手架:通过严格的输入输出契约、代码沙箱和环境状态解析,消除绝大多数由于通信失真引发的低级错误,吃下 80% 以上的基础增益;

  2. 完全解耦的独立观察者:绝不让执行模型兼任裁判,采用低延迟、低成本的微型后训练专家,专门监视异常状态;

  3. 基于确定性预言机的底线验证:在关键提交节点之前,引入外部不可篡改的执行引擎(如编译器、无头运行时或严格类型系统)作为裁决依据,用这最后的控制闭环将最难啃的失败用例精准救回。

对于正在探索落地的大模型应用开发者而言,这一结论具有极强的实操指导意义:与其耗费精力等待所谓全能模型的参数膨胀,或者在提示词里堆叠复杂的“反思指令”,不如退回架构本身,为 Agent 搭建一套拥有客观裁判席与独立审计官的确定性闭环。在严肃的企业软件世界里,这才是将概率性模型转化为高可用生产力的唯一确定路径。