Agent评测盲区:BIWM量化执行接口对多步信念的扭曲

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

评价一个大语言模型Agent的能力,业界通常只看一个最终指标: 即该模型是否成功解决了当前任务。 这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。 该研究揭示了一个在各类大模型榜单中常被忽视的盲点。 决定Agent能否成功的,不仅是模型本身的基础智力。 还有那个将模型与外部环境连接起来的“脚手架”。 也就是执行接口Harness)。

ArXiv URL:http://arxiv.org/abs/2607.04528v1

本文敏锐地指出,Harness绝非中立的底层基础设施。 它像一个过滤网,控制着Agent能看到什么、能执行什么动作。 它决定了哪些故障会被自动修复,哪些状态会被系统验证。 甚至决定了哪些执行证据会被记录在案。 研究表明,即使任务本身、运行环境和底层大模型完全相同。 仅仅改变Harness的配置,就能彻底改变Agent的多步信念轨迹。

接口即偏见:切牛排的精准隐喻

论文中给出了一个非常克制且精准的机制隐喻。 如图1所示,我们假设任务是切牛排,大模型是进餐的食客。

Refer to caption

在原生的参考接口下,系统正常提供刀和叉。 模型在获取这一观察结果后,会判定该任务非常容易可行。 并由此在信念中赋予极高的预期成功概率。 但如果切换到带有风险门控的接口呢? 系统可能只提供筷子,并将“使用刀叉”标记为违反安全策略。 此时,底层的牛排任务没变,模型的智商也没有改变。 但因为接口传递给模型的“反馈证据”发生了本质变化。 模型对任务难度、潜在风险和预期成功的信念Belief)发生了严重扭曲。

多步信念发散的量化拆解

为了量化这种由接口引发的隐形扭曲,本文提出了一种全新的诊断方法。 它不再把世界模型看作一个仅供一次性调用的黑盒网络。 而是让Agent在给定接口下,生成结构化的 $K$ 步信念推演。

Refer to caption

这种推演记录了Agent对任务进度、活跃约束、风险状态的评估。 同时包含了对不确定性、可能故障模式以及推荐下一步动作的预测。 基于这些结构化数据,研究者定义了核心指标。 即跨接口信念发散Cross-Harness Belief Divergence)。

为了精准定位不同接口造成的具体影响,这个全局发散度被精妙地拆解: 第一部分是 $D_{arrival}$,被定义为“到达项”。 它专门捕捉由于接口规则不同导致的即时信息断层。 只要接口重写了动作空间或修改了可见约束,这种不匹配会立刻显现。 第二部分是 $D_{growth}$,被定义为“增长项”。 它衡量随着推演视界的展开,那些持续变化的字段所带来的偏移。 包括风险状态评估、故障模式标签和数值型的成功率预测等。

这种数学拆解具有极高的诊断价值。 因为在实际评测中,整体的发散度有时看起来趋于稳定。 但真正影响Agent后续规划的核心信念,可能一直在暗中持续漂移。

信念空间与发散度公式的严格定义

为了让这种漂移可计算,研究首先严格定义了五维的信念空间 $\mathcal{B}$。 它由类别状态预估、故障标签、约束集合、数值预测和动作推荐组成。 当对比两个不同的接口配置时,整体的发散度被定义为各组件的加权和:

\[D_{belief}(H_{a},H_{b};K) =w_{cat}D_{cat}+w_{fail}D_{fail}+w_{set}D_{set}+w_{num}D_{num}+w_{act}D_{act}\]

在这个公式框架下,到达项 $D_{arrival}$ 主要由集合距离和动作距离构成。 而增长项 $D_{growth}$ 则由类别距离、故障距离和数值预测距离构成。 所有权重在评估前均固定不变,确保了跨任务比对的公平性。

接口设计的六个实验切面

为了隔离并验证不同的扭曲机制,本文实例化了六种典型的Harness配置。 它们真实反映了当前主流Agent框架中常见的工程选择: 第一种是原始参考接口,它向模型暴露未经过滤的底层观察结果。 第二种是结构化接口,将冗长的原始输出替换为解析后的回溯信息。 第三种是风险门控接口,在执行前直接拦截高风险动作并隐瞒真实结果。 第四种是重度修复接口,失败后自动打补丁,并向模型压缩隐藏失败路径。 第五种是选择性验证接口,仅对部分状态应用强校验。 第六种是成本感知接口,当剩余预算不足时省略昂贵的系统检查。

BIWM:免训练的信念校准协议

既然各种接口机制都会不可避免地产生证据偏见。 那么在评测Agent时,我们该如何提取其真实的内部信念轨迹? 为此,本文提出了一种无需重新训练的强大协议。 即**信念不变世界模型**(**Belief-Invariant World-Modeling, BIWM**)

Refer to caption

BIWM本质上是一套严谨的“证据矫正”管线。 它包含几个硬核的底层操作,旨在拉平不同接口造成的认知鸿沟: 首先是对观察结果进行规范化映射,消除因语法格式差异带来的误导。 其次是要求系统必须完整记录那些被审查机制屏蔽的操作分支。 最核心的一点是,它会在“暗处”执行高风险动作。 即实施影子执行Shadow Execution)。 这意味着,哪怕某个动作被安全网拦截而未对环境生效。 其真实的执行验证掩码依然会被提取并保留。 从而在多个不同接口视角之间,强行对齐Agent的底层信念轨迹。

数学底座:到达下限与审查单调性

为了确保诊断协议的严谨性,本文提供了坚实的理论证明。 其中最引人注目的是关于“约束集下限”的引理。 引理在数学上证明,只要两个接口呈现给模型的约束表示完全不相交。 无论其他的信念组件如何变化,都会立即产生一个固定的误差底线。

而对于审查机制导致的信念偏差,定理1给出了明确的单调增长条件。 当一个高危动作被某个接口屏蔽,但被原始接口真实执行时。 如果大模型对这种“屏蔽态”和“执行态”具有不同的故障敏感度。 这种由审查引起的信念扭曲,将在多步推演中产生累积效应。 此时,增长项 $D_{growth}$ 将呈现出与视界高度相关的非单调性变化。 这种机制极其危险:被拦截的动作会让Agent产生一种幻觉。 它可能在内部推理中认为危险分支根本不存在,而不是“被系统禁止”了。 这为未来的越狱攻击埋下了认知层面的隐患。

长短视界的深度实验论证

在严格控制变量的基准测试中,代码任务的实验现象完美印证了理论推导。 如数据模式所示,当推演步数 $K=1$ 时。 到达项 $D_{arrival}$ 就已经迅速逼近其理论上限。 这充分说明,只要换了执行接口,Agent第一眼看到的“世界规则”就彻底变了。

而在更长的视野下,从 $K=1$ 延伸至 $K=20$ 的长程诊断中。 我们发现整体的标量发散度并未呈现出无限放大的趋势,而是在早期后趋于稳定。 但从图4的细分数据中可以清晰看到,增长项呈现出极具特征的轨迹。 结构化解析机制会导致信念发散持续稳步增长,直至第五步推演。 而风险门控和选择性验证机制,则在长视野下表现出剧烈的非单调波动。 这表明,部分接口造成的偏见会在推理中被模型自我消化。 而另一些接口造成的偏差,则会随着规划步骤的加深而不断恶化。

结论与Agent工程启示

这项研究给整个大模型Agent评测生态和工程落地敲响了警钟。 执行接口的设计,绝不仅仅是用来跑通代码、封装API的底层细节。 它是Agent评估体系中不可或缺的、必须被控制的实验变量。 当我们惊叹于某些模型在各类Benchmark上大杀四方、成功率极高时。 必须清醒地认识到,其成功不仅源于庞大参数量带来的智力涌现。 更深度受制于特定Harness所提供的、经过精心裁剪的“有偏证据”。

未来的Agent安全监控、性能评估以及系统架构设计。 绝不能仅仅停留在观察最终是否输出了正确的代码或工具调用。 必须引入类似BIWM这样的多步信念审计与对齐机制。 只有让模型黑盒中那条由环境反馈驱动的规划轨迹变得可见、可测。 我们才能真正评估一个大模型Agent在复杂世界中的真实能力边界。