清华等提出FCPAgent:把规划做成可证伪假设,WebArena提升13.8%

Falsifiable Commitment Planning for Self-Correcting Web Agents

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

清华等提出FCPAgent:把规划做成可证伪假设,WebArena提升13.8% 论文图示

在网页端让智能体(Agent)自主完成多步骤长链路任务,是当前大模型落地中最具诱惑力但也最容易翻车的方向之一。让模型去购物网站比价下单、在企业内部管理系统中配置权限、或者在代码托管平台上创建组织并邀请成员,往往需要十几步甚至数十步连续的点击、输入与页面翻转。在这个过程中,最致命的问题往往不是模型“不会点击按钮”,而是模型“悄无声息地走偏了”。

ArXiv URL:https://arxiv.org/abs/2607.24167v1

一个极具代表性的场景是:智能体进入了一个看似高度相关的页面分支,虽然每一步点击都在语义上与用户需求高度贴合,但这个分支里根本不存在最终所需的交互入口。此时,智能体依然在局部一本正经地反复探索,直到耗尽步数彻底失败。来自清华大学和 Noumena AI 的研究团队在最新论文中指出了这一症结:现有的大模型规划机制大多将步骤当成“必然正确的菜谱”,却从未规定在何种证据下,当前步骤应该被宣布失效。

针对这一顽疾,研究团队提出了 FCPAgent(Falsifiable Commitment Planning Agent)。其核心思想借鉴了认知心理学中的目标导向行为理论——真正鲁棒的行为是具备前瞻预期的,规划不应是一成不变的指令序列,而是一组“可证伪的承诺”(Falsifiable Commitments)。在 WebArena 基准测试中,FCPAgent 相比当前最强基线取得了 13.8% 的相对提升,平均成功率达到 65.3%;在步数超过 11 步的长链路任务中,性能提升幅度更是高达 161%,直击长程任务漂移的核心痛点。

FCPAgent 应对偏航执行的动机示例

为什么长链路网页 Agent 总是“走偏”?

传统的网页智能体通常依赖“观察-思考-行动”(ReAct)范式,或者引入反思(Reflection)、动态重规划(Replanning)和技能库(Skill Memory)。这类方法虽然能让模型在失败后重试,但存在一个底层缺陷:它们缺少实时的“轨道偏航检测器”。

在复杂的现代网页中,信息往往是不完全可见的,状态转移高度动态。论文展示了一个非常典型的 GitLab 任务:用户要求创建一个群组并邀请若干指定成员。当智能体顺利创建完群组后,需要寻找“邀请成员”的入口。由于界面上显眼地挂着“Group information(群组信息)”菜单,智能体极易顺理成章地点击进入。从局部语义来看,找成员去“群组信息”完全合情合理;但实际上,GitLab 的邀请控件只留在群组概览首页。一旦跳入子菜单,后续无论怎么翻找,任务都已经走进了死胡同。

现有智能体之所以在此类场景下频频崩溃,是因为它们的规划只描述了“要做什么”,却缺乏“在什么情况下说明我做错了”的明确标准。一旦底层执行偏离轨道,这种微小的偏差就会在长链路决策中呈指数级滚雪球,最终导致不可逆的失败。

要打破这种“自欺欺人式执行”,智能体需要的不仅是行动生成能力,更是证伪自身假设的能力。

核心机制:将规划解构为“可证伪承诺单元”

FCPAgent 的首要创新,是将传统计划拆解为一个个具备科学可检验性的单元——可证伪承诺单元(Falsifiable Commitment Unit,简称 FCU)。

在形式化定义中,第 $i$ 个规划步骤被表示为一个五元组:

\[c_i = (g_i, s_i, E^+_i, E^-_i, \kappa_i)\]

其中,$g_i$ 代表当前子目标;$s_i$ 是可选的、来自历史库的可复用技能;$\kappa_i$ 为该步骤的先验置信度;而整套机制的核心灵魂,在于精心设计的证实证据集 $E^+_i$ 和证伪证据集 $E^-_i$。

证实证据 $E^+_i$ 采取分阶段校验设计,细分为:前置条件证据(当前页面状态是否真的支持该子目标)、进展证据(执行轨迹是否沿着预期路径推进)、完成证据(子目标达成的确定性特征)。

与证实证据对称且更为关键的是分层证伪证据 $E^-_i$。论文将其清晰划分为三个层级,直接决定了后续干预的颗粒度:

  1. 执行级证伪证据(Execution-level Falsifiers):定位在局部动作漂移。例如页面没有如期响应、点击了错误的衍生链接,但当前子目标和所选技能本身没有问题。

  2. 技能级证伪证据(Skill-level Falsifiers):表明当前调用的既有技能已经不适配当前的页面布局或权限状态。例如网站改版导致预置动作序列卡死,必须更换技能模板。

  3. 规划级证伪证据(Planning-level Falsifiers):最高级别的预警,表明不仅当前动作不对,连最初拆解出来的子目标或解题假设本身都是错的。例如搜索策略直接漏掉了前置约束,导致后续整个规划分支失去意义。

借助这种表示,规划不再是盲目向下传递的死命令,而是具备自我否定判据的假说。执行过程自然演变为在线假设检验:证据支持则推进(Proceed),证据矛盾则修复(Repair)。

FCPAgent 架构与运行回路

运行闭环:规划、测试与分层修复

FCPAgent 围绕 FCU 构建了一套紧凑的“规划-测试-修复”(Plan-Test-Repair)运行时闭环。这套闭环在保障高精度的同时,极力避免了过度调用大模型带来的高昂推理延迟。

1. 经验引导的承诺生成

在任务开始时,规划器结合用户指令 $q$、初始观察 $o_0$、可复用技能库 $\mathcal{S}$ 以及历史失败-修复经验库 $\mathcal{F}$,生成初始的承诺序列。成功经验负责提供标准流程先验,指明“正常情况下应该看到什么”(构成 $E^+$);而失败经验则化身为安全护栏,把历史上踩过的坑提前编译为警惕信号(构成 $E^-$)。

2. 快慢结合的混合承诺测试

如果页面上的每一步微小动作都要调用超大模型进行深度诊断,系统的交互延迟和 API 成本将无法承受。FCPAgent 巧妙地设计了双层测试路由结构:

在轻量级测试层(Fast Tester),系统对动作提议执行前置拦截,并对执行后的页面返回进行轻量文本与视觉打分。具体通过自然语言推理模型(NLI)计算文本匹配度,结合图像-文本匹配模型(ITM)对屏幕状态进行快速打分:

\[\alpha_t^{\pm} = \lambda \, \mathrm{NLI}(T_t, E_i^{\pm}) + (1-\lambda) \, \mathrm{ITM}(I_t, E_i^{\pm})\]

轻量测试充当筛查哨兵。绝大多数常规的、符合预期的操作直接放行;只有当系统检测到强烈的完成信号、捕捉到高风险证伪信号、或者证实与证伪分数出现严重冲突的模糊地带时,才会将控制权上交。

在被升级的节点上,LLM 诊断验证器(Slow Verifier)介入。它调取近期轨迹、当前上下文和轻量测试给出的警示标签,跳出局部表象进行全局审视,做出决策:推进到下一步(Advance)、继续当前承诺(Continue),或是触发修复(Repair)。在裁定修复时,验证器还会输出结构化的诊断信息 $u_t$,明确标注矛盾究竟爆发在哪一层。

3. 范围感知的精准手术式修复

一旦承诺被证伪,很多传统 Agent 的做法是全盘重试或盲目追加一段 Prompt 重新生成。这种做法往往会把此前已经正确完成的步骤一并冲垮。

FCPAgent 采用“范围感知修复”(Scope-Aware Repair)策略。系统会严格保留已经验证通过的前缀步骤 $(c_1, \ldots, c_{i-1})$,仅对受累区域做最小化精准修剪:

这种自底向上的故障隔离机制,确保了系统既能从致命错误中抽身,又不会反复做无用功。

实验验证:长链路任务上的大幅跃迁

研究团队在包含多种高度逼真网页环境的权威基准 WebArena 上对 FCPAgent 进行了全面评测,选用的骨干模型为统一的 Qwen3.5-397B-A17B。环境涵盖了电商购物(Shopping)、内容管理(Admin)、代码协作(GitLab)、在线地图(Map)和多域跨平台任务(Cross)。

在整体表现上,FCPAgent 将平均任务成功率推升至 65.3%,相较此前表现最出色的 ColorBrowserAgent(57.4%)实现了 13.8% 的相对增幅。在逻辑嵌套复杂的 GitLab 环境中,成功率从 63.4% 跃升至 75.5%,在 Shopping 和 Admin 领域也均表现出稳固的领先优势。

更为关键的证据来自任务长度维度的细分统计。长链路稳健性是该方法最核心的立论支柱。研究人员以基线模型在各任务上的轨迹长度为锚点,将任务划分为不同步数区间(1-5 步、6-10 步、11 步以上)。

不同任务步数下的成功率对比

从步数分层图表中可以清晰看到:

这一结果有力地支撑了论文的核心假设:在长程交互中,局部的小漂移如果不被及时证伪,最终一定会酿成不可逆的轨迹崩溃。可证伪承诺的价值,随着任务深度的增加被成倍放大。

在跨领域的零样本泛化测试(WebChoreArena)中,FCPAgent 未经针对性微调即取得了 9.6% 的相对增幅,证明该机制并非针对特定网页特性的过拟合,而是具备通用的执行监控能力。

深入拆解:模块消融与运行效率

为了厘清性能飞跃的具体来源,研究团队对架构核心组件进行了细致的消融分析。

在三域(Shopping、Admin、GitLab)的平均测试中,完整 FCPAgent 取得了 70.6% 的高成功率。当移除可证伪规划(智能体仅接收技能库指导而没有结构化 FCU 及证据链),成功率骤降至 64.4%,这是所有消融中跌幅最深的一项,直接证明了“带着预期与证伪标准去执行”的底层必要性。移除混合承诺测试后,成功率下滑到 67.4%;移除范围感知修复后,成功率降至 68.6%。这表明,高质量的检验标准(规划)、敏锐的在线监控(测试)与分层止损(修复)缺一不可。

在系统运行效率方面,快慢结合的双层测试体系交出了漂亮的答卷。如果完全放弃轻量级匹配层,让每一个网页状态转移都交由大模型做全量诊断(Slow-only),任务成功率虽然基本持平,但每个任务的大模型调用耗时平均从 374.0 秒暴增至 464.5 秒。轻量匹配层的引入,直接削减了近 19.5% 的推理等待时间,成功实现了“寻常状态快速放行、关键转折深度介入”的设计初衷。

经验积累曲线

此外,经验缩放实验表明,随着历史轨迹数据的累积,FCPAgent 的性能呈现持续稳定的上升趋势。尤其值得注意的是,包含“失败-修复经验库”的完整版本始终显著优于仅使用“成功技能库”的变体。这从另一侧面给出了技术启示:在训练与优化智能体时,教它认识失败的特征并学会止损,往往比单向灌输成功案例更有价值。

实战复盘:一次识破假象的重规划

本文提供了一个非常直观的真实电商搜索案例(Figure 5),清晰展现了系统如何在面对看似合理的页面时触发自我否定。

任务要求智能体在购物网站上查询指定自有品牌“Amazon Basics”系列产品的价格区间。普通智能体通常会直接在顶部主搜索框键入“Amazon Basics”。搜索结果返回后,页面上确实罗列着大量相关商品,整体排版、价格标签一应俱全。传统的基于语义相似度或表面状态的智能体会认为该步骤已经顺利完成,随即开始对返回列表进行排序并提取价格。

然而,常规搜索返回的列表中实际夹杂了其他赞助商和第三方的竞品。如果直接基于该结果提取价格区间,最终得出的结论必然是错误的。

在 FCPAgent 的监控下,该步骤的 FCU 中包含了严格的品牌排他性证伪判据。当轻量测试与诊断验证器巡查返回的商品列表时,敏锐识别到了非目标品牌条目,随即抛出规划级证伪信号(Planning-level drift):当前宽泛的全局搜索策略根本无法满足品牌约束。

系统立刻阻断了后续的排序操作,触发范围感知修复。由于属于规划级失效,智能体果断弃用了原有的简单搜索逻辑,就地重写后续方案——转而点击进入“高级搜索(Advanced Search)”页面,在细分品类及专属品牌字段中精确输入筛选条件。最终,页面返回了纯净的 Amazon Basics 产品列表,智能体精准提取到了正确的价格分布区间。

这一案例极为鲜明地体现了 FCPAgent 的独特之处:它不仅能发现“按钮点错了”这种浅层动作故障,更能看穿“表面看似成功、实则方向全错”的高阶隐性偏航。

总结与展望

FCPAgent 的提出,切中了当前自主智能体领域最核心的症结之一。过去,行业往往将资源倾注于让模型“看得更清”(多模态表征)或“想得更多”(长链思维与反思),但忽视了最基础的行动哲学:未经检验的假说不应被赋予盲目的信任。

通过引入证伪主义理念,FCPAgent 把规划变成了一组带边界、带预警指标的科学猜想,构建了“生成-快慢检验-分层修复”的工程闭环。在 WebArena 等基准上的优异表现,特别是长程任务中展现出的惊人抗压能力,证明了这一范式的有效性。

当然,该框架目前仍依赖规划器初始生成证据的质量:过于敏感的证伪证据可能引发不必要的频繁打断,过于严苛的证据则可能放跑真实漂移。但毫无疑问,让 Agent 懂得“如何证明自己错了”,是通往高可靠性长任务自主智能体的关键一步。