FRAMES:不微调模型也能自我进化?双目标优化与防退化门控驱动Agent技能演进

FRAMES: Guarded and Dual-Objective Skill Evolution for Agents in Policy-Governed Enterprise Workflows

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在金融审查、贷款审批和合规审计等受到严密监管的企业级场景中,部署基于大语言模型的智能体(Agent)正从前沿实验走向核心生产环境。然而,将自动化交由大模型主导的业务系统往往面临一道棘手难题:企业政策极为繁复,规则跨越多页文档、涉及严苛的前置条件与交叉核验;当业务一线发现 Agent 的某次审核遗漏了关键边缘案例时,工程师试图修复它,却常常引发不可预测的副作用——修改了一处提示词规则,原本正常运转的其他分类场景却突然发生严重衰退。

ArXiv URL:https://arxiv.org/abs/2608.01772

由于金融合规场景对审计追责的要求极高,传统的模型微调(Fine-tuning)不仅昂贵、对数据饥渴,更会产生无法溯源的不透明权重,导致合规团队根本无法核验模型行为变更的边界。而在不触碰模型权重的前提下,直接编辑扁平的系统提示词,又极易在多轮演化后失控。为此,研究团队提出了 FRAMES(Feedback-driven Reasoning with Adaptive Mutation and Evolution of Skills,自适应突变与技能演化的反馈驱动推理框架),旨在让大模型 Agent 在模型权重保持冻结的约束下,通过闭环的技能自进化实现安全、透明且可审计的性能迭代。

FRAMES 整体架构与闭环演化流水线

FRAMES 的核心突破在于,它将企业内的知识进化单元定义为模块化的“自然语言技能”(Skills),并搭建了一套包含冷启动、共识突变、帕累托(Pareto)双目标选择和分分类防倒退保障的完整闭环。在真实部署的生产级金融文档审计系统 FinDAS 以及标准基准 $\tau$-bench 上,FRAMES 证明了自身能够在严格守住各业务类别底线的同时,找到准确率与推理 Token 成本的最优平衡点。

企业级合规工作流中的技能困局

在诸如房屋抵押贷款申请的自动化审核中,Agent 需要查验借款人提交的多页税表、银行流水与收入证明。这些业务并非简单的单文档问答,而是需要执行环环相扣的验证逻辑:若借款人自雇,则需核验特定附表的净利润并扣除折旧;若收入来源为佣金,则必须跨季度平滑计算并核实连续存续期。

以往应对 Agent 表现不佳的方案大多存在致命缺陷。依赖人工对 Agent 的每一步输出复核,直接抵消了自动化的降本初衷;重新微调底层基座模型,则面临高昂的训练成本与稀缺的高质量标注样本,更重要的是,微调后的黑盒权重无法提供合规官要求的单条规则修改记录。如果仅仅依靠工程师手工修补长提示词,系统很快就会滑向混乱,常常是修好了一个自雇收入判定的漏洞,却让普通受薪阶层的核销逻辑全面崩溃。

更具挑战性的是生产环境反馈的天然缺陷。业务一线或人工复核员退回的错误案例,通常只标注了“结果不符”或附带一句简短的操作批注,几乎没有形式化的根因分析,更不会指明究竟哪条规则应该如何重写。与此同时,在高并发业务中,Agent 消耗的 Token 数量直接关联着推理账单,单纯堆砌长推理链条换取准确率的做法在商业上难以长期维系。因此,如何在稀疏甚至带有噪声的业务反馈中,让 Agent 自主更新技能,并且保证每一次修改都可回溯、不退化且不过度推高推理开销,构成了企业级智能体落地的核心瓶颈。

FRAMES的设计哲学:从企业资产冷启动到结构化表征

FRAMES 选择了一条与强化学习更新模型参数截然不同的路径:冻结基座模型,将进化集中在自然语言编写的结构化技能库 $\mathcal{S}={s_{1},\dots,s_{L}}$ 上。框架整体由两个主要阶段构成,分别是面向存量合规资产的冷启动,以及依赖运营反馈驱动的周期性演化循环。

在冷启动阶段,系统不需要从零等待标注数据积累。FRAMES 利用大语言模型将企业的原始政策文档 $\Pi$ 沿着业务流程的自然边界切分,并将每一段改写为独立的、对应具体可核验业务动作的技能文件 $s_{l}$(通常以标准 Markdown 形式沉淀)。为了消除深层嵌套带来的隐性依赖风险,FRAMES 的技能库采用了扁平存储、标签索引与引用组合的架构设计。每个技能都包含一个供检索匹配的语义描述 $d_{l}$,以及指向原始政策条款的确定性反向链接。这种设计使得 Agent 在生产环境中的任何一次判断,都能直接穿透回溯到合规白皮书中的具体章节。

即便企业在上线之初没有任何历史纠错反馈,FRAMES 也能实现自我启动。框架中的用例生成器会主动扫描技能库尚未覆盖的政策盲区,自动合成出一套基准评测用例集。一旦系统接入真实的业务流程,无论是人工复审日志、Agent 的执行轨迹,还是最新颁布的政策修正案,都会通过对应的转换器被统一清洗并提炼为结构化用例 $f_{i}=(m_{i},t_{i})$。其中 $m_{i}$ 为诊断记录,描述了失败表象与潜在诱因;$t_{i}$ 则为可执行的评测任务,内嵌评判执行正误的真实基准标签。无法复现的经验性建议则被提取为先验上下文挂载至对应技能。至此,分散破碎的业务资产被规整为推动演化的统一燃料。

求解帕累托最优:共识突变与防倒退门控机制

当新的反馈用例积攒到一定阈值,演化循环便正式触发。FRAMES 将技能进化抽象为一个在受控约束下的双目标优化问题:最大化通过率 $\text{PR}(\mathcal{S})$,同时最小化平均推理成本 $\text{Cost}(\mathcal{S})$。为了杜绝全局准确率上升掩盖局部灾难性滑坡的问题,系统引入了严格的分分类防倒退硬约束

\[\max_{\mathcal{S}} \big(\text{PR}(\mathcal{S}),\;-\text{Cost}(\mathcal{S})\big) \quad \text{s.t.} \quad \text{PR}_{c}(\mathcal{S})\geq (1-\epsilon)\text{PR}_{c}(\mathcal{S}_{0})\;\;\forall c\in\mathcal{C}\]

这一数学表述体现了严谨的工程考量。在金融审核中,不同业务分类的风险不对称,高风险的特例升级审核绝不能因为常规验证分类通过率的暴涨而牺牲。公式中的 $\mathcal{S}{0}$ 是演化启动时的基线技能集,$\epsilon$ 则是用于吸收大模型推理随机波动的容忍度参数。FRAMES 始终锚定初始基线 $\mathcal{S}{0}$,而不是动态滑动的父代,从而有效防止了防退化阈值在连续迭代中发生隐式衰减。

每一轮演化迭代的内部推演均经过精心构造,主要包含以下四个紧密协作的环节:

首先是父代选择。系统并不采取贪心策略去单挑当前最高分的候选集,而是在帕累托前沿集合中进行轮询调度,确保兼顾成本偏向与精度偏向的技能集都有均等机会繁衍后代,避免搜索空间过早收敛至单一极端。

其次是分布式诊断与共识过滤。面对一大批待解决的诊断记录,单一模型单次通读容易产生幻觉或局部偏见。FRAMES 将待诊断记录随机切分为多个互不相交的批次,分发给独立的诊断模型并发运行。每个诊断器在看到完整的父代技能集后,输出各自的根因定位与修改提议。随后,整合器通过设置投票过滤阈值(例如至少需要 $q$ 个独立诊断器同时提议修改某技能),剔除偶发噪声,并将通过筛选的建议融合成一份统一的修改蓝图。

接着进入技能重写阶段。为了防止模型在修补新规则时产生“灾难性遗忘”,FRAMES 从长期维护的回归测试用例池 $\mathcal{R}$ 中检出依赖于该技能的历史用例(称为锚点用例),连同目标技能的完整正文、相关兄弟技能的一行摘要等上下文一同喂给重写器。大语言模型输出的产物完全是自然语言文本级的规程改写,形成形如 Git 提交记录的版本化 Diff。未被波及的技能则原样继承,组装出全新的候选子代。

最后是严格的打分与准入裁决。候选子代将在当期用例集以及从回归池动态采样的历史上榜用例上进行执行评估。这里执行评估的 Agent 对诊断记录完全盲测,以规避测试集信息泄露。只有当该子代在所有预设业务分类上的通过率均不低于基线阈值时,才有资格进入候选池,进一步与帕累托前沿成员展开非支配性优胜劣汰比拼。连续多轮未产生更优前沿个体后,搜索即告终止。

工业级落地验证:FinDAS与tau-bench上的实证表现

为了验证 FRAMES 的真实有效性,研究团队将其部署在真实的金融文档审计系统 FinDAS 上。与公开的传统文档问答评测集不同,FinDAS 面对的是高度嘈杂的各类扫描件与复杂报表,规则逻辑包含大量跨页字段关联与条件运算。

评测采用业界标准的 pass@$k$ 无偏估计指标衡量准确率,并综合统计执行全流程消耗的平均输入和输出 Token 数量。在完全留存的 FinDAS 测试集上,基线方案普遍暴露出明显缺陷:简单的单次提示词自生成缺乏反思深度;直接迭代重写由于缺乏回归约束,往往在某些分类取得微弱提升的同时,导致其他分类严重受挫。

而 FRAMES 在多轮演化后,在各项业务细分领域均取得了全面的优势。无论在常规审核、特殊分类还是涉及复杂边界的防幻觉分类中,FRAMES 均稳定超越各类对比基线。更具说服力的是,当将通过率指标从 $k=1$ 扩展至 $k=3$ 展开综合评估时,FRAMES 始终稳固处于最顶层位置。其所取得的准确率优势并非依赖更冗长的推理链条强行换取,实际的单用例部署推理 Token 消耗与基线相比并未出现异常膨胀,这充分体现了帕累托双目标优化在压制无效冗余逻辑上的显著效果。

除了内部闭环系统,研究团队还将该框架迁移至包含丰富工具调用逻辑的公开基准 $\tau$-bench 上进行横向验证。实验结果展现了相同的演化演进态势,证明 FRAMES 的有效性并不局限于某一套特定的金融模板,而是具备跨场景、跨任务形式的通用技能演化潜力。

机制剖析与工程取舍

在消融实验部分,研究深入揭示了各项模块对整体鲁棒性的具体影响。

首当其冲的是诊断批次大小的选择。实验显示,细粒度的小批次虽然大幅增加了离线演化阶段的模型调用成本(输入 Token 翻了数倍),但能够带来更多样化的诊断视角;而将所有用例塞进单一大批次的粗暴做法,演化成本虽低,却难以捕捉偶发性缺陷,最终产出的技能不仅在测试集上表现平平,反而会在实际推理端产生更高的 Token 负载。

在共识过滤器的设计上,完全放开过滤会让噪声长驱直入,降低整体通过率;而如果采用过于苛刻的完全一致性约束,又会导致大量有价值的渐进式修复提议被提前扼杀。基于技能维度的投票过滤机制恰好处于最佳折中点,在过滤误报与保留有效探索之间达成了平衡。

防倒退容忍度 $\epsilon$ 的取值同样揭示了演化动态学中的关键权衡。如果设置绝对零容忍($\epsilon=0\%$),任何在中间迭代中由于评估噪声引发的微小波动都会导致有前途的候选分支被瞬间枪毙,使得演化过早陷入停滞;反之,若完全解除这一约束($\epsilon=100\%$),选择机制就会退化为单纯的全局平均分比拼。由于全局均值对单分类的暴跌极不敏感,严重退化的个体极易混入帕累托前沿,导致后续迭代沿着错误的技术路线盲目演化,最终产出无法安全交付合规审查的废弃版本。

结语与未来演进方向

FRAMES 展现了一种在强监管场景下极具实用价值的 Agent 迭代范式:模型权重不需要频繁重训,人类知识库与自然语言技能文件本身,就是最理想的持续学习载体。它将不可预测的提示词修改,转化为了带有审计追踪、支持版本回滚、受严格非退化门控保护的工程化流程。对于企业管理者而言,帕累托前沿生成的不是单一的“黑盒更新”,而是一份清晰的“部署菜单”——高价值案件可以选用精度顶格的技能配置,海量普惠业务则可选用推理成本更紧凑的版本。

这项研究同样坦诚指出了当前的瓶颈。目前整个演化循环中,最昂贵的开销来自于候选技能集的多次盲评执行,多轮采样带来了不小的离线算力成本。如何引入轻量级的代理评估器或智能采样策略,在不牺牲非退化保障底线的前提下压缩评测开销,将是推动该机制进一步扩展到数万级用例超大规模流水线的关键课题。对于正在探索大模型落入关键业务纵深的企业而言,FRAMES 所践行的这种结构化、有约束且完全可解释的进化闭环,无疑提供了一条极具参考价值的演进路径。