Progressive Crystallization:提取确定性工作流,成本降低70%
Progressive Crystallization: Turning Agent Exploration into Deterministic, Lower-Cost Workflows in Production

在企业级 IT 运维(AIOps)中,引入大语言模型(LLM)驱动的 Agent 已经成为解决复杂故障的主流方向。Agent 通过调用工具观察系统状态、进行逻辑推理并执行修复动作,这种高度的灵活性使其能够有效应对前所未见的新型故障。然而,随着部署规模的扩大,一个致命的商业悖论逐渐浮出水面:在生产环境中,越是高频发生的已知问题,Agent 消耗的算力成本就越高。
ArXiv URL:https://arxiv.org/abs/2607.07052v1
Microsoft 的研究团队在一篇最新论文中敏锐地点出了这一痛点——目前的大多数系统将 Agent 视作一种“永久性的执行引擎”。这意味着,即使是 Agent 已经成功解决过一万次的常规网络故障,当第一万零一次相同故障发生时,系统依然会唤醒庞大的语言模型,重新消耗成千上万个 Token 进行完整的推理、规划和工具调用。这种每次执行都依赖全量模型推理的模式,使得 Agent 沦为了企业基础设施中深不见底的“永久性成本中心”,总支出随着事件数量呈线性甚至指数级增长。
为了打破这一僵局,Microsoft 提出了一个名为 Progressive Crystallization(渐进结晶)的全新生命周期框架。该研究的核心洞见在于:不应将 Agent 的探索和推理作为常规任务的永久执行方式,而应将其重新定位为一种“发现机制”。通过从 Agent 的历史执行轨迹中提取规律,系统可以逐步将那些被反复验证的随机性行为,转化为低成本、高可靠性的确定性工作流。
告别永久推理:从探索到结晶的范式转移
传统降低大模型成本的思路往往局限于模型层面。例如 FrugalGPT 等研究致力于通过模型级联(Model Cascades)或请求路由,将简单的任务分配给更小、更便宜的模型。然而,Microsoft 团队指出,只要系统本质上仍是概率性的,它就永远无法完全消除对已解决问题的推理开销。
Progressive Crystallization 的解法与优化模型本身完全正交,它汲取了流程挖掘(Process Mining)的思想。在传统的流程挖掘中,系统通过分析数据库或应用程序的事件日志来还原业务流程;而在 Progressive Crystallization 框架下,事件日志变成了 Agent 的执行轨迹(Execution Traces),还原出的模型则是可以直接在生产环境中运行的自动化剧本(Executable Playbooks)。
这种将非结构化的 LLM 探索“凝固”为结构化代码的过程,被形象地称为“结晶”。通过这一过程,平台能够在不依赖人类工程师手动重写代码的前提下,自动变得更加经济、快速且安全。
执行类型的分类谱系与渐进演化
为了实现从探索到确定的平滑过渡,研究团队定义了一个包含三个阶段的执行类型谱系。这三种类型并非相互孤立的系统,而是同一个底层运维任务在不同生命周期阶段的表现形式。

处于最前端的是 Type 3(Agent 编排)工作流。这是一种完全随机且成本高昂的执行模式,也是任何新型故障进入系统的初始入口。在这个阶段,Agent 在预设的边界内拥有极大的自主调查权,它将自主决定读取哪些监控数据、如何组合信息。为了保证安全,这类工作流在执行写入或变更操作时,必须依赖人类在环(Human-in-the-Loop, HITL)的审批机制。每一次 Type 3 的执行通常需要消耗数万个 Token,耗时几秒到几分钟不等。
当 Agent 在 Type 3 阶段积累了足够的成功经验后,任务会被提取并晋升为 Type 2(混合型)工作流。Type 2 具有固定的步骤结构,LLM 的介入被严格限制在特定的节点上。更为关键的是,在 Type 2 中,大模型仅负责理解、分类或总结信息,不再负责决定“下一步做什么”。所有的执行动作都必须经过严格的类型约束和模式验证(Schema-validated)。通过剥离规划和决策权,Type 2 的单次运行成本骤降至几千个 Token。
最终的形态是 Type 1(完全确定性)工作流。这是系统从历史轨迹中提纯出的终极产物,表现为预先编写好的硬编码逻辑。Type 1 具有与传统 IT 自动化脚本完全相同的执行保障:它的 Token 消耗为零,执行延迟被压缩至毫秒级,且具备百分之百的可重复性。
基于证据的晋升与熔断降级机制
将高成本的 Agent 转化为零成本脚本,面临的最大工程挑战是如何保证转化过程的可靠性。Progressive Crystallization 设计了一套极其严格的“基于证据”的晋升标准。
研究团队强调了一个核心的设计哲学:系统的自主权并非来自于底层模型能力的强弱,而是来自于特定剧本和操作类型的“历史业绩”。一个参数规模再庞大、跑分再高的先进模型,如果在某个特定运维任务上没有积累足够的历史成功轨迹,它依然只能在 Type 3 阶段接受人类的严格监督;相反,只有那些被数据反复证明行之有效的执行路径,才会被自动提取为 Type 1。

然而,IT 基础设施是一个动态变化的环境,曾经完美的确定性脚本随时可能因为外部环境的改变而失效。为此,该框架引入了“持续发现与降级”的熔断机制。
论文中记录了一个非常典型的生产案例:系统曾经生成了一个高度稳定的 Type 1 确定性剧本,用于处理某种网络设备的故障。但在一次固件更新后,设备返回的命令行输出格式发生了微小的改变。面对这一变化,Type 1 的硬编码解析器瞬间失效并触发执行错误。
此时,系统的容错机制发挥了作用。它没有让故障处理流程陷入瘫痪,而是立即触发熔断,将该任务自动“降级”回 Type 2 或 Type 3。由于恢复了 LLM 的介入,Agent 强大的上下文理解能力让它迅速读懂了新的命令行格式,并成功解决了问题。在连续多次成功处理新格式的故障后,系统再次从新的执行轨迹中提取规律,将任务重新晋升为 Type 1。这种机制赋予了平台双重优势:既享受确定性自动化带来的极高稳定性和极低成本,又保留了 Agent 面对环境突变时的极强适应力,且全程无需人类工程师干预。
打破直觉的结论:成本越低,系统越安全
在涉及自动化系统的改造时,业内普遍存在一种直觉式的担忧:将复杂的 LLM 推理替换为成本更低的自动化脚本,是否意味着牺牲了系统的安全性或质量?
Microsoft 的研究给出了截然相反的结论:结晶过程不仅没有损害安全性,反而使所有的关键安全指标实现了单调递增。
作者指出,完全确定的 Type 1 工作流比最初的 Agent 探索具有更高的安全性,原因在于其验证前置。在 Type 3 阶段,系统对爆炸半径的控制主要依赖于运行时的动态拦截和人类审批,这种方式充满不确定性,可重复性仅在 50% 左右。而随着任务向 Type 1 演进,控制手段从动态拦截转变为静态模式验证,最终转变为可以在代码执行前就进行完全静态证明的确定性逻辑。
此外,审计能力在整个生命周期中均未妥协,因为所有类型的工作流都会保留完整的执行追踪日志。合规性也从“依赖于在场人类的判断”转变为“内置于系统结构的刚性约束”。简而言之,因为确定性意味着绝对的可重现和可验证,所以平台的安全水位与经济效益实现了罕见的同频共振。
生产环境的大规模验证与商业启示
为了验证该框架的实际效能,Microsoft 将 Progressive Crystallization 部署到了其负责大规模云网络运维的生产级 AIOps 系统中。在长达八个月的观察期内,该系统每月需要处理数以万计的真实网络故障。

实验结果展现了惊人的商业价值。随着时间推移,系统中越来越高比例的故障匹配到了成熟的模式。原本完全依赖大模型的系统,其 Type 1 确定性工作流的执行占比从最初的 0% 稳步攀升至 45%。得益于底层路由策略将流量引向零成本工作流,即使在此期间总体的网络故障工单量翻了一倍,系统分摊到每次故障处理的 Agent 成本依然大幅降低了 70% 以上。
与此同时,服务质量未受到任何负面影响。平台对常见故障类别的自主解决率保持在 90% 以上,平均故障恢复时间(MTTR)从数小时骤降至几分钟,且错误修复率严格控制在 5% 以下,没有发生任何客户可见的服务降级。
这项研究为整个 AI 行业特别是 ToB 领域的企业级落地提供了一个极具前瞻性的视角。团队在论文末尾提出,Type 1、Type 2 和 Type 3 在系统中的执行比例,应当成为未来衡量任何大规模 Agent 团队“运营成熟度”的核心指标。
大模型平台不必永远承受极其高昂的推理税。通过将 LLM 强大的泛化能力聚焦于对未知领域的“发现”,并利用 Progressive Crystallization 将被验证的知识沉淀为零成本的基础设施,企业可以在拥抱 AI 终极灵活性的同时,建立起一条具备长期经济可行性和极高安全边界的自动化坦途。