AtumAI:从自然语言到数据中心控制面策略,性能超越专家手工设计
AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies
数据中心是现代计算体系的支柱,支撑着从微服务、海量存储到大规模 AI 训练与推理的各类关键任务。然而,随着底层异构硬件的爆炸式增长与上层分布式负载的频繁演变,数据中心运行效率的上限,正越来越取决于其控制面(Control Plane)策略的优劣。无论是虚拟机的放置调度、服务资源的动态扩缩容,还是集群级的功耗分配,每一项控制策略都需要在复杂的约束边界与相互冲突的指标之间寻找微弱的平衡点。传统依赖人类专家进行数月手工调优与原型验证的方式,已经无法跟上硬件栈与负载更迭的节奏,导致大量能耗与计算资源的隐性浪费。
ArXiv URL:https://arxiv.org/abs/2608.02569
自然语言驱动的智能体系统(Agentic AI)看似是自动化设计控制策略的理想工具,但直接将开箱即用的大语言模型套用到数据中心底层系统时,往往会遭遇严峻的现实壁垒。现有通用智能体缺乏形式化保障,无法将模糊的运维意图转化为严格的机器校验规约,容易突破硬性约束;缺乏跨任务迁移能力,每次面对新策略都只能从零探索;并且严重依赖大模型自身的直觉生成,极易陷入局部最优。
为了打破这一困局,研究人员提出了面向数据中心控制面策略生成的结构化框架 AtumAI。该框架通过前端的“任务编译器”与后端的“演化设计发现循环”,将自然语言需求自动转化为具备严格约束保障的中间表示,并通过扩散模型、演化算法与代理模型的协同配合,实现了系统化的全局策略搜索。在负载放置、资源扩缩容以及集群功耗管理三大经典场景中,AtumAI 生成的控制策略均一致超越了人类专家长期精细调优的基线方案,将新策略的原型设计周期从以月为单位直接缩减至撰写一段自然语言描述。

为什么开箱即用的 AI 智能体无法接管数据中心控制面?
现代数据中心的控制面逻辑,本质上是在一个极其庞大且强耦合的设计空间内寻找多目标帕累托前沿的过程。例如在资源扩缩容场景中,系统既要压缩 CPU 与内存的占用以降低运行成本,又必须死守尾延迟(Tail Latency)的服务等级目标(SLO,如 $p99 \le 50\text{ ms}$)。如果仅凭工程师的直觉或通用智能体的零样本生成,很难系统性地覆盖这类多维度约束空间。
归结起来,现有通用智能体在应对数据中心底层控制面时暴露出三个维度的根本缺陷:
-
缺乏形式化(Not Formal):现有的智能体范式通常依赖自然语言 Prompt 或简单的手工适应度函数。问题定义、硬件物理边界与 SLO 硬约束大多停留在隐式上下文层面。大模型在输出代码或参数时,由于缺乏形式化与机器可检查的机制,极易输出违背集群物理承载力或导致服务雪崩的不可行策略。
-
缺乏可迁移性(Not Transferable):在传统方案中,每一个系统优化任务都被作为孤立的定制问题来处理。工程师为一个调度任务积累的防抖动(Anti-thrashing)或突发流量预警机制,无法自动投射到扩缩容或功耗控制任务中。缺乏统一表征的结果,是每一项新策略都要经历从头编写和调试的漫长迭代。
-
缺乏系统化搜索(Not Systematic):通用智能体完全依赖 LLM 作为策略候选者的单一来源。大模型的输出往往受到预训练语料中既有范式的偏置影响,只能在其熟悉的狭窄设计空间内打转,生成诸如“按负载线性缩放”等平庸甚至脆弱的策略,无法对连续参数与离散拓扑展开高强度的全局探索,最终深陷局部最优。
针对上述缺失的三大支柱,AtumAI 构建了专门的双层体系。前端由“数据中心任务编译器”(Datacenter Task Compiler)将非结构化意图落地为严格的中间表示,后端则由“演化设计发现循环”(Evolutionary Design Discovery Loop)跳出单纯的大模型文本生成限制,利用多模态算法与物理仿真器进行深度探索与验证。
数据中心任务编译器:将自然语言意图编译为可执行搜索空间
要让自动化策略生成变得可信,首要前提是建立严格的规格说明(Specification)。AtumAI 的前端核心是“数据中心任务编译器”,其作用机制与传统编译技术类似,分为“提升”(Raising)与“降级”(Lowering)两个核心阶段。

在提升阶段,编译器接收运维工程师提出的自然语言请求,例如“在不增加延迟的前提下最小化服务的资源占用”。同时,编译器会接入目标集群的数据挖掘管道,提取该服务的历史负载曲线、不同资源配置下的实际延迟响应特征以及物理服务器节点的拓扑与容量限制。通过将抽象意图与真实的物理画像绑定,编译器消除了单纯依靠自然语言带来的歧义,并输出一套标准化的中间表示(Intermediate Representation, IR)。
这份 IR 并非无约束的自由文本,而是一个经过严格验证的结构化模式(Schema)。它显式地固定了四个核心要素:优化目标(如最小化 CPU 核心占用)、硬性约束(如尾延迟违标次数占比上限)、决策变量(如反应窗口大小、扩容步长)以及评估方法。统一的 IR 构成了前端意图与后端搜索之间的稳定契约,后续的所有优化机制都能直接解析该数据结构,而不需要反复重新解析不稳定的自然语言上下文。
统一 IR 带来的另一个核心收益是“控制知识的跨域迁移”。在实际数据中心管理中,许多核心控制逻辑在数学结构上是同构的。例如“突发流量预测防护机制”(Burst-prediction guard),其本质是一个结合短时需求压力、趋势与队列风险的复合评估函数:
\[\mathit{pressure}=f(\mathit{trend},\mathit{queue},\mathit{slo\_risk})\]当这一抽象控制逻辑应用于资源动态伸缩时,编译器会自动将其变量投影(Projection)绑定到服务的具体信号上,如请求速率趋势、请求排队深度以及当前延迟与 SLO 的比值;而当该逻辑迁移到虚拟机放置场景时,相同的数学骨架会被无缝重构为宿主机维度的空闲余量、放置后的容量松弛度与超卖风险。这种形式化映射使得在某一特定场景中验证成熟的控制思想,能够作为模块化资产沉淀在共享库中,直接复用到完全不同的运维领域。
如果面临全新问题且现有知识库无法覆盖,编译器还内置了开放世界扩展机制。它通过一套安全的公式领域特定语言(Formula DSL),仅允许基于目标字段的安全算术运算树组合,杜绝了生成不可控代码的隐患,并在形式化校验通过后将新算子注册进知识库,驱动库的自演进。
完成形式化提升与知识库投影后,编译器进入降级阶段。它将 IR 编译转换为后端搜索所需的四种可执行构件:离散与连续维度的参数搜索空间、初始候选策略生成器、低开销的代理评估模型,以及与真实物理环境高度对齐的高保真仿真器接口。
演化设计发现循环:突破大模型偏置的系统化探索
仅有标准化的搜索空间并不足以产生超越人类设计的精妙策略。如果依然完全依靠大模型采样,探索依然会停留在浅层。AtumAI 的后端构建了一个闭环的“演化设计发现循环”,将 LLM 的概念推理优势与演化算法的参数调优能力、扩散模型的拓扑探索能力深度融合。

循环的起点是生成种子策略。大语言模型基于任务编译器提供的 IR、硬件负载特征以及共享知识库中的优秀模板,生成第一批符合领域工程常识的种子候选者。为了避免单点失败,所有种子的生成过程相互独立,单一格式异常的提案不会阻塞整个演化周期。
紧随其后的“扩展”(Expand)阶段是 AtumAI 打破大模型搜索瓶颈的关键。系统从“策略结构”与“数值参数”两个正交的轴向对候选集进行大规模展开:
-
结构探索(扩散模型):利用在策略语法树上训练的扩散机制对控制逻辑的结构进行跳跃式变异,例如引入新的条件分支或组合不同的控制范式,从而跳出初始种子的结构范畴。
-
参数调优(演化算法与模拟退火):针对策略中的浮点阈值与整型旋钮,演化算法通过向数值参数施加高斯扰动生成变异个体,并在其局部空间展开密集的退火优化链,对策略细节进行高精度打磨。

双轴扩展能够在极短时间内衍生出数以千计的候选策略,其数量远远超出了高保真物理仿真器可承受的吞吐上限。为此,AtumAI 引入了“代理模型过滤”(Filter)机制。代理模型是一个根据真实物理特征离线或增量训练的轻量化评估器,能够以极低的时延预测某项候选策略在不同负载压力下的 SLO 达标率、资源损耗与过载风险,并给出置信区间估计。系统利用代理模型剔除明显不可行或劣化的绝大部分方案,仅筛选出少量处于预测帕累托前沿的潜力候选者,输入高保真仿真器进行深度评估。
在高保真验证环节,保留下来的策略会在与真实系统(如生产级 Kubernetes 轨迹与异构服务器架构)严格校准的高保真模拟环境中运行。系统不仅输出准确的评分,还会生成详细的“结构化失败摘要”(Failure Summary),精准记录策略在何时、因何种负载突变导致了硬性约束的失真。这些评估结果与帕累托前沿的对照样本共同打包为结构化反馈信息,重新注入到下一轮迭代中,指导扩散模型聚焦于薄弱逻辑的重构,从而实现策略质量的代际持续累进。
三大核心控制面场景的实证检验
为了全面检验 AtumAI 的泛化性与控制性能,研究团队在三种具有不同问题边界、控制粒度与权衡目标的数据中心核心任务上开展了系统性实证评估。所有评测均在高保真仿真环境下进行,并以业内成熟专家长期维护的生产基线策略(Gen-0 Baseline)作为基准(归一化为 1.0)。
1. 工作负载放置(Workload Placement)
虚拟机或容器的跨宿主机调度,核心目标在于尽可能提高集群的接纳率(Admission Rate)与调度吞吐,同时避免因同台共存(Colocation)引发的 CPU 或内存争抢。这是一个典型的离散决策组合优化难题。过于激进的装箱会导致 CPU 热点频发并拖垮运行中的关键任务,而过于保守的放置策略又会造成机架空间与能源的巨大浪费。
实验结果表明,AtumAI 在经历多轮演化后,生成的综合策略得分达到了基线的 $1.13\times$。在保证不发生同台资源争抢硬约束违背的前提下,AtumAI 自主发掘出了一种兼顾动态余量预留与细粒度负载预测的新型评分函数,其调度接纳率显著优于传统专家制定的分级装箱规则。
2. 资源弹性伸缩(Resource Scaling)
动态伸缩任务旨在根据毫秒或秒级的服务负载波动,精细调节分配给各微服务实例的 CPU 核心数与内存配额。硬约束是集群的总物理承载力上限,优化目标是在守住严苛的尾延迟 SLO(如 $p99 \le 50\text{ ms}$)的前提下,将集群整体资源预留压到最低。
在此场景下,AtumAI 生成的自适应扩缩容策略展现出惊人的效率提升,综合评分达到了专家基线的 $1.27\times$ 至 $1.33\times$。消融分析显示,常规大模型生成的策略往往在负载骤增时发生伸缩震荡或反应滞后,进而击穿延迟底线;而 AtumAI 依靠形式化编译器投影的突发流量防护机制,结合演化算法微调的灵敏度参数,在极度削减冗余资源配额的同时,依然平稳化解了所有激增流量对尾延迟的冲击。
3. 跨集群功耗管理(Power Management)
针对大语言模型推理集群的全局功耗调度问题,管理员必须在严苛的峰值总能耗预算红线内,最大化整个机房的推理吞吐量。控制手段包括模型动态量化分流、模型大小切换以及频偏控制等,其硬约束在于各服务的推理准确度必须维持在满血大模型基准的 $90\%$ 以上。
AtumAI 在该任务中最终实现了专家基线的 $1.28\times$ 至 $1.31\times$ 的性能表现。框架在复杂的功耗-吞吐-精度三角关系中寻找到了一条动态弹性路径:在各服务具有精度冗余(Headroom)的时段,策略会自动将部分非关键流量引向轻量化模型并降低核心功耗,把富余的电力配额实时倾斜给处于负载峰值的计算密集型推理实例,从而在硬性能耗包络线之内撬动了更高的并发服务上限。
深入拆解:形式化编译器与演化循环各自贡献了什么?
AtumAI 的出色表现究竟来自底层语言模型的能力提升,还是源于框架本身的结构性设计?研究通过严密的消融与敏感度实验给出了清晰的证据。
在探讨任务编译器的必要性时,对比实验设立了六种渐进的支撑配置:完全无编译器的“纯 LLM 方案”、仅使用手工编写 IR、使用手工 IR 配合人工 Prompt 提示、无跨任务知识迁移的编译器、单次迭代编译器以及完整的任务编译器。
测试结果揭示了一个关键事实:没有任务编译器支持的纯 LLM 方案得分为零。在无结构化形式保障的环境下,大语言模型生成的策略无一例外均违背了数据中心的底层硬性约束(如导致节点过载崩溃或突破功率红线),无法被视为可用的部署策略。即便人工提供手写的形式化 IR,策略质量也仅能恢复至完整系统能力的 $82\% \sim 93\%$;唯有引入真实物理负载画像挖掘、形式化校验与跨域知识迁移的完整编译器,才能完全释放端到端策略发现的潜能。这证明了将隐式意图编译为显式数学规约,是 AI 走出实验室、落地到数据中心底层不可或缺的基础设施。
而在后端驱动核心的敏感度测试中,研究人员将演化循环中的 LLM 分别替换为 Claude Opus 4.8、Gemini 2.5 Pro、Gemini 2.5 Flash 以及更轻量的 Gemini 2.5 Flash-Lite。令人瞩目的是,所有配置生成的策略评分均稳定大幅超越基线。在资源扩缩容任务中,各模型对应的策略收益高度聚拢在 $1.21\times$ 至 $1.33\times$ 之间;在功耗管理任务中,即便体量最小的 Flash-Lite 也能达成 $1.28\times$ 的增益,与最前沿模型的 $1.31\times$ 仅有微小差距。
这一系列对照确凿地表明:AtumAI 的卓越性能并非单纯寄生于某一款最强基础大模型的文本生成直觉,而是由框架所确立的“形式化编译约束 + 演化扩散多维探索 + 仿真闭环反馈”这一系统性工程架构所赋予的。大模型的代际增强可以进一步抬高策略质量的上限,但 AtumAI 建立的严谨骨架,才是托起整个控制面自动化生成可行性与高确定性底线的决定性力量。
随着大规模基础设施向万卡乃至十万卡集群快速推进,传统依靠工程师经验驱动的控制面优化体系正在逼近认知极限。AtumAI 提供了一种范式转变的可能:系统运维人员不再需要深陷于冗长琐碎的算法硬编码,而是通过规范的自然语言声明意图,由智能框架将需求形式化、在广泛的设计空间内系统化挖掘全局最优解,并将演化积累的系统经验转化为可复用的数字资产。这种以形式化保证为前提的智能体闭环搜索模式,或将成为未来大规模分布式计算基础设施走向自主自治(Autonomous Datacenter)的关键演进路径。