ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AtumAI:面向数据中心控制平面策略的规范化智能体生成框架

AtumAI:面向数据中心控制平面策略的规范化智能体生成框架

AtumAI:面向数据中心控制平面策略的规范化智能体生成框架

论文arXiv编号:2608.02569v1 | 发布时间:2026-08-03 | 开源协议:CC BY-NC-SA 4.0

摘要

数据中心的运行效率完全依赖控制平面:即调度硬件资源的各类管理策略。但人工设计控制平面策略的难度正持续加剧:软硬件栈规模扩张速度远超工程师的理解上限;优化空间庞大、变量高度耦合,专家极易错过性能优化机会;单套候选策略的原型验证往往需要数月周期。
现有开箱即用的智能体AI系统虽可自动化策略搜索,但存在三大核心缺陷:

  1. 非规范化:无结构化、可检索的问题描述,硬约束无法得到强制保证,搜索过程缺少可利用的固定结构;
  2. 无迁移能力:每个任务从零求解,跨场景学到的经验无法复用;
  3. 非系统化搜索:仅依靠大模型生成候选方案,探索空间狭窄、存在模型偏见,极易收敛到局部最优。

本文提出AtumAI框架,通过智能体AI自动生成数据中心控制平面策略,同时补齐上述三大短板。工程师仅需自然语言描述优化目标,AtumAI即可自主完成候选策略生成、仿真测试、迭代调优直至产出满足全部约束的可用方案。框架由两大核心组件协同工作:

  1. 数据中心任务编译器:将自然语言需求编译为可机器校验、可检索的形式化规约,规约绑定真实业务负载与硬件平台采集数据,包含优化目标、决策变量、硬约束、评测方案;
  2. 进化式设计迭代环:基于规约开展全域搜索,通过扩散模型探索差异化策略结构、进化算法调参、代理模型预过滤低价值候选,大幅降低高精度仿真的计算开销。

在三类完全不同的控制平面任务(负载部署、资源弹性扩缩、功耗管理)上完成评测:AtumAI生成的策略性能全面超越人工专家基线;单套统一流水线可适配所有数据中心优化场景,无需针对任务定制开发。

现有系统缺失能力带来的问题AtumAI解决方案
规范化形式化描述无绑定真实负载的结构化问题定义,硬约束无法保证任务编译器生成绑定业务/硬件的标准化可检索中间表示IR
知识迁移机制每个任务独立开发,经验无法复用统一IR+共享优化算子库,跨任务蒸馏知识可复用
全域系统化搜索仅依赖LLM生成方案,搜索范围窄、易陷入局部最优扩散模型(结构探索)+进化算法(参数调优)+代理预过滤三重搜索

1 引言

数据中心支撑微服务、网页检索、存储、数据分析、大模型训练推理全场景业务,其成本、吞吐、稳定性完全由控制平面决定。控制平面包含一系列调度策略:通过负载部署、缓存、流量路由榨取硬件算力,或直接调控服务器功耗。
每类策略都存在多目标权衡(服务器利用率、尾延迟、成本、功耗)与硬性约束(SLA服务指标、硬件容量、功耗上限)。随着硬件异构性、业务负载持续迭代,策略的优化空间呈组合爆炸式增长。传统专家手工设计、调优模式已跟不上业务迭代速度,带来海量资源浪费。

智能体AI(LLM驱动多步执行系统)可自主理解目标、调用工具、执行代码,正在革新软件工程与科学计算领域。本文提出:智能体可大幅提升数据中心控制平面策略研发效率,扩充人类可探索的优化空间,让工程师聚焦问题定义与结果评判,而非手工调参。

但直接使用通用智能体解决调度优化存在三大致命短板:

  1. 无形式化规约:目标、约束隐式写在Prompt与自定义适应度函数中,未绑定真实业务数据;优化过程缺少结构化边界,生产环境极易出现仿真达标但线上失效的策略;
  2. 无迁移复用:每个任务都需要从零搭建脚手架,无法复用过往调度经验;
  3. 搜索范围受限:全部候选方案由LLM生成,继承模型固有偏见,仅能探索极小一片设计空间,快速收敛局部最优。

本文核心工作

本文设计AtumAI规范化智能体框架:工程师自然语言描述需求,框架全自动生成、评测、迭代验证控制平面策略,支持负载、硬件持续变化下的数据中心自演化
框架核心两大创新组件:

  1. 数据中心任务编译器:将需求编译为标准化、可校验中间表示IR,实现问题形式化;配套共享优化算子库,实现跨任务知识迁移;
  2. 进化式设计迭代环:突破LLM单一生成局限,扩散模型探索策略结构、进化算法优化参数、代理模型提前筛除劣质方案,实现系统化全域搜索。

三大评测场景效果

  1. 负载部署:对比人工基线,部署成功率提升17%,调度吞吐提升8%;
  2. 资源弹性扩缩:资源使用成本降低24%,SLA违规率仅1.3%;
  3. 功耗管理:集群功耗下降21%,业务吞吐同步提升17%。

三类场景共用同一套Atum流水线,无需定制改造;策略设计周期从数月压缩至数小时,跨领域调度经验可完全复用。

本文四大核心贡献

  1. 提出AtumAI框架,实现自然语言需求到可用数据中心控制策略的全自动智能体流水线;
  2. 设计数据中心任务编译器:将自然语言意图转化绑定真实负载、硬件的可检索、机器校验IR规约;
  3. 提出进化式设计迭代环:融合扩散结构搜索、进化参数调优、代理预过滤,突破LLM搜索边界;
  4. 在负载部署、资源扩缩、功耗管理三大典型数据中心任务完成全量实验,验证框架通用性与性能优势。

2 背景与动机

2.1 数据中心控制平面

控制平面是管理服务器、CPU、内存、功耗等硬件资源的软件集合,由多套独立策略组成,每套策略包含决策变量、优化目标、硬约束、业务评测负载四大统一要素。本文全程使用三类典型策略作为示例:

  1. 负载部署策略(Borg/Protean等集群调度器)
    决策每个虚拟机/服务运行节点,权衡服务器利用率、部署成功率、业务尾延迟、调度器自身吞吐;约束为节点CPU/内存容量、服务共存限制。传统方案依赖数十年手工启发式规则,负载迭代后性能持续衰减。
  2. 资源弹性扩缩策略(Autopilot自动扩缩容系统)
    动态调整服务CPU、内存配额,权衡资源开销与流量峰值下SLA违规风险;结合时序预测、反馈控制与人工安全阈值。
  3. 集群功耗管理(Dynamo、Thunderbolt)
    统一分配整机功耗预算,通过功耗超配提升硬件利用率,约束为单服务精度下限、整机功耗上限。
人工策略的固有缺陷

软硬件规模持续扩张,策略优化空间组合爆炸;单套候选策略原型、仿真、上线验证周期长达数月;策略上线后随负载、硬件迭代性能持续退化,无法自适应变化。
亟需自动化方案:输入高层优化目标,全自动生成适配当前集群调度策略。该方案需要两大能力:

  1. 将自然语言意图转化绑定真实集群硬件、负载的精准数学规约;
  2. 大范围搜索优质策略,不局限于人类专家的启发式思路。智能体AI为上述能力提供落地路径。

2.2 智能体系统与现有相关工作

(1)传统机器学习调度优化

LLM智能体出现前,各类独立ML模型被用于单一场景优化(分支预测、缓存替换、芯片布局、资源扩缩),但每个场景都需要独立定制模型与训练流水线,无法跨任务复用。

(2)LLM代码生成、软件智能体

MetaGPT、SWE-agent等多智能体框架通过测试反馈完成代码纠错,但仅聚焦功能正确性;ECO-LLM基于反模式重构代码,仅面向狭义性能优化,无法处理多约束数据中心调度问题。

(3)内核/算子智能进化框架

KernelEvolve、AI CUDA Engineer等工具迭代优化计算内核,仅单目标性能调优;而数据中心策略存在多冲突目标+大量硬性约束,无法直接复用。

(4)LLM驱动进化搜索(AlphaEvolve、SkyDiscover)

通过LLM变异代码、适应度筛选迭代,但存在两大致命局限:

  1. 所有候选均由LLM生成,搜索空间狭窄,容易局部最优;
  2. 每个新任务需要人工编写适应度函数、搭建仿真脚手架,把自然需求转为约束优化的专家步骤无法自动化。
现有方案三大缺失

无形式化绑定业务的规约、无跨任务知识迁移、仅LLM单一搜索源;本文AtumAI完整补齐三点。

3 AtumAI整体架构

AtumAI单条完整流水线:自然语言需求 → 数据中心任务编译器 → 可执行搜索问题 → 进化式设计迭代环 → 验证通过的最优控制策略
两大核心模块:

  1. 前端:数据中心任务编译器:将非正式意图形式化为统一中间表示IR,实现知识可迁移,最终输出可执行搜索任务;
  2. 后端:进化式设计迭代环:系统化全域搜索,输出满足全部IR约束的最优策略;
    迭代环输出评测反馈回传编译器,形成闭环持续优化。

运行示例(贯穿全文案例)

需求:在不提升延迟的前提下,最小化服务资源占用(资源扩缩场景,固定服务器硬件、附带历史流量追踪,p99延迟≤50ms硬SLA约束)
编译器自动将模糊需求转化完整形式IR规约,迭代环全域搜索扩缩控制器策略。

4 数据中心任务编译器

现有智能体将问题定义藏在Prompt、手写适应度函数中,目标约束隐式表达,经验无法复用。编译器通过三大设计解决该问题:

  1. 形式化:自然语言意图转为显式IR规约(决策变量、目标、约束、评测方法);
  2. 可迁移:共享优化算子库,单任务学到的调度逻辑跨场景复用;
  3. 系统化搜索前置:将IR规约转化结构清晰的可执行优化问题。

编译器三阶段执行流程:

  1. 意图提升:自然语言需求转为标准化形式IR;
  2. 算子投射:从共享库选取适配优化算子,绑定当前场景变量;
  3. 下编译:IR规约输出完整可执行搜索任务(参数空间、生成器、代理模型、高精度仿真器)。

4.1 意图提升:自然语言转形式规约

输入:工程师文字需求 + 可选工件(负载追踪、部署配置、历史策略)
输出:基础未绑定IR规约,分两步执行

  1. 意图解析
    智能体识别调度决策、优化目标、隐含硬约束;规则校验器(非LLM)确定性校验规约完整性,缺失信息自动反问工程师;空白值从领域标准模板填充,保证简短需求也能生成完整规约。校验器强制IR类型规范:变量定义域、约束可观测、单位统一,拒绝非法规约。
  2. 负载与硬件特征挖掘
    自动拉取集群真实流量、硬件上限数据绑定IR,优化搜索不再基于抽象假设,全部贴合真实线上环境。

4.2 中间表示IR(统一标准规约)

所有数据中心调度任务共用同一份IR结构,作为编译器与迭代环的标准接口,包含六大核心字段,示例如下:

task_type:resource scaling# 决策变量:控制器可调参数decision_variables:replicas:int in[1,12]cpu_limit:float in[0.5,4.0]# CPU核心数mem_limit:float in[0.5,8.0]# 内存GB# 优化目标(支持多目标优先级)objectives:minimize allocated_resources# 优先级1.0# 硬性约束(绝对不可违反)constraints:p99_latency_ms \leq 50 cooldown \geq 1 interval# 评测规范evaluation:simulator = autoscaling_evaluator trace = mined_load(service) metrics ={p99_latency,resources,slo_violation_rate}# 执行预算(策略推理时延上限)execution_budget:class=loose interval=30s mode=full# 绑定真实集群特征characterization:load profile,latency-vs-alloc curve,platform limits
  1. 决策变量:策略可调整参数与取值空间;
  2. 目标:多优化方向+优先级,不强制合并为单一标量;
  3. 硬约束:任何候选策略违反即直接淘汰;
  4. 评测方法:固定仿真器、负载追踪、观测指标,保证所有方案可复现对比;
  5. 执行预算:策略在线推理最大时延,约束策略复杂度;
  6. 特征绑定:自动挖掘的集群负载、硬件数据。

4.3 可迁移控制知识:共享优化算子库

形式IR描述优化目标,但不包含实现调度逻辑的方法;编译器维护全局共享优化算子库,实现跨任务知识迁移。

算子库结构

单个优化算子(抽象调度逻辑)包含4部分:适用条件、需满足目标、领域适配投射公式、历史置信度。
示例算子:突发流量预警防护

  • 抽象公式:压力 = f(流量趋势, 队列深度, SLA风险)
  • 适配负载部署场景:转化为主机剩余容量打分公式
  • 适配资源扩缩场景:转化为扩容触发压力指标
算子筛选三步流程
  1. 过滤:仅保留匹配IR适用条件算子;
  2. 打分:算子描述与IR目标匹配度排序;
  3. 覆盖贪心选择:最小算子集合完整覆盖全部IR约束/目标。
算子投射机制

抽象公式绑定当前场景真实观测指标,生成领域专属调度项;同一套预警算子无需重新开发,直接复用在部署、扩缩两类完全不同任务。

Figure3:抽象算子跨领域投射示例

4.4 下编译:IR转为可执行搜索任务

输入IR与筛选后的优化算子,输出四件套搜索工件:

  1. 参数空间:所有算子阈值、变量取值范围;
  2. 候选生成器:基于算子库初始化初始策略;
  3. 代理预评估模型:低成本预测策略指标,减少高精度仿真次数;
  4. 高精度仿真器:基于挖掘的真实负载搭建评测环境。
评估栈设计

代理模型:编译器根据IR指标、负载特征自动构建,迭代过程持续重训练,提前筛除劣质候选;
仿真器:扩展IR所需观测指标,完整复刻线上集群环境。

完整编译算法(算法1)
输入:自然语言需求r,目标领域d,算子库L 1. ir = Raise(r) # 意图提升,挖掘负载硬件特征 2. 标准化+校验IR,空白填充领域模板 3. P = SelectPasses(ir, L) # 筛选适配优化算子 4. 遍历所有算子p∈P: tp = Project(p, d) # 投射为领域专属公式 5. 遍历IR所需但无匹配算子的目标: 生成安全DSL原语,校验硬件是否支持 6. prob = Bind(ir, {tp}) # 绑定生成完整搜索任务 7. 根据IR执行预算裁剪搜索规模 8. 返回可执行搜索任务prob

4.5 开放世界扩展机制

算子库无法覆盖全部全新调度逻辑时,编译器生成安全公式DSL原语(仅基础四则运算,无可执行代码);若仿真器缺少所需观测指标,标记能力缺口,后续迭代完善。

4.6 证据驱动算子库演化

每次迭代的评测结果更新算子置信度,负收益算子自动降低筛选优先级;每完成一类任务,新增算子入库,后续所有任务均可复用,知识持续累积。

5 进化式设计迭代环

编译器输出搜索任务后,迭代环完成全域系统化搜索;单LLM仅能探索局部空间,迭代环通过结构扩散+参数进化双向拓展候选范围,搭配代理预过滤降低仿真开销。
单次迭代5阶段:生成种子 → 结构/参数扩展 → 代理过滤 → 高精度仿真验证 → 反馈迭代。

Figure4:迭代环五阶段完整流程 ![在这里插入图片描述](https://i-blog.csdnimg.cn/direct/b8e2be30c4f242c5a4bd73047584e64c.png)

5.1 Generate:种子策略生成

迭代首轮初始化种子:LLM结合算子库、历史成功/失败案例生成基础可行策略;不限制单一模型,多条种子并行生成,错误方案不阻塞流程。

5.2 Expand:双向全域扩展

基于少量种子生成海量差异化候选,分两条扩展路径:

  1. 结构扩散(离散扩散模型)
    掩码策略局部模块(打分逻辑、安全阈值),仅重生成掩码区域,保留有效逻辑;约束编辑边界,仅修改指定片段,避免破坏已有可行逻辑;可融合多条最优策略的优势结构。实现层面用LLM完成掩码重写,拒绝越界修改。
  2. 参数进化算法
    对同一策略结构,高斯扰动阈值、窗口、容量等数值参数;搭配模拟退火局部寻优,允许临时变差跳出局部最优;全部参数调整通过代理模型预打分,不占用高精度仿真资源。
Figure5:种子双向扩展+代理过滤流程

5.3 Filter:代理模型低成本预筛选

扩展后候选数量巨大,无法全部仿真;代理模型快速预测所有指标(带置信区间),基于探索感知打分筛选高价值方案。

打分规则

综合预测收益、不确定性奖励、失败修复增益、新颖度,淘汰重复劣质方案;配额制预留小众、高不确定候选,避免最优方案被过滤。

代理模型实现

高斯过程+树集成融合回归器,输入策略结构特征、负载场景,输出多指标预测;每轮仿真数据增量重训练,预测精度持续提升。

5.4 评估与校验

过滤后少量候选送入全量高精度仿真,覆盖稳态、突发、碎片多类负载场景,避免策略过拟合单一流量;强制校验全部IR硬约束,只要一项违规直接淘汰;持续校验代理预测准确度,防止过滤失效。

5.5 反馈与迭代

仿真结果生成结构化反馈:约束违规场景、最优对比样本;反馈指导下一轮种子生成、扩散掩码选取;本轮最优/最差策略存入算子库作为正负样本,跨任务复用经验。

单次迭代完整算法(算法2)
输入:搜索任务S,上轮最优父策略P,代理模型M,历史反馈B,算子库L 1. seeds = Generate(S, L, B) # 算子库引导生成种子 2. cand = Diffuse(P∪seeds) ∪ Mutate(P∪seeds) ∪ Anneal(P∪seeds) 3. pool = P ∪ seeds ∪ cand 4. ranked = Rank(pool, M) # 代理不确定性打分排序 5. filter = Select(ranked) # 配额筛选少量候选 6. rows = Simulate(filter) # 多负载高精度仿真,剔除违规方案 7. M = Refit(M) # 增量重训练代理模型 8. P = ParetoParents(rows) # 帕累托最优作为下轮父策略 9. B = Failures(rows) # 记录约束违规反馈 10. 更新算子库,存入本轮最优/最差策略 11. 返回本轮验证通过最优策略

6 多场景案例实验

三大独立数据中心调度任务:负载部署、资源弹性扩缩、功耗管理;每个场景人工专家基线为线上成熟调度系统;评测指标归一化基线分数=1.0;迭代环默认使用Claude Opus 4.8,同时测试多款LLM鲁棒性。

6.1 场景1:虚拟机负载部署

任务定义

90台服务器集群,Azure真实VM流量追踪;优化目标:最大化部署成功率、调度吞吐,降低CPU热点;硬约束:CPU/内存容量、服务共存隔离;基线为工业界Best-Fit装箱调度器。

评测指标VMScore = 0.5部署成功率 + 0.2调度吞吐 + 0.2 P50热点惩罚 + 0.1 P99热点惩罚
实验结果

AtumAI综合得分1.13倍基线:部署成功率+17%,调度吞吐+8%,热点负载无恶化。

核心创新策略
  1. 谐波CPU/内存剩余容量打分,预留未来部署空间;
  2. 拓扑分组筛选主机,大幅降低单轮调度计算开销;
消融结论

仅LLM仅1.01倍;增加扩散+进化至1.05;完整反馈闭环提升至1.13,反馈是核心增益来源;更换Gemini等其他LLM依旧稳定超越基线。

Figure6 负载部署实验曲线(得分迭代、消融、LLM敏感性)

6.2 场景2:服务资源弹性扩缩

任务定义

100微服务共享30节点,阿里真实多模式流量(稳态/突发/趋势);目标:最小分配资源,硬约束p99延迟SLO;基线为阈值式被动扩缩控制器。

指标:0.5 SLA质量 + 0.5资源成本,归一化基线
实验结果

综合得分1.27倍基线,资源开销降低24%,SLA违规率仅1.3%。

核心创新策略

区分扩容/缩容预测窗口,高风险服务优先分配资源,低压力场景缩容避免震荡。

消融

纯LLM 1.16,扩散进化1.21,完整反馈闭环1.27;多款大模型均稳定1.20以上,鲁棒性强。

Figure7 资源扩缩实验图表

6.3 场景3:LLM推理集群功耗管理

任务定义

960服务器大模型推理集群,Azure线上两周流量;目标:同等功耗下提升吞吐;硬约束单服务精度≥0.9;基线为固定大模型高功耗调度策略。

指标:0.4功耗优化 + 0.3精度 + 0.2吞吐
实验结果

综合得分1.31倍基线,功耗下降21%,吞吐提升17%,所有服务精度达标。

核心策略

差异化模型尺寸分配,低精度负载使用小模型,功耗导向流量路由。

消融

仅LLM等于基线;结构扩散提升至1.14;完整迭代环1.31;轻量化LLM依旧可达1.28倍。

Figure8 功耗管理实验图表

6.4 数据中心任务编译器价值消融实验

设置6组对比:仅LLM、手写IR、IR+人工提示、无知识迁移完整编译器、单轮编译器、完整Atum编译器。

  1. 纯LLM:无合法满足约束策略,得分0;
  2. 手写IR:仅82%-93%完整系统性能;
  3. IR+提示:92%-96%;
  4. 关闭算子知识迁移:性能下降3.6%-4%;
  5. 单轮编译器不迭代优化:性能下降1.2%-3.2%;
    结论自动挖掘负载硬件+跨任务算子迁移是Atum核心收益来源,仅靠LLM或人工规约无法产出线上可用策略。
Figure9 编译器消融柱状图

7 结论

人工设计数据中心控制平面策略难以匹配软硬件迭代速度;现有通用智能体存在非形式化、无迁移、搜索范围窄三大缺陷。
本文提出AtumAI:

  1. 数据中心任务编译器将自然语言需求转为绑定真实业务的形式化IR,实现跨任务调度知识迁移;
  2. 进化式设计迭代环融合扩散结构搜索、进化调参、代理预过滤,实现全域系统化策略搜索;
    在负载部署、资源扩缩、功耗管理三类典型数据中心任务验证,统一流水线生成策略全面超越人工专家基线,将数月策略研发周期压缩至数小时。未来可基于Atum构建持续自适应、全自动演化的数据中心调度系统。

论文资源链接

  1. 论文HTML原文:https://arxiv.org/html/2608.02569v1
  2. arXiv论文PDF:https://arxiv.org/pdf/2608.02569v1
  3. 配套仿真测试工具:VLMEvalKit同类数据中心评测框架(文中提及)
  4. 实验负载数据集:Azure Public Dataset V2、阿里微服务追踪数据集(开源下载地址见参考文献)
返回列表