AI已将数据中心转变为一个耦合约束问题,电力供应、制冷系统、冗余配置和工作负载部署现在相互关联,这意味着优化不再是一组可以并行调节的独立参数。语义数字孪生是缺失的一层,它将这些约束条件建立在共同意义的基础之上,使决策变得可计算、可验证且可管控,而非通过协商和猜测得出。
这一点至关重要,因为数据中心正面临来自供需两方面的压力。一方面,由于AI已成为现实,需求急剧增长,另一方面,由于电力和制冷资源有限,物理空间日益紧张。国际能源署(IEA)估计,2024年数据中心耗电量约为4150亿千瓦时,并预测到2030年这一数字将翻倍,达到约9450亿千瓦时。在机架层面,国际正常运行时间协会(Uptime Institute)报告称,4至6千瓦的机架仍然最为常见,但随着密集化进程的加速,7至9千瓦的机架正变得越来越普遍。
当这些压力袭来时,数据中心便不再是单纯的“设施”,而成为制约增长、运营韧性和成本的显性因素。此时,核心问题从“我们的容量是多少?”转变为一个更棘手的问题:企业能否将数据中心视为一个连贯的系统进行推理,还是仍然将其作为一堆工具来操作,这些工具定义不一致且可见性无法验证?
数据中心现已成为一个耦合系统
要实现连贯性,需认识到一个根本性转变:数据中心不再是一系列孤立的领域。数据中心管理、灾难恢复和高性能计算(HPC)之间的隐藏依赖关系日益复杂,而AI的集成则进一步加剧了这种耦合。
在耦合系统中,局部“优化”可能导致全局故障。你可能在空闲机架单元方面“状况良好”,但仍没有安全的地方放置工作负载,因为可用机架位于错误的电力路径之后、错误的制冷范围内、错误的冗余状态下,或处于错误的维护窗口期,这就是为什么许多企业最终会出现容量闲置和伪装成技术规划的政治讨论。
AI优化的表现
面对这种复杂性,行业最明显的应对方式是AI驱动的优化。谷歌和DeepMind展示了当将数据中心视为物理控制系统时,“AI优化”是什么样的。2016年,他们报告称,将DeepMind的机器学习应用于谷歌数据中心,将制冷能耗降低了多达40%,他们表示,在考虑非制冷损耗后,这相当于测试站点整体电力使用效率(PUE)开销降低了15%,并创造了该站点有史以来的最低PUE记录。
该架构值得深入探讨,因为它既展示了仅依赖遥测控制的潜力,也揭示了其局限性,他们的模型基于数千个传感器收集的历史运行数据——温度、电力、泵速、设定点等——并针对预测的未来PUE(总设施能耗除以IT能耗)进行优化,他们还训练了模型来预测运行变量,如温度和压力,以确保建议保持在安全运行约束范围内,换句话说,就是基于观察到的行为构建冷却系统及其动态的替代模型,在约束条件下持续提出更好的设定点。


闽公网安备 35020602001684号