Search

AI Data Center Design: A Practical Blueprint for 100 kW+ GPU Clusters – 中文

AI data center design

AI 数据中心设计已从设施工程问题转变为计算性能学科。根据 2025 年 8 月发布的分析,全球 AI 数据中心市场预计将从 2025 年的 USD 236.4 billion 增长至 2030 年的 USD 933.7 billion,复合年增长率为 31.6%。传统设施中 2-10 kW 的机柜密度,如今在 NVIDIA GB300 级别的部署中已超过 100 kW,2025 年的参考设计更指向 600 kW 机柜。

AI 数据中心设计与传统设施规划有何不同?

传统设施围绕可预测、低密度的 IT 负载而建:服务器每机柜功耗为 2-10 kW,风冷即可满足需求,供配电链路留有充足的余量。AI 负载打破了这些假设。GPU 集群的功耗呈剧烈、随负载而变的突发特征,而非平稳负载,其产生的热量密度超出了空调机组的散热能力。

据 Omdia 高级研究总监 Vladimir Galabov 介绍,超大规模部署的密度正在急剧攀升,将设施基础设施推向远超历史常规的水平。一个 600 kW 的 AI 机柜在数小时内消耗的电量,比普通家庭一个月的用电量还多。因此,AI 数据中心设计如今从 GPU 负载倒推供电、制冷、网络和布局的规模,而非从通用建筑标准顺推。

AI 数据中心设计应以何种功率密度为目标?

目标密度决定了后续所有决策,因此必须依据真实的 GPU 路线图来设定,而不是厂商宣传。AI 数据中心设计实践大致分为三个密度层级。传统企业机柜仍处于 10-30 kW 区间,Uptime Institute《2025 年全球数据中心调查》指出,大多数设施的单机柜功率仍低于 30 kW。专建的 AI 工厂则以 50-100 kW 机柜搭配芯片直触式液冷为标准。

NVIDIA 的 2025 参考架构更进一步,描述了支持 500+ GPU、单柜功耗达 600 kW 的机柜方案,功耗约为当今最高密度机柜的五倍。

尽早确定密度层级至关重要,因为结构荷载、母线槽规格、制冷容量和机房布局都会由这一数值逐级决定。如果设计师按 30 kW 规划,却在项目中途发现实际需求是 100 kW,返工改造的成本将远高于一次建对。在成熟的 AI 数据中心设计中,每个机柜位置都有明确的功率上限,并通过智能 PDU 和容量管理软件加以落实。

AI 数据中心设计

AI 数据中心设计应采用哪种制冷架构?

制冷是传统假设最先失效的子系统,也是 AI 数据中心设计与传统实践分歧最大的地方。风冷尚可支撑小幅提升,但 Uptime Institute 的调查显示,平均 PUE 已连续六年几乎没有改善,部分受制于传统基础设施。高密度 AI 机柜需要液冷。冷板式液冷约占液冷市场的 80%,因为它兼容现有服务器架构,且总拥有成本最低。

浸没式冷却可将 PUE 降至约 1.05,浸没式液冷细分市场预计到 2030 年将达到 USD 5.8 billion,复合年增长率为 39%。监管压力加速了这一转变:中国要求 2025 年后新建的超大规模数据中心 PUE 不得高于 1.25,液冷实际上已成为强制要求。芯片直触式冷却是高密度 AI 部署的标配,通常与用于非 GPU 设备的风冷并存。任何仅依赖风冷支撑 GPU 机房的 AI 数据中心设计,都会撞上以兆瓦计的热量天花板。

哪种供配电架构能可靠支撑 AI 负载?

供配电是 AI 数据中心设计中最不起眼却最昂贵的子系统。GPU 功耗并非平稳负载,它会随训练步骤的开始和结束而快速波动。供配电链路必须吸收这些波动,既不能触发保护跳闸,也不能损害电网稳定性。传统 UPS 系统的效率为 90-94%,而 800V 高压直流架构可达到 97% 甚至更高,并将资本支出削减约 20%。NVIDIA 的 GB300 平台展示了故事的另一面:增强储能电源架在训练 Megatron LLM 时将电网峰值需求降低了 30%。

对您自己的设施而言,这意味着应选用内置电池缓冲的电源架,而不是容量过大的变压器。备用电池单元和超级电容器组正成为机柜级标配,其响应时间低于一毫秒,可满足 GPU 训练所需的脉冲功率补偿。配电间还必须按照实际运行的冗余等级来设计,而不是按纸面上宣称的 Tier III 等级。富有韧性的 AI 数据中心设计,应把电力当作控制问题,而非容量计算问题。

GPU 集群需要什么样的网络拓扑?

AI 数据中心设计在网络层的失败频率高于电力层,因为分布式训练对带宽和时延的要求极为严苛。为南北向 Web 流量调优的传统叶脊(leaf-and-spine)网络,无法支撑集合通信产生的东西向流量模式。训练任务需要在 GPU 之间传输梯度、激活值和优化器状态,网络饱和会直接拉长训练时间。现代 GPU 集群将纵向扩展(scale-up)与横向扩展(scale-out)网络分开:scale-up 通过 NVLink 等高带宽互联连接节点内的 GPU,scale-out 则通过 InfiniBand 或 400G/800G 以太网互联连接各节点。

麦肯锡估计,为满足计算需求,到 2030 年数据中心的累计资本支出将达 USD 6.7 trillion,其中相当一部分预算流向交换基础设施。规则是:在购买交换机之前先对通信模式建模,绝不让网络超售比成为隐形瓶颈。因此,AI 数据中心设计必须把网络架构视为头等要素,并在每一层明确设定超售比。

为什么 AI 数据中心设计优先考虑灰空间而非白空间?

传统数据中心布局将大部分建筑面积分配给白空间(IT 设备机房),把制冷和电气设备挤进剩余空间。AI 数据中心设计颠倒这一比例。高密度 GPU 机柜每平方米需要更多的电力调节、散热和液体分配,因此在专建的 AI 工厂中,用于制冷和电气系统的灰空间如今已与白空间相当,甚至超过白空间。

实际影响包括:更高的结构楼层以支撑液体环路、针对 600 kW 机柜的更强楼板荷载,以及逐步部署的模块化电源撬块。如果灰空间在设计阶段预留不足,无论白空间能物理容纳多少 GPU 机柜,设施都会触及硬性天花板。AI 数据中心设计中的一个常见错误是照搬传统平面布局、只更换制冷机组,结果没有为液冷所需的管道、泵和散热设备留出空间。

设计 AI 数据中心应遵循哪些步骤?

严谨的流程能避免代价最高的错误。首先,明确目标负载:训练、推理还是两者兼顾,因为训练对网络和存储的要求高,而推理对时延敏感。其次,锁定 GPU 路线图,并计算每个机房的机柜密度层级、功率包络和制冷方式。第三,按含缓冲的峰值负载设计供配电链路,并选用储能电源架。第四,围绕实测的通信模式设计网络架构,将 scale-up 与 scale-out 分开。这些决策都应在浇筑混凝土之前、即 AI 数据中心设计的早期阶段完成。

第五,在确定白空间布局之前,为液体分配、散热和配电间预留灰空间。第六,对照 ASHRAE 90.4 进行验证——该标准规定了制冷和供电系统的最低效率要求,并在 2022 年增补版中纳入了水冷 IT 设备。第七,规划分阶段部署,让先建成的机房投入运行,同时继续建设后续机房,这一模式在 AI 数据中心设计中越来越普遍。遵循这一流程,可确保整个项目与计算路线图保持一致,并避开返工改造的陷阱。

哪些指标可以验证 AI 数据中心设计?

设计质量体现在可量化的指标上,任何 AI 数据中心设计在动工前都应以这些指标为基准进行对标。PUE 仍是首要的效率指标,但 Uptime Institute 的调查发现,仍有十分之一的宕机会造成严重或重大影响,因此可用性工程同样值得重视。采用液冷时,PUE 低于 1.25 的目标是可行的,但要求 ASHRAE 90.4 中的机械负载分量和电气损耗分量保持在气候区限值以内。

机柜利用率——以每美元设施资本支出所实现的计算吞吐量来衡量——可以判断设计是否真正服务于 AI 负载。通电时间(time-to-power),即从机柜安装到 GPU 完全运行之间的延迟,则能暴露母线槽、制冷和网络交付中的瓶颈。

结论:AI 数据中心设计下一步应如何演进?

AI 数据中心设计不再是既有模板上的边际优化,而是对三十年设施实践的结构性突破。密度目标、制冷架构、供配电、网络拓扑和空间分配都必须源于 GPU 负载,容错空间则以数百万美元的闲置算力来衡量。成功的设施会尽早锁定密度层级、标准化液冷、为供配电链路配置缓冲,并对照 ASHRAE 和 Uptime 的数据进行验证。从负载而非建筑出发开始 AI 数据中心设计,其余一切便会水到渠成。 

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注