Search

AI Data Center Cooling: How to Know When Air Isn’t Enough – 中文

AI Data Center Cooling

您正站在一个功率达 130 千瓦的机架前。风扇在轰鸣。仪表盘上的 PUE 监测仪显示 1.7。而您意识到:三年前安装的风冷系统从未为这种负载而设计。

这一刻来得比大多数运维人员预期的更快。AI 工作负载正在改写热管理规则,如果您仍依赖风冷来应对 GPU 密集机架,那您既在烧钱,又在白白浪费性能。本文为您提供一个具体框架,用于评估您的基础设施是否需要转向采用液冷方案的 AI 数据中心冷却 ——以及您究竟该如何着手。

为什么您的 AI 机架密度正在超越风冷的极限

风冷在每机架约 20 千瓦处触及硬性天花板。多年来这已足够,因为您的标准服务器机架功耗仅为 5 到 8 kW。但根据 TrendForce 的数据,NVIDIA 的 GB200 NVL72 系统如今已将单机架热设计功耗推高到 130 至 140 kW。如果您将这些 GPU 部署在传统风冷设施内,您将面临热节流风险,它会悄无声息地降低您的 AI 训练吞吐量。

物理规律毫不留情,而且直接影响您。当您的机架密度超过 30 kW 时,需要移动的空气量在机械上变得不切实际。结果就是更宽的通道、更大的风管、更高的风机能耗,以及 1.5 到 1.9 之间的 PUE 值。

AI 数据中心冷却

到 2028 年,根据 Tom’s Hardware 的报道,NVIDIA 的 Feynman 架构将把每处理器的热设计功耗推高到 4,400 瓦。当您达到这种密度水平时,AI 数据中心冷却将成为您的基础设施底线要求。

驱动 AI 数据中心冷却的真实电力数据

您需要理解正在发生之事的规模。根据国际能源署(IEA)的数据,到 2030 年,数据中心将消耗全球约 4% 的电力。其中,您的 AI 加速服务器正以每年约 30% 的速度增长电力消耗——据中国经济网报道,这几乎是传统服务器 9% 增速的三倍。

高盛预计,AI 训练服务器中的液冷渗透率将从 2024 年的 15% 跃升至 2027 年的 80%。如果两年后您仍在运行风冷,您将沦为少数派。TrendForce 则单独估算,AI 数据中心冷却的采用率在 2025 年从 14% 升至 33%。这些并非渐进式的变化——它们预示着一场您无法忽视的结构性转型。

据 MarketIntelo 统计,AI 数据中心冷却市场在 2025 年达到 66 亿美元,而您的行业正以 28.7% 的复合年增长率(CAGR)迈向 2034 年的 618 亿美元。到 2024 年,液冷系统已占据更广泛冷却市场的 46%——据 Mordor Intelligence 统计——而您可以看到这一趋势正在加速。如果您负责容量规划或基础设施预算,这些数字现在就应该塑造您的采购决策。

您需要评估的液冷技术

当您开始评估 AI 数据中心冷却 方案时,有三种架构应纳入您的视野。

冷板冷却(Cold plate cooling)将金属板直接贴合在您的 CPU 和 GPU 上,冷却液在其中循环以带走热量。您可以将其作为改造方案部署——它能与您现有的空气处理基础设施共存。据 Tom’s Hardware 报道,CoolIT 展示了一种单相冷板,能够在接近 200 W/cm² 的功率密度下冷却高达 4,000 瓦;而 Accelsius 声称其两相方案可达 300 W/cm²。

浸没式冷却(Immersion cooling)将您的整台服务器浸入介电液体中。如果您选择单相,液体始终保持液态,您将受益于更低的成本——据 MGrid 统计,这一类别占据浸没式市场 80.9% 的份额。如果您需要超高密度的 AI 数据中心冷却,两相系统让液体在低温下沸腾,通过相变吸收热量,同时您的机架功耗可超过 200 kW。您的 PUE 可低至 1.02。

嵌入式冷却(Embedded cooling)将微流道直接蚀刻进芯片封装中,台积电(TSMC)目标在 2027 年前后实现商用部署。您在这三种 AI 数据中心冷却架构之间的选择,取决于您是在改造棕地(brownfield)容量,还是从零新建绿地(greenfield)集群。

匹配您的 AI 冷却策略

如果您的机架运行在 30 到 80 kW 之间,冷板直触(direct-to-chip)是您最实用的 AI 数据中心冷却方案。与风冷相比,您可以节省 30% 到 46% 的冷却能耗,PUE 介于 1.1 到 1.3 之间。您可保留现有的机架布局,避免重大结构性改动。

如果您的机架功耗突破 100 kW——而如果您在训练前沿 AI 模型,它们很可能会——浸没式冷却将成为您的底线。两相浸没式系统可为您带来 1.02 到 1.05 的 PUE,这意味着您总功率中只有不到 5% 用于冷却开销。与 Uptime Institute 给出的行业平均 PUE 1.56 相比,财务逻辑对您的运营而言已不可回避。

不妨看一个真实的部署案例:LiquidStack 建成了一个 40 兆瓦的浸没式冷却超大规模设施,实现了 92.6% 的冷却能耗节省,且所需的占地面积比同等的风冷建设少 90%。如果您正按商业地产价格付费,这种空间节省将彻底改变您的成本模型。

PUE 与 AI 数据中心冷却的财务论据

谈论 AI 数据中心冷却不可能不看 PUE,而风冷与液冷之间的差距是惊人的。采用风冷,您的设施 PUE 介于 1.4 到 1.8 之间。冷板直触将其降至 1.1 到 1.3。两相浸没式则可将其推至 1.02 到 1.08——据 MGrid 2026 年的分析。

这些数字对您的运营预算意味着什么?BOYD Corporation 的数据显示,当您将 75% 的冷却从风冷转为液冷时,总电力成本下降 27%,整体能耗下降 15.5%。对于一个按每千瓦时 0.08 美元计费的 40 兆瓦设施,您 40% 到 50% 的冷却能耗节省相当于每年 140 万至 175 万美元的运营成本削减。

华为的基准测试显示,一个采用浸没式液冷的 50,000 服务器数据中心每年可节省约 1,650 万美元的电费。而使用风冷,这些利润就白白流失了。

超大规模厂商在 AI 数据中心冷却方面的举措

在这场转型中您并不孤单。据 MarketIntelo 统计,Google、Microsoft、Meta 和 AWS 都已公开承诺其液冷路线图。您可以把 Microsoft 当作标杆——它一直在美国中西部和亚洲开展液冷试点,并计划在 2025 年让液冷成为新部署的标准——据 TrendForce 报道。如果最大的云服务商都在押注液冷方案,您的犹豫将带来竞争成本。

在印度,Submer Technologies 于 2025 年年中与中央邦(Madhya Pradesh)签署协议,开发高达 1 吉瓦的液冷 AI 数据中心容量。您还应关注日本的 KDDI,它在为边缘 AI 部署集装箱式单相浸没设备后,录得了接近 1.05 的 PUE 值。这些都是您应作为参考案例研究的实际生产部署。

监管压力正在加速您的时间表。欧盟《能源效率指令》现规定,从 2026 年起您必须报告 PUE 和用水效率(WUE)。美国多个州——包括加利福尼亚、密歇根和爱荷华——已通过您必须遵守的季度披露法规。如果您的设施以每机架 20 kW 以上的风冷基础设施运行,您面临的不仅是效率差距,更是监管责任。

您的 AI 数据中心冷却路线图

您不必明天就拆掉每一台空气处理机组。但您确实需要一个分阶段的计划。

首先,审计您当前的机架密度。如果有任何集群持续超过每机架 30 kW,请将其标记为在 12 个月内进行液冷评估。其次,评估您的水基础设施。冷板直触和浸没式系统采用闭路循环设计,与蒸发式冷却塔相比,可将您的直接耗水量减少 70% 到 90%——如果您运营在缺水地区,这一点至关重要。

第三,先试点一个小型集群。一个浸没式液槽或一机架冷板直触服务器,就能让您获得真实的运营数据,而无需承诺全面改造。您的成本约为每兆瓦 200 万至 300 万美元,因此在大规模推广前,您需要先行验证。

最后,从现在就为每一份新设施规格书内置液冷兼容性。超大规模厂商计划仅在 2026 年就向 AI 基础设施投资 6,500 亿美元,而 2027 和 2028 年投产的设施将默认采用液冷。如果您的新建项目仍围绕风冷设计,那么混凝土浇筑之前,您就已锁定了成本劣势。

对您的运营而言,转向液冷 AI 数据中心冷却已不再是”是否”的问题,而是”何时”的问题——何时您的机架密度跨越风冷失效的阈值。对大多数运行 AI 工作负载的运营商来说,这个阈值已经到来。 

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注