Search

Why Your Next CDU for Data Center Will Make or Break AI Performance – 中文

CDU for data center

数据中心CDU是数据中心液冷系统的核心换热模块。它使冷却液在冷板中循环,冷板直接从CPU和GPU捕获热量,然后将热量传递给设施的主冷却回路。

在选择数据中心CDU部署方案时,运维人员必须审慎面对复杂的技术规格、架构选型与运维要求。本指南提供了一套系统化的框架,帮助您为特定环境选择合适的数据中心CDU。

数据中心CDU

第1步:评估热容量与功率密度需求

热容量是任何数据中心CDU的基石。您的CDU必须能够处理系统的总设计功率——即服务器和GPU所产生的全部热量。按照经验法则,规划时应考虑功率密度最高机架的热负荷,以及每个计算舱的总负荷。

现代CDU的容量跨度极大。对于中小规模部署,机架式和行间CDU通常可处理70 kW至600 kW;设施级设备单台覆盖2 MW至4 MW,而超大规模级CDU单模块可达10 MW甚至更高——Carrier近期还推出了面向超大规模数据中心的1.3 MW至5 MW CDU。

在确定数据中心CDU的规格时,不仅要考虑当前的热负荷,还要考虑预期的未来增长。AI工作负载的强度提升很快,而重新改造冷却系统的成本远高于初期就做超额配置。

第2步:计算流量与压头

流量与冷却性能直接相关。现代AI和HPC集群对流量的要求比以往任何时候都高——通常每千瓦热量需要每分钟1.5至2升的流量。低估流量需求会导致散热不足和热节流,直接影响GPU性能和训练时长。

CDU的泵必须产生足够的压头,将冷却液推送到系统中的每一个回路、弯管和冷板。系统设计人员常常低估压降,尤其是在改造项目中——原有管道配置并非为液冷而设计。

第3步:选择液-液CDU还是液-气CDU

CDU通常分为两大架构:

液-液(L2L)CDU 利用换热器将IT冷却回路的热量传递给设施的冷冻水系统。它们最适合部署在已有冷冻水基础设施的大规模或HPC数据中心。L2L CDU冷却效率更优,但需要设施水系统以及适当的水处理规程。

液-气(L2A)CDU 通过内置风机和盘管将热量直接排入数据中心的室内空气。它们适合规模较小的部署或没有冷冻水条件的设施,但会增加数据大厅的热负荷。在选择液-气(L2A)数据中心CDU时,请注意它会升高机房的室内温度。

第4步:按部署位置评估CDU类型

除了换热方式之外,CDU还按其在设施内的安装位置进行分类:

机架式CDU 直接安装在单个服务器机架内,为该机柜提供专属冷却。它们是高密度机架或无法进行行级集成的改造场景的理想选择。Vertiv的CoolChip CDU 70和CDU 100正是这一类别的代表,专为AI基础设施而设计。

行间CDU 安装在冷/热通道布局中的机架之间,单台设备即可服务多个机架。这是企业AI集群最常见的部署模式。对大多数新项目而言,行间数据中心CDU在密度与可维护性之间实现了最佳平衡。

第5步:了解单相与两相技术

单相直接芯片(direct-to-chip)冷却目前是AI数据中心的主流选择。在此架构中,冷却液从处理器吸收热量,以液态返回CDU进行冷却并再次循环。该技术成熟、广为人知,并拥有广泛的供应商生态系统支持。

两相直接芯片冷却则是一种新兴的替代方案。冷却液在吸收热量时由液态变为气态,随后在CDU处冷凝回液态。相变带来了显著更高的热传输能力,同时所需流量更低、泵能耗更少。然而,两相系统也会带来更高的成本和法规方面的考量,尤其是关于制冷剂及其全球变暖潜能值的问题。

数据中心CDU

对当今大多数企业部署而言,单相液-液(L2L)CDU仍然是最安全、最具成本效益的数据中心CDU选择。两相技术最适合超高密度的AI和HPC环境——在这些环境中,每一瓦的冷却效率都至关重要,资本预算也能容纳专用基础设施。

第6步:明确冗余与可靠性要求

N+1冗余——即在满足全部热负荷所需数量之外再增加一台CDU——已成为冷却系统设计的行业标准最低要求。这种方案可在组件故障、计划性维护或负荷变化期间保持持续运行。对于关键任务型AI工作负载,运维人员越来越多地指定2N CDU配置,尽管这会带来显著的空间和资本成本。

除了单元级冗余之外,还应寻找配备冗余泵(N+1或2N配置)、冗余过滤器与传感器以及双路供电的数据中心CDU。采用开放式框架设计、让泵、过滤器和控制部件易于检修的CDU,可减少维护期间的停机时间。

第7步:规划可持续性与长期可扩展性

评估CDU时,要考虑对更高出水温度的支持。可在最高40°C冷却液温度下运行的系统能最大化自然冷却时间,降低冷水机组能耗,并支持区域供热等应用的热量再利用。热量回收能力正迅速从可选功能变为必备要求,尤其是在推行碳定价或设有激进可持续发展目标的地区。

可扩展性同样需要未雨绸缪。数据中心CDU市场增长迅猛,直接液冷正以约20%至30%的复合年增长率(CAGR)增长,预计到2029年市场规模将接近60亿美元。这一快速增长已吸引约40家厂商进入CDU领域,从全球巨头到细分领域专家不一而足。虽然竞争推动创新,但也带来了供应商锁定或资产搁浅的风险。

所选的数据中心CDU应具备模块化扩展路径、开放式控制架构,并兼容多种冷却液类型。冗余容量设计让您无需更换整套冷却基础设施即可扩展机架密度。请向供应商索取与您计划设施规模相当的参考部署案例,并核实所在地区长期备件供应与服务支持情况。

结语:AI、HPC与CDU的未来

AI训练负载会不可预测地激增和波动。GPU性能可能快速上升或下降,产生即时的温度尖峰。AI环境中的CDU必须持续调节泵速、流量和阀门位置,以均匀分配热负荷。这需要先进的控制逻辑,而不仅仅是更大的泵。

HPC集群往往是设施中密度最高的部署。对于这类环境,建议为每个计算舱配备专用CDU,而不是多个舱共用设备。这种方式能够隔离热故障域、简化故障排查,并使冷却容量与具体工作负载特性相匹配。

请记住:数据中心CDU不只是一台带换热器的泵,它是将冷却液从一种介质转变为可管理资源的智能层。选择正确的数据中心CDU部署方案,是您在AI时代将要做出的最重大的基础设施决策之一。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注