Search

Liquid Cooling for Servers:How to Retrofit Your Data Center – 中文

Liquid Cooling for Servers

多年来,你的数据中心一直依靠风冷运行。当每个机架功耗为 5 至 8 千瓦时,它足以胜任。如今,你的 GPU 集群要求每个机架达到 40 kW,CRAC 机组已经逼近红线。你并不孤单:Uptime Institute 报告显示,2015 年之前建成的企业数据中心中,有 68% 缺乏应对现代 AI 工作负载的制冷能力,而其中 82% 的设施租约还剩十年以上。你需要一套行之有效的服务器液冷改造方案——而且越快越好。

风冷为何力不从心

物理规律毫不留情。传统风冷的热阻为每瓦 0.5 至 2.0 摄氏度——当机架功耗为 8 至 25 kW 时足以应付。而根据 TrendForce 2025 年 8 月的研究,如今一台 NVIDIA GB200 NVL72 机架的热设计功耗高达 130 至 140 kW。风冷根本无法带走这么多热量。

你的机房 PUE 很可能在 1.4 到 1.6 之间,这意味着电费账单中近一半花在了制冷上。把风冷机架推到 25 kW 以上,你就会撞上硬墙:气流紊乱、热点频现、风扇故障成倍增加。你可能已经注意到高峰负载时服务器出现降频。这些不是偶发现象——而是制冷系统到达物理极限的表现。这正是服务器液冷改变局面的地方。

服务器液冷:你的三种选择

评估服务器液冷时,有三条路径可选:冷板式(芯片直触)、单相浸没和两相浸没。其中只有一种对改造项目具有实际意义。

冷板式(芯片直触)冷却将金属冷板直接安装在你的 CPU 和 GPU 上。水-乙二醇混合液在微通道中循环,吸收热量后输送到冷却液分配单元(CDU),再由 CDU 将热量排入机房的供水回路。服务器上的其余部件仍保持风冷。根据 ToneCooling 的基准测试,冷板式(芯片直触)的热阻可低至每瓦 0.02 至 0.10 摄氏度——比风冷好 10 到 20 倍。

单相浸没将服务器完全浸入介电冷却液中。两相浸没则使用在 50 至 60 摄氏度下沸腾的冷却液。浸没式可将 PUE 压低至 1.02,但需要定制槽体、专用机箱、冷却液处理规程,并重新设计机房。对于大多数评估服务器液冷的运营者来说,浸没式对改造而言过于激进。

冷板式 vs. 浸没式:哪种适合你

冷板式(芯片直触)支持每机架 60 至 120 kW,PUE 为 1.05 至 1.15。浸没式可承载 100 至 250 kW,PUE 为 1.01 至 1.08。从纸面上看,浸没式在能效上更胜一筹。但在现实中,冷板式(芯片直触)只需在现有机架上加装冷板、软管和一台 CDU——这些改造你的团队几周内就能掌握。浸没式则需要清空机房、以每升 35 至 80 美元的价格灌入介电冷却液,并让员工接受化学品安全培训。

《The Cooling Report》在 2026 年 2 月指出,冷板式(芯片直触)占据液冷市场 47% 的份额,而浸没式仍是小众路线,复合年增长率(CAGR)为 25%。Dell、HPE、联想和 Supermicro 均提供工厂集成的冷板式(芯片直触)服务器,采用标准 19 英寸机架。浸没式服务器则大多是定制产品。

单就改造而言,451 Research 发现,液冷改造能以新建方案 20% 的成本实现其 70% 的性能。Introl 2025 年 12 月的一项研究记录了某制药公司将一座 2008 年建成的机房改造为可容纳 800 块 NVIDIA H100 GPU 的设施,花费 420 万美元——而新建需要 3500 万美元。工期从 18 个月缩短到 4 个月。这正是冷板式服务器液冷主导改造讨论的原因。

你的数据中心准备好迎接液冷了吗

在下单冷板之前,先评估三个因素:电力基础设施、水回路容量和楼板承重。加装服务器液冷通常会使每个机架增重 15 至 25 公斤。大多数按每机架 800 至 1,200 公斤设计的防静电地板无需加固即可承受——但请务必与结构工程师确认。

水回路是更大的变量。CDU 将热量排入你的冷凝水系统。如果供水温度在 10 至 15 摄氏度之间,说明你已经具备条件。如果水温偏高——这在老旧建筑中很常见——你可能需要额外的冷水机组或一台液-气 CDU。TrendForce 证实,液-气系统之所以成为主流的过渡架构,正是因为它能与现有基础设施配合工作。

服务器液冷

电力是第三项检查。每机架 40 至 60 kW 的 GPU 集群需要相应规格的配电系统。许多 2015 年前的机房是按每机架 5 至 10 kW 设计的。请将电力升级与服务器液冷改造同步规划。只做其一而忽略另一个,会制造出新的瓶颈。

你的改造路线图

第一阶段:试点。挑选两到四个机架,在温度最高的 GPU 服务器上安装冷板,接入一台 CDU,运行 30 天。监测冷却液进出口温度、压降和部件温度。在规模化之前,你要确保性能稳定、零泄漏。

如果试点期间出现流量不稳定,监测工具会实时采集整个回路的热数据,帮你精确定位压降或热量积聚发生在哪里。

第二阶段:扩展至完整机柜组。安装带快速接头的机架级歧管。根据 TrendForce 的数据,CPC、Parker Hannifin、Danfoss 和 Staubli 均为经认证的 NVIDIA GB200 供应商。额定 10,000 次插拔循环的快速接头是底线要求——它们让你无需排空回路即可更换服务器。

第三阶段:全面部署。此时你的团队应当已经熟练掌握了冷却液补充、CDU 滤芯更换和泄漏检测。《中国液冷服务器市场报告》显示,冷板方案按营收计算占据液冷市场 80% 以上的份额,因为它能与现有运维体系无缝集成,无需掌握全新技能。

服务器液冷要花多少钱

根据厂商基准数据,冷板式(芯片直触)改造的资本成本为每个机架 5,000 至 15,000 美元。100 个机架的部署规模,制冷硬件成本为 50 万至 150 万美元。仅槽体和冷却液一项,浸没式就要花费每机架 20,000 至 50,000 美元。

运营节省彻底改变了这笔账。从 PUE 1.5 的风冷切换到 PUE 1.2 的服务器液冷,制冷能耗可降低 30% 至 40%。2026 年 5 月发布的一份中国行业改造指南估算,一座 10 MW 的数据中心从风冷改造为冷板式服务器液冷后,每年可节省约 2400 万元人民币电费。即使按资本成本上限计算,投资回收期也远低于 24 个月。

第二个好处:根据热可靠性研究,更低的结温可将 CPU 和 GPU 的寿命延长两到三倍。如果你的 GPU 集群价值数百万美元,这种可靠性提升对服务器液冷的商业论证至关重要。

烧光预算的常见错误

跳过水回路评估是最昂贵的错误。如果建筑水回路无法吸收 CDU 的热负荷,你事后只能加装干冷器——既推迟工期,又让预算增加 30% 至 50%。购买硬件之前,请与暖通机械工程师一起为回路容量建模。

把改造单纯当作 IT 项目是另一个陷阱。服务器液冷涉及机房设施、电气、管道和运维。如果只由 IT 团队单独推进,你会在调试阶段才发现水温高了 5 度,或者地漏位置装错了。从第一天起就要让设施和运维团队参与进来。

忽视冷却液质量是三大错误中的最后一个。乙二醇-水混合液会随时间降解,产生腐蚀性酸,侵蚀冷板的微通道。你需要制定过滤维护计划,并每季度进行一次冷却液化学检测。更换一块被腐蚀的冷板,远比安装一套过滤系统昂贵。

服务器液冷:你的新常态

服务器液冷改造完成后,服务器风扇会减速甚至完全停转。数据机房噪音下降 20 至 30 dB。无论工作负载如何变化,部件温度都稳定在 2 至 3 摄氏度的区间内。PUE 降至 1.2 以下,每月电费账单缩减三分之一。

你还获得了密度余量:风冷下上限 15 kW 的机架,现在可以承载 50 至 80 kW。你可以整合工作负载、释放机房空间、推迟新建项目。TrendForce 预测,服务器液冷在 AI 数据中心中的渗透率将从 2024 年的 14% 跃升至 2025 年的 33%,并继续攀升。现在动手改造,你就能领先一步,而不是等竞争对手都已转型后才手忙脚乱地追赶。

窗口期已经打开,但正在关闭。NVIDIA 的路线图指向 2026 年 600 kW 的机架。未来五年能够生存下来的数据中心,将是那些在 2025 年或 2026 年就采用服务器液冷的设施。你的数据中心应该成为其中之一。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注