La refrigeración líquida para HPC no es una tecnología monolítica única. Es una familia de enfoques de gestión térmica que utilizan un medio líquido —normalmente una mezcla de agua y glicol o un fluido dieléctrico— para eliminar el calor de los componentes informáticos de alto rendimiento de forma mucho más eficiente que el aire.

Cuando se miran los números, la física habla por sí sola: el agua tiene aproximadamente 3,500 veces la capacidad calorífica volumétrica del aire, según los principios fundamentales de la ingeniería térmica. Sus GPU de última generación generan un calor que el aire por sí solo no puede eliminar con la suficiente rapidez. Por eso la refrigeración líquida para HPC está pasando rápidamente de ser una solución de nicho a una necesidad.
Según TrendForce, se prevé que la penetración mundial de la refrigeración líquida en los centros de datos salte del 14% en 2024 al 33% en 2025. No está apostando por una tecnología experimental; se está alineando con un mercado que está duplicando su huella de refrigeración líquida en un solo año.
El propio mercado de la refrigeración líquida para centros de datos creció de $4.75 mil millones en 2024 a $5.47 mil millones en 2025 y se prevé que alcance los $11.18 mil millones en 2030, con una CAGR del 15.31%, según ResearchAndMarkets. Para su planificación, lo que importa es que la cadena de suministro de equipos para la refrigeración líquida de HPC se está expandiendo con rapidez y que los primeros adoptantes se están asegurando los mejores plazos de despliegue.
El punto de inflexión de la densidad de sus racks
Necesita un umbral claro para actuar. Peter Huang, presidente mundial del negocio de gestión térmica de Castrol, ofrece un punto de referencia práctico citado por China Daily: cuando la potencia de su rack alcanza los 70 a 80 kW, la refrigeración híbrida sigue siendo posible, pero más allá de 100 kW, la refrigeración por aire resulta ineficaz y la refrigeración líquida para HPC se convierte en su única vía viable. Si examina su hoja de ruta de GPU, este umbral se acerca rápidamente.
La GPU Blackwell B200 de NVIDIA tiene una potencia de diseño térmico de 1,200W por chip, mientras que la Blackwell Ultra B300 la eleva a 1,400W. Cuando instala estas GPU en una configuración GB200 NVL72, la demanda de potencia por rack alcanza los 120 kW. Sus instalaciones refrigeradas por aire existentes nunca fueron diseñadas para esto.
El consenso del sector, recogido por múltiples empresas de ingeniería de centros de datos, es claro: si la potencia de su rack supera los 30 kW, debe empezar a planificar ya su arquitectura de refrigeración líquida para HPC, en lugar de esperar a que la limitación térmica le obligue a hacerlo.
Refrigeración directa al chip: su camino más rápido
La refrigeración directa al chip (DTC) es su punto de entrada más pragmático a la refrigeración líquida para HPC. Este enfoque coloca placas frías directamente sobre sus CPU y GPU, haciendo circular el refrigerante por microcanales para absorber el calor en su origen. El resto de componentes de sus servidores siguen utilizando flujo de aire, lo que significa que no necesita rediseñar toda su instalación desde el primer día.
Según GBC Engineers, la DTC suele ser muy adecuada para racks en el rango de 30 a 100 kW, exactamente el tramo en el que la mayoría de los operadores se encuentran entrando ahora mismo.
Para usted, como operador, las cifras de energía son convincentes. Los sistemas DTC suelen alcanzar un PUE de entre 1.03 y 1.15, según los puntos de referencia de ingeniería de GBC Engineers. Puede desplegar la DTC en actualizaciones por fases, añadiendo racks refrigerados por líquido a medida que crecen sus cargas de trabajo de alta densidad.

Los acoplamientos de desconexión rápida permiten a sus equipos de mantenimiento gestionar los servidores con los flujos de trabajo habituales basados en racks, manteniendo bajo control los costos de recualificación. La CDU (unidad de distribución de refrigerante) aísla el circuito de los servidores del circuito de agua del edificio, protegiendo su hardware de TI de las fluctuaciones de presión y de los trabajos de mantenimiento.
Lo que debe vigilar: la detección de fugas, la calidad de las conexiones y el control de la química del refrigerante pasan a formar parte de sus operaciones diarias. Pero para la mayoría de los centros de datos existentes, la DTC ofrece el mejor equilibrio entre ganancia de rendimiento y continuidad operativa de todas las opciones de refrigeración líquida para HPC disponibles hoy en día.
Refrigeración por inmersión: cuando su densidad exige más
Si su hoja de ruta incluye densidades de rack sostenidas por encima de 100 kW, la refrigeración por inmersión merece su atención como el siguiente nivel de la refrigeración líquida para HPC. Aquí, las placas de sus servidores se sumergen en un fluido dieléctrico que absorbe el calor de los procesadores, la memoria y la electrónica de potencia de forma simultánea. La inmersión monofásica mantiene el fluido en estado líquido durante toda la operación, mientras que la inmersión bifásica aprovecha un proceso de ebullición para lograr tasas de transferencia de calor aún mayores.
Con la inmersión, su PUE puede bajar hasta 1.02 a 1.05, según los puntos de referencia de GBC Engineers. Pero debe sopesar esto frente a un mayor esfuerzo operativo: los tanques de inmersión requieren nuevos cálculos de carga de suelo, procedimientos de control y reposición de fluido, verificación de compatibilidad de materiales y condiciones de garantía revisadas por parte de los OEM de sus servidores. Esta vía es la más adecuada para sus campus de IA greenfield o despliegues de HPC contenerizados, donde puede planificar el edificio y el modelo operativo en torno a la tecnología desde el primer día.
Si está realizando una remodelación brownfield (instalaciones existentes), la inmersión añade una complejidad que puede no justificar la mejora incremental de PUE frente a un sistema DTC bien diseñado.
El costo real de retrasar su transición a la refrigeración líquida para HPC
Puede que se sienta tentado a exprimir un año más a su infraestructura refrigerada por aire. Pero cuando se tienen en cuenta la limitación térmica, la economía se vuelve en contra de la demora. Las GPU que limitan su rendimiento para protegerse pierden entre un 15% y un 30% de su capacidad de cómputo, según la intensidad de la carga de trabajo y las condiciones ambientales.
Si está ejecutando un clúster de 100 GPU que cuestan $30,000 cada una, esa pérdida de rendimiento se traduce en millones de dólares en capacidad de cómputo inutilizada que ya ha pagado.
Sus costos de energía cuentan una historia paralela. El PUE medio nacional de los centros de datos de China se situó en 1.46 en 2024, según la Academia China de Tecnología de la Información y las Comunicaciones. Si consigue reducir su PUE de 1.46 a 1.10 con la refrigeración líquida para HPC, el ahorro de electricidad en una instalación de tamaño medio puede alcanzar cientos de miles de dólares al año. Y esto es antes de tener en cuenta el beneficio de la densificación: puede empaquetar más capacidad de cómputo en menos metros cuadrados, aplazando o eliminando por completo su próxima ampliación del edificio.
De la planificación a la producción: su hoja de ruta de refrigeración líquida para HPC
1.Auditoría realista de la carga.
Trace un mapa de la distribución de potencia actual de sus racks y superponga su plan de adquisición de GPU para los próximos 18 a 24 meses. Si su densidad máxima por rack superará los 30 kW dentro de ese periodo, la planificación de su transición de refrigeración debe empezar ahora, no cuando llegue el hardware.
2.Un despliegue piloto
Ponga en marcha un pequeño clúster —de cuatro a ocho racks refrigerados por líquido— y mida el PUE real, las temperaturas del refrigerante y los procedimientos de mantenimiento en comparación con su entorno base refrigerado por aire. Muchos operadores comprueban que el aprendizaje práctico de un piloto saca a la luz problemas de integración que ningún libro blanco de un proveedor le contará: conflictos de trazado de tuberías, restricciones de ubicación de la CDU o carencias de formación en su equipo de instalaciones. Estas primeras lecciones son las que le permiten escalar la refrigeración líquida para HPC a lo largo de todo su parque de instalaciones sin repetir errores costosos.
3.Selección de proveedores
Al evaluar a los socios de equipos, exija datos cuantificados: densidad de potencia por rack soportada, mejora de PUE certificada, intervalos de mantenimiento, disponibilidad de piezas de repuesto y mecanismos de contención de fugas. Si le resulta difícil comparar afirmaciones de la competencia o necesita placas frías, CDU y colectores de rack (manifolds) que se integren limpiamente con su infraestructura existente, proveedores de equipos como SOETECK pueden ayudarle a alinear las especificaciones de los componentes con su perfil real de carga térmica y las limitaciones de sus instalaciones. Las decisiones correctas sobre hardware en esta etapa determinan si su despliegue de refrigeración líquida para HPC se mantiene en los plazos y dentro del presupuesto.
Sus próximos pasos antes de que la refrigeración líquida para HPC se convierta en un cuello de botella
Está operando en una ventana en la que los primeros adoptantes se están asegurando sus cadenas de suministro y construyendo el músculo operativo que los rezagados se esforzarán por replicar. IDC proyecta que el mercado chino de servidores con refrigeración líquida crecerá a una tasa anual compuesta del 46.8% de 2024 a 2029, hasta alcanzar los $16.2 mil millones. Esa trayectoria de crecimiento significa que los plazos de entrega de equipos, la disponibilidad de técnicos cualificados y la atención de los proveedores se inclinarán cada vez más hacia los compradores comprometidos.
Sus acciones inmediatas son sencillas: audite la densidad de sus racks, haga las cuentas de PUE de su instalación actual y ponga en marcha un piloto. La refrigeración líquida para HPC no es una consideración de futuro: es la decisión de infraestructura que determina si su próxima inversión en GPU ofrece el rendimiento por el que pagó o se ve limitada hasta caer en la mediocridad.
发表回复