Search

AI Data Center Design: A Practical Blueprint for 100 kW+ GPU Clusters – Español

AI data center design

Diseño de centros de datos de IA ha pasado de ser un ejercicio de ingeniería de instalaciones a convertirse en una disciplina de rendimiento de cómputo. Se prevé que el mercado mundial de centros de datos de IA crezca de USD 236.4 billion en 2025 a USD 933.7 billion en 2030, lo que supone una tasa de crecimiento anual compuesta del 31.6 %, según un análisis publicado en agosto de 2025. Las densidades de rack que alcanzaban 2-10 kW en las instalaciones tradicionales superan ahora los 100 kW en despliegues de la clase NVIDIA GB300, y los diseños de referencia de 2025 apuntan a racks de 600 kW.

¿Por qué el diseño de centros de datos de IA difiere de la planificación de instalaciones convencionales?

Las instalaciones convencionales se construyeron en torno a una TI predecible y de baja densidad. Los servidores consumían 2-10 kW por rack, la refrigeración por aire era suficiente y las cadenas eléctricas se dimensionaban con amplios márgenes. Las cargas de trabajo de IA rompen esos supuestos. Los clústeres de GPU consumen energía en ráfagas violentas y dependientes de la carga de trabajo, en lugar de cargas constantes, y generan densidades de calor que los manejadores de aire no pueden eliminar.

Según Vladimir Galabov, director sénior de investigación de Omdia, los despliegues hiperescala están experimentando un fuerte aumento de la densidad que lleva la infraestructura de las instalaciones mucho más allá de las normas históricas. Un único rack de IA de 600 kW puede consumir más electricidad en un par de horas que la que usa un hogar medio en un mes. En consecuencia, el diseño de centros de datos de IA dimensiona ahora la energía, la refrigeración, la red y la distribución a partir de la carga de trabajo de GPU, y no a la inversa a partir de normas genéricas de construcción.

¿Qué densidad de potencia debe perseguir el diseño de un centro de datos de IA?

La densidad objetivo determina todas las decisiones posteriores, por lo que debe fijarse a partir de la hoja de ruta real de GPU, no del marketing de los proveedores. La práctica del diseño de centros de datos de IA se agrupa en torno a tres niveles de densidad. Los racks empresariales tradicionales se mantienen en el rango de 10-30 kW, y la Encuesta Global de Centros de Datos 2025 del Uptime Institute señala que la mayoría de las instalaciones siguen por debajo de los 30 kW por rack. Las fábricas de IA construidas a propósito se estandarizan en racks de 50-100 kW con refrigeración líquida directa al chip.

Las arquitecturas de referencia de NVIDIA para 2025 van más allá y describen gabinetes de rack que admiten más de 500 GPU y consumen 600 kW cada uno, aproximadamente cinco veces la potencia de los racks de mayor densidad en uso hoy en día.

Elegir pronto el nivel de densidad es importante porque la carga estructural, el dimensionado del busway, la capacidad de refrigeración y la distribución de la sala dependen todos de ese número. Los diseñadores que planifican para 30 kW y descubren a mitad de proyecto un requisito de 100 kW se enfrentan a una reforma mucho más costosa que construir bien a la primera. En un diseño maduro de centro de datos de IA, cada posición de rack tiene un límite de potencia declarado, aplicado mediante PDU inteligentes y software de gestión de capacidad.

Diseño de centros de datos de IA

¿Qué arquitectura de refrigeración encaja en el diseño de un centro de datos de IA?

La refrigeración es el primer subsistema en el que fallan los supuestos tradicionales, y es donde el diseño de centros de datos de IA diverge más bruscamente de la práctica heredada. La refrigeración por aire puede soportar aumentos modestos, pero la encuesta del Uptime Institute muestra que el PUE medio apenas ha mejorado durante seis años consecutivos, limitado en parte por la infraestructura heredada. Los racks de IA de alta densidad requieren refrigeración líquida. La refrigeración líquida por placa fría cubre alrededor del 80 % del mercado de refrigeración líquida porque funciona con las arquitecturas de servidor existentes y ofrece el menor costo total de propiedad.

La refrigeración por inmersión reduce el PUE hasta aproximadamente 1.05, y se prevé que el segmento de inmersión alcance USD 5.8 billion en 2030, con una CAGR del 39 %. La presión regulatoria acelera el cambio: China exige que los nuevos megacentros de datos construidos después de 2025 alcancen un PUE no superior a 1.25, lo que hace que la refrigeración líquida sea prácticamente obligatoria. La refrigeración directa al chip es ahora estándar en los despliegues de IA de alta densidad y, a menudo, convive con la refrigeración por aire para los equipos que no son GPU. Cualquier diseño de centro de datos de IA que dependa solo del aire para las salas de GPU chocará con un techo térmico medido en megavatios.

¿Qué arquitectura de suministro eléctrico soporta de forma fiable las cargas de trabajo de IA?

El suministro eléctrico es el subsistema menos visible pero más costoso del diseño de centros de datos de IA. El consumo de las GPU no es una carga plana; oscila rápidamente a medida que comienzan y terminan los pasos de entrenamiento. La cadena eléctrica debe absorber esas fluctuaciones sin disparar las protecciones ni degradar la estabilidad de la red. Los sistemas UPS tradicionales alcanzan una eficiencia del 90-94 %, mientras que las arquitecturas de CC de alta tensión de 800 V llegan al 97 % o más y reducen el gasto de capital en aproximadamente un 20 %. La plataforma GB300 de NVIDIA muestra el resto de la historia: los bastidores de alimentación mejorados con almacenamiento de energía redujeron la demanda máxima de la red en un 30 % durante el entrenamiento del LLM Megatron.

Para tu propia instalación, esto significa especificar bastidores de alimentación con almacenamiento de batería integrado en lugar de transformadores sobredimensionados. Las unidades de batería de respaldo y los paquetes de supercondensadores se están convirtiendo en estándar a nivel de rack, con tiempos de respuesta inferiores a un milisegundo para la compensación de potencia pulsante que exige el entrenamiento de GPU. La sala eléctrica también debe dimensionarse para el nivel de redundancia que realmente se opera, no para la insignia Tier III que se declara sobre el papel. Un diseño resiliente de centro de datos de IA trata la energía como un problema de control, no como un problema de dimensionamiento.

¿Qué topología de red exigen los clústeres de GPU?

El diseño de centros de datos de IA falla en la capa de red más a menudo que en la capa de energía, porque el entrenamiento distribuido tiene requisitos brutales de ancho de banda y latencia. Las redes tradicionales leaf-and-spine, ajustadas para el tráfico web norte-sur, no pueden sostener los patrones de tráfico este-oeste de la comunicación colectiva. Los trabajos de entrenamiento mueven gradientes, activaciones y estados del optimizador entre las GPU, y la saturación de la red alarga directamente el tiempo de entrenamiento. Los clústeres de GPU modernos separan las redes scale-up y scale-out: el scale-up conecta las GPU dentro de un nodo mediante tejidos de alto ancho de banda como NVLink, mientras que el scale-out conecta los nodos mediante tejidos InfiniBand o Ethernet de 400G/800G.

McKinsey estima que los centros de datos requerirán USD 6.7 trillion en gasto de capital acumulado para 2030 para satisfacer la demanda de cómputo, y una parte significativa de ese presupuesto se destina a la infraestructura de conmutación. La regla: modela los patrones de comunicación antes de comprar los conmutadores y nunca permitas que la sobresuscripción de la red se convierta en el cuello de botella oculto. Por tanto, el diseño de centros de datos de IA debe tratar la arquitectura de red como un ciudadano de primera clase, con ratios de sobresuscripción fijados explícitamente en cada nivel.

¿Por qué el diseño de centros de datos de IA prioriza el espacio gris sobre el espacio blanco?

Las distribuciones heredadas de centros de datos asignaban la mayor parte de la superficie al white space (espacio blanco), las salas de equipos de TI, y apretaban los equipos de refrigeración y eléctricos en lo que quedaba. El diseño de centros de datos de IA invierte esa proporción. Los racks de GPU densos exigen más acondicionamiento de energía, más rechazo de calor y más distribución de líquido por metro cuadrado, por lo que el grey space (espacio gris) para los sistemas de refrigeración y eléctricos rivaliza ahora con el white space o incluso lo supera en las fábricas de IA construidas a propósito.

Implicaciones prácticas: forjados estructurales más altos para soportar los circuitos de líquido, mayor capacidad de carga de la losa para racks de 600 kW y skids de alimentación modulares desplegados de forma incremental. Si el espacio gris queda infradimensionado en la fase de diseño, la instalación choca con un techo duro sin importar cuántos racks de GPU pueda albergar físicamente el espacio blanco. Un error común en el diseño de centros de datos de IA es copiar los planos de planta heredados y solo cambiar las unidades de refrigeración, lo que no deja espacio para las tuberías, el bombeo y el rechazo de calor que requiere la refrigeración líquida.

¿Qué pasos se deben seguir al diseñar un centro de datos de IA?

Una secuencia disciplinada evita los errores más costosos. Primero, define la carga de trabajo objetivo: entrenamiento, inferencia o ambas, porque el entrenamiento consume mucha red y almacenamiento, mientras que la inferencia es sensible a la latencia. Segundo, congela la hoja de ruta de GPU y calcula el nivel de densidad de rack, el envolvente de potencia y el método de refrigeración para cada sala. Tercero, dimensiona la cadena eléctrica a partir de la carga máxima con almacenamiento intermedio y especifica bastidores de alimentación con almacenamiento de energía. Cuarto, diseña el tejido de red en torno a los patrones de comunicación medidos, separando el scale-up del scale-out. Cada una de estas decisiones pertenece a la fase inicial del diseño del centro de datos de IA, antes de verter el hormigón.

Quinto, asigna espacio gris para la distribución de líquido, el rechazo de calor y las salas eléctricas antes de finalizar las distribuciones de espacio blanco. Sexto, valida contra ASHRAE 90.4, que establece los requisitos mínimos de eficiencia para los sistemas de refrigeración y energía y ahora aborda la TI refrigerada por agua en sus adendas de 2022. Séptimo, planifica un despliegue incremental para que las primeras salas operen mientras se construyen las siguientes, un patrón cada vez más común en el diseño de centros de datos de IA. Seguir esta secuencia mantiene todo el proyecto alineado con la hoja de ruta de cómputo y evita la trampa de la reforma.

¿Qué métricas validan un diseño de centro de datos de IA?

La calidad del diseño se manifiesta en indicadores medibles, y todo diseño de centro de datos de IA debería compararse con ellos antes de que comience la construcción. El PUE sigue siendo la métrica de eficiencia más destacada, pero la encuesta del Uptime Institute descubrió que uno de cada diez cortes sigue causando una disrupción grave o severa, por lo que la ingeniería de disponibilidad merece la misma atención. Los objetivos de PUE inferiores a 1.25 son viables con refrigeración líquida, pero exigen que el componente de carga mecánica y el componente de pérdidas eléctricas de ASHRAE 90.4 se mantengan dentro de los límites de la zona climática.

La utilización del rack, medida como el rendimiento de cómputo conseguido por dólar de capex de la instalación, indica si el diseño realmente sirve a las cargas de trabajo de IA. El time-to-power, el retraso entre la instalación del rack y el funcionamiento completo de las GPU, expone los cuellos de botella en el busway, la refrigeración y la entrega de red.

Conclusión: ¿cómo debe evolucionar a continuación el diseño de centros de datos de IA?

El diseño de centros de datos de IA ya no es una optimización marginal de una plantilla existente; es una ruptura estructural con tres décadas de práctica de instalaciones. Los objetivos de densidad, la arquitectura de refrigeración, el suministro eléctrico, la topología de red y la asignación de espacio deben derivarse todos de la carga de trabajo de GPU, y el margen de error se mide en millones de dólares de cómputo inmovilizado. Las instalaciones que triunfan fijan pronto los niveles de densidad, estandarizan la refrigeración líquida, amortiguan la cadena eléctrica y validan contra los datos de ASHRAE y Uptime. Empieza el diseño del centro de datos de IA por la carga de trabajo, no por el edificio, y el resto encaja solo. 

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注