En bref
En 2024, un rack qui accueille 72 GPU B200 (configuration NVL72 de Nvidia) dissipe 120 kilowatts en continu — soit l’équivalent de 60 cuisinières électriques allumées dans un volume de 60 cm × 120 cm. L’air ne peut physiquement pas évacuer cette chaleur. L’eau, elle, le peut : sa capacité à transporter l’énergie thermique est 3 500 fois supérieure à celle de l’air à volume égal. Ce fait de physique explique pourquoi les hyperscalers (Microsoft, Meta, Google, CoreWeave) basculent massivement vers le refroidissement liquide — et pourquoi ce basculement est irréversible pour les charges IA haute densité.
Cet article décrit les mécaniques thermiques concrètes : pourquoi l’air échoue au-delà d’un seuil, comment fonctionnent les quatre grandes familles de refroidissement (air, rear-door, direct-to-chip, immersion single- et two-phase), comment mesurer l’efficacité avec les métriques PUE et WUE, et quels sont les risques opérationnels réels. Il ne couvre ni la consommation électrique globale des datacenters (→ Datacenters et énergie), ni l’empreinte carbone ou hydrique globale du cycle de vie IA (→ IA et environnement).
Comprendre le problème : quand la physique impose ses règles
La trajectoire de densité puissance
Pendant quinze ans, les équipes datacenter ont optimisé un même système : souffler de l’air froid sous les serveurs, laisser la chaleur monter, la capturer en allée chaude. En 2010, un rack standard dissipait 4 à 10 kW. En 2020, les serveurs H100 DGX franchissaient les 20 à 40 kW. En 2024, le rack GB200 NVL72 atteint 120 à 140 kW.
| Période | Puissance typique par rack | Régime thermique |
|---|---|---|
| 2010-2015 | 4-10 kW | Air suffisant |
| 2015-2020 | 10-20 kW | Air optimisé (allées chaudes/froides) |
| 2020-2023 | 20-40 kW (H100 DGX) | Seuil de basculement vers le liquide |
| 2024-2026 | 120-140 kW (GB200 NVL72, Blackwell Ultra) | Liquide obligatoire |
Source : Tom’s Hardware, « The data center cooling state of play (2025) ».
Cette progression de densité n’est pas un choix — elle est imposée par la loi de Moore appliquée aux accélérateurs IA : chaque nouvelle génération de GPU comprime plus de transistors dans le même boîtier et dissipe davantage de watts. Le rack NVL72 regroupe 72 GPU B200 et 36 processeurs Grace dans un volume d’environ 42 unités d’armoire.
L’impasse physique de l’air
Imaginez essayer de refroidir une forge à l’aide d’un ventilateur de bureau. L’air peut transporter un peu de chaleur, mais pas assez vite pour une source aussi intense. C’est exactement la situation des racks IA haute densité face au refroidissement par convection forcée.
La cause est mesurable : la capacité calorifique volumique de l’air à 20°C est d’environ 1 200 joules par litre par degré Kelvin. Celle de l’eau est de 4 180 000 joules dans les mêmes conditions — soit un rapport de 3 483.
En clair : pour évacuer la même quantité de chaleur, l’air doit circuler 3 500 fois plus vite que l’eau, ou en quantité 3 500 fois plus grande. À 120 kW par rack, les vitesses d’air requises dépassent 15 m/s — incompatibles avec une infrastructure bâtimentaire fermée, sans parler du bruit et des contraintes mécaniques sur les équipements.
Cas concret NVL72 : NVIDIA impose une architecture de refroidissement liquide avec une unité de distribution de liquide (Coolant Distribution Unit, CDU) externe de 150 à 200 kW de capacité, un débit minimum de 2 à 3 litres par minute par module (soit environ 80 litres par minute au total), et une température d’entrée du liquide comprise entre 20 et 45°C. (Source : ToneCooling, NVIDIA GB200 NVL72 Cooling Requirements, 2024.)
Le basculement de marché
Ce déterminisme physique se traduit en chiffres de marché : les systèmes à base liquide représentent 46 % du marché mondial du refroidissement datacenter en 2024, contre environ 10 % en 2020. Le marché du refroidissement liquide datacenter est passé de 1,5 milliard de dollars en 2024 à une projection de 7 milliards de dollars pour 2029. (Sources : Tom’s Hardware 2025 ; Dell’Oro Group, 2024.)
Les quatre familles de refroidissement
Il existe un continuum de solutions, du plus simple au plus sophistiqué. Chaque famille répond à une plage de densité et s’accompagne de ses propres contraintes d’infrastructure.
Vocabulaire de base
- Convection forcée : déplacement d’un fluide (air ou liquide) pour transporter la chaleur d’un point à un autre.
- Capacité calorifique : quantité d’énergie qu’un fluide peut absorber par unité de volume et de degré de température. Plus elle est élevée, plus le fluide est efficace comme caloporteur.
- CDU (Coolant Distribution Unit) : unité de distribution de liquide caloporteur, interface entre le circuit primaire (côté serveurs) et le circuit secondaire (côté bâtiment/refroidisseur).
- PUE (Power Usage Effectiveness) : ratio énergie totale datacenter / énergie consommée par les serveurs seuls. Un PUE parfait = 1,0.
- WUE (Water Usage Effectiveness) : litres d’eau consommés par kilowattheure d’énergie IT.
Famille 1 — Air cooling (< 40 kW par rack)
Le refroidissement par air est le régime historique. L’infrastructure de base : des unités de conditionnement d’air (CRAC — Computer Room Air Conditioner, ou CRAH — Computer Room Air Handler) soufflent de l’air froid sous plancher surélevé, les serveurs le traversent, l’air chaud monte vers l’allée chaude. Le free cooling — échangeurs air-air utilisant l’air extérieur froid — améliore significativement l’efficacité dans les régions tempérées.
Performances : PUE atteignable entre 1,2 et 1,4 en climat favorable (datacenter en zone froide), 1,5 à 1,8 en région chaude sans free cooling.
Limite : physiquement inadapté au-delà de 40 à 50 kW par rack dans des clusters denses. Encore pertinent pour les serveurs standard (moins de 20 kW par rack) ou en cohabitation avec d’autres techniques dans un même datacenter.
En clair : l’air cooling reste valable pour les charges de bureau et les serveurs applicatifs standard. Dès qu’on installe un rack GPU de génération actuelle, il faut passer à autre chose.
Famille 2 — Rear Door Heat Exchanger (30-60 kW par rack)
Imaginez un radiateur de chauffage central monté à l’arrière d’une armoire réseau : c’est exactement le principe du Rear Door Heat Exchanger (RDHx). L’air chaud sortant des serveurs traverse un échangeur eau/air avant d’être rejeté dans la salle. Deux variantes existent :
- RDHx passif : aucun ventilateur propre — utilise uniquement les ventilateurs internes des serveurs. Pour des charges modérées (jusqu’à ~30 kW par rack selon le débit d’air serveur).
- RDHx actif : ventilateurs dédiés intégrés dans la porte. Améliore le débit thermique, adapté à des charges plus élevées (jusqu’à 50-60 kW par rack).
Performances : 30 à 60 % plus efficace que l’air seul, selon Silverback Data Center Solutions. Principal avantage : s’installe dans un datacenter existant sans intervention sur les tuyauteries à distance des serveurs.
Adoption : 29 % des opérateurs datacenter utilisent déjà des RDHx ; 83 % des nouveaux projets planifient leur déploiement dans l’année. (Source : InsightAce Analytic, Data Center RDHx Cooling Market 2026-2035 [estimation marché commerciale].)
Limite : solution de transition, pas d’endpoint. La version passive atteint ses limites vers 30 kW par rack ; la version active vers 60 kW. Au-delà, seul le Direct-to-Chip ou l’immersion suffit.
En clair : le RDHx est le chemin de moindre résistance pour les opérateurs qui doivent déployer des GPU modérément denses dans une infrastructure existante. Ce n’est pas la solution finale pour les racks NVL72.
Famille 3 — Direct-to-Chip Liquid Cooling / DLC (50-100+ kW par rack)
Plutôt que de refroidir l’air dans la salle, le DLC amène le liquide directement à la source de chaleur — la puce elle-même. Des plaques froides (cold plates) en cuivre ou aluminium sont montées sur les CPU et GPU. Un liquide caloporteur (eau déminéralisée, mélange eau-glycol, ou propylène glycol) circule dans des micro-canaux usinés dans la plaque, absorbe la chaleur à quelques millimètres du silicium, puis repart chaud vers le CDU.
Architecture type NVL72 :
- 36 plaques froides montées en parallèle sur un manifold commun (circuit aller/retour)
- Débit total : environ 80 litres par minute pour le rack complet
- Température d’entrée tolérée : jusqu’à 45°C (les GPU B200 acceptent une entrée chaude, réduisant le besoin de refroidisseurs mécaniques énergivores)
- CDU externe de 150 à 200 kW de capacité
Avantage clé : le DLC n’impose pas de reconcevoir les serveurs. Les plaques froides s’adaptent aux architectures existantes. L’air résiduel reste présent pour les composants périphériques — stockage, interfaces réseau, alimentations — non équipés de plaques.
Adoption : 47 % de part dans le segment liquid cooling IA en 2024 (DLC = segment dominant du marché). 22 % des opérateurs datacenter utilisent déjà le DLC ; 61 % l’envisagent. (Source : Uptime Institute, Cooling Systems Survey 2024.)
Limite : nécessite une infrastructure hydraulique complète (tuyauteries, raccords, CDU). Le risque de fuite — eau ou glycol à proximité d’équipements sous tension — est la principale préoccupation opérationnelle. L’ASHRAE Technical Bulletin de septembre 2024 note explicitement que « the loss of cooling can be catastrophic when supporting extreme chip powers » et recommande des protocoles de résilience explicites.
En clair : le DLC est la technologie de facto pour les déploiements GPU haute densité en 2025-2026. C’est le compromis entre efficacité thermique élevée et infrastructure raisonnablement compatible avec les pratiques datacenter existantes.
Famille 4 — Immersion cooling (100+ kW par rack)
Dans l’immersion cooling, plus de plaques froides ni de tuyaux locaux : les serveurs sont entièrement plongés dans un bain de liquide diélectrique. Deux sous-familles existent, avec des propriétés très différentes.
4a — Immersion single-phase
Le liquide (huile minérale ou fluide synthétique — ex : Shell Immersion Cooling Fluid) reste à l’état liquide, absorbe la chaleur en circulant autour des composants, et est pompé vers un échangeur thermique externe.
Avantages : suppression totale des ventilateurs serveurs (économie mesurée à ~80 % de la consommation ventilateurs), homogénéité thermique sur l’ensemble du serveur, densités jusqu’à 200+ kW par rack théoriquement supportées.
Déploiements réels : Meta a présenté des racks liquid-cooled de 140 kW pour ses workloads LLaMA à l’OCP Global Summit d’octobre 2024. Le marché global de l’immersion cooling est estimé à 5,72 milliards de dollars pour 2026. (Source : Mordor Intelligence, 2025.)
Limites : les serveurs doivent être extraits de leur rack standard pour être placés dans des pods étanches — la maintenance est plus lourde. Le lock-in sur les fluides diélectriques (souvent propriétaires) et le coût supérieur au DLC freinent l’adoption.
4b — Immersion two-phase
Variante plus sophistiquée : le fluide diélectrique (historiquement à base fluorocarbonée, type 3M Novec) change d’état liquide vers gaz au contact des puces chaudes. La chaleur latente de vaporisation absorbe l’énergie thermique bien plus efficacement qu’un liquide stable. La vapeur monte, se condense sur un serpentin refroidi en hauteur du bain, et retombe liquide par gravité — un cycle autonome sans pompe nécessaire pour la phase gaz.
Performance : meilleure efficacité de transfert thermique de toutes les techniques. Densités supérieures à 200 kW par rack théoriquement supportées.
Déploiements : Microsoft a testé le two-phase immersion sur des clusters d’entraînement IA avec un gain d’efficacité énergétique rapporté de 30 % [non vérifié — sources secondaires uniquement, publication originale Microsoft non retrouvée]. Meta déploie du two-phase immersion en 2024-2025.
Limites critiques : les fluides fluorocarbonés sont sous pression réglementaire forte (PFAS, potentiel de réchauffement global élevé). 3M a annoncé l’arrêt progressif de Novec d’ici fin 2025, créant une tension sur la supply des fluides two-phase. La reconception complète des racks est obligatoire — pas de transition depuis l’air ou le DLC sans rupture de la mécanique serveur.
En clair : l’immersion two-phase est la technologie la plus performante thermiquement, mais aussi la plus complexe à déployer et la plus exposée aux risques réglementaires sur les fluides. Elle reste un marché niche en croissance rapide, pas encore le standard hyperscale.
Métriques d’efficacité : PUE et WUE
Comparer des installations de refroidissement sans métriques communes revient à comparer des voitures sans parler de leur consommation. Le secteur s’est doté de deux indicateurs standardisés.
PUE — Power Usage Effectiveness
Le PUE mesure l’efficacité globale de l’alimentation électrique d’un datacenter. Un PUE de 1,0 signifie que toute l’énergie consommée va au calcul informatique, aucune n’est gaspillée en refroidissement ou infrastructures. En pratique, le refroidissement représente la part principale de l’écart entre 1,0 et le PUE réel.
| Type d’installation | PUE typique |
|---|---|
| Datacenter classique (moyenne mondiale 2024) | 1,56 |
| Datacenter air-cooled optimisé | 1,2-1,4 |
| Datacenter liquid-cooled (DLC/immersion) | < 1,2 |
| Google — fleet worldwide (2024) | 1,09 |
| Nouveaux hyperscalers AI-first | 1,1-1,15 |
Sources : PUE Google — Google Data Centers Efficiency page, 2024. PUE moyen mondial — Lawrence Berkeley National Laboratory, 2024.
Impact mesuré du passage au liquide (étude Vertiv sur un datacenter Tier 2, ~1,5 MW, région Baltimore) : le passage de 100 % air vers 75 % de refroidissement liquide réduit la puissance d’installation de 18,1 % et la puissance totale du datacenter de 10,2 %. Le PUE passe de 1,38 à 1,34 — un gain de ratio modeste, mais une économie absolue significative. (Source : Vertiv, Quantifying the impact on PUE when introducing liquid cooling, EMEA.)
Effet géographique : le PUE dépend fortement du climate. Un datacenter à Montréal avec free cooling disponible sept mois par an peut atteindre PUE 1,10 à 1,15. Un datacenter à Phoenix sans refroidissement liquide atteint difficilement PUE < 1,35. Avec le DLC à haute température d’entrée (jusqu’à 45°C pour les GPU B200), le rejet de chaleur peut se faire avec des tours de refroidissement moins énergivores, même en climat chaud.
En clair : le PUE descend vers 1,0 à mesure que le refroidissement liquide remplace l’air. Chaque point de PUE gagné représente directement moins d’électricité gaspillée en infrastructure thermique. Pour un datacenter de 100 MW, passer de 1,4 à 1,2 économise 20 MW permanents.
WUE — Water Usage Effectiveness
Le WUE mesure la consommation d’eau du datacenter en litres par kilowattheure d’énergie IT. Développé par The Green Grid, il cible spécifiquement l’eau évaporative utilisée dans les tours de refroidissement — un point de tension entre refroidissement liquide et impact environnemental.
| Scénario | WUE |
|---|---|
| Moyenne industrie | 1,9 L/kWh |
| Microsoft FY2024 | 0,30 L/kWh |
| Cible Microsoft nouveau design (zéro-évaporation) | ~0 (résiduel services bâtiment) |
| Projection Berkeley Lab 2028 (adoption liquid) | 0,45-0,48 L/kWh |
Sources : Microsoft — blog Sustainable by design, décembre 2024. Berkeley Lab — 2024 US Data Center Energy Usage Report.
Nuance importante : le refroidissement liquide ne réduit pas mécaniquement la consommation d’eau. Un circuit DLC boucle fermée, où le CDU échange sa chaleur via un refroidisseur mécanique à air, consomme quasi zéro eau (WUE ≈ 0). Mais si le CDU rejette sa chaleur via une tour évaporative, le WUE reste élevé — simplement déplacé du datacenter vers la tour. La réduction réelle dépend de l’architecture complète du circuit secondaire.
Microsoft zero-water design (août 2024) : depuis août 2024, tous les nouveaux projets Microsoft intègrent une boucle fermée complète sans évaporation. Économie estimée : plus de 125 millions de litres d’eau par an par datacenter. Le WUE de Microsoft a atteint 0,30 L/kWh en FY2024, soit une amélioration de 39 % par rapport à 2021. Des déploiements pilotes sont en cours en Arizona et Wisconsin, avec une mise en service complète projetée fin 2027. (Source : Microsoft Cloud Blog, décembre 2024.)
En clair : le WUE mesure où va l’eau — un DLC boucle fermée sans tour évaporative peut approcher WUE = 0. Mais la même infrastructure connectée à une tour de refroidissement humide n’économise pas d’eau, elle déplace juste la consommation. Ce sujet est traité sous l’angle empreinte globale dans l’article IA et environnement.
État du déploiement 2024-2026
Hyperscalers — la transition est en cours
Microsoft : depuis août 2024, tout nouveau projet datacenter intègre le zero-water evaporation cooling en boucle fermée. Les densités cibles sont de 140 kW par rack. Les supercomputers IA déployés en 2025 sont 100 % refroidis par liquide. (Source : Microsoft Cloud Blog, décembre 2024.)
Meta : racks de 140 kW présentés à l’OCP Global Summit d’octobre 2024. Objectif déclaré : 100 % des datacenters de Meta en refroidissement liquide d’ici 2030. L’investissement de 65 milliards de dollars annoncé pour l’infrastructure IA 2025 inclut un déploiement massif de liquid cooling. (Sources : Meta OCP announcements, EnkiAI analysis, 2024.)
Google : les racks TPU sont en liquid cooling custom. PUE de 1,09 en moyenne fleet-wide 2024 — le meilleur du secteur. (Source : Google Data Centers Efficiency, 2024.)
CoreWeave : l’ensemble des nouveaux datacenters en liquid cooling depuis 2025, pour les racks GB200 NVL72 à 130 kW. [estimation basée sur communications publiques CoreWeave 2024-2025]
Données marché (avec leurs limites)
| Indicateur | Valeur | Source | Fiabilité |
|---|---|---|---|
| Part liquide dans marché cooling datacenter | 46 % en 2024 | Tom’s Hardware / Global Market Insights | Triangulé 2 sources |
| Opérateurs utilisant déjà DLC | 22 % en 2024 | Uptime Institute Survey 2024 | Auto-déclaratif, N non précisé |
| Opérateurs envisageant DLC | 61 % | Uptime Institute Survey 2024 | Auto-déclaratif |
| Opérateurs utilisant RDHx | 29 % | Uptime Institute Survey 2024 | Auto-déclaratif |
| Hyperscale IA dans liquid cooling 2025 | 55 % | Future Market Insights 2025 | Estimation vendeur marché |
| Marché liquid cooling 2024-2029 | 1,5 → 7 Md$ | Dell’Oro Group 2024 | Projection marché |
Note méthodologique : les pourcentages d’adoption varient fortement selon que l’on inclut uniquement le DLC, ou le DLC + immersion + RDHx. Les projections marché (Dell’Oro, Future Market Insights) sont des estimations commerciales, pas des mesures indépendantes.
Retrofit versus new build
New build : standard de facto pour l’hyperscale IA. L’infrastructure hydraulique (tuyauteries, CDU, manifolds) est intégrée dès la conception, pour un surcoût marginal par rapport à une infrastructure air pure.
Retrofit : la barrière principale. Adapter une infrastructure air existante pour accueillir des racks GB200 coûte de 5 à 10 millions de dollars par mégawatt selon des estimations industrielles [single — Introl, 2025 ; non confirmé par source indépendante]. Les exigences électriques associées — circuits 480 V triphasé, câbles de 300 A — relèvent de la norme industrielle lourde.
Barrières citées (Uptime Institute Survey 2025, n = 1 033 opérateurs) :
- Manque de standardisation des raccordements CDU : 39 %
- Coût élevé : 38 %
- Choix limité de vendeurs : 26 %
- Maintenance plus complexe : 26 %
- Formation du personnel : 16 %
En clair : pour une nouvelle installation prévue pour l’IA haute densité, le liquid cooling est moins cher à long terme. Pour une infrastructure existante, le retrofit coûte cher et demande une réorganisation significative.
Matrice de décision — quelle technique pour quel contexte
| Contexte (densité rack) | Technique recommandée | Pourquoi |
|---|---|---|
| < 30 kW — serveurs applicatifs standard | Air cooling optimisé (CRAC/CRAH + allées) | Suffisant thermiquement, infrastructure mature, coût d’exploitation bas. |
| 30-50 kW — GPU récents sans cluster dense | RDHx passif ou actif | Retrofit rapide dans infrastructure existante, aucune tuyauterie sous plancher. |
| 50-100 kW — clusters GPU modernes (H100, A100) | DLC obligatoire | Seule solution viable à ce niveau sans sur-dimensionnement air massif. |
| > 100 kW — NVL72, Blackwell Ultra, racks IA next-gen | DLC ou immersion, air résiduel pour périphériques | NVIDIA impose le liquid dès la spec NVL72. L’immersion si l’on veut supprimer les ventilateurs et pousser la densité. |
| Projet greenfield hyperscale | Immersion ou DLC intégré dès conception | Coût marginal plus faible qu’en retrofit ; meilleur PUE ; flexibilité densité future. |
Règles heuristiques :
- Commencer par auditer la densité actuelle et future : un rack de 20 kW aujourd’hui peut monter à 80 kW à la prochaine génération de GPU. Concevoir pour la densité d’après.
- Ne pas confondre PUE et économie absolue : un PUE de 1,1 dans un datacenter de 10 MW économise plus d’énergie qu’un PUE de 1,05 dans un datacenter de 1 MW.
- Le RDHx n’est pas une fin en soi : c’est un pont utile, pas une architecture cible pour les charges IA de 2026+.
- Avant de choisir l’immersion two-phase, vérifier la disponibilité des fluides de remplacement post-3M Novec — la réglementation PFAS est un risque supply réel.
- Mesurer le WUE, pas seulement le PUE : un DLC raccordé à une tour évaporative améliore le PUE mais ne réduit pas la consommation d’eau.
Risques opérationnels
Le passage au liquid cooling n’est pas sans risques. En voici les principaux, avec les mitigations documentées.
Risques hydrauliques
Fuites : eau ou glycol à proximité d’équipements électroniques haute tension. Risque de court-circuit ou de corrosion accélérée. Les fluides diélectriques (immersion) ne conduisent pas l’électricité — le risque électrique y est nul, mais un fluide dégradé peut contaminer les composants. Mitigation standard : tuyaux certifiés, raccords quick-disconnect à fermeture automatique, capteurs de fuite localisés dans les sous-planchers et à proximité des CDU.
Corrosion : l’eau déminéralisée peut être agressive envers certains alliages métalliques. Un programme de gestion de la qualité de l’eau (conductivité, pH, inhibiteurs de corrosion, biocides) est requis — une discipline nouvelle pour des équipes datacenter formées principalement à la mécanique de l’air.
Pression manifold : les manifolds NVL72 opèrent typiquement jusqu’à 6 bar, avec une rupture spécifiée à 12 bar minimum. Les incidents sont rares, mais une rupture manifold sur un rack actif peut être destructrice.
Complexité maintenance
Extraction en immersion : sortir un serveur d’un bain d’huile ou de fluide fluorocarboné demande une procédure lourde — protection du personnel, drainage partiel, nettoyage des composants. La cadence de maintenance est plus contrainte qu’en rack air où l’on remplace un disque en deux minutes.
Interopérabilité des raccords : il n’existe pas de standard universel pour les connecteurs CDU ↔ rack. L’Open Compute Project (OCP) travaille sur des spécifications, mais l’adoption reste fragmentée. 39 % des opérateurs citent ce manque de standardisation comme première barrière à l’adoption. (Source : Uptime Institute, 2025.)
Formation : les équipes opérations datacenter classiques n’ont pas de background hydraulique. La formation au liquid cooling — gestion de la qualité de l’eau, détection de fuite, procédures LOTO (lock-out/tag-out) sur circuits sous pression — représente un investissement non trivial.
Résilience : l’ASHRAE TC 9.9, dans son bulletin technique de septembre 2024 sur la résilience du liquid cooling haute densité, recommande des protocoles explicites de continuité en cas de perte de liquide — ce que les architectures air gèrent naturellement par la permanence de l’air ambiant.
En clair : le refroidissement liquide n’est pas plug-and-play. Il introduit des systèmes mécaniques (pompes, tuyauteries, échangeurs) avec leurs propres modes de défaillance, et demande des compétences opérationnelles que la plupart des équipes datacenter devront développer.