En bref

Depuis 2024, Nvidia publie sa feuille de route datacenter à quatre ans pour répondre à une pression inédite : les hyperscalers — Google, AWS, Microsoft — renouvellent leurs puces maison à un rythme annuel. En rupture avec le cycle biannuel précédent, Nvidia aligne désormais une génération par an : Blackwell Ultra (B300) en H2 2025, Vera Rubin (R100) en H2 2026, Rubin Ultra (R300) en H2 2027, et Feynman en 2028. À chaque saut, les performances prétendues doublent ou triplent — mais les contraintes d’approvisionnement en mémoire HBM4, de packaging TSMC, et de refroidissement liquide deviennent aussi des variables critiques que la performance brute elle-même.

Note de lecture : cet article couvre la prospective 2025-2028. Pour l’architecture Blackwell actuelle (B100/B200), le stack CUDA et la domination du marché présent, voir l’article GPU Nvidia et CUDA.


Pourquoi une cadence annuelle ? Le contexte stratégique

Jusqu’en 2022, Nvidia respectait un cycle biannuel : Ampere en 2020, Hopper en 2022. Blackwell, attendu en 2024, a déjà initialisé une première compression à deux ans depuis Hopper. Mais la vraie rupture s’opère en 2024 avec une décision formalisée par Jensen Huang lors de la keynote GTC 2025 (mars 2025) : une génération par an.

L’explication tient en quelques chiffres. Les TPU v7 de Google, les Trainium 2 et 3 d’AWS, les Maia de Microsoft se renouvellent sur un cycle annuel, ciblant l’inférence à bas coût. Chaque itération réduit l’écart de performance par dollar. Nvidia répond en publiant sa roadmap publique comme signal stratégique : les systèmes Nvidia progresseront plus vite que ce qu’un hyperscaler peut développer en interne.

Jensen Huang a justifié l’investissement continu par un argument précis : les modèles de raisonnement (reasoning models, comme o3 ou ses successeurs) nécessitent selon lui “100× plus de calcul” que les modèles génératifs classiques pour l’inférence. Argument commercial autant que technique — il n’existe pas de démonstration indépendante de ce facteur — mais il légitime l’achat de matériel Nvidia face à des alternatives moins puissantes.

Calendrier officiel (GTC 2025) :

  • H2 2025 — Blackwell Ultra (B300)
  • H2 2026 — Vera Rubin (R100)
  • H2 2027 — Rubin Ultra (R300)
  • 2028 — Feynman

En clair : Nvidia publie un plan sur quatre ans non pas par transparence industrielle, mais comme arme concurrentielle. La roadmap dit aux hyperscalers : “investir dans vos propres puces vous fera rater quatre générations d’amélioration Nvidia.” C’est autant une proposition de valeur qu’une pression commerciale.

Sources : GTC 2025 keynote Jensen Huang (mars 2025) [S3] ; NextPlatform “Nvidia Draws GPU System Roadmap Out To 2028” (mars 2025) [S7] ; Tom’s Hardware “Inside the AI accelerator arms race” (2025).


Blackwell Ultra (B300) — H2 2025

Ce que c’est : une itération mémoire, pas un nouveau nœud

Il est important de comprendre ce qu’est le B300 avant d’en détailler les specs. Le Blackwell Ultra n’est pas une nouvelle architecture. Le die GPU reste identique à Blackwell : même procédé TSMC 4NP, même double-die GH100 limité par la surface de réticule, 208 milliards de transistors. L’amélioration est concentrée sur la mémoire et la densité de calcul associée.

Vocabulaire

  • Nœud de gravure : finesse des transistors en nanomètres (ex : 4NP = process Nvidia 4 nm). Un nœud plus fin = plus de transistors par mm², moins de consommation, plus de performance par watt.
  • Die : la puce de silicium elle-même, avant découpe et packaging. Le B200 et le B300 utilisent le même die.
  • Réticule (reticle) : le gabarit d’exposition UV dans la machine de lithographie. La surface maximale d’un réticule limite la taille d’un die unique (~830 mm²). Au-delà, Nvidia assemble plusieurs dies.

Specs clés

Mémoire : 288 Go de HBM3e par GPU (contre 192 Go sur B200), obtenus en passant de stacks 8-Hi à stacks 12-Hi. La bande passante reste à 8 To/s — la hauteur des stacks augmente la capacité, pas la vitesse de l’interface.

Calcul [roadmap vendor claim] : 15 PFLOPS FP4 dense (contre 10 PFLOPS sur B200, +50%), 20 PFLOPS FP4 sparse, 5 PFLOPS FP8.

Interconnexion : NVLink 5 à 1,8 To/s bidirectionnel (inchangé vs B200), NVLink-C2C à 900 Go/s pour la cohérence CPU-GPU. TDP : 1 400 W.

Système GB300 NVL72 : 72 GPU B300 interconnectés, avec 1 100 PFLOPS FP4 inférence [roadmap vendor claim] (+50% vs GB200 NVL72), et 360 PFLOPS FP8 entraînement [roadmap vendor claim].

Angle d’usage : inference-weighted

Le B300 est positionné explicitement par Nvidia comme “inference-weighted”. Plus de mémoire par GPU signifie que les modèles longs-contexte (centaines de milliers de tokens de KV-cache) tiennent entiers en une passe. Le gain en FP64 (calcul scientifique de précision) est délibérément déprioritisé — signal clair que le marché cible est l’inférence en production, pas la simulation physique ou la recherche académique.

En clair : le B300 est un B200 avec plus de mémoire et un boost de calcul de 50 %. Pas de nouveau nœud, pas de nouvelle architecture. Il sert de transition pendant que Vera Rubin (le vrai saut) est en production chez TSMC.

Sources : NVIDIA Technical Blog “Inside NVIDIA Blackwell Ultra” [S1] ; Tom’s Hardware “Nvidia announces Blackwell Ultra B300” (2025) ; NextPlatform (mars 2025) [S7] ; WCCFTech “NVIDIA Blackwell Ultra B300 Unleashing In 2H 2025”.


Vera Rubin (R100) — H2 2026

Vera Rubin est le premier vrai saut architectural depuis Blackwell. Le nom couvre deux composants distincts : Rubin (GPU, codename R100) et Vera (CPU, codename CV100). Assemblés ensemble, ils forment le superchip Vera Rubin (VR100), analogue au Grace Hopper pour Hopper ou au Grace Blackwell pour Blackwell.

Le GPU Rubin R100 : saut de nœud et doublement de l’interface mémoire

Process node : TSMC N3/N3P (3 nm). C’est le premier saut d’un nœud complet depuis le 4NP de Blackwell — potentiellement +30 à 40 % de performance par watt, avant même l’optimisation architecturale.

Architecture die : deux dies reticle-limited (GR100) par package SXM7, flanqués de deux I/O tiles qui isolent la logique SerDes NVLink, PCIe et NVLink-C2C du die de calcul. 336 milliards de transistors (+62% vs Blackwell). 224 Streaming Multiprocessors, Tensor Cores 5e génération.

Mémoire : 288 Go de HBM4 par GPU (8 stacks 12-Hi). La vraie rupture est l’interface mémoire doublée : 2048 bits contre 1024 bits sur HBM3e, à une vitesse de pin de 6,4 Gb/s (plafond JEDEC HBM4). Résultat : une bande passante de ~20,5 To/s [roadmap vendor claim] — Nvidia annonce “22 To/s”, SemiAnalysis calcule ~20,5 To/s, l’écart de 7% reflète des hypothèses d’efficacité différentes. Dans les deux cas, c’est 2,8× le B200 (8 To/s → ~22 To/s).

Calcul [roadmap vendor claim] : 50 PFLOPS FP4 dense inférence, 35 PFLOPS FP4 entraînement. ×5 inférence vs Blackwell, ×3,5 entraînement vs Blackwell.

Interconnexion : NVLink 6 à 3,6 To/s bidirectionnel par GPU (doublé vs NVLink 5, même SerDes 224G mais nombre de lanes doublé), NVLink-C2C à 1,8 To/s CPU↔GPU, ConnectX-9 à 1,6 Tb/s pour le scale-out réseau. TDP estimé : ~1 800 W [roadmap vendor claim].

Statut : lors de la keynote CES janvier 2026, Jensen Huang a annoncé que les puces Vera Rubin sont “en pleine production” et en a montré physiquement une wafer. Livraisons clients H2 2026. [S10]

En clair : Vera Rubin n’est pas un B300 avec plus de transistors. C’est un saut complet : nouveau nœud TSMC 3 nm, nouvelle génération mémoire HBM4, interface mémoire doublée, interconnexions doublées. La bande passante mémoire — le vrai goulot d’étranglement de l’inférence LLM — fait un bond de 2,8×.

Le CPU Vera CV100 : le premier CPU totalement custom Nvidia

Nvidia a utilisé le CPU Grace (Hopper et Blackwell) sur un design Neoverse V2 licencié depuis ARM. Avec Vera, c’est la première fois que Nvidia conçoit un CPU ARM from scratch : architecture ARM v9.2-A, cœurs custom “Olympus” (conception interne, pas un design ARM standard).

Specs : 88 cœurs Olympus + Spatial Multithreading (176 threads). IPC annoncé +50% vs Grace, performances globales +150% [roadmap vendor claim]. L2 : 2 Mo/cœur. L3 unified : 164 Mo. Mémoire : 1,5 To LPDDR5X via modules SOCAMM (format améliorant la serviceabilité vs SO-DIMM). Bande passante CPU : 1,2 To/s (3× Grace).

Le signal stratégique est clair : Nvidia se positionne sur la couche CPU du datacenter IA, en concurrence directe avec Intel Xeon et AMD EPYC pour les “AI factories” — les datacenters construits de bout en bout pour l’IA.

Le système NVL144 : 144 dies GPU, 1 rack

Configuration : VR200 NVL144 — 72 packages Vera Rubin (= 144 dies GPU + 72 CPU Vera). Note terminologique : Nvidia compte les “dies”, pas les packages, dans le nom du système. SemiAnalysis et NextPlatform ont signalé cette évolution comme une façon d’afficher des nombres optiquement plus élevés (“Jensen Math”).

Performance système [roadmap vendor claim] :

  • 3,6 EFLOPS FP4 inférence (1 exaflop = 10¹⁸ opérations flottantes/seconde)
  • 1,2 EFLOPS FP8 entraînement
  • ×3,3 vs GB300 NVL72 ; ×5 vs GB200 NVL72

Fabric : NVLink 6 à 260 To/s agrégé par rack NVL72 (topologie all-to-all 72 GPU), Spectrum-6 switch à 102,4 Tb/s.

Sources : NVIDIA Technical Blog “Inside the NVIDIA Vera Rubin Platform” (janvier 2026) [S2] ; SemiAnalysis “NVIDIA GTC 2025 — Built For Reasoning, Vera Rubin, Kyber, CPO, Dynamo Inference” [S5] ; SemiAnalysis “Vera Rubin – Extreme Co-Design” [S6] ; Tom’s Hardware “Nvidia’s Vera Rubin platform in depth” (2026) [S8] ; DataCenterDynamics (janvier 2026) [S10] ; VideoCardz “NVIDIA Vera Rubin NVL72 Detailed” (2026) [S13].


L’enjeu HBM4 : supply structurelle et exclusions

La transition HBM3e → HBM4 est le verrou physique le plus critique de la roadmap Rubin. Comprendre qui fournit la mémoire et pourquoi éclaire les risques d’exécution de la roadmap.

SK Hynix 70 %, Samsung 30 %, Micron exclu du flagship

Nvidia exige des débits HBM4 supérieurs à 10 Gb/s par pin. Parmi les trois fabricants capables de produire de la HBM4 — SK Hynix, Samsung, Micron — seuls SK Hynix et Samsung ont été qualifiés pour le GPU flagship Rubin R100 :

  • SK Hynix (~70% des volumes) : en production pleine à partir de mars-avril 2026. [S11, S12]
  • Samsung (~30%) : qualification réussie à 10 et 11 Gb/s (Q1 2026). [S11]
  • Micron : exclu du flagship Rubin. Positionné sur le segment “Rubin CPX” (moyen de gamme). [S11]

Cette concentration chez deux fournisseurs est un risque supply structural. Une interruption chez SK Hynix (problème de rendement, incident usine) affecterait ~70% de l’approvisionnement HBM4 de Nvidia.

HBM4 16-Hi pour Rubin Ultra : contrainte non résolue

Pour Rubin Ultra (2027), Nvidia demande des stacks HBM4 16-Hi (16 couches de DRAM au lieu de 12) pour atteindre 1 To par package. Ces stacks sont en développement chez les trois fabricants, avec une date de livraison demandée par Nvidia pour Q4 2026. À la date de rédaction (avril 2026), aucun fabricant n’a publié de spécifications validées pour cette configuration.

En clair : le calendrier de Rubin Ultra dépend d’une technologie mémoire qui n’est pas encore en production. C’est un risque identifié, non géré, dans la roadmap Nvidia — à surveiller pour les acheteurs enterprise qui planifient des déploiements 2027.

Sources : TrendForce “Samsung, SK Hynix Reportedly Tapped as NVIDIA Rubin HBM4 Suppliers” (mars 2026) [S11] ; TrendForce “SK Hynix Reportedly to Supply About Two-Thirds of NVIDIA HBM4” (janvier 2026) [S12].


Rubin Ultra (R300) — H2 2027

Toutes les informations sur Rubin Ultra sont issues de l’annonce GTC 2025 (mars 2025). Aucune mesure indépendante n’est disponible. L’ensemble de cette section est taguée [roadmap vendor claim] sauf mention contraire.

GPU Rubin Ultra : 4 dies par package

La rupture architecturale de Rubin Ultra est le passage de 2 à 4 dies GPU par package SXM8. Le die GPU reste du même type que Rubin R100 (probabilité élevée — non confirmé), mais le package contient 4 dies au lieu de 2, doublant le silicium GPU par unité achetée.

Calcul [roadmap vendor claim] : 100 PFLOPS FP4 dense par GPU package (×2 vs Rubin R100).

Mémoire [roadmap vendor claim] : 1 To de HBM4E (HBM4 Enhanced, pin speed >8 Gb/s) par GPU package, via 16 stacks 8-Hi HBM4E. Bande passante estimée : ~40 To/s par package.

Interconnexion [roadmap vendor claim] : NVLink 7 (version roadmap GTC 2025 — specs détaillées non dévoilées), NVSwitch 6 à 7,2 To/s. TDP estimé : ~3 600 W par package — estimation déductive (×2 dies vs ~1 800 W pour Rubin R100), non confirmée par source primaire Nvidia. [S7]

Système NVL576 “Kyber” : 600 kW par rack

Le rack Kyber est un changement de forme radical.

Configuration [roadmap vendor claim] : 576 dies GPU (144 packages × 4 dies) + 144 CPU Vera.

Performance [roadmap vendor claim] :

  • 15 EFLOPS FP4 inférence (×21 vs GB200 NVL72 actuel)
  • 5 EFLOPS FP8 entraînement
  • 365 To de “fast memory” système (147 To HBM4E + 218 To LPDDR), 4,6 Po/s de bande passante agrégée

Architecture physique : rotation 90° des compute trays en blade form factor. 4 canisters × 18 compute blades. Le backplane PCB remplace les câbles cuivre NVLink (réduction latence, densification). Consommation : 600+ kW par rack [roadmap vendor claim].

En clair : 600 kW par rack, c’est la consommation d’environ 600 foyers européens concentrée dans quelques mètres carrés. À titre de comparaison, un rack standard de datacenter consomme 5 à 20 kW. Le Kyber n’est pas un rack — c’est une contrainte d’infrastructure qui exige un bâtiment conçu pour.

Variation NVL1152 : SemiAnalysis mentionne une version NVL1152 (288 packages, 1 152 dies) “en développement” [S5]. Non confirmée officiellement.

Sources : GTC 2025 keynote Jensen Huang (mars 2025) [S3] ; NextPlatform (mars 2025) [S7] ; SemiAnalysis “NVIDIA GTC 2025 — Built For Reasoning” (mars 2025) [S5] ; VideoCardz “NVIDIA unveils Rubin Ultra with 1TB HBM4e memory for 2027, Feynman architecture in 2028” ; TrendForce (mars 2025).


Feynman — 2028

Feynman (hommage à Richard Feynman, physicien quantique) est à ce stade essentiellement un codename avec des directions architecturales, pas une spécification. Le CPU associé s’appelle Rosa (hommage à Rosalyn Sussman Yalow, Prix Nobel de physiologie 1977 — Nvidia perpétue la tradition de nommer les CPU après des scientifiques féminines).

Les informations disponibles viennent de deux sources primaires : GTC 2025 (codename et premières directions) et GTC 2026 (détails 3D stacking, Rosa, NVLink 8 CPO).

Innovation majeure : 3D die stacking vertical [annoncé partiellement]

Toutes les générations précédentes assemblent leurs dies en 2.5D (côte à côte sur un interposeur). Feynman introduit l’empilement vertical 3D des dies GPU — une première pour des processeurs à cette classe de puissance. L’empilement vertical réduit les distances de communication inter-dies et permet une densification supplémentaire.

Le défi thermique est ouvert : dissiper la chaleur depuis des dies empilés verticalement avec une puissance par package probablement >1 000 W est un problème d’ingénierie non résolu à la date de GTC 2026. Nvidia a reconnu ce challenge sans communiquer de solution précise.

Mémoire custom HBM [annoncé partiellement]

Pour la première fois, Nvidia conçoit sa propre logique de contrôle mémoire intégrée aux stacks HBM — le cHBM (custom HBM). C’est une rupture avec le modèle JEDEC standardisé : Nvidia ne s’appuie plus sur les spécifications standard mais co-conçoit la mémoire avec ses fournisseurs. Probablement HBM5 ou HBM4E+ enhanced. Aucune capacité ni bande passante chiffrée n’est annoncée.

Feynman introduit le NVLink 8 CPO (Co-Packaged Optics) — la première intégration optique co-packagée dans le standard NVLink. Les interconnexions scale-up et scale-out transitionnent vers l’optique directement intégrée dans le package, éliminant les pertes d’un connecteur électro-optique externe. Le reste du stack réseau : BlueField-5 DPU, CX10 InfiniBand optique (3,2 Tb/s/port), Spectrum 7 Ethernet (204 Tb/s/switch), NVSwitch 8e génération.

Rosa CPU [annoncé partiellement]

Rosa est décrit par Nvidia comme un redesign complet de Vera, pas une évolution incrémentale. Aucune spécification cœur/fréquence/mémoire n’est disponible.

Ce qu’on ne sait pas

Performances Feynman : aucun chiffre PFLOPS/EFLOPS officiellement annoncé. SemiAnalysis estime une augmentation de 5 à 20× vs Rubin [estimation tiers, spéculative]. Process node : TSMC N2 ou N2P probable (N2P en volume H2 2026, timeframe compatible avec 2028), non confirmé par Nvidia. Prix : inconnu.

En clair : Feynman, c’est 2028 vu depuis 2026. On connaît le nom du physicien, la direction (3D stacking, optique, mémoire custom), et très peu de chiffres. La prudence épistémique s’impose.

Sources : GTC 2025 keynote (mars 2025) [S3] ; GTC 2026 keynote Jensen Huang (mars 2026) [S4] ; Tweaktown “NVIDIA updates roadmap, with new details on its next-gen GPU Feynman coming in 2028” (mars 2026) ; Tom’s Hardware “Nvidia updates data center roadmap with Rosa CPU and stacked Feynman GPUs” (mars 2026) [S9] ; WCCFTech “NVIDIA Feynman GPU Gets 3D Die-Stacking, Custom HBM, & Next-Gen Rosa CPU” (2026).


Implications pour les datacenters et l’industrie

La progression TDP : refroidissement liquide comme seule option

La montée en puissance par rack suit une courbe exponentielle :

GénérationTDP GPURack de référenceConsommation rack
H100 SXM (Hopper)700 WDGX H100 8-GPU~10 kW
B200 (Blackwell)1 000 WGB200 NVL72~120 kW
B300 (Blackwell Ultra)1 400 WGB300 NVL72~170 kW [estimé]
R100 (Vera Rubin)~1 800 W [vendor claim]NVL144~300 kW [estimé]
R300 (Rubin Ultra)~3 600 W/package [estimé]NVL576 Kyber600+ kW [vendor claim]

Le refroidissement liquide direct est obligatoire depuis Blackwell Ultra. Le rack Kyber à 600+ kW n’a aucune variante air possible. La plupart des datacenters existants ne sont pas équipés pour des densités >30 kW par rack — Kyber exige des infrastructures spécifiques : boucles liquides, plomberie hydraulique, distribution électrique adaptée.

En clair : déployer un rack Kyber en 2027, c’est comme vouloir alimenter en électricité un bloc d’immeubles depuis une prise de courant résidentielle. L’infrastructure doit être repensée avant même de commander les puces.

Packaging TSMC CoWoS : un goulot d’étranglement capacitaire

L’emballage CoWoS (Chip-on-Wafer-on-Substrate) de TSMC est la technologie d’interposeur qui permet d’assembler plusieurs dies sur un même substrat. La capacité CoWoS est le vrai goulot d’étranglement de la production Nvidia depuis 2024 — pas le silicium lui-même.

Nvidia a sécurisé ~60% de la capacité de packaging avancé TSMC pour 2026. TSMC a engagé 56 milliards de dollars de capex pour doubler sa capacité CoWoS en anticipation de la montée en charge Rubin. Cette sécurisation signifie que les autres clients (AMD, Broadcom, Google pour ses TPU) doivent se contenter des 40% restants.

L’argument CUDA continuity

Nvidia affirme maintenir la backward compatibility CUDA sur toutes les générations : les kernels CUDA écrits pour Hopper tournent sur Blackwell et tourneront sur Rubin. Cette garantie est l’argument stratégique central contre la migration vers AMD ROCm ou les ASICs hyperscalers — qui eux ne peuvent pas offrir cette continuité logicielle sur des architectures radicalement différentes.

Dynamo : l’écosystème logiciel qui précède le hardware

Annoncé à GTC 2025, Dynamo est une couche d’orchestration multi-GPU pour les modèles de raisonnement (smart router tokens prefill/decode, GPU planner auto-scaling, NCCL optimisé avec 4× moins de latence sur petits messages, offload KV-cache vers NVMe). Dynamo est hardware-indépendant — il prépare l’écosystème logiciel à exploiter NVL144 et NVL576 avant même que ces systèmes ne soient disponibles.

Prix et allocation : les inconnues structurelles

Aucun prix officiel n’a été publié pour B300, Rubin ou Rubin Ultra. Les estimations analytiques :

  • B300 : 40 000–50 000 USD/GPU (H100 ~37 000, B200 ~40 000)
  • Rubin : probablement >60 000 USD/GPU (coût HBM4 + TSMC N3P)

L’allocation reste une contrainte : TSMC CoWoS-L est le goulot packaging. Les hyperscalers (Microsoft, Google, Meta, Amazon) ont des contrats de précommande. Les entreprises hors top-tier anticipent des délais de 12 à 18 mois post-disponibilité générale.


Quelle génération pour quelle décision ?

Contexte d’achatGénération pertinentePourquoi
Déploiement production maintenant (2025)B300 Blackwell UltraDisponible H2 2025, +50% mémoire vs B200, entraînement et inférence longs-contextes.
Planification cluster 2026R100 Vera RubinSaut architectural complet, ×5 inférence vs Blackwell, HBM4 — mais supply HBM4 concentrée SK Hynix.
Roadmap datacenter 2027+R300 Rubin UltraDoubler le silicium GPU, 600 kW/rack — infrastructure à concevoir maintenant si déploiement 2027 prévu.
Prospective long-termeFeynman 2028Directions confirmées (3D stacking, optique), specs inconnues — aucune décision d’achat possible.
Contrainte budget serréeGPU Blackwell B200 actuelStock disponible, performance documentée MLPerf, pas de surpaiement pour roadmap non livrée.

Règles heuristiques :

  • Ne pas payer pour la roadmap avant livraison : toutes les specs Rubin Ultra et Feynman sont [roadmap vendor claim]. Blackwell (actuel) a été retardé de ~6 mois en 2024 pour problèmes thermiques racks. Les retards sont possibles.
  • Vérifier l’infrastructure avant les puces : 300+ kW pour NVL144, 600+ kW pour Kyber — la contrainte est la salle, pas le budget GPU.
  • Anticiper le supply HBM4 : deux fournisseurs seulement (SK Hynix 70%, Samsung 30%). Un incident de production peut décaler toute la roadmap.
  • CUDA continuity reste l’argument le plus solide : pour les équipes qui ont investi en code GPU, la backward compatibility Nvidia est un argument documenté et non contesté par les alternatives.

Ce qu’on retient en 2026

La roadmap Nvidia 2025-2028 est une réponse structurelle à l’accélération des puces maison des hyperscalers. Sa cohérence repose sur trois paris : (1) que TSMC délivre la capacité CoWoS promise, (2) que SK Hynix et Samsung livrent le HBM4 et HBM4E dans les délais, (3) que les datacenters clients investissent dans des infrastructures capables d’absorber 600+ kW par rack. Sur les quatre générations, deux sont livrées ou en production (B300, R100), une est annoncée avec specs partielles (R300), et une est un codename avec directions (Feynman). L’angle prospectif de cet article sera mis à jour à mesure que les livraisons réelles et les benchmarks MLPerf indépendants valideront — ou infirmeront — les claims de la roadmap vendor.