En bref
Depuis 2022, cinq startups — Cerebras, Groq, SambaNova, Etched et Tenstorrent — ont conçu des puces spécialisées pour l’inférence des grands modèles de langage (LLM). Leur pari commun : là où les GPU Nvidia sont optimisés pour l’entraînement (des milliards de paramètres à calculer en parallèle sur de gros batches), l’inférence suit une logique radicalement différente — séquentielle, sensible à la latence, contrainte par la bande passante mémoire. Résultat en 2026 : Cerebras revendique jusqu’à 2 500 tokens par seconde par utilisateur sur Llama 3.1 405B, des données indépendantes confirment Groq à 877 tokens/s sur Llama 3 8B. Mais le tableau est plus nuancé : Groq a été acquis par Nvidia en décembre 2025 et n’est plus un challenger indépendant. Etched a levé 620 millions de dollars sans avoir livré un seul chip à un client externe. Et Tenstorrent atteint seulement 50 % de son pic théorique en inférence LLM réelle.
Cet article couvre les cinq acteurs startup inference ASIC. Pour les hyperscalers (AMD, AWS Trainium, Google TPU, Microsoft Maia), voir l’article puces-alternatives.
Comprendre le problème : pourquoi le GPU n’est pas la bonne puce pour l’inférence
Imaginez un atelier qui fabrique des meubles. Pour une commande de 1 000 tables identiques, un grand atelier avec 200 ouvriers travaillant en parallèle est imbattable — c’est l’entraînement des LLM. Mais si un client arrive et demande une seule chaise sur mesure, en attenant au comptoir, les 200 ouvriers ne l’aident pas : la machine est trop grande pour une tâche séquentielle, et le client attend quand même que le premier ouvrier finisse la première étape avant de commencer la suivante. C’est l’inférence des LLM.
Le goulot de la bande passante mémoire
L’inférence LLM génère un token à la fois, de façon autoregressive. À chaque étape, le modèle doit lire l’intégralité de ses paramètres depuis la mémoire, plus un cache de contexte (le KV-cache, Key-Value cache) qui grossit à chaque token généré. Sur un GPU H100 de Nvidia, la bande passante mémoire HBM est de 3,35 To/s. Pour un modèle Llama 3.1 70B en FP16, cela représente environ 140 Go de poids à lire à chaque étape — soit un minimum théorique d’environ 42 ms par token, c’est-à-dire environ 24 tokens par seconde pour un seul utilisateur en décodage. [source : IEEE Spectrum 2024 “Challengers Are Coming for Nvidia’s Crown”, arxiv 2503.11698]
Le problème structurel : les GPU ont été conçus pour le training, qui maximise l’utilisation des unités de calcul (matmul sur de larges batches). L’inférence autoregressive ne peut pas paralléliser sur les tokens futurs — on ne sait pas encore ce qu’ils seront. Les GPU sous-utilisent massivement leur capacité de calcul en inférence à faible batch.
Trois métriques distinctes — souvent confondues
Vocabulaire
- Throughput (tokens/s agrégé) : tokens totaux par seconde, toutes requêtes confondues. Métrique datacenter et coût serveur. S’améliore avec le batching — plus on regroupe les requêtes, plus la puce est efficacement utilisée.
- Latence par utilisateur (tokens/s per user) : débit vu par un utilisateur en interaction directe. Ne s’améliore PAS avec le batching — au contraire, mettre plus de requêtes en parallèle augmente la latence par utilisateur. C’est la métrique conversationnelle.
- Time to first token (TTFT) : délai avant l’apparition du premier token. Critique pour les applications interactives.
- Cost per token : coût d’infrastructure par token produit. Dépend du coût total de possession (TCO) du hardware et de sa consommation énergétique.
En clair : quand un vendeur annonce “1 000 tokens/s”, la question décisive est : s’agit-il de 1 000 tokens agrégés sur 50 requêtes simultanées (= 20 tokens/s par utilisateur) ou de 1 000 tokens par utilisateur en interaction directe ? La différence est de 50×. Les deux métriques ont leur place, mais elles ne sont pas interchangeables.
Cerebras WSE-3 — la tranche de silicium entière
L’idée fondatrice : éliminer le bus mémoire externe
Cerebras a choisi la solution la plus radicale au goulot de bande passante : supprimer entièrement la mémoire externe. Le WSE-3 (Wafer-Scale Engine 3, 2024) occupe la totalité d’une tranche de silicium de 300 mm de diamètre — soit 46 225 mm² de surface, contre 814 mm² pour un H100 (57 fois plus grand). Il intègre directement :
- 4 000 milliards de transistors (procédé 5nm TSMC) [source : Cerebras press release mars 2024, confirmé IEEE Spectrum]
- 900 000 cœurs IA (Sparse Linear Algebra cores) [source : Cerebras.ai/chip, Hot Chips 2024]
- 44 Go de SRAM on-chip — la mémoire est sur la puce elle-même [source : arxiv 2503.11698]
- Bande passante mémoire : 21 pétaoctets/s — environ 7 000 fois la bande passante HBM d’un H100 [source : Cerebras datasheet]
L’idée clé : en éliminant le bus mémoire externe, le WSE-3 supprime le goulot d’étranglement qui limite les GPU en inférence. Là où un H100 doit aller chercher les poids en mémoire HBM à 3,35 To/s, le WSE-3 les lit en SRAM on-chip à 21 pétaoctets/s — une différence d’environ 3 à 4 ordres de grandeur.
En clair : la mémoire HBM d’un GPU ressemble à une bibliothèque dans une pièce adjacente — il faut sortir du bureau pour chercher les livres. La SRAM on-chip de Cerebras, c’est la bibliothèque dans le même bureau, sur le même meuble, à portée de main. La différence de vitesse d’accès est astronomique.
Benchmarks et triangulation
| Modèle | Tokens/s | Contexte | Source |
|---|---|---|---|
| Llama 3.1 405B | 969 tokens/s | Par utilisateur, requête unique | Cerebras press release jan 2026 [vendor claim] |
| Llama 3.1 405B | 2 522 tokens/s | Non précisé | Comparaison vs NVIDIA DGX B200 (1 038 t/s) [vendor claim] |
| Llama 4 Maverick | 2 500 tokens/s | Par utilisateur | Cerebras blog 2026 [vendor claim] |
| Llama4Scout | ~2 600 tokens/s | Par utilisateur | Tests communauté (Adam Holter, 2026) [source indépendante, méthodologie non publiée] |
Triangulation : Cerebras ne participe pas aux benchmarks MLPerf Inference officiels — la comparaison standardisée n’existe donc pas. Les chiffres de 969 tokens/s et 2 522 tokens/s sont des communications Cerebras. La seule triangulation partielle disponible vient de tests communautaires (Adam Holter, 2026) qui confirment ~2 600 tokens/s sur Llama4Scout via l’API publique — source indépendante mais méthodologie non publiée.
Limite architecturale : les 44 Go de SRAM on-chip ne suffisent pas pour les très grands modèles (Llama 3.1 405B ≈ 800 Go en FP16). Cerebras utilise une architecture disaggregated inference : un prétraitement sur AWS Trainium pour le prefill, puis le WSE-3 gère le décodage. [source : AWS blog mars 2026, SiliconAngle mars 2026]
Trajectoire 2025-2026
- Janvier 2026 : OpenAI signe un partenariat multi-années pour 750 MW de capacité Cerebras, contrat estimé à plus de 10 milliards de dollars. [source : SiliconAngle jan 2026, confirmé Axios avr 2026 — 3 sources indépendantes]
- Mars 2026 : AWS déploie le WSE-3 dans ses datacenters via Amazon Bedrock — première intégration dans un hyperscaler. [source : SiliconAngle mars 2026]
- Avril 2026 : Cerebras dépose son S-1 pour une introduction en bourse sur le Nasdaq (ticker CBRS), avec une valorisation cible d’au moins 35 milliards de dollars et des revenus 2025 de 510 millions de dollars. [source : TechCrunch avr 2026, TheAIInsider avr 2026]
Groq LPU — l’acquisition qui change tout
L’architecture déterministe : zéro décision à l’exécution
Groq a inventé le LPU (Language Processing Unit), une rupture architecturale par rapport au GPU. Là où un GPU prend des décisions à chaque cycle (scheduler hardware qui gère les contentions de ressources, cache misses, branch prediction), le LPU est entièrement compilé et déterministe : le compilateur Groq (GXCC) pré-calcule à la compilation l’intégralité du graphe d’exécution, y compris les communications entre chips, jusqu’au cycle d’horloge individuel. À l’exécution, le hardware ne décide rien.
Vocabulaire
- Jitter : variabilité dans le temps de réponse. Un système avec latence moyenne de 100 ms et jitter de 50 ms répondra parfois en 50 ms, parfois en 150 ms. Le jitter est critique pour les applications interactives — l’utilisateur ressent les pics de latence.
- Tail latency : la latence au 99e ou 99,9e percentile. Souvent 5-10× la médiane sur GPU, à cause des contensions de ressources. Le LPU éliminine ce problème par construction.
- SRAM : mémoire on-chip, rapide, mais coûteuse et en quantité limitée. Voir HBM pour la mémoire externe des GPU.
Architecture interne du LPU :
- Mémoire SRAM uniquement comme stockage de travail primaire (pas de HBM ni de cache hiérarchique)
- Bande passante SRAM : plus de 80 To/s vs ~8 To/s pour le HBM d’un H100 [source : Groq architecture whitepaper 2024]
- Modules d’exécution spécialisés : Matrix (tenseurs denses), Vector (arithmétique pointwise), Switch (mouvement de données structuré)
En clair : un GPU improvise à l’exécution comme un chef cuisinier qui adapte sa recette selon ce qu’il trouve dans le frigo. Le LPU exécute une partition écrite à la note près — zéro improvisation, zéro retard imprévu, mais le programme doit être complet avant de commencer.
Benchmarks pré-acquisition (données indépendantes)
Les données Artificial Analysis (2024) constituent la source la plus fiable disponible hors MLPerf pour Groq :
| Modèle | Tokens/s | Source |
|---|---|---|
| Llama 3 8B | 877 tokens/s | Artificial Analysis (indépendant, 2024) — triangulé |
| Llama 3 70B | 284 tokens/s | Artificial Analysis (indépendant, 2024) — triangulé |
| Llama 2 70B | ~300 tokens/s | Groq + EE Times 2024 — partiellement triangulé |
Ces chiffres sont à comparer à un H100 single-GPU qui atteint environ 24 tokens/s en décodage Llama 3.1 70B (single user) — Groq affiche un rapport de ~12× sur ce modèle. Ce ratio est cohérent avec l’avantage architectural SRAM vs HBM.
La fin de Groq indépendant : acquisition Nvidia décembre 2025
C’est la rupture majeure de 2025. Nvidia a acquis Groq le 24 décembre 2025 pour 20 milliards de dollars (structure : licence non-exclusive + acquisition de talent + IP). Jonathan Ross (fondateur), Sunny Madra (président) et la majorité des ingénieurs ont rejoint Nvidia. [source : Tom’s Hardware jan 2026, IntuitionLabs jan 2026]
Le résultat concret : Groq 3 LPX — le LPU intégré dans la plateforme Vera Rubin de Nvidia comme co-processeur d’inférence. Specs du rack LPX :
- 315 PFLOPS FP8 (256 chips Groq 3 LPU par rack)
- 128 Go SRAM totale
- 40 PB/s bande passante SRAM on-chip
- Architecture AFD (Attention-FFN Disaggregation) : le GPU Vera Rubin gère prefill et attention ; le LPU gère décodage, FFN et MoE
- Claim Nvidia : “35× higher inference throughput per megawatt” vs solutions concurrentes [vendor claim, non vérifié indépendamment]
[source : NVIDIA Technical Blog “Inside Nvidia Groq 3 LPX”, avr 2026]
En clair : Groq n’est plus un challenger indépendant. La technologie LPU est maintenant une brique dans la plateforme Nvidia — ce qui renforce la domination Nvidia sur l’inférence plutôt que de la contester. Les clients de Groq Cloud accèdent désormais à la technologie uniquement via l’écosystème Nvidia.
SambaNova SN40L/SN50 — le dataflow reconfigurable pour les très grands modèles
La RDU : compiler des graphes entiers, pas des kernels
L’approche SambaNova est différente des deux précédentes. La RDU (Reconfigurable Dataflow Unit) ne se contente pas d’accélérer des opérations individuelles (matmul, attention) — elle compile des graphes complets d’opérations en un pipeline dataflow continu. Là où un GPU lance une séquence de kernels séparés (matmul, puis softmax, puis layernorm), la RDU fusionne des centaines d’opérations en un seul appel.
SN40L (2023-2025, TSMC 5nm, chiplet 2.5D CoWoS) :
- 1 040 Pattern Compute Units (PCUs) : 638 TFLOPS BF16 de peak
- Système mémoire à trois niveaux :
- PMU SRAM on-chip : 520 MiB à quelques centaines de To/s
- HBM co-packagé : 64 GiB à environ 2 To/s
- DDR DRAM : jusqu’à 1,5 TiB à plus de 200 Go/s (capacité totale pour très grands modèles)
[source : arxiv 2405.07518 “SambaNova SN40L: Scaling the AI Memory Wall”, papier ingénieurs SambaNova présenté à Hot Chips 2024]
La mémoire DDR de 1,5 TiB est l’élément distinctif. Elle permet à plusieurs très grands modèles de coexister en mémoire et de commuter entre eux en 31 fois moins de temps qu’un système GPU équivalent — critique pour les déploiements CoE (Composition of Experts) où plusieurs modèles spécialisés s’alternent selon la requête.
En clair : imaginez une bibliothèque avec trois zones — les livres les plus utilisés sur le bureau (SRAM), les classiques sur les étagères proches (HBM), et les archives dans une pièce voisine (DDR). La SN40L peut accéder aux archives sans perdre de temps à vider le bureau — un avantage décisif pour les modèles de plus d’un milliard de paramètres.
Benchmarks SN40L
| Modèle | Métrique | Valeur | Source |
|---|---|---|---|
| Llama 3.1 405B | tokens/s per user | 114 tokens/s | Artificial Analysis (indépendant) — triangulé |
| DeepSeek-R1 671B | tokens/s per user | 198 tokens/s | TechRadar jan 2026 (citant SambaNova) — partiellement triangulé |
| DeepSeek (agrégé) | throughput total | >4 500 tokens/s | SambaNova blog [vendor claim] |
Le chiffre le plus frappant : 198 tokens/s sur DeepSeek-R1 671B avec seulement 16 chips SN40L. Un système GPU équivalent nécessiterait environ 130 H100 pour ce modèle de 671 milliards de paramètres. [source : TechRadar jan 2026]
SN50 — prochaine génération
Annoncé en février 2026, avec une levée de 350 millions de dollars supplémentaires :
- Procédé TSMC 3nm, design dual-chiplet
- 3,2 PFLOPS FP8 et 1,6 PFLOPS BF16 par chip
- 432 MB SRAM on-chip / 64 GB HBM2E / jusqu’à 2 TB DDR5
- Claim vendeur : Llama 3.3 70B à 895 tokens/s per user (FP8) vs 184 tokens/s sur Nvidia B200 — ratio 4,9× [vendor claim — chip non livré]
- Partenariat Intel pour la plateforme Xeon CPU
Livraison prévue : second semestre 2026 — annoncé, non livré à la date de rédaction. Les chiffres SN50 restent entièrement des claims vendeur.
[source : BusinessWire fev 2026, Tom’s Hardware fev 2026, NextPlatform fev 2026]
Etched Sohu — le pari existentiel sur le transformer
Transformer-only câblé dans le silicium
Etched est le pari le plus radical de ce comparatif. Là où Cerebras utilise une tranche entière de silicium mais reste un processeur relativement générique, le Sohu est un ASIC transformer-only pur : les blocs d’attention multi-têtes (projections QKV, softmax, projection de sortie), les réseaux feed-forward (GELU/SiLU) et la layer normalization sont câblés en dur dans le silicium. Il n’est pas possible de reprogrammer Sohu pour un autre type de modèle.
Avantage théorique : densité de calcul transformer maximale, aucune surface gaspillée pour des opérations inutilisées. Spécifications annoncées (TSMC 4nm) :
- 144 Go HBM3E
- Claim : 500 000 tokens/s sur Llama 70B pour un serveur 8-Sohu [vendor claim]
- “Remplace 160 H100” selon les communications Etched [vendor claim]
[source : The Register juin 2024, Tom’s Hardware juin 2024]
En clair : un Sohu est comme une machine à café professionnelle qui fait exactement un type de café à la perfection — mais ne peut pas faire de thé, ni réchauffer de plats, ni faire autre chose. Si le café reste le standard, c’est un génie. Si les habitudes changent, c’est une machine inutilisable.
L’inconvénient structurel : le bet existentiel
L’architecture transformer domine depuis 2017, mais ce n’est pas une loi physique — c’est une convention. Si l’architecture évolue significativement (post-transformer, State Space Models, mamba-style, hybrid), Sohu devient inutilisable. C’est un pari existentiel sur la permanence des transformers.
Funding et statut réel (avril 2026)
| Événement | Date | Montant | Source |
|---|---|---|---|
| Série A | Juin 2024 | 120 M$ | The Register + Crunchbase — triangulé |
| Financement additionnel | Janvier 2026 | 500 M$ | Data Center Dynamics jan 2026 |
| Total levé | >620 M$ | Valorisation : 5 milliards $ |
Statut livraison : zéro livraison client en avril 2026. Une prédiction Manifold Markets (“Will Sohu ship within a year of announcement?”) a résolu NO à mi-2025. En mars 2026, aucun client externe n’a reçu de Sohu. Etched mentionne des “réservations de dizaines de millions de dollars” de clients non nommés.
Zéro benchmark indépendant : toutes les performances citées (500 000 tokens/s, “20× vs H100”) sont des projections théoriques issues de simulations internes. Aucun tiers n’a testé Sohu en conditions réelles. [source : Tom’s Hardware “Sohu AI chip claimed to run models 20x faster”, Manifold Markets prediction, Data Center Dynamics jan 2026]
En clair : avec 620 millions de dollars levés sans livraison ni benchmark tiers, Etched est le cas le plus difficile à évaluer. L’architecture peut être brillante ou catastrophique — il n’y a pas encore de données pour le savoir. Traiter toutes les performances annoncées comme [unverified — no third-party data].
Tenstorrent Blackhole — l’approche open-source
Stratégie multi-marché et open-source
Tenstorrent est l’acteur le plus atypique de ce comparatif. Sa stratégie, pilotée par Jim Keller (ancien architecte chez Intel, AMD, Apple, Tesla), cible plusieurs marchés simultanément : inference datacenter, inference edge et embarqué, et licensing IP RISC-V à d’autres fabricants. Le stack logiciel (tt-metal) est entièrement open-source — une rareté dans l’écosystème ASIC spécialisé.
Architecture Tensix : RISC-V + matmul
Le cœur de Tenstorrent est le cœur Tensix. Chaque Tensix intègre un CPU RISC-V à 5 cœurs (pour l’orchestration) plus des unités vectorielles et un moteur matriciel. Sur Blackhole (2024, TSMC 6nm) :
- 120 cœurs Tensix par chip (note : réduit depuis 140 par mise à jour firmware, Tom’s Hardware nov 2025)
- 32 Go GDDR6 par chip (non HBM — choix économique)
- 210 Mo SRAM distribuée on-chip
- 774 TFLOPS FP8 (Blackhole p150) [source : Tenstorrent.com/hardware/blackhole]
La génération précédente, Wormhole n300 (encore disponible à la vente), intègre 128 cœurs Tensix, 192 Mo SRAM et 24 Go GDDR6.
[source : AnandTech Wormhole launch 2024, Tenstorrent.com/hardware/blackhole]
Les benchmarks réels : 50 % du pic théorique
The Register a publié en novembre 2025 un test indépendant du QuietBox — une station de travail Tenstorrent Blackhole commercialisée à environ 12 000 dollars :
- Performance réelle : ~50 % du peak théorique sur Llama 3.1 8B
- 76 des 120 cœurs Tensix (avant correction) inutilisés pendant l’inférence LLM — les kernels optimisés pour Wormhole n’ont pas encore été portés vers Blackhole
- Performance single P150 ≈ Nvidia DGX Spark sur les modèles testés, malgré un avantage théorique de 2 à 3× pour Blackhole
- Verdict The Register : “le manque de kernels optimisés pour l’inférence LLM est une faute inexcusable”
[source : The Register “Blackhole QuietBox review” nov 2025 — source indépendante]
En clair : Tenstorrent livre du matériel, mais le logiciel qui permet d’exploiter ce matériel n’est pas encore à niveau. C’est comme avoir un moteur de Formule 1 avec des pneus de vélo de ville — la puissance est là, mais elle ne peut pas s’exprimer. La nuance importante : tt-metal est en développement actif sur GitHub, et les chiffres de novembre 2025 ne sont pas définitifs.
Funding et trajectoire
- 693 millions de dollars levés (round mené par AFW Partners et Samsung Securities, avec LG, Fidelity et Bezos Expeditions) — valorisation 2,6 milliards de dollars
- 150 millions de dollars de contrats signés à la date de la levée
- Novembre 2025 : discussions pour un round additionnel de 800 millions de dollars à 3,2 milliards de valorisation (Fidelity lead)
- Roadmap : cycle hardware bi-annuel (Blackhole 2024 → génération suivante prévue ~2026)
[triangulé : Yahoo Finance, Tom’s Hardware, TechSpot, TheStack — 4 sources indépendantes sur le round 700 M$]
Ce que le marché a fait de ces paris — revue de septembre 2026
Un an après, la question n’est plus « ces architectures tiennent-elles ? » mais « qui reste indépendant ? ». La réponse est instructive.
| Acteur | Ce qui a bougé en 2026 |
|---|---|
| Groq | Absorbé. L’acquisition par Nvidia, 20 milliards de dollars, se clôt en décembre 2025. |
| Cerebras | Introduit en bourse en mai 2026 — 5,6 milliards levés, la plus grosse IPO de l’année, capitalisation initiale proche de 40 milliards. Trois mois plus tôt, une Série H d’un milliard à 23 milliards de valorisation, close quatre jours après la signature d’un accord de calcul pluriannuel de 10 milliards avec OpenAI. |
| SambaNova | Premier closing d’un milliard à environ 11 milliards de valorisation post-money en juillet 2026. Le SN50 doit être livré aux clients d’ici la fin de l’année. |
| Etched | Plus d’un milliard de dollars de contrats clients signés après démonstration de silicium fonctionnel — les racks sont encore en validation, les termes restent privés. |
| Tenstorrent | Commande de 96 Galaxy, soit 3 072 puces Blackhole, rapportée par Jim Keller. |
Ces chiffres proviennent de la presse spécialisée et des communiqués des sociétés ; aucun n’est audité. [NON VÉRIFIÉ]
En clair : le pari du non-GPU n’a pas échoué, il s’est trié. Le plus abouti techniquement — Groq et son déterminisme au cycle près — a été racheté par celui qu’il devait concurrencer. Les deux qui ont survécu indépendants l’ont fait en s’adossant à un client unique et massif (OpenAI pour Cerebras) ou en levant sans discontinuer. Le seul acteur du tableau à vendre un produit qu’un lecteur peut acheter et poser sur son bureau reste Tenstorrent.
Ce que les benchmarks indépendants montrent réellement
Il y a une limite structurelle dans toute comparaison de ces acteurs : aucun ne participe régulièrement aux benchmarks MLPerf Inference (les benchmarks officiels de l’industrie, arbitrés par un tiers indépendant). La comparaison standardisée n’existe pas. Les données disponibles viennent de trois sources, de qualité inégale :
Données les plus fiables — Artificial Analysis (service de benchmark cloud indépendant) :
| Puce / Modèle | Tokens/s per user | Statut |
|---|---|---|
| Groq LPU / Llama 3 8B | 877 | Triangulé — source indépendante |
| Groq LPU / Llama 3 70B | 284 | Triangulé — source indépendante |
| SambaNova SN40L / Llama 3.1 405B | 114 | Triangulé — source indépendante |
| H100 GPU single / Llama 3.1 70B | ~24 | Référence établie |
Données partiellement triangulées (1-2 sources indépendantes, méthodologie partielle) :
- SambaNova 198 tokens/s sur DeepSeek-R1 671B avec 16 chips SN40L (TechRadar jan 2026)
- Cerebras ~2 600 tokens/s sur Llama4Scout (Adam Holter, communauté, 2026)
Vendor claims uniquement (non vérifiés par des tiers) :
- Cerebras 2 522 tokens/s Llama 3.1 405B vs DGX B200 (1 038 t/s)
- Etched Sohu 500 000 tokens/s Llama 70B (8-chip server)
- SambaNova SN50 895 tokens/s per user Llama 3.3 70B
- Nvidia Groq 3 LPX “35× inference throughput/MW”
En clair : en l’absence de MLPerf, la seule base de comparaison rigoureuse disponible en avril 2026 est Artificial Analysis pour Groq et SambaNova. Tous les autres chiffres — y compris les plus spectaculaires — sont à traiter avec prudence.
Matrice de décision — quelle technologie pour quel usage
| Contexte | Acteur à considérer | Pourquoi |
|---|---|---|
| Ultra-faible latence conversationnelle, modèles >100B paramètres | Cerebras WSE-3 | SRAM on-chip élimine le goulot mémoire ; partenariats OpenAI + AWS valident l’usage en production |
| Latence déterministe, zéro jitter, applications temps réel | Groq (via Nvidia) | LPU élimine les décisions à l’exécution par construction ; données indépendantes confirment 877 t/s sur 8B |
| Très grands modèles MoE/multilingual (>500B paramètres), commutation rapide de modèles | SambaNova SN40L | Mémoire DDR 1,5 TiB + 31× commutation plus rapide ; données Artificial Analysis sur 405B triangulées |
| Développeurs hardware, edge enterprise, open-source | Tenstorrent Blackhole | Stack tt-metal open-source, workstations à ~12K$, RISC-V licensing ; mais 50% du pic LLM seulement en nov 2025 |
| Pari sur l’inférence transformer-only pur à très haute densité (H2 2026+) | Etched Sohu | Zéro données terrain disponibles ; 620M$ levés sans livraison ; ne considérer que si les transformers restent le paradigme dominant à horizon 3-5 ans |
Règles heuristiques pour choisir
Ne pas comparer des tokens/s sans préciser le contexte. Un “1 000 tokens/s” agrégé sur 50 requêtes simultanées correspond à 20 tokens/s par utilisateur — une vitesse conversationnelle médiocre. Toujours demander : tokens/s agrégé ou per user ? Quel modèle ? Quel batch size ? Quelle quantization ?
Les vendor claims doivent être triangulés. Aucun de ces cinq acteurs ne participe à MLPerf. Les seules données comparables rigoureuses disponibles en 2026 sont celles d’Artificial Analysis (Groq, SambaNova) et les tests communautaires pour Cerebras. Le reste est marketing non vérifié.
L’écosystème compte autant que la puce. Groq, le challenger le plus crédible sur la métrique latence, a été absorbé par Nvidia. SambaNova et Cerebras s’intègrent dans AWS. Tenstorrent mise sur l’open-source. La puce seule ne suffit pas.
Distinguer livré vs annoncé. En avril 2026 : WSE-3 livré et en production chez AWS + OpenAI. SN40L livré. Groq LPU livré (mais maintenant Nvidia). Tenstorrent Blackhole livré (maturité logicielle partielle). Sohu : zéro livraison client.
Ce qu’on retient en 2026
Le marché des ASIC inference startups traverse en 2026 un moment de clarification forcée. Trois signaux :
Premier signal — validation vs promesses. La fracture entre acteurs validés en production (Cerebras avec OpenAI + AWS, SambaNova avec DeepSeek + clients entreprise) et acteurs non validés (Etched, encore Tenstorrent sur l’inférence pure) s’est accentuée. Un ASIC reste une promesse tant qu’aucun client externe ne l’a testé en production réelle.
Deuxième signal — la consolidation a commencé. L’acquisition de Groq par Nvidia pour 20 milliards de dollars n’est pas un détail — c’est un signal que la technologie LPU était suffisamment valide pour que Nvidia veuille l’intégrer à sa plateforme Vera Rubin. Et c’est simultanément la preuve que survivre indépendant face à Nvidia est difficile même avec les meilleures métriques latence de l’industrie.
Troisième signal — la question qui compte en 2026. Les GPU Blackwell (H200, B200, B300) améliorent l’efficacité inference bien plus vite que prévu. La vraie question n’est plus “qui fait le token le plus rapide ?”, mais : “est-ce que la déflation des coûts inference GPU ira assez vite pour que les hyperscalers restent clients de ces startups, ou vont-ils tous internaliser comme AWS (Trainium), Google (TPU) et Meta (MTIA) l’ont déjà fait ?”
Les cinq architectures décrites ici apportent des réponses différentes — mais la réponse du marché se lira dans les revenus 2026-2027, pas dans les benchmarks de synthèse.