En bref

Entraîner un grand modèle de langage coûte des dizaines à des centaines de millions de dollars — un investissement massif, ponctuel, amorti sur plusieurs années. Mais en 2024, OpenAI a dépensé environ 2,3 milliards de dollars en calcul d’inférence seul, soit quinze fois le coût d’entraînement de GPT-4.5 estimé [TechCrunch / futuresearch.ai, 2024]. L’économie de l’IA générative s’est renversée : le coût ponctuel de fabrication du modèle est désormais mineur face au coût continu de son utilisation. Cet article documente ce basculement — ses causes, ses chiffres, ses conséquences sur les marges, et pourquoi les reasoning models comme o3 amplifient encore le problème.


Comprendre la distinction : CAPEX et OPEX dans l’IA

Imaginez une imprimerie. L’achat des presses, la construction du bâtiment, la formation des équipes : c’est l’investissement initial — une dépense lourde, mais bornée. Ensuite, chaque livre imprimé consomme du papier, de l’encre, de l’électricité, de la main-d’œuvre : c’est le coût opérationnel, proportionnel au volume.

Les grands modèles de langage fonctionnent selon la même logique :

Vocabulaire de base

  • CAPEX (Capital Expenditure) : investissement en capital. Pour l’IA, c’est le coût de l’entraînement — location de GPU, acquisition de données, personnel R&D. Dépense ponctuelle, amortie sur plusieurs années.
  • OPEX (Operational Expenditure) : coût opérationnel récurrent. Pour l’IA, c’est l’inférence — le calcul consommé à chaque requête utilisateur. Proportionnel au volume d’utilisation.
  • Entraînement (training) : la phase où le modèle apprend à partir d’un corpus massif. Se produit une fois (ou en plusieurs runs itératifs). C’est le CAPEX.
  • Inférence (inference) : le moment où le modèle répond à une question. Se produit des milliards de fois. C’est l’OPEX.

Jusqu’en 2022, le débat sur les coûts de l’IA se concentrait presque exclusivement sur le training. Logique : les chiffres étaient spectaculaires, les modèles peu utilisés à grande échelle. Depuis 2023-2024, l’équation s’est renversée. Les centaines de millions d’utilisateurs de ChatGPT, Claude, Gemini génèrent des volumes de requêtes qui font passer le coût d’entraînement au second plan sur la durée de vie d’un modèle.

En clair : construire le modèle coûte cher une fois. Le faire tourner coûte cher à l’infini. En 2024, c’est la seconde catégorie qui domine les budgets.


Timeline 2020–2025 : ce qu’ont vraiment coûté les grands modèles

GPT-3 (2020) : 4 à 5 millions de dollars d’entraînement

GPT-3, 175 milliards de paramètres, reste le point de référence fondateur. Trois sources convergent sur une fourchette de 4 à 5 millions de dollars en coût cloud-équivalent :

  • Lambda Labs (2020) estime 4,6 M$ pour reproduire l’entraînement de GPT-3 aux tarifs GPU cloud de l’époque [cudocompute.com, citant Lambda Labs].
  • Fortune (2024) cite une fourchette consensuelle de 2 à 4 M$ pour le coût de calcul interne d’OpenAI (matériel propriétaire, sans tarif cloud).
  • Epoch AI (2022), avec une méthodologie hardware-aware, arrive à 700 K$ à 1,1 M$ en USD 2020 via les performances théoriques GPU — tout en précisant que “les coûts réels pourraient être plusieurs fois supérieurs” [Epoch AI blog, 2022].

Le chiffre de 10 M$ régulièrement cité dans la presse est probablement majoré [NON VÉRIFIÉ — pas de source primaire OpenAI].

À titre de comparaison, le prix de l’inférence GPT-3 au lancement était d’environ 60 dollars par million de tokens en novembre 2021 [a16z LLMflation, 2024]. Ce chiffre sert de référence pour mesurer l’effondrement des prix qui suivra.

PaLM et Megatron-Turing (2022) : des fourchettes similaires

PaLM de Google (540 milliards de paramètres) est estimé entre 3 et 12 M$ [Epoch AI ; cudocompute.com]. Megatron-Turing NLG de NVIDIA et Microsoft (530 milliards de paramètres) est évalué à environ 2,1 M$ en USD 2022 [Epoch AI, 2022]. Ces ordres de grandeur illustrent que les géants de 2022 se payaient encore dans des enveloppes “petits projets” comparées à ce qui allait suivre.

GPT-4 (2023) : le saut à 63–100 millions de dollars

GPT-4 marque une rupture dans l’économie du training. Trois sources triangulent une fourchette de 63 à 100 M$ :

  1. SemiAnalysis (Dylan Patel & Gerald Wong, juillet 2023) : analyse architecture + infrastructure GPT-4, estimations training [newsletter.semianalysis.com — partiellement paywall].
  2. Sam Altman (Wall Street Journal, 2023) : déclaration directe “$100M+” pour le coût d’entraînement de GPT-4 [NON VÉRIFIÉ sans accès source primaire WSJ].
  3. Juma.ai (2024) : estimation computationnelle indépendante → ~63 M$ en hypothèse H100 au tarif cloud actuel, sur 90 à 100 jours de training [juma.ai].

OpenAI n’a jamais divulgué de chiffre officiel. La fourchette reste large, mais les ordres de grandeur sont cohérents entre sources indépendantes.

Au lancement (mars 2023), l’inférence GPT-4 était facturée 30 à 60 dollars par million de tokens (input/output 8K). Le prix a été ramené à 10 à 30 dollars pour GPT-4o en mai 2024 [OpenAI pricing, 2024].

Llama 3.1 405B (Meta, 2024) et DeepSeek V3 (2024)

Meta documente officiellement 30,8 millions d’heures GPU sur H100-80GB pour entraîner Llama 3.1 405B [Meta AI blog, 2024]. Au tarif cloud H100 (2 à 3 dollars/heure/GPU), cela représente 61 à 92 M$ en coût cloud-équivalent. Meta utilisant ses propres clusters (49 152 GPU H100), le coût interne est significativement inférieur.

DeepSeek V3 (décembre 2024) a déclaré un coût d’entraînement de seulement 5,58 M$ sur 2 048 GPU H800 pendant 55 jours [DeepSeek technical report, 2024]. Ce chiffre est très controversé : il ne couvre que le run final, pas la R&D totale, les expériences préliminaires, ni le coût des GPU H800 à tarif interne chinois [The Register, sept. 2025 ; Martin Vechev, INSAIT — The Recursive]. La leçon économique reste valide : les innovations algorithmiques de DeepSeek (MoE, MLA, précision mixte FP8) ont massivement réduit les FLOP par token. Le chiffre marketing doit être lu avec précaution.

En clair : de GPT-3 en 2020 (4–5 M$) à GPT-4 en 2023 (63–100 M$), le coût d’entraînement d’un modèle frontier a été multiplié par 15 à 20 en trois ans. La trajectoire continue — mais les techniques d’efficacité (DeepSeek, distillation) commencent à contrebalancer.


Structure des coûts d’entraînement

Ce qui compose les 100 millions de dollars

Les estimations citées plus haut portent quasi exclusivement sur le compute cost — le coût brut de calcul GPU. La structure réelle est plus complexe :

PostePart estiméeNotes
GPU compute (location ou amortissement)60–80 %Poste dominant. H100 : 2–3 $/GPU-heure cloud ; 0,5–1 $/GPU-heure cluster propre (amortissement)
Données (acquisition, nettoyage, droits)10–20 %Variable selon politique open/closed data
Énergie électrique5–15 %Couvert séparément dans l’article datacenters-energie
Personnel R&D (ML engineers, researchers)Non inclusImportant pour le coût total, mais non comptabilisé dans les chiffres “compute-only”

Conséquence directe : quand Sam Altman cite “100 M$ pour GPT-4”, il parle de compute cost. Le coût total incluant équipes, données et infrastructure serait substantiellement plus élevé — mais ces chiffres ne sont pas publics.

Les tarifs GPU en pratique (2022–2026)

Les tarifs GPU cloud ont connu une volatilité importante :

  • A100 80 GB (2022-2024) : 1,07 à 3,43 $/GPU-heure selon provider [Hyperstack, Spheron, TensorDock].
  • H100 80 GB SXM (2023-2025) : 2,40 à 3,00 $/GPU-heure en on-demand ; pic à ~8 $/GPU-heure pendant la pénurie de 2023 [Jarvis Labs, GMI Cloud, Thunder Compute].
  • H100 80 GB (2026) : 1,38 à 2,99 $/GPU-heure suite à l’amélioration de l’offre [Thunder Compute, mars 2026].

La baisse des tarifs GPU en 2025-2026, tirée par l’augmentation de l’offre, rend mécaniquement les entraînements futurs moins coûteux — toutes choses égales par ailleurs.

Pre-training vs fine-tuning : l’essentiel de la facture

L’économie du training est très concentrée :

  • Pre-training : 95 %+ du compute total. C’est l’entraînement de base sur corpus massif.
  • Fine-tuning supervisé + RLHF : quelques pourcents du pre-training compute. L’alignement et l’instruction-following ajoutent 5 à 20 % selon les modèles.
  • Fine-tuning d’inférence (LoRA, adapters) : négligeable, moins de 1 % du pre-training.

En clair : quand on parle du coût d’entraînement de GPT-4, on parle à 95 % du pre-training. Le fine-tuning, l’alignement, les adaptations spécialisées — tout ça coûte relativement peu comparé au run initial.


Structure des coûts d’inférence

Tokens entrants et sortants : pourquoi les prix ne sont pas symétriques

Le pricing API reflète la structure de coût réelle de l’inférence :

  • Tokens entrants (input, prompt) : moins coûteux. Le modèle lit le contexte fourni via le KV cache (un mécanisme qui stocke les calculs d’attention sur les tokens déjà traités). Pas de génération séquentielle.
  • Tokens sortants (output, completion) : 3 à 6 fois plus chers. La génération est séquentielle — chaque token produit dépend du précédent. Elle consomme davantage de mémoire GPU et de temps de calcul.

Cette asymétrie apparaît clairement dans les tarifs 2024 :

ModèleInput (1M tokens)Output (1M tokens)Ratio input/output
GPT-4o (mai 2024)2,50 $10,00 $1× / 4×
Claude Opus (2024)15,00 $75,00 $1× / 5×
Gemini 1.5 Pro (2024)3,50 $10,50 $1× / 3×
DeepSeek R1 (jan. 2025)0,55 $2,19 $1× / 4×

Sources : OpenAI pricing page ; Anthropic pricing page ; SemiAnalysis DeepSeek Debates ; IntuitionLabs comparatif 2025.

Le KV cache : un levier économique silencieux

Le KV cache (Key-Value cache) est le principal outil d’économie sur les longues conversations. Dans les architectures Transformer, chaque token généré nécessite de calculer l’attention sur tous les tokens précédents. Le KV cache stocke ces calculs intermédiaires et évite de les refaire.

Les providers le monétisent différemment. Anthropic, par exemple, propose un tarif de lecture du cache 10 fois inférieur au tarif d’un nouveau contenu : 0,30 $/M tokens en cache read contre 3 $/M tokens pour du nouveau contenu (Claude Sonnet 2024). Pour les applications à longues conversations répétitives — assistants documentaires, chatbots métier — l’économie peut être substantielle.


Le basculement 2024 : l’inférence dépasse le training

OpenAI en 2024 : 2,3 milliards de dollars en compute d’inférence

Les données financières d’OpenAI pour 2024 illustrent concrètement le basculement :

  • Revenus 2024 : environ 6 Mds$ (ARR juin 2024 : 3,4 Mds$ ; progression rapide).
  • Pertes 2024 : ~5 Mds$ net malgré ces revenus [futuresearch.ai].
  • Dépenses inference 2024 : estimées à 2,3 Mds$ en compute d’inférence seul [TechCrunch / futuresearch.ai, 2024 — une source].

Pour mettre ce chiffre en perspective : 2,3 Mds$ d’inference en 2024 représente environ 15 fois le coût estimé de l’entraînement de GPT-4.5 [croisement TechCrunch / futuresearch.ai]. En une seule année d’exploitation, OpenAI dépense en inférence l’équivalent de quinze cycles d’entraînement d’un modèle frontier.

Anthropic : de -94 % à +40 % de marge brute en deux ans

Les données Anthropic (Sacra.com ; ai2.work) révèlent une trajectoire particulièrement frappante :

  • Marge brute 2024 : -94 %. Les coûts d’inférence dépassaient les revenus générés.
  • ARR décembre 2024 : ~1 Md$.
  • Projection marge brute 2025 : ~40 % [Sacra.com].
  • ARR mars 2026 : ~30 Mds$ (croissance tirée en partie par Claude Code à 2,5 Mds$ ARR en février 2026).
  • Cash-flow break-even projeté : 2028 [futuresearch.ai].

La marge brute négative de -94 % en 2024 signifie qu’Anthropic perdait de l’argent sur chaque dollar de revenu généré, du seul fait du coût d’inférence — avant même de compter les coûts R&D, marketing ou personnel.

En clair : même à 15 dollars par million de tokens pour Claude Opus, les coûts de calcul réels dépassaient les revenus. L’explosion de l’utilisation (95 % des utilisateurs Anthropic sont non-payants) [ai2.work] et les modèles de subscription bas coût (ChatGPT Plus à 20 $/mois) créent une asymétrie structurelle entre prix affiché et coût réel.

Pourquoi les marges restent difficiles

Quatre mécanismes expliquent la pression sur les marges :

  1. Offre “illimitée” sous-tarifée : proposer un accès “illimité” à 20 $/mois génère des pertes sur les utilisateurs intensifs, dont la consommation peut dépasser plusieurs centaines de dollars de compute réel.
  2. Freemium à très haute proportion : 95 % des utilisateurs Anthropic ne paient pas [ai2.work]. La base payante subventionne une infrastructure massive.
  3. CAPEX GPU en montée : les cloud providers facturent en OPEX aux labs IA, qui subissent l’escalade des tarifs GPU lors des pénuries (pic à 8 $/heure pour le H100 en 2023).
  4. Reasoning models = coûts ×10 à ×1 000 : chaque déploiement d’un modèle plus “intelligent” augmente mécaniquement le coût de service par requête.

CAPEX hyperscalers : l’escalade structurelle

L’économie de l’inference ne peut se lire sans comprendre le contexte plus large des dépenses d’infrastructure :

AnnéeAmazon AWSMicrosoft AzureGoogle GCPMetaTotal ~4 hyperscalers
2023~53 Mds$~52 Mds$~32 Mds$~28 Mds$~165 Mds$
2024~75 Mds$~60 Mds$~52 Mds$~38 Mds$~225 Mds$
2025~118 Mds$~80 Mds$~85 Mds$~69 Mds$~352 Mds$
2026p [NON VÉRIFIÉ]~200 Mds$~120 Mds$~175-185 Mds$~115-135 Mds$~660-690 Mds$

Sources : IEEE ComSoc Technology Blog (déc. 2025) ; Futurum Group (avr. 2026) ; DCPulse ; CNBC (fév. 2026). Les chiffres 2026 sont des projections déclarées par les entreprises, non réalisées.

Note critique : ces CAPEX couvrent l’ensemble de l’infrastructure cloud, pas uniquement l’IA. La part IA/GPU est estimée à 40–60 % du total en 2025-2026 selon les analystes, contre 15–20 % en 2022. La distinction énergie/refroidissement/bâtiments est traitée dans l’article [datacenters-energie].

En clair : en 2025, les quatre hyperscalers ont investi ensemble ~350 Mds$ en infrastructure cloud — dont une part croissante en GPU et systèmes d’inference. C’est 40 fois le budget d’entraînement de tous les grands modèles public de la même année.


Reasoning models : l’amplificateur de coûts

Le principe : dépenser à l’inférence ce qu’on ne dépense pas au training

Les reasoning models (o1, o3, R1) introduisent un changement de paradigme économique. Plutôt que d’entraîner un modèle plus grand pour obtenir de meilleures performances, ils allouent des ressources computationnelles supplémentaires au moment de la requête — via une “chaîne de raisonnement” interne (chain of thought) avant de répondre.

Vocabulaire

  • Test-time compute (TTC) : ressources allouées à l’inférence pour améliorer la qualité de la réponse, par opposition au training compute. Aussi appelé “inference-time compute”.
  • Chain of thought : séquence de raisonnement intermédiaire générée par le modèle avant sa réponse finale. Ces tokens “de réflexion” consomment du compute mais peuvent ne pas être tous facturés ou visibles.
  • Reasoning model : modèle spécialisé dans l’allocation de TTC — o1, o3 (OpenAI), R1 (DeepSeek). À distinguer des modèles “chat” standards.

La conséquence économique est directe : pour une même tâche complexe, un reasoning model consomme beaucoup plus de compute qu’un modèle chat standard. Ce surplus se traduit en prix.

Les ordres de grandeur : de ×6 à ×1 000

Le tableau de pricing raconte une partie de l’histoire :

ModèlePrix output (1M tokens)Multiplicateur vs GPT-4o
GPT-4o (mai 2024)10 $1× (référence)
o1-preview (sept. 2024)60 $6×
o1-pro (mars 2025)600 $60×
DeepSeek R1 (jan. 2025)2,19 $0,2×

Sources : OpenAI pricing page (2024-2025) ; SemiAnalysis DeepSeek Debates.

Le pricing ne reflète qu’une partie du différentiel réel. L’analyse du compute effectivement utilisé révèle des écarts encore plus spectaculaires :

  • o1 vs GPT-4o-128k : facteur ~15× d’inference compute pour une même tâche [Poe.com analysis, citée dans vellum.ai].
  • o3-high vs o3-low : facteur 170× de ressources computationnelles [TechCrunch, Maxwell Zeff, 23 déc. 2024].
  • o3 en mode benchmark ARC-AGI : “plus de 10 000 dollars pour runner le benchmark complet en mode high” — trop cher pour participer au prix ARC [TechCrunch, 2024].
  • o3-high vs o1-low : facteur >1 000× [TechCrunch, 2024].

En clair : entre le mode économique et le mode haute performance d’o3, OpenAI consomme 170 fois plus de ressources de calcul. Ce n’est pas un arrondi — c’est un abîme économique entre deux niveaux d’un même modèle.

DeepSeek R1 : la disruption par l’efficacité

DeepSeek R1 (janvier 2025) propose des performances équivalentes à o1 pour un prix 20 à 50 fois inférieur. La clé : des innovations architecturales sur l’inference.

Deux techniques sont particulièrement significatives économiquement :

  1. MLA (Multi-head Latent Attention) : compression du KV cache via des projections latentes. Réduit significativement la mémoire GPU requise par requête, donc le coût d’infrastructure [DeepSeek inference cost explained, IntuitionLabs].
  2. Mixture of Experts (MoE) : seulement une fraction des paramètres est activée par requête. Pour DeepSeek V3, ~37 Mds paramètres actifs par token sur un total de 671 Mds. Le coût compute par token est proportionnel aux paramètres activés, pas au total.

L’annonce de R1 a provoqué une chute de 17 % du cours Nvidia en une journée (environ 600 Mds$ de capitalisation boursière effacés) [HPCwire, jan. 2025 ; SemiAnalysis DeepSeek Debates]. Signal de marché : si on peut obtenir les mêmes performances avec beaucoup moins de GPU, la demande en infrastructure est peut-être surévaluée.


L’effondrement des prix d’inférence : -1 000× en trois ans

La thèse a16z : LLMflation

a16z documente en 2024 une baisse de coût d’un facteur 1 000 en trois ans pour un niveau de performance équivalent au GPT-3 original :

  • Novembre 2021 : GPT-3 → 60 $ par million de tokens.
  • 2024 : Llama 3.2 3B (performances MMLU ≥ 42) → 0,06 $ par million de tokens.

Réduction : 1 000 fois en trois ans pour le même niveau de performance benchmark [a16z LLMflation, 2024].

Epoch AI : -50× par an en médiane, -200× post-2024

Epoch AI (2025) analyse l’évolution des prix d’inférence sur six benchmarks (MMLU, GPQA Diamond, MATH-500, HumanEval, Chatbot Arena) :

  • Médiane de baisse : 50× par an sur les données 2022-2025.
  • Données post-janvier 2024 uniquement : 200× par an — la baisse s’est accélérée [Epoch AI, data-insights, 2025].

Pour référence : “Le prix pour atteindre les performances de GPT-4 sur les questions scientifiques de niveau doctorat a baissé de 40× par an.”

Six facteurs structurels

Six mécanismes alimentent cette déflation :

  1. Amélioration hardware : de l’A100 au H100 au B200, chaque génération améliore le ratio FLOP/watt et FLOP/dollar.
  2. Quantization : réduire la précision numérique des calculs (FP16 → FP8 → INT4) améliore l’efficacité d’un facteur 4.
  3. Optimisation software : FlashAttention, PagedAttention, spéculative decoding réduisent les goulots d’étranglement mémoire sans toucher au modèle.
  4. Modèles plus petits surpassant les anciens grands : un Llama 3.2 3B 2024 dépasse GPT-3 2020 à une fraction du coût.
  5. Instruction tuning et RLHF : des modèles mieux alignés nécessitent moins de tokens par tâche.
  6. Compétition open-source : Llama, Mistral, DeepSeek compriment les marges des providers fermés.

Le paradoxe de Jevons

Malgré la chute du coût par token, les dépenses totales en inference continuent d’augmenter. L’économiste William Stanley Jevons a observé au XIXe siècle que les gains d’efficacité énergétique augmentaient la consommation totale plutôt que de la réduire — les ressources devenant moins chères, on les utilise davantage.

Le même phénomène est à l’œuvre dans l’IA : les tokens moins chers génèrent davantage d’applications, d’utilisateurs et de cas d’usage, ce qui augmente le volume total. Les projections sectorielles [NON VÉRIFIÉ] estiment le marché de l’inference IA à 106 Mds$ en 2025 et 255 Mds$ en 2030 (CAGR 19,2 %).

Gartner projette une baisse de >90 % du coût d’inférence sur les modèles d’un trillion de paramètres d’ici 2030 par rapport à 2025 [Gartner, mars 2026]. Si l’effet Jevons se maintient, cette baisse alimentera l’expansion du marché plutôt que sa contraction.

En clair : les tokens coûtent mille fois moins qu’en 2021. Pourtant, les labs IA dépensent plus que jamais en inference. La demande suit l’offre — et le volume explose à chaque baisse de prix.


La guerre des prix de 2025

L’onde de choc DeepSeek en janvier 2025 a déclenché une compétition tarifaire dans l’industrie. En quelques mois, les prix par token ont chuté de plus de 90 % [SemiAnalysis DeepSeek Debates ; HPCwire]. OpenAI, Anthropic, Google et les providers cloud ont tous répercuté ou anticipé la pression sur leurs tarifs API.

Ce mouvement crée un paradoxe pour les labs : réduire les prix pour rester compétitifs érode les marges déjà fragiles, mais ne pas réduire les prix fait fuir les développeurs vers les alternatives moins chères. Le pricing de l’inference est devenu un jeu à somme négative à court terme, justifié par l’espoir que le volume compense.

PhaseTendanceActeurs
2021-2022Pricing opaque, marges élevéesOpenAI seul en prod grand public
2023Competition API (Anthropic, Google)Baisse graduelle
Jan. 2025Choc DeepSeek : -17 % cours Nvidia, -90 % prix tokensTout le marché
2025-2026”Inference Wars” — compression marges structurelleOpenAI, Anthropic, Google, providers cloud

Quelle stratégie économique selon le type d’usage

Profil d’usageLevier économique principalOrdre de grandeur coût
Chatbot basique, peu de contexteModèle petit (Haiku, GPT-4o mini) + batch<0,01 $/1 000 appels
RAG documentaire, contexte longKV cache + prompt caching Anthropic/GoogleCache read à 0,30 $ vs 3 $/M tokens
Reasoning lourd (audit, code complexe)Budget compute explicite (o3-low vs o3-high)0,50 $ à 50 $+ par tâche selon mode
Volume massif, batch offlineAPI batch (50 % discount OpenAI/Anthropic)Moitié du prix on-demand
Self-hosted open-sourceCoût amortissement GPU H100 ~1 $/GPU-heureÉconomique à >10 M tokens/mois

En clair : le choix du modèle et du mode d’inférence est aussi important que le fournisseur. Un usage o3-high là où o3-low suffit multiplie la facture par 170.


Ce qu’on retient en 2026

L’économie de l’IA générative est entrée dans une phase de tension structurelle. Le training coûte cher — jusqu’à 100 M$ pour un modèle frontier — mais c’est l’inférence qui domine désormais les budgets sur la durée de vie d’un modèle. OpenAI a dépensé 2,3 Mds$ en inference compute en 2024, soit quinze fois le coût d’entraînement de GPT-4.5. Anthropic affichait une marge brute de -94 % la même année.

Simultanément, le coût par token s’est effondré — facteur 1 000 en trois ans selon a16z, -200× par an selon Epoch AI depuis 2024. Les reasoning models comme o3 compliquent l’équation : ils permettent des performances inédites mais consomment jusqu’à 1 000 fois plus de ressources par requête que leurs équivalents standards.

La déflation tarifaire (effet LLMflation) et la hausse des volumes (effet Jevons) se compensent pour l’instant. Le marché reste déficitaire pour les labs IA — les pertes se chiffrent en milliards, justifiées par l’espoir d’un point d’inflexion que les projections situent vers 2028.