En bref

L’analyse de 1 200 déploiements en production (l’environnement réel où tournent les logiciels utilisés par les clients finaux, par opposition à un prototype de laboratoire) — source ZenML, 2025 — pose un constat sans équivoque : la phase d’expérimentation est terminée, la phase d’ingénierie commence. Les chiffres d’adoption varient fortement selon la source — 11 % chez Deloitte, 57 % chez LangChain — mais cette dispersion révèle un problème de définition plus qu’une contradiction. Les cas qui fonctionnent partagent un point commun : des agents étroits (un agent = une tâche précise dans un domaine borné, pas un assistant généraliste), mono-domaine, sous supervision humaine.

En clair : mettre un agent LLM en production, c’est comme ouvrir un restaurant. Un prototype, c’est cuisiner pour ses amis le dimanche — les bugs sont pardonnés. La production, c’est servir 500 couverts par soir, tous les soirs, avec inspection sanitaire, comptes à tenir et clients qui râlent. La promesse démo et la fiabilité opérationnelle sont deux métiers différents.


Pourquoi les chiffres divergent

En clair : les chiffres disent la même chose avec des règles différentes. Un sondage qui compte « une équipe a un agent qui tourne » comptera tout le monde. Un sondage qui exige « gouvernance formelle + adoption large » n’en comptera presque aucun. Les deux sont honnêtes, ils mesurent deux étapes différentes.

57 % des organisations ont des agents en production selon LangChain (n=1 300+). Deloitte (2026) mesure seulement 11 %. Ces deux chiffres sont corrects — ils ne mesurent pas la même chose.

LangChain recense tout déploiement fonctionnel (un agent qui tourne pour au moins un cas d’usage réel, même dans une seule équipe), y compris à périmètre réduit ou dans une seule équipe. Deloitte mesure le déploiement à l’échelle organisationnelle (adoption généralisée avec gouvernance centrale, politiques de sécurité, audit), avec gouvernance et adoption généralisée. L’écart révèle que beaucoup d’organisations ont des agents qui tournent quelque part, mais très peu ont atteint un déploiement systématique (intégré dans le flux de travail standard, avec maintenance, monitoring et résilience opérationnelle).

McKinsey (nov. 2025, n=1 993) affine le tableau : 88 % des organisations utilisent l’IA dans au moins une fonction, mais seulement 23 % sont en train de déployer à l’échelle un système agentique (un ensemble d’agents LLM qui enchaîne décisions et appels d’outils pour accomplir une tâche complète de façon semi-autonome). Gartner (août 2025) estime à moins de 5 % les applications enterprise embarquant des agents aujourd’hui, avec une projection à 40 % d’ici fin 2026.

Le consensus n’est pas sur les chiffres. Il est sur la tendance : le passage du prototype au système maintenu en production est le vrai défi.


Six patterns qui distinguent les équipes qui livrent

En clair : les équipes qui réussissent ne sont pas celles qui ont le « meilleur » modèle, mais celles qui traitent l’agent comme un logiciel industriel — avec garde-fous, tests, monitoring et discipline d’ingénieur.

ZenML a analysé 1 200 cas dans sa LLMOps Database (base de cas ouverte documentant les déploiements LLM en production ; l’équivalent d’un retour d’expérience mutualisé pour l’industrie). Six patterns distinguent les équipes qui déploient réellement de celles bloquées en mode démonstration.

Vocabulaire technique de la section

  • Context engineering : discipline consistant à choisir quelle information injecter dans la fenêtre du modèle, quand, et sous quelle forme. Proche de ce qu’un bibliothécaire fait pour un chercheur : trier les bonnes sources avant lecture.
  • Prompt engineering : écriture fine des instructions textuelles données au modèle. Utile, mais insuffisant à grande échelle si l’information injectée est mauvaise au départ.
  • Token : unité élémentaire de texte pour un LLM, à peu près 3-4 caractères en français. La « fenêtre de contexte » se mesure en tokens.
  • Guardrails : garde-fous automatisés qui empêchent l’agent de faire certaines actions (mauvais outil, coût excessif, permission manquante).
  • Circuit breaker : disjoncteur électrique appliqué au logiciel. Si un compteur explose (trop de requêtes, trop de coût), le circuit coupe automatiquement avant dégât plus large.
  • Shadow testing : mode « agent qui regarde sans agir ». L’agent produit des décisions en parallèle du processus humain, on compare, on ajuste, on active seulement quand la précision atteint la cible.
  • Observabilité : capacité à voir ce que fait le système en temps réel (quels appels, quels coûts, quelles erreurs). Sans observabilité, un bug en production reste invisible.

1. Context engineering plutôt que prompt engineering. La dégradation de la fenêtre de contexte (espace mémoire temporaire dans lequel le modèle lit et écrit — elle ne grandit pas indéfiniment sans perte de qualité) commence entre 50 000 et 150 000 tokens quelle que soit la capacité théorique du modèle. Les équipes performantes architecturent l’injection d’information (juste-à-temps : on ne donne au modèle que l’info dont il a besoin maintenant, pas tout le dossier ; masquage d’outils : on cache les outils non pertinents pour l’étape en cours) plutôt que d’affiner les prompts.

2. Guardrails dans l’infrastructure, pas dans les instructions. Les contraintes de sécurité architecturales — circuit breakers (coupe-circuits logiciels), permissions en double couche (l’agent a un droit demandé + un droit effectivement vérifié par un second système), isolation de session (ce que fait un utilisateur n’affecte pas un autre) — remplacent les approches basées sur les prompts pour les systèmes critiques. Dire « sois prudent » dans le prompt ne suffit pas : le garde-fou doit être dans le code qui encadre l’agent, pas dans le texte que le modèle peut ignorer.

3. Agents étroits sous supervision humaine. Les agents en production fonctionnent comme des spécialistes mono-domaine, pas comme des entités autonomes. Ramp (gestion de notes de frais) traite 65 % des approbations de manière autonome [NON VÉRIFIÉ — source unique ZenML].

4. Shadow testing avant mise en production. Les agents sont d’abord exécutés en mode shadow (l’agent calcule une décision en parallèle mais c’est l’humain qui décide ; on compare a posteriori) sur des transactions réelles, comparés aux décisions humaines, puis activés uniquement quand le seuil de précision cible est atteint.

5. Évaluation comme pratique d’ingénierie standard. 89 % des équipes avec des agents en production ont implémenté de l’observabilité (instrumentation qui logue chaque appel, chaque coût, chaque erreur — source LangChain, 2025). Seulement 52 % ont des évaluations formelles (jeux de tests reproductibles, avec métriques chiffrées et comparaison régression). Les équipes les plus matures construisent des jeux de données de référence et des systèmes d’évaluation automatique.

6. Ingénierie logicielle avant sélection de modèle. ZenML formule explicitement : « Les fondamentaux du génie logiciel — pas les modèles frontier (les modèles les plus puissants du marché à un instant donné, typiquement GPT-4, Claude, Gemini dernière génération) — restent le principal prédicteur de succès. » Optimiser le réseau et l’infrastructure génère plus de valeur que de passer à un modèle plus récent.


Exemples concrets : architectures qui fonctionnent

En clair : trois cas réels, trois approches différentes, une constante — le périmètre est borné et les responsabilités sont claires. Personne n’essaie de faire un agent qui fait tout.

Stripe — agents one-shot à périmètre étroit

L’architecture “Minions” de Stripe repose sur des agents sans état conversationnel (chaque appel est isolé, l’agent ne garde aucune mémoire entre deux requêtes — un peu comme un formulaire à remplir à chaque fois, pas une discussion suivie) : un agent, une tâche, un appel LLM. Pour les workflows (enchaînements de tâches logiques) de conformité complexes, un graphe orienté acyclique ou DAG (schéma où les tâches s’enchaînent dans un ordre précis sans jamais revenir en arrière, comme un arbre généalogique qui ne boucle pas) enchaîne ces agents spécialisés. Résultat sur la détection de fraude : précision passée de 59 % à 97 % pour les grands marchands.

Uber — réseau d’agents spécialisés par étape

Uber a migré du code à grande échelle avec LangGraph (framework open-source pour orchestrer plusieurs agents LLM en graphe, avec états partagés et logique conditionnelle), en assignant un agent distinct à chaque étape du pipeline de test (enchaînement automatique des étapes de vérification du code : lint = analyse du style, build = compilation, test = exécution des tests automatisés). L’agent de lint couple analyse statique déterministe (outil qui lit le code source et applique des règles fixes, toujours le même résultat pour le même code) et LLM pour les cas ambigus — un pattern dit “hybride” (on utilise le LLM uniquement quand le déterministe ne sait pas trancher) qui réduit les appels LLM aux situations où ils apportent vraiment de la valeur.

JPMorgan — déploiement institutionnel

La LLM Suite (plateforme interne JPMorgan donnant accès à plusieurs modèles LLM via une interface unifiée pour les employés, avec contrôle sécurité et audit) de JPMorgan a onboardé (intégré dans la plateforme, avec formation et accès) 200 000 utilisateurs en 8 mois, avec 450 cas d’usage en production. Budget IA 2024 : environ 1,3 milliard de dollars (sur 17 milliards de budget tech total). Gain de productivité sur le code estimé à +10-20 %.


Échecs documentés

En clair : les échecs ne viennent pas du modèle qui « hallucine ». Ils viennent d’agents qui tournent en rond sans garde-fou, ou d’agents qui se parlent entre eux sans vérifier ce qu’ils se disent.

L’escalade de coûts incontrôlée

Un cas de la ZenML Database illustre le risque d’un bug de boucle infinie (l’agent rappelle un outil sans condition de sortie ; chaque appel coûte, les coûts s’additionnent jusqu’à ce qu’un humain intervienne) : coûts hebdomadaires passés de 127 $ à 47 000 $ en quatre semaines. Six semaines de travail de correction. Les agents avec accès aux systèmes de facturation exigent des circuit breakers explicites (limites chiffrées hard-codées : si coût > X, on arrête sans demander).

Les systèmes multi-agents génériques ne passent pas en production

Cemri, Pan, Yang et al. (UC Berkeley, arXiv mars 2025) ont analysé 1 600+ traces d’exécution (enregistrements complets de ce qu’a fait l’agent à chaque étape : quel outil appelé, quel input, quel output, quelle erreur) sur 7 frameworks (bibliothèques logicielles qui fournissent la structure et les outils pour bâtir un système agentique) différents, dont GPT-4, Claude 3, et CodeLlama. Résultat : 14 modes d’échec (catégories de dysfonctionnement distinctes, chacune avec sa propre cause racine) distincts, classés en trois catégories — conception du système, désalignement entre agents (deux agents qui travaillent sur la même tâche partent dans des directions contradictoires sans s’en rendre compte), vérification de tâche.

Sur ChatDev (framework multi-agents — plusieurs agents qui collaborent via échange de messages pour accomplir une tâche complexe — open-source), le taux de correction correcte est de 25 %. Même avec des interventions d’optimisation (prompt engineering + orchestration améliorée), le gain est de +14 points seulement — insuffisant pour la production réelle.

La distinction critique : les systèmes multi-agents généralistes (conçus pour traiter tous types de tâches) présentent des taux d’échec prohibitifs. Les systèmes multi-agents à périmètre borné (on définit à l’avance le domaine exact couvert et on exclut le reste) et spécialisés (Uber, Stripe) fonctionnent.

La prédiction Gartner sur les annulations

Gartner (2025) prévoit qu’au moins 40 % des projets d’IA agentique (systèmes autonomes où les agents LLM prennent des décisions et agissent sans validation humaine à chaque étape) seront annulés d’ici fin 2027. La cause identifiée n’est pas technique : coûts escaladants, valeur métier insuffisante, et absence de contrôles de risque (dispositifs organisationnels et techniques qui limitent l’exposition financière et réputationnelle : quotas, audits, validation croisée). Deloitte (2026) corrobore : seulement 21 % des organisations disposent d’un modèle de gouvernance mature (règles écrites, rôles assignés, processus d’approbation et de révocation formalisés) pour les agents autonomes.


ROI : auto-déclaré vs indépendant

En clair : quand les chiffres viennent d’un sondage où l’entreprise se déclare elle-même, ils sont flatteurs. Quand les chiffres viennent d’un tiers qui vérifie les comptes, ils chutent. Le grand écart (171 % vs < 5 %) ne veut pas dire que quelqu’un ment — cela veut dire qu’on ne mesure pas la même chose, et qu’aucune étude n’impose encore de standard.

Les enquêtes auto-déclaratives (sondages où ce sont les entreprises elles-mêmes qui répondent sans vérification externe de leurs chiffres) affichent des chiffres élevés : retour sur investissement ou ROI (rapport entre le gain généré et l’investissement engagé, exprimé en pourcentage ; un ROI de 171 % signifie que pour 100 € investis, on récupère 271 €) moyen de 171 % selon certaines agrégations, 74 % des exécutifs déclarant un ROI dans la première année [NON VÉRIFIÉ — sources sans méthodologie publiée]. Ces chiffres sont à traiter avec précaution : ils proviennent majoritairement d’études commanditées par des vendeurs ou d’enquêtes sans audit indépendant (vérification par un tiers qui n’a aucun intérêt dans le résultat annoncé).

McKinsey (source indépendante, n=1 993) est nettement plus sobre : 39 % des organisations attribuent un impact sur leur résultat opérationnel (ce que l’entreprise gagne effectivement après avoir payé ses coûts courants, également appelé EBIT — earnings before interest and taxes) à l’IA. Parmi eux, la majorité rapporte moins de 5 % de leur résultat opérationnel.

Les deux positions coexistent dans la littérature sans réconciliation. L’absence de définition standardisée d’un “agent en production” et l’absence d’audit indépendant expliquent en grande partie la dispersion.


Ce qu’il faut retenir

  • Les chiffres d’adoption (11 % Deloitte vs 57 % LangChain) mesurent des réalités différentes : déploiement organisationnel systématique versus toute instance fonctionnelle. Les deux sont corrects.
  • Les agents en production réussis sont étroits, mono-domaine, et supervisés — pas autonomes et généralistes.
  • L’UC Berkeley (MAST, 2025) a documenté 14 modes d’échec distincts des systèmes multi-agents, avec des taux de correction aussi bas que 25 % sur les frameworks généralistes.
  • Gartner prévoit 40 % d’annulations d’ici 2027 pour des raisons de gouvernance et de valeur métier insuffisante — pas pour des raisons techniques.
  • Le ROI auto-déclaré (171 % moyen) contraste fortement avec les mesures indépendantes McKinsey (impact EBIT < 5 % pour la majorité). Aucune source académique ne corrobore les niveaux élevés.

Signaux skill

Aucune insuffisance majeure du skill identifiée sur cet article.

Note éditoriale : la T-source contient plusieurs facts tagués [NON VÉRIFIÉ] (source unique). Ces tags ont été conservés dans l’article pour les affirmations les plus importantes (Ramp 65 %, ROI 171 %). Les chiffres clairement secondaires ou illustratifs non vérifiés ont été omis plutôt qu’inclus avec réserve, conformément à la règle “dense > dilué”.