Aller au contenu

Enjeux

Les questions qui dépassent la technique

12 articles · 3 sous-catégories
Sous-catégorie
Type de contenu
comparatif Évaluation

Ce que les laboratoires publient sur leurs modèles — et ce qu'ils taisent

Relevé du même jour sur les pages modèles d'Anthropic, OpenAI et Google : quatre informations décident d'une architecture, et aucun des trois ne les publie toutes.

evaluationdocumentationtransparenceanthropicopenaigooglearchitecturemodeles
analyse Économie

Le coût réel d'un système multi-agents — un ordre de grandeur au-dessus

Un agent solo coûte 9 dollars par session. Un système multi-agents avec orchestrateur coûte 200 dollars. D'où vient ce facteur 22× et quand est-il justifié ? Anatomie des coûts cachés : tokens de coordination, recréation de contexte, boucles de vérification.

multi-agentscoûttokensorchestrationprompt-cachingéconomieproductionscaling
analyse Évaluation

Le LLM-juge est trois fois plus permissif que l'humain

Les données quantitatives du problème LLM-as-judge : taux de faux positifs supérieur à 75 %, précision équilibrée de 69 %, et une calibration par régression qui réduit l'erreur de 72 %. Radiographie chiffrée d'une crise méthodologique.

evaluationLLM-as-Judgefaux-positifscalibrationmetrologieAI-Scientistbenchmarkpermissivite
analyse Évaluation

Mirage — quand les LLM « voient » sans regarder

Les modèles multimodaux de pointe produisent des descriptions confiantes d'images qu'ils n'analysent pas. 74% des benchmarks multimodaux sont contaminés. L'évaluation multimodale est structurellement cassée.

multimodalVLMbenchmarkcontaminationevaluationmiragevisionradiologie
guide Déploiement

Les 14 modes de défaillance des agents IA

La taxonomie MAST identifie 14 modes de défaillance des systèmes multi-agents LLM, classés en trois catégories. Un guide praticien pour anticiper et diagnostiquer les pannes de vos agents.

agentsdefaillanceMASTmulti-agentdebuggingproductiontaxonomiefiabilite
analyse Gouvernance

IA agentique — catalyseur d'une prochaine explosion d'intelligence ?

Evans, Bratton et Agüera y Arcas (Google/UChicago, 2026) soutiennent que la prochaine explosion d'intelligence ne sera pas un esprit monolithique mais une société distribuée d'agents humains et artificiels. Analyse de leur thèse et de ses limites.

agentsia-agentiquesingularitéintelligence-collectivemulti-agentsgouvernancealignementprospective
analyse Gouvernance

Made by AI — et alors ?

Tout le contenu de ce site est produit avec assistance IA. Voici pourquoi c'est assumé, ce que ça change concrètement et pourquoi la transparence est le seul positionnement honnête.

transparenceia-generativemethodeethiqueproduction-contenusourcingverificationauthenticite
concept Évaluation

Pourquoi votre agent ne sait pas s'il a réussi

Entre 27 % et 78 % des succès rapportés par les benchmarks d'agents dissimulent des violations procédurales. Le critère binaire succès/échec est structurellement insuffisant — et les alternatives restent des problèmes ouverts.

evaluationagentsbenchmarksverificationtrajectoiremonitoringmulti-agentsqualite
concept Évaluation

Pourquoi les LLMs se trompent en auto-évaluation

Les grands modèles de langage sont utilisés pour s'évaluer eux-mêmes et évaluer d'autres LLMs. Quatre biais systémiques expliquent pourquoi ce paradigme déraille — et pourquoi les corriger est plus difficile qu'il n'y paraît.

evaluationbiaisLLM-as-Judgecalibrationauto-evaluationsurconfiancedebiaisementmetrologie
concept Sécurité

Guardrails LLM — la sécurité comme architecture

Les guardrails sont des mécanismes de contrôle multicouches qui encadrent le comportement des agents autonomes. Ils ne limitent pas les capacités de l'agent : ils les rendent déployables en conditions réelles.

guardrailssécuritéagentsvalidationfiltragemoindre privilègepydanticcheckpoint
concept Déploiement

Human-in-the-Loop — l'humain et l'agent, un duo nécessaire

Le pattern Human-in-the-Loop structure la supervision humaine des systèmes agentiques : quand intervenir, comment déléguer, et comment l'humain reste indispensable sans bloquer l'automatisation.

human-in-the-loopsupervisionrlhfescalationautonomieagentsdéploiementalignement
concept Gouvernance

Réguler l'IA — pourquoi l'Europe, les États-Unis et la Chine ne parlent pas le même langage

Trois puissances, trois philosophies de régulation. L'Europe classe les risques, la Chine contrôle les contenus, les États-Unis oscillent selon les administrations.

gouvernancerégulationeu-ai-actdigital-omnibussécuritééthiquegéopolitique