{
  "a_propos": {
    "source": "https://labo-llm.fr/donnees",
    "licence": "CC BY 4.0 — citer labo-llm.fr",
    "methode": "https://labo-llm.fr/methode",
    "note": "Le niveau de preuve est calculé depuis les classes des sources, jamais saisi. « Triangulé » exige deux origines institutionnelles distinctes, pas deux documents."
  },
  "genere_le": "2026-09-12",
  "total": 235,
  "articles_instrumentes": 121,
  "par_niveau": {
    "primaire": 215,
    "corrobore": 9,
    "triangule": 11
  },
  "assertions": [
    {
      "id": "amazon-nova#nova-forge-open-training",
      "enonce": "AWS parle d'*open training*, c'est-à-dire l'accès aux points de contrôle pré-entraînés, mi-entraînés et post-entraînés, donc la possibilité d'injecter ses propres données à chaque étape de l'entraînement, et pas seulement en fin de course.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "aws-novaforge",
          "titre": "Amazon, \"Amazon introduces new frontier Nova models, a pioneering Nova Forge service, and Nova Act\", re:Invent 2025",
          "url": "https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models",
          "classe": "P2",
          "origine": "aboutamazon.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Amazon Nova — la stratégie modèles d'AWS face à OpenAI et Google",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/amazon-nova",
        "url_en": "https://labo-llm.fr/en/acteurs/amazon-nova",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "amazon-nova#nova-act-90",
      "enonce": "AWS annonce 90 % de fiabilité sur les premiers flux clients — chiffre du fournisseur, non répliqué.",
      "nature": "extrapolation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "aws-novaforge",
          "titre": "Amazon, \"Amazon introduces new frontier Nova models, a pioneering Nova Forge service, and Nova Act\", re:Invent 2025",
          "url": "https://www.aboutamazon.com/news/aws/aws-agentic-ai-amazon-bedrock-nova-models",
          "classe": "P2",
          "origine": "aboutamazon.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Amazon Nova — la stratégie modèles d'AWS face à OpenAI et Google",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/amazon-nova",
        "url_en": "https://labo-llm.fr/en/acteurs/amazon-nova",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "anthropic#gamme-5-prix",
      "enonce": "Sonnet 5 (fiche système datée du 30 juin 2026) devient le modèle par défaut des offres Free et Pro et descend à 2 $ / 10 $ par million de tokens, contre 3 $ / 15 $ pour Sonnet 4.6.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "platform-1779fb",
          "titre": "Anthropic, \"Claude API — Models overview\", consulté 2026",
          "url": "https://platform.claude.com/docs/en/about-claude/models/overview",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Anthropic — de la recherche au produit",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/anthropic",
        "url_en": "https://labo-llm.fr/en/acteurs/anthropic",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "anthropic#retrait-engage",
      "enonce": "Anthropic publie pour chacun une date de retrait engagée, ce que ne font ni OpenAI ni Google — c'est une des rares garanties de stabilité contractuelle du marché.",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "platform-1779fb",
          "titre": "Anthropic, \"Claude API — Models overview\", consulté 2026",
          "url": "https://platform.claude.com/docs/en/about-claude/models/overview",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Anthropic — de la recherche au produit",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/anthropic",
        "url_en": "https://labo-llm.fr/en/acteurs/anthropic",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "anthropic#serie-g-380",
      "enonce": "Série G à 380 milliards en février 2026 — 30 milliards levés en un seul tour, le deuxième plus important de l'histoire du capital-risque",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-25",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "cnbc-c4f8a4",
          "titre": "CNBC, \"Anthropic closes $30 billion funding round at $380 billion valuation\", février 2026",
          "url": "https://www.cnbc.com/2026/02/12/anthropic-closes-30-billion-funding-round-at-380-billion-valuation.html",
          "classe": "S1",
          "origine": "cnbc.com",
          "consulte_le": null
        },
        {
          "id": "anthropic-5f2c1d",
          "titre": "Anthropic, \"Claude's Constitution\", janvier 2026",
          "url": "https://www.anthropic.com/news/claudes-constitution",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Anthropic — de la recherche au produit",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/anthropic",
        "url_en": "https://labo-llm.fr/en/acteurs/anthropic",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "claude-famille#sonnet46-bancs",
      "enonce": "Sonnet 4.6 (17 février) : SWE-bench 79,6%, OSWorld 72,5%",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "platform-1779fb",
          "titre": "Models overview — Claude API Docs",
          "url": "https://platform.claude.com/docs/en/about-claude/models/overview",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "La famille Claude — Haiku, Sonnet, Opus, et maintenant Fable",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/claude-famille",
        "url_en": "https://labo-llm.fr/en/acteurs/claude-famille",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "claude-famille#contexte-200k",
      "enonce": "La version 2.1 (novembre 2023) introduit la fenêtre contextuelle 200 000 tokens",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "platform-1779fb",
          "titre": "Models overview — Claude API Docs",
          "url": "https://platform.claude.com/docs/en/about-claude/models/overview",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        },
        {
          "id": "platform-3fc182",
          "titre": "Context windows — Claude API Docs",
          "url": "https://platform.claude.com/docs/en/build-with-claude/context-windows",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "La famille Claude — Haiku, Sonnet, Opus, et maintenant Fable",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/claude-famille",
        "url_en": "https://labo-llm.fr/en/acteurs/claude-famille",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "cohere#command-a-plus",
      "enonce": "C'est le premier modèle Mixture of Experts de la maison, multimodal et multilingue, orienté agents — et Cohere revendique qu'il tourne sur **deux GPU H100**.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "cohere-commandaplus",
          "titre": "Cohere, \"Introducing Command A+\", 20 mai 2026",
          "url": "https://cohere.com/blog/command-a-plus",
          "classe": "P1",
          "origine": "cohere.com",
          "consulte_le": null
        },
        {
          "id": "docs-b921c6",
          "titre": "docs.cohere.com — Models overview, Command R, Command R+, Command R7B, Command A (consulté avril 2026)",
          "url": "https://docs.cohere.com/docs/models",
          "classe": "P2",
          "origine": "cohere.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Cohere — l'IA enterprise-first depuis Toronto",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/cohere",
        "url_en": "https://labo-llm.fr/en/acteurs/cohere",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "constitutional-ai-rlaif#ccai-1000-americains",
      "enonce": "Anthropic a tenté une réponse partielle avec **Collective Constitutional AI** (2024) : un processus d'input public impliquant environ 1 000 Américains via la plateforme Polis pour co-rédiger une constitution alternative.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "anthropic-5d4707",
          "titre": "Anthropic Research. Collective Constitutional AI: Aligning a Language Model with Public Input (2024).",
          "url": "https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Constitutional AI — quand le modèle s'auto-aligne selon des principes écrits",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/constitutional-ai-rlaif",
        "url_en": "https://labo-llm.fr/en/acteurs/constitutional-ai-rlaif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "constitutional-ai-rlaif#ccai-50-recouvrement",
      "enonce": "La constitution publique résultante présente environ 50 % de recouvrement conceptuel avec la constitution interne, mais insiste davantage sur l'objectivité et l'accessibilité.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "anthropic-5d4707",
          "titre": "Anthropic Research. Collective Constitutional AI: Aligning a Language Model with Public Input (2024).",
          "url": "https://www.anthropic.com/research/collective-constitutional-ai-aligning-a-language-model-with-public-input",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Constitutional AI — quand le modèle s'auto-aligne selon des principes écrits",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/constitutional-ai-rlaif",
        "url_en": "https://labo-llm.fr/en/acteurs/constitutional-ai-rlaif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "constitutional-ai-rlaif#cai-llama3-collapse",
      "enonce": "Des réplications du pipeline CAI sur Llama 3-8B avec DPO (2025) montrent des signes de model collapse lors des itérations.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-4f8901",
          "titre": "Constitution or Collapse? Exploring Constitutional AI with Llama 3-8B (2025). — arXiv:2504.04918",
          "url": "https://arxiv.org/abs/2504.04918",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Constitutional AI — quand le modèle s'auto-aligne selon des principes écrits",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/constitutional-ai-rlaif",
        "url_en": "https://labo-llm.fr/en/acteurs/constitutional-ai-rlaif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "deepseek-ai#v4-deux-modeles",
      "enonce": "La famille compte deux modèles, tous deux à un million de tokens de contexte : **V4-Pro** (1 600 milliards de paramètres au total, 49 milliards actifs) et **V4-Flash** (284 milliards au total, 13 milliards actifs).",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "deepseek-v4-preview",
          "titre": "DeepSeek, \"DeepSeek V4 Preview Release\", 24 avril 2026",
          "url": "https://api-docs.deepseek.com/news/news260424/",
          "classe": "P1",
          "origine": "deepseek.com",
          "consulte_le": null
        },
        {
          "id": "deepseek-v4-card",
          "titre": "DeepSeek, \"DeepSeek V4 Technical Documentation\" (carte de modèle), 27 avril 2026",
          "url": "https://fe-static.deepseek.com/chat/transparency/deepseek-V4-model-card-EN.pdf",
          "classe": "P1",
          "origine": "deepseek.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "DeepSeek — quand un fonds quantitatif construit un laboratoire frontier",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/deepseek-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/deepseek-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "deepseek-ai#v3-moe-671",
      "enonce": "V3 est un modèle **Mixture of Experts** (MoE) : sur 671 milliards de paramètres au total, seuls 37 milliards sont activés pour chaque token traité.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-25",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-d76507",
          "titre": "arXiv:2412.19437 — DeepSeek-V3 Technical Report (DeepSeek-AI, décembre 2024). Source primaire officielle V3.",
          "url": "https://arxiv.org/abs/2412.19437",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "DeepSeek — quand un fonds quantitatif construit un laboratoire frontier",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/deepseek-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/deepseek-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "deepseek-ai#cout-5576",
      "enonce": "Le rapport V3 déclare **2,788 millions de H800 GPU-heures** pour l'entraînement, soit un coût marginal de **5,576 millions de dollars** au prix de location des H800.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-25",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-d76507",
          "titre": "arXiv:2412.19437 — DeepSeek-V3 Technical Report (DeepSeek-AI, décembre 2024). Source primaire officielle V3.",
          "url": "https://arxiv.org/abs/2412.19437",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "DeepSeek — quand un fonds quantitatif construit un laboratoire frontier",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/deepseek-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/deepseek-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "ecosysteme-acteurs#anthropic-serie-g",
      "enonce": "Anthropic a atteint 14 milliards de dollars de revenus en run-rate début 2026, avec une valorisation de 380 milliards de dollars après une levée de 30 milliards en Series G.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "anthropic-d7d479",
          "titre": "Anthropic, \"Anthropic raises $30 billion Series G funding, $380 billion post-money valuation\", février 2026",
          "url": "https://www.anthropic.com/news/anthropic-raises-30-billion-series-g-funding-380-billion-post-money-valuation",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "L'écosystème LLM — cartographie des forces en présence",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/ecosysteme-acteurs",
        "url_en": "https://labo-llm.fr/en/acteurs/ecosysteme-acteurs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "ecosysteme-acteurs#deepseek-r1-mit",
      "enonce": "En janvier 2025, une startup de Hangzhou d'environ 200 employés a publié DeepSeek R1 sous licence MIT.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "cacm-66f952",
          "titre": "DeepSeek / Communications of the ACM, \"DeepSeek Inside: Origins, Technology, and Impact\", 2025",
          "url": "https://cacm.acm.org/opinion/deepseek-inside-origins-technology-and-impact/",
          "classe": "S1",
          "origine": "acm.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "L'écosystème LLM — cartographie des forces en présence",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/ecosysteme-acteurs",
        "url_en": "https://labo-llm.fr/en/acteurs/ecosysteme-acteurs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "ecosysteme-acteurs#hf-41-telechargements",
      "enonce": "Sur Hugging Face, ils représenteraient 41 % des téléchargements sur 12 mois — un chiffre issu d'une source unique, à traiter avec précaution.",
      "nature": "extrapolation",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "huggingface-429881",
          "titre": "Hugging Face, \"State of Open Source on Hugging Face: Spring 2026\", 2026",
          "url": "https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026",
          "classe": "P2",
          "origine": "huggingface.co",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "L'écosystème LLM — cartographie des forces en présence",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/ecosysteme-acteurs",
        "url_en": "https://labo-llm.fr/en/acteurs/ecosysteme-acteurs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "gemini#contexte-1m",
      "enonce": "Gemini 2.5 Pro maintient 1 million de tokens en entrée ; certains déploiements via Vertex AI permettent 2 millions de tokens pour les usages enterprise",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "ai-2de9fc",
          "titre": "Models | Gemini API | Google AI for Developers",
          "url": "https://ai.google.dev/gemini-api/docs/models",
          "classe": "P2",
          "origine": "google.dev",
          "consulte_le": null
        },
        {
          "id": "arxiv-c56b89",
          "titre": "Gemini 2.5: Pushing the Frontier — rapport technique ArXiv",
          "url": "https://arxiv.org/abs/2507.06261",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Gemini — la réponse de Google",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gemini",
        "url_en": "https://labo-llm.fr/en/acteurs/gemini",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gemini#rappel-degrade",
      "enonce": "La fenêtre de 1 million de tokens est disponible depuis Gemini 1.5 Pro, mais la précision de rappel se dégrade sur certaines tâches au-delà de certains seuils",
      "nature": "interpretation",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-c56b89",
          "titre": "Gemini 2.5: Pushing the Frontier — rapport technique ArXiv",
          "url": "https://arxiv.org/abs/2507.06261",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Gemini — la réponse de Google",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gemini",
        "url_en": "https://labo-llm.fr/en/acteurs/gemini",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "google-deepmind#tpu8-dedouble",
      "enonce": "En 2026, Google annonce la huitième génération et la sépare en deux puces : **TPU 8t** pour l'entraînement (superpod de 9 600 puces, 2 pétaoctets de mémoire partagée, 121 ExaFLOPS) et **TPU 8i** pour l'inférence (288 Go de HBM, 384 Mo de SRAM sur puce).",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "blog-tpu8",
          "titre": "Google, \"Our eighth generation TPUs: two chips for the agentic era\", 2026",
          "url": "https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/eighth-generation-tpu-agentic-era/",
          "classe": "P1",
          "origine": "blog.google",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Google DeepMind — l'infrastructure au service de l'IA",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/google-deepmind",
        "url_en": "https://labo-llm.fr/en/acteurs/google-deepmind",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "google-deepmind#version-ne-dit-pas-puissance",
      "enonce": "En septembre 2026, le modèle le plus « avancé » en numéro est un Flash 3.8, pendant que le raisonnement lourd reste sur un Pro 3.1 plus ancien.",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "deepmind-gemini",
          "titre": "Google DeepMind — Gemini, page de gamme (consultée le 2026-09-06)",
          "url": "https://deepmind.google/models/gemini/",
          "classe": "P1",
          "origine": "google.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Google DeepMind — l'infrastructure au service de l'IA",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/google-deepmind",
        "url_en": "https://labo-llm.fr/en/acteurs/google-deepmind",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpt#gpt41-contexte",
      "enonce": "GPT-4.1 (avril 2025) porte la fenêtre de contexte à 1 million de tokens.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-03-21",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-gpt41",
          "titre": "OpenAI — Introducing GPT-4.1",
          "url": "https://openai.com/index/gpt-4-1/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": "2026-03-21"
        },
        {
          "id": "helicone-gpt41",
          "titre": "Helicone — GPT-4.1 Full Developer Guide",
          "url": "https://www.helicone.ai/blog/gpt-4.1-full-developer-guide",
          "classe": "S2",
          "origine": "helicone.ai",
          "consulte_le": "2026-03-21"
        }
      ],
      "article": {
        "titre": "Les GPT d'OpenAI — de GPT-4o à Astra",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gpt",
        "url_en": "https://labo-llm.fr/en/acteurs/gpt",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpt#catalogue-56-contexte",
      "enonce": "La gamme GPT-5.6 remplace le modèle unique par trois variantes nommées, toutes à 1,05 million de tokens de contexte",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-pricing",
          "titre": "OpenAI — API Pricing",
          "url": "https://openai.com/api/pricing/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": "2026-09-06"
        }
      ],
      "article": {
        "titre": "Les GPT d'OpenAI — de GPT-4o à Astra",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gpt",
        "url_en": "https://labo-llm.fr/en/acteurs/gpt",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpt#etalement-prix",
      "enonce": "À contexte identique de 1,05 million de tokens, la sortie va de 1,20 $ à 50 $ par million de tokens selon la variante.",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-pricing",
          "titre": "OpenAI — API Pricing",
          "url": "https://openai.com/api/pricing/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": "2026-09-06"
        }
      ],
      "article": {
        "titre": "Les GPT d'OpenAI — de GPT-4o à Astra",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gpt",
        "url_en": "https://labo-llm.fr/en/acteurs/gpt",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpt#o1-aime",
      "enonce": "74 % AIME contre 12 % pour GPT-4o, soit ×6",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-03-21",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-o1",
          "titre": "OpenAI — Learning to reason with LLMs (o1)",
          "url": "https://openai.com/index/learning-to-reason-with-llms/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": "2026-03-21"
        },
        {
          "id": "wikipedia-o1",
          "titre": "Wikipedia — OpenAI o1",
          "url": "https://en.wikipedia.org/wiki/OpenAI_o1",
          "classe": "T",
          "origine": "wikipedia.org",
          "consulte_le": "2026-03-21"
        }
      ],
      "article": {
        "titre": "Les GPT d'OpenAI — de GPT-4o à Astra",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gpt",
        "url_en": "https://labo-llm.fr/en/acteurs/gpt",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpt#o1-gpqa-doctorants",
      "enonce": "Le score GPQA Diamond de 78,1 % dépasse le niveau médian des doctorants humains experts dans leur domaine.",
      "nature": "interpretation",
      "portee": "datee",
      "verifie_le": "2026-03-21",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-o1",
          "titre": "OpenAI — Learning to reason with LLMs (o1)",
          "url": "https://openai.com/index/learning-to-reason-with-llms/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": "2026-03-21"
        }
      ],
      "article": {
        "titre": "Les GPT d'OpenAI — de GPT-4o à Astra",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/gpt",
        "url_en": "https://labo-llm.fr/en/acteurs/gpt",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "huggingface-plateforme#cadence-tenue",
      "enonce": "Six mois plus tard, début septembre 2026, la branche 5 en est à sa seizième version mineure — soit très exactement le rythme annoncé.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "github-9a589f",
          "titre": "GitHub huggingface/transformers — github.com/huggingface/transformers",
          "url": "https://github.com/huggingface/transformers",
          "classe": "P1",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Hugging Face — la plateforme qui distribue l'IA open source au monde",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/huggingface-plateforme",
        "url_en": "https://labo-llm.fr/en/acteurs/huggingface-plateforme",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "llama#pas-de-llama5",
      "enonce": "Il n'y a pas eu de Llama 5. Le 8 avril 2026, Meta publie **Muse Spark**, premier modèle des Meta Superintelligence Labs et premier d'une série nommée *Muse*",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "meta-musespark",
          "titre": "Meta, \"Introducing Muse Spark: Scaling Towards Personal Superintelligence\", 8 avril 2026",
          "url": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
          "classe": "P1",
          "origine": "meta.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Llama — l'open source selon Meta",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/llama",
        "url_en": "https://labo-llm.fr/en/acteurs/llama",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "llama#glimmer-apache",
      "enonce": "Le 10 août 2026, Meta revient partiellement en arrière avec **Muse Glimmer**, un modèle dense de 30 milliards de paramètres distillé depuis Muse Spark, doté d'un encodeur de perception dédié, publié sous **Apache 2.0**.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "meta-museglimmer",
          "titre": "Hugging Face, carte du modèle meta-models/Muse-Glimmer-30B, août 2026",
          "url": "https://huggingface.co/meta-models/Muse-Glimmer-30B",
          "classe": "P1",
          "origine": "huggingface.co",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Llama — l'open source selon Meta",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/llama",
        "url_en": "https://labo-llm.fr/en/acteurs/llama",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "llama#fermeture-poids",
      "enonce": "**Muse Spark n'est pas en open weights.** C'est la rupture. Après trois ans de poids téléchargeables, le modèle phare de Meta redevient un service.",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "meta-musespark",
          "titre": "Meta, \"Introducing Muse Spark: Scaling Towards Personal Superintelligence\", 8 avril 2026",
          "url": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
          "classe": "P1",
          "origine": "meta.com",
          "consulte_le": null
        },
        {
          "id": "meta-museglimmer",
          "titre": "Hugging Face, carte du modèle meta-models/Muse-Glimmer-30B, août 2026",
          "url": "https://huggingface.co/meta-models/Muse-Glimmer-30B",
          "classe": "P1",
          "origine": "huggingface.co",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Llama — l'open source selon Meta",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/llama",
        "url_en": "https://labo-llm.fr/en/acteurs/llama",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "meta-ai#muse-glimmer-table",
      "enonce": "| Muse Glimmer | Août 2026 | 30B dense distillé de Muse Spark, **Apache 2.0**, agentique locale |",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "meta-museglimmer",
          "titre": "Hugging Face, carte du modèle meta-models/Muse-Glimmer-30B, août 2026",
          "url": "https://huggingface.co/meta-models/Muse-Glimmer-30B",
          "classe": "P1",
          "origine": "huggingface.co",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Meta AI — le pari open source",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/meta-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/meta-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "meta-ai#muse-spark-ferme",
      "enonce": "| Muse Spark | Avr. 2026 | Premier modèle des Superintelligence Labs — **poids fermés** |",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "meta-musespark",
          "titre": "Meta, \"Introducing Muse Spark: Scaling Towards Personal Superintelligence\", 8 avril 2026",
          "url": "https://ai.meta.com/blog/introducing-muse-spark-msl/",
          "classe": "P1",
          "origine": "meta.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Meta AI — le pari open source",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/meta-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/meta-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "mistral-ai#serie-c-117",
      "enonce": "lève 1,7 milliard d'euros et valorise l'entreprise à 11,7 milliards d'euros post-money",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "mistral-seriec",
          "titre": "Mistral AI raises 1.7B€ to accelerate technological progress with AI — Mistral AI, sept. 2025",
          "url": "https://mistral.ai/news/mistral-ai-raises-1-7-b-to-accelerate-technological-progress-with-ai/",
          "classe": "P1",
          "origine": "mistral.ai",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mistral AI — l'alternative européenne",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/mistral-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/mistral-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "mistral-ai#ministral3-tailles",
      "enonce": "Ministral 3 (décembre 2025) propose trois tailles denses — **3B, 8B et 14B** paramètres — chacune déclinée en variantes base, instruct et raisonnement, sous Apache 2.0.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "mistral-8a6b5a",
          "titre": "Introducing Mistral 3 — Mistral AI officiel",
          "url": "https://mistral.ai/news/mistral-3",
          "classe": "P2",
          "origine": "mistral.ai",
          "consulte_le": null
        },
        {
          "id": "docs-97d4d7",
          "titre": "Mistral Docs — Models overview",
          "url": "https://docs.mistral.ai/getting-started/models",
          "classe": "P2",
          "origine": "mistral.ai",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mistral AI — l'alternative européenne",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/mistral-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/mistral-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "mistral-ai#large3-moe",
      "enonce": "Mistral Large 3 (décembre 2025) pousse l'architecture MoE à grande échelle : 675 milliards de paramètres totaux, 41 milliards actifs",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "mistral-8a6b5a",
          "titre": "Introducing Mistral 3 — Mistral AI officiel",
          "url": "https://mistral.ai/news/mistral-3",
          "classe": "P2",
          "origine": "mistral.ai",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mistral AI — l'alternative européenne",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/mistral-ai",
        "url_en": "https://labo-llm.fr/en/acteurs/mistral-ai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "mistral-modeles#mixtral-smoe",
      "enonce": "Le modèle totalise 46,7 milliards de paramètres, mais n'en active que 12,9 milliards par token",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "arxiv-89014a",
          "titre": "Papier Mixtral of Experts",
          "url": "https://arxiv.org/abs/2401.04088",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "mistral-bc9be0",
          "titre": "Annonce Mixtral 8x7B",
          "url": "https://mistral.ai/news/mixtral-of-experts",
          "classe": "P2",
          "origine": "mistral.ai",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les modèles Mistral — de Mixtral à Medium 3.5",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/mistral-modeles",
        "url_en": "https://labo-llm.fr/en/acteurs/mistral-modeles",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "mistral-modeles#small4-unification",
      "enonce": "En mars 2026, Mistral Small 4 (119B totaux, 6B actifs, 128 experts, fenêtre 256k, Apache 2.0) est le premier modèle de la gamme à unifier en un seul poids instruction following, raisonnement configurable, multimodal et coding agentique",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "docs-e93c70",
          "titre": "Models overview — documentation Mistral AI",
          "url": "https://docs.mistral.ai/getting-started/models/models_overview/",
          "classe": "P2",
          "origine": "mistral.ai",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les modèles Mistral — de Mixtral à Medium 3.5",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/mistral-modeles",
        "url_en": "https://labo-llm.fr/en/acteurs/mistral-modeles",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "open-source-vs-proprietaire#hf-concentration",
      "enonce": "Les chiffres révèlent une concentration interne : 0,01 % des modèles représentent 49,6 % des téléchargements.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "huggingface-429881",
          "titre": "State of Open Source on Hugging Face: Spring 2026",
          "url": "https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026",
          "classe": "P2",
          "origine": "huggingface.co",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Open source vs propriétaire — ce que ça signifie vraiment pour les LLM",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/open-source-vs-proprietaire",
        "url_en": "https://labo-llm.fr/en/acteurs/open-source-vs-proprietaire",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "open-source-vs-proprietaire#qwen-113000-derives",
      "enonce": "Qwen (Alibaba) compte 113 000 modèles dérivés sur la plateforme, loin devant Llama (27 000) et DeepSeek (6 000).",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "huggingface-429881",
          "titre": "State of Open Source on Hugging Face: Spring 2026",
          "url": "https://huggingface.co/blog/huggingface/state-of-os-hf-spring-2026",
          "classe": "P2",
          "origine": "huggingface.co",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Open source vs propriétaire — ce que ça signifie vraiment pour les LLM",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/open-source-vs-proprietaire",
        "url_en": "https://labo-llm.fr/en/acteurs/open-source-vs-proprietaire",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "open-source-vs-proprietaire#cout-083-vs-603",
      "enonce": "L'avantage de coût reste réel : 0,83 dollar par million de tokens en moyenne pour l'open source, contre 6,03 dollars pour le propriétaire — soit 86 % d'économies.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-0adc52",
          "titre": "Open-Source Advantage in Large Language Models (LLMs)",
          "url": "https://arxiv.org/html/2412.12004v3",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Open source vs propriétaire — ce que ça signifie vraiment pour les LLM",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/open-source-vs-proprietaire",
        "url_en": "https://labo-llm.fr/en/acteurs/open-source-vs-proprietaire",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "openai#astra-tarif",
      "enonce": "Tarification API annoncée : 10 $ par million de tokens en entrée, 50 $ en sortie.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-astra26",
          "titre": "OpenAI, \"GPT-6 Astra: A new generation of intelligence\", 3 septembre 2026",
          "url": "https://openai.com/index/gpt-6-astra/",
          "classe": "P1",
          "origine": "openai.com",
          "consulte_le": null
        },
        {
          "id": "cnbc-astra26",
          "titre": "CNBC — OpenAI announces rollout of GPT-6 Astra model, 3 septembre 2026",
          "url": "https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html",
          "classe": "S1",
          "origine": "cnbc.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "OpenAI — du non-profit au leader commercial",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/openai",
        "url_en": "https://labo-llm.fr/en/acteurs/openai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "openai#astra-100k-gpu",
      "enonce": "D'abord, OpenAI déclare avoir pour la première fois pré-entraîné sur plus de 100 000 GPU, sur son site Stargate au Texas.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-astra26",
          "titre": "OpenAI, \"GPT-6 Astra: A new generation of intelligence\", 3 septembre 2026",
          "url": "https://openai.com/index/gpt-6-astra/",
          "classe": "P1",
          "origine": "openai.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "OpenAI — du non-profit au leader commercial",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/openai",
        "url_en": "https://labo-llm.fr/en/acteurs/openai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "openai#astra-exploitbench",
      "enonce": "Sur le banc ExploitBench, Astra est annoncé à 100 % contre 78,5 % pour GPT-5.6 Sol — un chiffre publié par le fournisseur, sans réplication indépendante à ce jour.",
      "nature": "extrapolation",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-astra26",
          "titre": "OpenAI, \"GPT-6 Astra: A new generation of intelligence\", 3 septembre 2026",
          "url": "https://openai.com/index/gpt-6-astra/",
          "classe": "P1",
          "origine": "openai.com",
          "consulte_le": null
        },
        {
          "id": "openai-sol26",
          "titre": "OpenAI, \"Previewing GPT-5.6 Sol: a next-generation model\", juin 2026",
          "url": "https://openai.com/index/previewing-gpt-5-6-sol/",
          "classe": "P1",
          "origine": "openai.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "OpenAI — du non-profit au leader commercial",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/openai",
        "url_en": "https://labo-llm.fr/en/acteurs/openai",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "qwen-alibaba#qwen38max-2400",
      "enonce": "le plus gros modèle jamais publié par la famille — **2 400 milliards de paramètres**, fenêtre de contexte d'un million de tokens, multimodal",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "alibabacloud-qwen38max",
          "titre": "Alibaba Cloud, \"Alibaba Unveils Qwen3.8-Max: Its Largest and Most Capable Flagship Model to Date\", 3 août 2026",
          "url": "https://www.alibabacloud.com/en/press-room/alibaba-unveils-qwen3-8-max",
          "classe": "P1",
          "origine": "alibabacloud.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Qwen — la famille de modèles ouverts d'Alibaba Cloud",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/qwen-alibaba",
        "url_en": "https://labo-llm.fr/en/acteurs/qwen-alibaba",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "qwen-alibaba#corpus-36t",
      "enonce": "**Corpus de 36 trillions de tokens** sur 119 langues (contre 18T pour Qwen2.5).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-25",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "arxiv-fbd1fb",
          "titre": "arXiv 2505.09388 — Qwen3 Technical Report, équipe Qwen, mai 2025. []",
          "url": "https://arxiv.org/abs/2505.09388",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "qwenlm-32b815",
          "titre": "qwenlm.github.io/blog/qwen3/ — Blog officiel équipe Qwen, release Qwen3, avr. 2025. []",
          "url": "https://qwenlm.github.io/blog/qwen3/",
          "classe": "P2",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Qwen — la famille de modèles ouverts d'Alibaba Cloud",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/qwen-alibaba",
        "url_en": "https://labo-llm.fr/en/acteurs/qwen-alibaba",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "qwen-alibaba#poids-annonces",
      "enonce": "Les poids de Qwen3.8-Max sont annoncés, pas publiés — c'est une promesse, pas encore un fait.",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "alibabacloud-qwen38max",
          "titre": "Alibaba Cloud, \"Alibaba Unveils Qwen3.8-Max: Its Largest and Most Capable Flagship Model to Date\", 3 août 2026",
          "url": "https://www.alibabacloud.com/en/press-room/alibaba-unveils-qwen3-8-max",
          "classe": "P1",
          "origine": "alibabacloud.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Qwen — la famille de modèles ouverts d'Alibaba Cloud",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/qwen-alibaba",
        "url_en": "https://labo-llm.fr/en/acteurs/qwen-alibaba",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "tpu-google#systolic-256",
      "enonce": "Au cœur du dispositif : le systolic array, une grille de 256×256 unités de multiplication-accumulation (MACs).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-82150e",
          "titre": "Jouppi et al., \"In-Datacenter Performance Analysis of a Tensor Processing Unit\", ISCA 2017",
          "url": "https://arxiv.org/abs/1704.04760",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "TPU Google — La seule alternative crédible aux GPU Nvidia",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/tpu-google",
        "url_en": "https://labo-llm.fr/en/acteurs/tpu-google",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "xai-grok#fusion-spacex-1250",
      "enonce": "En février 2026, xAI a fusionné avec SpaceX dans une opération valorisée à 1 250 milliards de dollars.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "cnbc-92fbe6",
          "titre": "CNBC — Fusion SpaceX-xAI à 1 250 Md$ (fév. 2026)",
          "url": "https://www.cnbc.com/2026/02/03/musk-xai-spacex-biggest-merger-ever.html",
          "classe": "S1",
          "origine": "cnbc.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "xAI et Grok — l'IA des données en temps réel",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/xai-grok",
        "url_en": "https://labo-llm.fr/en/acteurs/xai-grok",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "xai-grok#grok1-poids-apache",
      "enonce": "En mars 2024, xAI a publié les poids complets sous licence Apache-2.0 — un geste rare pour un modèle de taille frontier.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "github-a9afde",
          "titre": "GitHub xai-org/grok-1",
          "url": "https://github.com/xai-org/grok-1",
          "classe": "P1",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "xAI et Grok — l'IA des données en temps réel",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/xai-grok",
        "url_en": "https://labo-llm.fr/en/acteurs/xai-grok",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "architecture-bat-le-modele#maestro-mesure-empiriquement",
      "enonce": "La recherche MAESTRO (arXiv 2601.00481) l'a mesuré empiriquement sur 12 systèmes multi-agents : **l'architecture du système est le facteur dominant pour la reproductibilité, le coût et la précision — devant le choix du modèle**.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e57a34",
          "titre": "MAESTRO : Multi-Agent Evaluation Suite for Testing, Reliability, and Observability Zhao et al., arXiv 2601.00481, janvier 2026.",
          "url": "https://arxiv.org/abs/2601.00481",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "En orchestration multi-agents, l'architecture bat le modèle",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/architecture-bat-le-modele",
        "url_en": "https://labo-llm.fr/en/carnets/architecture-bat-le-modele",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "architecture-bat-le-modele#gains-recents-capacite",
      "enonce": "Résultat : **les gains récents de capacité n'ont produit que de faibles améliorations de fiabilité** (\"Towards a Science of AI Agent Reliability\", arXiv 2602.16666).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-311cbc",
          "titre": "Towards a Science of AI Agent Reliability Rabanser, Kapoor et al., Princeton University, arXiv 2602.16666, février 2026.",
          "url": "https://arxiv.org/abs/2602.16666",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "En orchestration multi-agents, l'architecture bat le modèle",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/architecture-bat-le-modele",
        "url_en": "https://labo-llm.fr/en/carnets/architecture-bat-le-modele",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "architecture-bat-le-modele#characterizing-faults-agentic",
      "enonce": "Une troisième étude, \"Characterizing Faults in Agentic AI\" (arXiv 2603.06847), a analysé 13 602 issues et pull requests sur des systèmes agentiques réels.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "characterizing-fau-8264c6",
          "titre": "Characterizing Faults in Agentic AI arXiv 2603.06847, mars 2026",
          "url": "https://arxiv.org/abs/2603.06847",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "En orchestration multi-agents, l'architecture bat le modèle",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/architecture-bat-le-modele",
        "url_en": "https://labo-llm.fr/en/carnets/architecture-bat-le-modele",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "budget-sous-agent-100k-tokens#avant-mesures-hypothese",
      "enonce": "Avant nos mesures, l'hypothèse courante — présente dans certaines issues GitHub comme la [#10212](https://github.com/anthropics/claude-code/issues/10212) — était que les sous-agents partageaient le budget du parent, autour de 200K tokens.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "github-a7098c",
          "titre": "GitHub issue #10212 — Independent Context Windows for Sub-Agents",
          "url": "https://github.com/anthropics/claude-code/issues/10212",
          "classe": "P1",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le vrai budget d'un sous-agent : environ 100K tokens",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/budget-sous-agent-100k-tokens",
        "url_en": "https://labo-llm.fr/en/carnets/budget-sous-agent-100k-tokens",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "compaction-contextuelle-agents#compaction-75-95",
      "enonce": "Les systèmes agentiques déployés en production — Claude Code, GitHub Copilot, LangChain — compressent entre 75 et 95% du contexte conversationnel accumulé.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "docs-41101d",
          "titre": "Documentation Claude Code — auto-compaction",
          "url": "https://docs.anthropic.com/en/docs/agents-and-tools/claude-code/overview",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Compaction contextuelle — pourquoi les agents jettent 80% du contexte",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/compaction-contextuelle-agents",
        "url_en": "https://labo-llm.fr/en/carnets/compaction-contextuelle-agents",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "convergence-knowledge-bases-llm#agentmemory-recall",
      "enonce": "agentmemory publie des métriques internes (Recall@10 = 64.1%, réduction 92% de tokens par rapport au context-dumping), mais sur son propre jeu de test (240 observations, 30 sessions).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "github-2f9d26",
          "titre": "rohitg00, \"agentmemory — Persistent memory for AI coding agents\", GitHub 2026",
          "url": "https://github.com/rohitg00/agentmemory",
          "classe": "P1",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Cinq knowledge bases, un même pattern",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/convergence-knowledge-bases-llm",
        "url_en": "https://labo-llm.fr/en/carnets/convergence-knowledge-bases-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "deny-rules-securite#reddy-gujral-aaai",
      "enonce": "[Reddy & Gujral, AAAI-SS 2025, arXiv:2509.10540](https://arxiv.org/abs/2509.10540)",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-753592",
          "titre": "Reddy & Gujral, \"EchoLeak\", AAAI-SS 2025, arXiv:2509.10540",
          "url": "https://arxiv.org/abs/2509.10540",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Deny rules Claude Code — anatomie d'un faux sentiment de sécurité",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/deny-rules-securite",
        "url_en": "https://labo-llm.fr/en/carnets/deny-rules-securite",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "orchestration-multi-agents-etat-art#maestro-janvier-evalue",
      "enonce": "La recherche MAESTRO (arXiv 2601.00481, janvier 2026) a évalué 12 systèmes multi-agents avec des traces framework-agnostiques.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e57a34",
          "titre": "MAESTRO : Multi-Agent Evaluation Suite for Testing, Reliability, and Observability Zhao et al., arXiv 2601.00481, janvier 2026.",
          "url": "https://arxiv.org/abs/2601.00481",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "État de l'art : orchestration multi-agents avec Claude Code (2026)",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/orchestration-multi-agents-etat-art",
        "url_en": "https://labo-llm.fr/en/carnets/orchestration-multi-agents-etat-art",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "orchestration-multi-agents-etat-art#princeton-university-klein",
      "enonce": "Princeton University et Berkeley Klein Center publient en février 2026 (\"Towards a Science of AI Agent Reliability\", arXiv 2602.16666) une évaluation de 14 modèles sur 12 métriques de fiabilité : consistance, robustesse, prédictibilité, sécurité.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-311cbc",
          "titre": "Towards a Science of AI Agent Reliability Rabanser, Kapoor et al., Princeton University / Berkeley Klein Center, arXiv 2602.16666, février 2026.",
          "url": "https://arxiv.org/abs/2602.16666",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "État de l'art : orchestration multi-agents avec Claude Code (2026)",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/orchestration-multi-agents-etat-art",
        "url_en": "https://labo-llm.fr/en/carnets/orchestration-multi-agents-etat-art",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "orchestration-multi-agents-etat-art#characterizing-faults-agentic",
      "enonce": "\"Characterizing Faults in Agentic AI\" (arXiv 2603.06847, mars 2026) a analysé 13 602 issues et pull requests sur 40 dépôts de systèmes agentiques.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-51e37a",
          "titre": "Characterizing Faults in Agentic AI arXiv 2603.06847, mars 2026.",
          "url": "https://arxiv.org/abs/2603.06847",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "État de l'art : orchestration multi-agents avec Claude Code (2026)",
        "territoire": "carnets",
        "url": "https://labo-llm.fr/carnets/orchestration-multi-agents-etat-art",
        "url_en": "https://labo-llm.fr/en/carnets/orchestration-multi-agents-etat-art",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agent-verification-succes#webarena-zhou-quantifie",
      "enonce": "WebArena (Zhou et al., 2023) quantifie l'écart : le meilleur agent GPT-4 atteint 14,41 % de taux de succès, contre 78,24 % pour les humains — et malgré cela, le critère \"succès\" reste défini par le benchmark, pas par la réalité de la tâche.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "zhou-et-al-2023-we-ad7250",
          "titre": "Zhou et al. (2023). WebArena. arXiv:2307.13854",
          "url": "https://arxiv.org/abs/2307.13854",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pourquoi votre agent ne sait pas s'il a réussi",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/agent-verification-succes",
        "url_en": "https://labo-llm.fr/en/enjeux/agent-verification-succes",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agent-verification-succes#shahnovsky-dror-illustrent",
      "enonce": "Shahnovsky et Dror (2026) illustrent le même problème sous un angle différent : le même agent atteint 38 % de succès global selon une métrique, et 89 % de précision par élément selon une autre.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "shahnovsky-dror-20-824c4b",
          "titre": "Shahnovsky, Dror (2026). AI Planning Framework for LLM-Based Web Agents. arXiv:2603.12710",
          "url": "https://arxiv.org/abs/2603.12710",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pourquoi votre agent ne sait pas s'il a réussi",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/agent-verification-succes",
        "url_en": "https://labo-llm.fr/en/enjeux/agent-verification-succes",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "auto-evaluation-llm#biais-position-66-80",
      "enonce": "en changeant simplement l'ordre de présentation, Vicuna-13B bat ChatGPT dans 66 cas sur 80 quand ChatGPT est juge",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-0016bb",
          "titre": "Zheng et al., \"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena\", NeurIPS 2023",
          "url": "https://arxiv.org/abs/2306.05685",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pourquoi les LLMs se trompent en auto-évaluation",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/auto-evaluation-llm",
        "url_en": "https://labo-llm.fr/en/enjeux/auto-evaluation-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "auto-evaluation-llm#debat-729",
      "enonce": "La moyenne observée est de 72,9 % — contre une baseline rationnelle de 50 % pour un débat à deux participants.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-d29f71",
          "titre": "Prasad & Nguyen, \"When Two LLMs Debate, Both Think They'll Win\", arXiv 2025",
          "url": "https://arxiv.org/abs/2505.19184",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pourquoi les LLMs se trompent en auto-évaluation",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/auto-evaluation-llm",
        "url_en": "https://labo-llm.fr/en/enjeux/auto-evaluation-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "auto-evaluation-llm#debat-617",
      "enonce": "Dans 61,7 % des débats, les deux modèles revendiquent simultanément une probabilité de victoire supérieure ou égale à 75 %.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-d29f71",
          "titre": "Prasad & Nguyen, \"When Two LLMs Debate, Both Think They'll Win\", arXiv 2025",
          "url": "https://arxiv.org/abs/2505.19184",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pourquoi les LLMs se trompent en auto-évaluation",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/auto-evaluation-llm",
        "url_en": "https://labo-llm.fr/en/enjeux/auto-evaluation-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "ce-que-les-labos-publient#aucun-des-trois",
      "enonce": "Le 6 septembre 2026, ces quatre informations ont été cherchées le même jour, sur les pages modèles officielles d'Anthropic, d'OpenAI et de Google. **Aucun des trois ne les publie toutes.**",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 3,
      "sources": [
        {
          "id": "platform-1779fb",
          "titre": "Models overview — documentation Anthropic",
          "url": "https://platform.claude.com/docs/en/about-claude/models/overview",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        },
        {
          "id": "developers-1d7e8a",
          "titre": "Models — documentation développeur OpenAI",
          "url": "https://developers.openai.com/api/docs/models",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": null
        },
        {
          "id": "ai-2de9fc",
          "titre": "Models — documentation de l'API Gemini",
          "url": "https://ai.google.dev/gemini-api/docs/models",
          "classe": "P2",
          "origine": "google.dev",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Ce que les laboratoires publient sur leurs modèles — et ce qu'ils taisent",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/ce-que-les-labos-publient",
        "url_en": "https://labo-llm.fr/en/enjeux/ce-que-les-labos-publient",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "cout-reel-systeme-multi-agents#facteur-22",
      "enonce": "Le même travail confié à un harness planner + generator + evaluator revient à 200 dollars sur six heures — soit un facteur 22×, mesuré par Anthropic sur un cas concret de génération de logiciel.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "anthropic-2ef732",
          "titre": "Anthropic Engineering, \"Harness design for long-running application development\", mars 2026",
          "url": "https://www.anthropic.com/engineering/harness-design-long-running-apps",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le coût réel d'un système multi-agents — un ordre de grandeur au-dessus",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/cout-reel-systeme-multi-agents",
        "url_en": "https://labo-llm.fr/en/enjeux/cout-reel-systeme-multi-agents",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "cout-reel-systeme-multi-agents#loi-scaling-tours",
      "enonce": "La loi de scaling observée sur le nombre de tours d'interaction est T = 2,72 × (n + 0,5)^1,724, avec un R² de 0,974.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-39e65c",
          "titre": "Hu et al., \"Towards a Science of Scaling Agent Systems\", arxiv:2512.08296, déc. 2025",
          "url": "https://arxiv.org/html/2512.08296v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le coût réel d'un système multi-agents — un ordre de grandeur au-dessus",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/cout-reel-systeme-multi-agents",
        "url_en": "https://labo-llm.fr/en/enjeux/cout-reel-systeme-multi-agents",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "gouvernance-regulation-ia#art50-application",
      "enonce": "Les obligations de transparence de l'article 50 sont entrées en application, et elles ne dépendent d'aucun niveau de risque",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "eu-ai-act-r-glemen-4c8a36",
          "titre": "EU AI Act — Règlement (UE) 2024/1689, Journal officiel de l'Union européenne, juillet 2024",
          "url": "https://eur-lex.europa.eu/eli/reg/2024/1689/oj",
          "classe": "P2",
          "origine": "europa.eu",
          "consulte_le": null
        },
        {
          "id": "commission-europ-e-d1eb9c",
          "titre": "Commission européenne, Transparency obligations under Article 50 of the AI Act — FAQ, digital-strategy.ec.europa.eu (consulté le 6 septembre 2026)",
          "url": "https://digital-strategy.ec.europa.eu/en/faqs/transparency-obligations-under-article-50-ai-act",
          "classe": "P2",
          "origine": "europa.eu",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Réguler l'IA — pourquoi l'Europe, les États-Unis et la Chine ne parlent pas le même langage",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/gouvernance-regulation-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/gouvernance-regulation-ia",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gouvernance-regulation-ia#omnibus-publication",
      "enonce": "a été publié au Journal officiel le 24 juillet 2026 et est entré en vigueur le 27 — six jours avant l'échéance qu'il déplace",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "r-glement-ue-2026-d867ab",
          "titre": "Règlement (UE) 2026/1744 — digital omnibus sur l'IA, publié au Journal officiel le 24 juillet 2026, en vigueur le 27 juillet 2026",
          "url": "https://eur-lex.europa.eu/eli/reg/2026/1744/oj",
          "classe": "P2",
          "origine": "europa.eu",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Réguler l'IA — pourquoi l'Europe, les États-Unis et la Chine ne parlent pas le même langage",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/gouvernance-regulation-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/gouvernance-regulation-ia",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gouvernance-regulation-ia#haut-risque-reporte",
      "enonce": "Haut risque : annexe III au 2 déc. 2027, annexe I au 2 août 2028",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "r-glement-ue-2026-d867ab",
          "titre": "Règlement (UE) 2026/1744 — digital omnibus sur l'IA, publié au Journal officiel le 24 juillet 2026, en vigueur le 27 juillet 2026",
          "url": "https://eur-lex.europa.eu/eli/reg/2026/1744/oj",
          "classe": "P2",
          "origine": "europa.eu",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Réguler l'IA — pourquoi l'Europe, les États-Unis et la Chine ne parlent pas le même langage",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/gouvernance-regulation-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/gouvernance-regulation-ia",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gouvernance-regulation-ia#standards-sans-sanction",
      "enonce": "Le NIST RMF et l'ISO 42001 (2023) existent comme standards de bonnes pratiques — mais sans mécanisme d'obligation ni de sanction",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "nist-ai-risk-manag-f2f4bf",
          "titre": "NIST AI Risk Management Framework 1.0, National Institute of Standards and Technology, 2023",
          "url": "https://www.nist.gov/itl/ai-risk-management-framework",
          "classe": "P2",
          "origine": "nist.gov",
          "consulte_le": null
        },
        {
          "id": "iso-42001-2023-inf-bd6541",
          "titre": "ISO 42001:2023 — Information technology — Artificial intelligence — Management system",
          "url": "https://www.iso.org/standard/42001",
          "classe": "P2",
          "origine": "iso.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Réguler l'IA — pourquoi l'Europe, les États-Unis et la Chine ne parlent pas le même langage",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/gouvernance-regulation-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/gouvernance-regulation-ia",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "ia-agentique-prochaine-explosion#penser-plus-longtemps",
      "enonce": "sur DeepSeek-R1 et QwQ-32B : ces modèles n'améliorent pas leurs performances simplement en \"pensant plus longtemps\".",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-2e4d03",
          "titre": "Kim J., Lai S., Scherrer N., Agüera y Arcas B., Evans J., \"Reasoning Models Generate Societies of Thought\", arXiv:2601.10825, 2026",
          "url": "https://arxiv.org/abs/2601.10825",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "IA agentique — catalyseur d'une prochaine explosion d'intelligence ?",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/ia-agentique-prochaine-explosion",
        "url_en": "https://labo-llm.fr/en/enjeux/ia-agentique-prochaine-explosion",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-juge-trois-fois-plus-permissif#tnr-sous-25",
      "enonce": "le taux de vrais négatifs (TNR) mesuré sur 14 modèles est inférieur à 25 % (Zhao et al., 2025)",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-b8276c",
          "titre": "Zhao, J. et al. \"Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations.\" arXiv:2510.11822 (octobre 2025).",
          "url": "https://arxiv.org/abs/2510.11822",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le LLM-juge est trois fois plus permissif que l'humain",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/llm-juge-trois-fois-plus-permissif",
        "url_en": "https://labo-llm.fr/en/enjeux/llm-juge-trois-fois-plus-permissif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-juge-trois-fois-plus-permissif#review-69-pourcent",
      "enonce": "Un système de review automatisé fondé sur GPT-4o atteint 69 % de précision équilibrée sur des papers scientifiques, et tombe à 66 % hors distribution (Lu et al., 2026).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nature-ba9641",
          "titre": "Lu, C. et al. \"Towards end-to-end automation of AI research.\" Nature 651, 914–919 (2026). DOI: 10.1038/s41586-026-10265-5.",
          "url": "https://www.nature.com/articles/s41586-026-10265-5",
          "classe": "P1",
          "origine": "nature.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le LLM-juge est trois fois plus permissif que l'humain",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/llm-juge-trois-fois-plus-permissif",
        "url_en": "https://labo-llm.fr/en/enjeux/llm-juge-trois-fois-plus-permissif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-juge-trois-fois-plus-permissif#papers-fabriques-82",
      "enonce": "Des papers entièrement fabriqués, sans aucune expérience réelle, passent les filtres LLM dans jusqu'à 82 % des cas (Dang et al., 2025).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-28bd63",
          "titre": "Dang, J. et al. \"BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?\" arXiv:2510.18003 (octobre 2025).",
          "url": "https://arxiv.org/abs/2510.18003",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le LLM-juge est trois fois plus permissif que l'humain",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/llm-juge-trois-fois-plus-permissif",
        "url_en": "https://labo-llm.fr/en/enjeux/llm-juge-trois-fois-plus-permissif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-juge-trois-fois-plus-permissif#tpr-96-tnr-25",
      "enonce": "le TPR dépasse 96 %, le TNR reste inférieur à 25 %",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "arxiv-b8276c",
          "titre": "Zhao, J. et al. \"Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations.\" arXiv:2510.11822 (octobre 2025).",
          "url": "https://arxiv.org/abs/2510.11822",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "arxiv-8dc6a5",
          "titre": "Gu, J. et al. \"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods.\" arXiv:2412.05579 (2024).",
          "url": "https://arxiv.org/abs/2412.05579",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le LLM-juge est trois fois plus permissif que l'humain",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/llm-juge-trois-fois-plus-permissif",
        "url_en": "https://labo-llm.fr/en/enjeux/llm-juge-trois-fois-plus-permissif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mirage-illusion-visuelle#sous-protocoles-evaluation",
      "enonce": "Sous les protocoles d'évaluation multimodaux standard, ce taux monte à 90–100 % [Asadi et al., arXiv:2603.21687v2].",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-731378",
          "titre": "Asadi et al., \"MIRAGE: The Illusion of Visual Understanding\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.21687",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mirage — quand les LLM « voient » sans regarder",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/mirage-illusion-visuelle",
        "url_en": "https://labo-llm.fr/en/enjeux/mirage-illusion-visuelle",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mirage-illusion-visuelle#benchmarks-medicaux-susceptibilite",
      "enonce": "Sur les benchmarks médicaux, la susceptibilité à l'inférence non visuelle atteint 60 à 99 % selon les benchmarks testés [Asadi et al., arXiv:2603.21687v2].",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-731378",
          "titre": "Asadi et al., \"MIRAGE: The Illusion of Visual Understanding\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.21687",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mirage — quand les LLM « voient » sans regarder",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/mirage-illusion-visuelle",
        "url_en": "https://labo-llm.fr/en/enjeux/mirage-illusion-visuelle",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mirage-illusion-visuelle#benchmarks-modeles-testes",
      "enonce": "Sur ces benchmarks, les modèles testés en mode « sans image » — en ne recevant que le texte de la question — obtiennent des scores qui retiennent 70 à 80 % de la performance mesurée avec image, parfois davantage [Asadi et al., arXiv:2603.21687v2].",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-731378",
          "titre": "Asadi et al., \"MIRAGE: The Illusion of Visual Understanding\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.21687",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mirage — quand les LLM « voient » sans regarder",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/mirage-illusion-visuelle",
        "url_en": "https://labo-llm.fr/en/enjeux/mirage-illusion-visuelle",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "modes-defaillance-agents-ia#mast-1642-traces",
      "enonce": "une équipe de l'UC Berkeley a analysé 1 642 traces d'exécution de systèmes multi-agents LLM et en a extrait une taxonomie structurée : MAST (Multi-Agent System Failure Taxonomy)",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-9eaf64",
          "titre": "Cemri, M., Pan, M. Z., Yang, S. et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.",
          "url": "https://arxiv.org/abs/2503.13657",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "sky-2f8fc2",
          "titre": "UC Berkeley Sky Computing Lab. MAST — Project Page.",
          "url": "https://sky.cs.berkeley.edu/project/mast/",
          "classe": "S2",
          "origine": "berkeley.edu",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 14 modes de défaillance des agents IA",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/modes-defaillance-agents-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/modes-defaillance-agents-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "modes-defaillance-agents-ia#mast-14-modes",
      "enonce": "Elle recense 14 modes de défaillance regroupés en trois catégories — conception système, désalignement inter-agents, et vérification des tâches.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-9eaf64",
          "titre": "Cemri, M., Pan, M. Z., Yang, S. et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.",
          "url": "https://arxiv.org/abs/2503.13657",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 14 modes de défaillance des agents IA",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/modes-defaillance-agents-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/modes-defaillance-agents-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "modes-defaillance-agents-ia#mast-grounded-theory",
      "enonce": "les chercheurs ont annoté 150 traces d'exécution sans catégories prédéfinies, en laissant les patterns émerger des données",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-9eaf64",
          "titre": "Cemri, M., Pan, M. Z., Yang, S. et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657.",
          "url": "https://arxiv.org/abs/2503.13657",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 14 modes de défaillance des agents IA",
        "territoire": "enjeux",
        "url": "https://labo-llm.fr/enjeux/modes-defaillance-agents-ia",
        "url_en": "https://labo-llm.fr/en/enjeux/modes-defaillance-agents-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "alignement-et-rlhf#instructgpt-13b-vs-175b",
      "enonce": "un modèle de 1,3 milliard de paramètres aligné par RLHF était préféré par des humains à GPT-3 non affiné avec 175 milliards de paramètres",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a3655f",
          "titre": "Ouyang, L. et al. (OpenAI), \"Training language models to follow instructions with human feedback\", NeurIPS 2022",
          "url": "https://arxiv.org/abs/2203.02155",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alignement et RLHF — comment corriger un LLM",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/alignement-et-rlhf",
        "url_en": "https://labo-llm.fr/en/fondamentaux/alignement-et-rlhf",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "alignement-et-rlhf#comparaisons-pairwise",
      "enonce": "les comparaisons pairwise suffisent, et elles sont beaucoup plus faciles à produire de façon cohérente que des notations absolues",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-59d2ad",
          "titre": "Christiano, P. et al., \"Deep Reinforcement Learning from Human Preferences\", NeurIPS 2017",
          "url": "https://arxiv.org/abs/1706.03741",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alignement et RLHF — comment corriger un LLM",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/alignement-et-rlhf",
        "url_en": "https://labo-llm.fr/en/fondamentaux/alignement-et-rlhf",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "architecture-transformer#chinchilla-surpasse-gopher",
      "enonce": "Chinchilla (70B paramètres, 1,4 trillion de tokens) surpassait ainsi Gopher (280B) et GPT-3 (175B) sur de nombreux benchmarks.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-ac31af",
          "titre": "Hoffmann et al. (DeepMind), \"Training Compute-Optimal Large Language Models\" (Chinchilla), arXiv:2203.15556, NeurIPS 2022",
          "url": "https://arxiv.org/abs/2203.15556",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Architecture Transformer — le mécanisme qui a tout changé",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/architecture-transformer",
        "url_en": "https://labo-llm.fr/en/fondamentaux/architecture-transformer",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "conformite-jailbreak#instructgpt-13-vs-175",
      "enonce": "(OpenAI, 2022) avec InstructGPT : un modèle de 1,3 milliard de paramètres affiné par RLHF est jugé préférable par des humains à GPT-3 non affiné avec 175 milliards de paramètres.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a3655f",
          "titre": "Ouyang, L. et al. (OpenAI), \"Training language models to follow instructions with human feedback\", NeurIPS 2022",
          "url": "https://arxiv.org/abs/2203.02155",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alignement des LLM — pourquoi corriger l'IA ne suffit pas",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/conformite-jailbreak",
        "url_en": "https://labo-llm.fr/en/fondamentaux/conformite-jailbreak",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "conformite-jailbreak#sycophancy-29-41",
      "enonce": "Leur méthode alternative améliore l'alignement sur les préférences humaines de 29 à 41 % sur les modèles testés.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-0fed8a",
          "titre": "Shapira, I., Benade, G., Procaccia, A.D., \"How RLHF Amplifies Sycophancy\", arXiv 2026",
          "url": "https://arxiv.org/abs/2602.01002",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alignement des LLM — pourquoi corriger l'IA ne suffit pas",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/conformite-jailbreak",
        "url_en": "https://labo-llm.fr/en/fondamentaux/conformite-jailbreak",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "degradation-contextuelle-mesurable#biais-positionnel-30",
      "enonce": "Sur la tâche QA multi-documents, la performance chute de **plus de 30%** quand le document-réponse passe de la position 1 à la position 10 dans un contexte de 20 documents.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "aclanthology-c939f5",
          "titre": "Nelson F. Liu et al., \"Lost in the Middle: How Language Models Use Long Contexts\", TACL Vol. 12, 2024",
          "url": "https://aclanthology.org/2024.tacl-1.9/",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "La dégradation contextuelle est mesurable — et elle suit une loi",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/degradation-contextuelle-mesurable",
        "url_en": "https://labo-llm.fr/en/fondamentaux/degradation-contextuelle-mesurable",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "degradation-contextuelle-mesurable#longueur-cause-242",
      "enonce": "Llama-3.1-8B-Instruct chute de **24,2%** sur le benchmark MMLU étendu à 30 000 tokens, malgré un taux de récupération parfaite de 97%",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "aclanthology-f32c7d",
          "titre": "Yufeng Du et al., \"Context Length Alone Hurts LLM Performance Despite Perfect Retrieval\", Findings of ACL: EMNLP 2025",
          "url": "https://aclanthology.org/2025.findings-emnlp.1264/",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "La dégradation contextuelle est mesurable — et elle suit une loi",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/degradation-contextuelle-mesurable",
        "url_en": "https://labo-llm.fr/en/fondamentaux/degradation-contextuelle-mesurable",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "degradation-contextuelle-mesurable#eventail-degradation",
      "enonce": "La dégradation observée varie de **13,9% à 85%** selon les modèles et les tâches, à des longueurs restant bien en dessous des fenêtres annoncées.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "aclanthology-f32c7d",
          "titre": "Yufeng Du et al., \"Context Length Alone Hurts LLM Performance Despite Perfect Retrieval\", Findings of ACL: EMNLP 2025",
          "url": "https://aclanthology.org/2025.findings-emnlp.1264/",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "La dégradation contextuelle est mesurable — et elle suit une loi",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/degradation-contextuelle-mesurable",
        "url_en": "https://labo-llm.fr/en/fondamentaux/degradation-contextuelle-mesurable",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "donnees-synthetiques#self-instruct-175",
      "enonce": "Le principe : fournir 175 instructions écrites par des humains, laisser un LLM en générer des milliers d'autres par imitation et variation, puis filtrer les doublons et les incohérences.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-274d34",
          "titre": "Wang et al., \"Self-Instruct: Aligning Language Models with Self-Generated Instructions\", arXiv:2212.10560, 2022",
          "url": "https://arxiv.org/abs/2212.10560",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Données synthétiques — comment les LLM apprennent de leurs propres sorties",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/donnees-synthetiques",
        "url_en": "https://labo-llm.fr/en/fondamentaux/donnees-synthetiques",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "donnees-synthetiques#alpaca-52000",
      "enonce": "52 000 exemples générés via GPT-3.5, pour un coût inférieur à 500 dollars",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-2ec94d",
          "titre": "Zhou et al., \"LIMA: Less Is More for Alignment\", NeurIPS 2023, arXiv:2305.11206",
          "url": "https://arxiv.org/abs/2305.11206",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Données synthétiques — comment les LLM apprennent de leurs propres sorties",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/donnees-synthetiques",
        "url_en": "https://labo-llm.fr/en/fondamentaux/donnees-synthetiques",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "donnees-synthetiques#phi-506-humaneval",
      "enonce": "Résultat : 50,6 % de réussite sur HumanEval (un benchmark de génération de code), devant des modèles dix fois plus grands entraînés sur des centaines de milliards de tokens bruts.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-c1ee6e",
          "titre": "Gunasekar et al., \"Textbooks Are All You Need\", arXiv:2306.11644, 2023 — Microsoft Research, phi-1",
          "url": "https://arxiv.org/abs/2306.11644",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Données synthétiques — comment les LLM apprennent de leurs propres sorties",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/donnees-synthetiques",
        "url_en": "https://labo-llm.fr/en/fondamentaux/donnees-synthetiques",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "embeddings-recherche-semantique#sbert-65-heures",
      "enonce": "Sur 10 000 phrases, cela représente environ 50 millions de paires à traiter — soit 65 heures de calcul sur un GPU standard.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-1415ff",
          "titre": "Reimers, N. & Gurevych, I., \"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks\", EMNLP 2019",
          "url": "https://arxiv.org/abs/1908.10084",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Embeddings et recherche sémantique — comment les LLM comprennent le sens",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/embeddings-recherche-semantique",
        "url_en": "https://labo-llm.fr/en/fondamentaux/embeddings-recherche-semantique",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "embeddings-recherche-semantique#sbert-5-secondes",
      "enonce": "Le temps de traitement pour 10 000 comparaisons tombe à 5 secondes.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-1415ff",
          "titre": "Reimers, N. & Gurevych, I., \"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks\", EMNLP 2019",
          "url": "https://arxiv.org/abs/1908.10084",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Embeddings et recherche sémantique — comment les LLM comprennent le sens",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/embeddings-recherche-semantique",
        "url_en": "https://labo-llm.fr/en/fondamentaux/embeddings-recherche-semantique",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "evaluation-benchmarks#gsm8k-contamination-13",
      "enonce": "Pour GSM8K, des études ont mesuré des chutes de précision allant jusqu'à 13 % après suppression des exemples contaminés.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "arxiv-7d75da",
          "titre": "Riddell, M. et al., \"Benchmark Data Contamination of Large Language Models: A Survey\", arXiv juin 2024",
          "url": "https://arxiv.org/abs/2406.04244",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "arxiv-85eeb6",
          "titre": "Guo, Z. et al., \"Benchmarking LLMs Under Data Contamination: A Survey\", arXiv février 2025",
          "url": "https://arxiv.org/abs/2502.17521",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Benchmarks LLM — pourquoi les scores ne disent pas tout",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/evaluation-benchmarks",
        "url_en": "https://labo-llm.fr/en/fondamentaux/evaluation-benchmarks",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "evaluation-benchmarks#benchmarks-445-16",
      "enonce": "une étude de 2025 (Frontiers in Artificial Intelligence) a analysé 445 benchmarks NLP : seulement 16 % utilisent des méthodes scientifiques rigoureuses",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "doi-58b2d4",
          "titre": "Frontières de l'IA, \"Moving LLM evaluation forward: lessons from human judgment research\", Frontiers in AI 2025",
          "url": "https://doi.org/10.3389/frai.2025.1592399",
          "classe": "P1",
          "origine": "doi.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Benchmarks LLM — pourquoi les scores ne disent pas tout",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/evaluation-benchmarks",
        "url_en": "https://labo-llm.fr/en/fondamentaux/evaluation-benchmarks",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "evaluation-benchmarks#juge-12-biais",
      "enonce": "ont catalogué jusqu'à 12 types de biais distincts",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-9bfb7d",
          "titre": "Koo, R. et al., \"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge\", arXiv octobre 2024",
          "url": "https://arxiv.org/abs/2410.02736",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Benchmarks LLM — pourquoi les scores ne disent pas tout",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/evaluation-benchmarks",
        "url_en": "https://labo-llm.fr/en/fondamentaux/evaluation-benchmarks",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "fenetre-de-contexte#gpt35-milieu-20",
      "enonce": "Sur GPT-3.5-Turbo, la performance pouvait chuter de plus de 20% quand l'information pertinente se trouvait au centre d'un long contexte — parfois en dessous de la performance d'un modèle qui n'avait reçu aucun document.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-b5e5a6",
          "titre": "Liu et al. (2024) — Lost in the Middle: How Language Models Use Long Contexts, TACL — arxiv.org/abs/2307.03172",
          "url": "https://arxiv.org/abs/2307.03172",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "La fenêtre de contexte — ce que c'est, pourquoi ça compte",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/fenetre-de-contexte",
        "url_en": "https://labo-llm.fr/en/fondamentaux/fenetre-de-contexte",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "generation-images#diffusion-20-100-etapes",
      "enonce": "Au bout de 20 à 100 étapes selon les implémentations, une image émerge.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "link-a6662e",
          "titre": "Springer, \"Comprehensive exploration of diffusion models in image generation: a survey\", 2025",
          "url": "https://link.springer.com/article/10.1007/s10462-025-11110-3",
          "classe": "P1",
          "origine": "springer.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Génération d'images par IA — du bruit à l'image",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/generation-images",
        "url_en": "https://labo-llm.fr/en/fondamentaux/generation-images",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "gradmem-memoire-contextuelle#gradmem-meta-learning",
      "enonce": "Sans cette phase, les performances s'effondrent : la variante sans meta-learning tombe à 12,9 % d'Exact Match sur 16 paires clé-valeur, contre 100 % avec meta-learning.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-1d8395",
          "titre": "Kuratov, Kairov, Bulatov, Rodkin, Burtsev — GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent — arXiv:2603.13875 (preprint, 17 mars 2026)",
          "url": "https://arxiv.org/abs/2603.13875",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "GradMem — comprimer le contexte en mémoire par descente de gradient",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/gradmem-memoire-contextuelle",
        "url_en": "https://labo-llm.fr/en/fondamentaux/gradmem-memoire-contextuelle",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gradmem-memoire-contextuelle#gradmem-64-lectures",
      "enonce": "En pratique, sur des contextes de 256 à 1 024 tokens, GradMem atteint la parité de latence avec GPT-2 full context après environ **64 opérations READ** sur le même contexte.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-1d8395",
          "titre": "Kuratov, Kairov, Bulatov, Rodkin, Burtsev — GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent — arXiv:2603.13875 (preprint, 17 mars 2026)",
          "url": "https://arxiv.org/abs/2603.13875",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "GradMem — comprimer le contexte en mémoire par descente de gradient",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/gradmem-memoire-contextuelle",
        "url_en": "https://labo-llm.fr/en/fondamentaux/gradmem-memoire-contextuelle",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "histoire-llm#gpt3-175-500",
      "enonce": "175 milliards de paramètres, entraîné sur environ 500 milliards de mots",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-449543",
          "titre": "Brown et al., \"Language Models are Few-Shot Learners\" (GPT-3), NeurIPS 2020",
          "url": "https://arxiv.org/abs/2005.14165",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Histoire des LLM — cinq ruptures qui ont tout changé",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/histoire-llm",
        "url_en": "https://labo-llm.fr/en/fondamentaux/histoire-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "histoire-llm#chinchilla-70b",
      "enonce": "Chinchilla, avec 70 milliards de paramètres mais quatre fois plus de données que ses contemporains, surpasse GPT-3 (175 milliards) sur la quasi-totalité des benchmarks.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "arxiv-ac31af",
          "titre": "Hoffmann et al., \"Training Compute-Optimal Large Language Models\" (Chinchilla), arXiv 2022",
          "url": "https://arxiv.org/abs/2203.15556",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "arxiv-a61ab0",
          "titre": "Kaplan et al., \"Scaling Laws for Neural Language Models\", arXiv 2020",
          "url": "https://arxiv.org/abs/2001.08361",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Histoire des LLM — cinq ruptures qui ont tout changé",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/histoire-llm",
        "url_en": "https://labo-llm.fr/en/fondamentaux/histoire-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "histoire-llm#instructgpt-85",
      "enonce": "InstructGPT avec 1,3 milliard de paramètres est préféré par les annotateurs humains à GPT-3 avec 175 milliards dans 85 % des cas.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a3655f",
          "titre": "Ouyang et al., \"Training language models to follow instructions with human feedback\" (InstructGPT), arXiv 2022",
          "url": "https://arxiv.org/abs/2203.02155",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Histoire des LLM — cinq ruptures qui ont tout changé",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/histoire-llm",
        "url_en": "https://labo-llm.fr/en/fondamentaux/histoire-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "hyperagents-auto-amelioration#polyglot-089m",
      "enonce": "**Les coûts sont élevés.** Le benchmark Polyglot seul consomme 0.89 million de tokens avec o3-mini.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-eb36df",
          "titre": "Zhang, J. et al. (2026). HyperAgents: Self-Referential Self-Improving Agents. arXiv:2603.19461.",
          "url": "https://arxiv.org/abs/2603.19461",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "HyperAgents — des agents IA qui modifient leur propre méthode d'amélioration",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/hyperagents-auto-amelioration",
        "url_en": "https://labo-llm.fr/en/fondamentaux/hyperagents-auto-amelioration",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "interpretabilite-mecanistique#sae-15000-features",
      "enonce": "Appliqué à la couche 6 de GPT-2 Small avec une expansion 16x, le résultat est frappant : environ 15 000 features distinctes, dont 70 % correspondent à un concept identifiable par des humains.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "transformer-circui-eaa331",
          "titre": "Bricken, T., Templeton, A. et al., \"Towards Monosemanticity: Decomposing Language Models With Dictionary Learning\", Transformer Circuits Thread, Anthropic, 2023",
          "url": "https://transformer-circuits.pub/2023/monosemantic-features",
          "classe": "P1",
          "origine": "transformer-circuits.pub",
          "consulte_le": null
        },
        {
          "id": "arxiv-73344f",
          "titre": "Cunningham, H., Ewart, A. et al., \"Sparse Autoencoders Find Highly Interpretable Features in Language Models\", arXiv:2309.08600, 2023",
          "url": "https://arxiv.org/abs/2309.08600",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Interprétabilité mécanistique — comprendre ce qui se passe dans un LLM",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/interpretabilite-mecanistique",
        "url_en": "https://labo-llm.fr/en/fondamentaux/interpretabilite-mecanistique",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "long-context#flashattention2-debit",
      "enonce": "FlashAttention-2 (2023) atteint 50 à 73 % du débit théorique maximal d'un GPU A100, contre 25 à 40 % pour la version originale.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-03a0c6",
          "titre": "Dao, \"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning\", ICLR 2024",
          "url": "https://arxiv.org/abs/2307.08691",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Fenêtre de contexte — ce que les LLM voient vraiment",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/long-context",
        "url_en": "https://labo-llm.fr/en/fondamentaux/long-context",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "long-context#ring-attention-100k",
      "enonce": "Avec cette méthode, LLaMA 2 7B passe de 4 000 à 100 000 tokens sur un seul nœud de 8 GPU.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-925b80",
          "titre": "Liu, Zaharia, Abbeel (UC Berkeley), \"Ring Attention with Blockwise Transformers for Near-Infinite Context\", ICLR 2024",
          "url": "https://arxiv.org/abs/2310.01889",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Fenêtre de contexte — ce que les LLM voient vraiment",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/long-context",
        "url_en": "https://labo-llm.fr/en/fondamentaux/long-context",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "long-context#gemini15-rappel",
      "enonce": "Gemini 1.5 Pro (Google DeepMind, 2024) constitue l'exception la plus documentée : 99,7 % de rappel à 1 million de tokens sur ce test, et 99,2 % à 10 millions de tokens en mode expérimental.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a1e2fe",
          "titre": "Reid et al. (Google DeepMind), \"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context\", 2024",
          "url": "https://arxiv.org/abs/2403.05530",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Fenêtre de contexte — ce que les LLM voient vraiment",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/long-context",
        "url_en": "https://labo-llm.fr/en/fondamentaux/long-context",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "long-context#llama31-contexte-effectif",
      "enonce": "LLaMA 3.1 70B, entraîné avec des techniques d'extension avancées, montre une longueur de contexte effectif estimée à 64 000 tokens seulement dans les tests RULER",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-6e2782",
          "titre": "Hsieh et al. (NVIDIA), \"RULER: What's the Real Context Size of Your Long-Context Language Models?\", COLM 2024",
          "url": "https://arxiv.org/abs/2404.06654",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Fenêtre de contexte — ce que les LLM voient vraiment",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/long-context",
        "url_en": "https://labo-llm.fr/en/fondamentaux/long-context",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "memoire-graphe-agents#survey-publie-fevrier",
      "enonce": "Un survey publié en février 2026 (Yang et al., arXiv:2602.05665) recense et classe l'ensemble des approches de mémoire graph-based pour agents IA.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-817ca5",
          "titre": "Yang, C. et al. (2026). Graph-based Agent Memory: Taxonomy, Techniques, and Applications. arXiv:2602.05665.",
          "url": "https://arxiv.org/abs/2602.05665",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mémoire graphe pour agents — au-delà du vecteur",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/memoire-graphe-agents",
        "url_en": "https://labo-llm.fr/en/fondamentaux/memoire-graphe-agents",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "memoires-agent-ia#reflexion-34-alfworld",
      "enonce": "Cette approche a produit une amélioration de 34 % sur ALFWorld et 10 % sur WebShop par rapport aux méthodes d'imitation et de renforcement classiques.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "shinn-cassano-yao-5d7c96",
          "titre": "Shinn, Cassano, Yao, Narasimhan — Reflexion: Language Agents with Verbal Reinforcement Learning — arXiv:2303.11366 (NeurIPS 2023)",
          "url": "https://arxiv.org/abs/2303.11366",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 3 mémoires d'un agent IA : sémantique, épisodique, procédurale",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/memoires-agent-ia",
        "url_en": "https://labo-llm.fr/en/fondamentaux/memoires-agent-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "memoires-agent-ia#reflexion-91-humaneval",
      "enonce": "Résultat mesuré : 91 % de précision sur HumanEval, contre 80 % pour GPT-4 à l'époque de la publication.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "shinn-cassano-yao-5d7c96",
          "titre": "Shinn, Cassano, Yao, Narasimhan — Reflexion: Language Agents with Verbal Reinforcement Learning — arXiv:2303.11366 (NeurIPS 2023)",
          "url": "https://arxiv.org/abs/2303.11366",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 3 mémoires d'un agent IA : sémantique, épisodique, procédurale",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/memoires-agent-ia",
        "url_en": "https://labo-llm.fr/en/fondamentaux/memoires-agent-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mixture-of-experts#mixtral-8x7b",
      "enonce": "| Mixtral 8x7B (2024) | 47 Md | 13 Md | 8 | 2 |",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-89014a",
          "titre": "Jiang et al. (Mistral AI), \"Mixtral of Experts\", arXiv 2024",
          "url": "https://arxiv.org/abs/2401.04088",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mixture of Experts — comment les grands modèles activent moins de paramètres qu'ils n'en ont",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/mixture-of-experts",
        "url_en": "https://labo-llm.fr/en/fondamentaux/mixture-of-experts",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mixture-of-experts#deepseek-v3-moe",
      "enonce": "| DeepSeek-V3 (2024) | 671 Md | 37 Md | 256 (fins) | Variable |",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-d76507",
          "titre": "DeepSeek-AI, \"DeepSeek-V3 Technical Report\", arXiv 2024",
          "url": "https://arxiv.org/abs/2412.19437",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mixture of Experts — comment les grands modèles activent moins de paramètres qu'ils n'en ont",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/mixture-of-experts",
        "url_en": "https://labo-llm.fr/en/fondamentaux/mixture-of-experts",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mixture-of-experts#switch-transformer",
      "enonce": "| Switch Transformer (2021) | 1 000 Md | ~1/N | Configurable | 1 |",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-ac0b71",
          "titre": "Fedus, Zoph, Shazeer, \"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity\", JMLR 2022",
          "url": "https://arxiv.org/abs/2101.03961",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mixture of Experts — comment les grands modèles activent moins de paramètres qu'ils n'en ont",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/mixture-of-experts",
        "url_en": "https://labo-llm.fr/en/fondamentaux/mixture-of-experts",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "multimodalite#clip-762-imagenet",
      "enonce": "CLIP atteint 76,2 % de précision sur ImageNet en zéro-shot — sans avoir vu une seule image labelisée ImageNet pendant l'entraînement — rivalisant avec un réseau de convolution entraîné en supervision complète.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-32448d",
          "titre": "Radford, A. et al., \"Learning Transferable Visual Models From Natural Language Supervision\", ICML 2021",
          "url": "https://arxiv.org/abs/2103.00020",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Multimodalité — comment les LLM ont appris à voir et à entendre",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/multimodalite",
        "url_en": "https://labo-llm.fr/en/fondamentaux/multimodalite",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "niveaux-agent-ia#huang-categorise-comme",
      "enonce": "Yu Huang (arXiv:2405.06643) catégorise L0 comme \"No AI\" dans sa propre échelle, réservant le terme \"agent\" à partir du moment où un système est capable de décision autonome.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e18d65",
          "titre": "Yu Huang, \"Levels of AI Agents: from Rules to Large Language Models\", arXiv:2405.06643, 2024",
          "url": "https://arxiv.org/abs/2405.06643",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 4 niveaux d'un agent IA (L0–L3)",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/niveaux-agent-ia",
        "url_en": "https://labo-llm.fr/en/fondamentaux/niveaux-agent-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "niveaux-agent-ia#huang-propose-echelle",
      "enonce": "Yu Huang (arXiv:2405.06643) propose une échelle L0–L5 inspirée des niveaux SAE de conduite autonome.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e18d65",
          "titre": "Yu Huang, \"Levels of AI Agents: from Rules to Large Language Models\", arXiv:2405.06643, 2024",
          "url": "https://arxiv.org/abs/2405.06643",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 4 niveaux d'un agent IA (L0–L3)",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/niveaux-agent-ia",
        "url_en": "https://labo-llm.fr/en/fondamentaux/niveaux-agent-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "niveaux-agent-ia#feng-mcdonald-zhang",
      "enonce": "Feng, McDonald et Zhang (arXiv:2506.12469) adoptent un angle orthogonal : leurs 5 niveaux mesurent le rôle de l'utilisateur dans l'interaction (opérateur, collaborateur, consultant, approbateur, observateur) plutôt que les capacités techniques de l'agent.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a714d4",
          "titre": "Feng, McDonald, Zhang, \"Levels of Autonomy for AI Agents\", arXiv:2506.12469, 2025",
          "url": "https://arxiv.org/abs/2506.12469",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Les 4 niveaux d'un agent IA (L0–L3)",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/niveaux-agent-ia",
        "url_en": "https://labo-llm.fr/en/fondamentaux/niveaux-agent-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "plafond-raisonnement-contraintes#quasi-totalite-taches",
      "enonce": "(arXiv:2603.23004) est net : sur la quasi-totalité des tâches nécessitant une optimisation réelle sous contraintes, les modèles stagnent autour de **55-60 % de satisfaction des contraintes**.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-fdf408",
          "titre": "Bernier, F., Ghamizi, S., Dogoulis, P., Cordy, M. (2026). Can Large Language Models Reason and Optimize Under Constraints? arXiv:2603.23004.",
          "url": "https://arxiv.org/abs/2603.23004",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le plafond de raisonnement sous contraintes — 55-60% et pas au-delà",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/plafond-raisonnement-contraintes",
        "url_en": "https://labo-llm.fr/en/fondamentaux/plafond-raisonnement-contraintes",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "plafond-raisonnement-contraintes#benchmark-constraintbench-confirme",
      "enonce": "Le benchmark **ConstraintBench** (Xu et al., arXiv:2602.22465, 2026) confirme ce diagnostic sur un périmètre plus large.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-fc890e",
          "titre": "Xu et al. (2026). ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization. arXiv:2602.22465.",
          "url": "https://arxiv.org/abs/2602.22465",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le plafond de raisonnement sous contraintes — 55-60% et pas au-delà",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/plafond-raisonnement-contraintes",
        "url_en": "https://labo-llm.fr/en/fondamentaux/plafond-raisonnement-contraintes",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "plafond-raisonnement-contraintes#montrent-optimise-isolation",
      "enonce": "(arXiv:2602.01058) montrent que le SFT optimisé en isolation peut verrouiller les modèles dans des modes imitatifs rigides : le modèle apprend à reproduire les patterns de la distribution d'entraînement plutôt qu'à généraliser le raisonnement.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-314cd3",
          "titre": "Guo et al. (2025). Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning. arXiv:2602.01058.",
          "url": "https://arxiv.org/abs/2602.01058",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le plafond de raisonnement sous contraintes — 55-60% et pas au-delà",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/plafond-raisonnement-contraintes",
        "url_en": "https://labo-llm.fr/en/fondamentaux/plafond-raisonnement-contraintes",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "raisonnement-cot#janvier-jason-collegues",
      "enonce": "En janvier 2022, Jason Wei et ses collègues de Google Brain publient \"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models\" ([arXiv:2201.11903](https://arxiv.org/abs/2201.11903)).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-5bd403",
          "titre": "Wei et al., \"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models\", NeurIPS 2022",
          "url": "https://arxiv.org/abs/2201.11903",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Chain-of-Thought — comment faire réfléchir un LLM à voix haute",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/raisonnement-cot",
        "url_en": "https://labo-llm.fr/en/fondamentaux/raisonnement-cot",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "raisonnement-cot#poussent-idee-loin",
      "enonce": "(2022, [arXiv:2203.11171](https://arxiv.org/abs/2203.11171)) poussent l'idée plus loin : au lieu de générer un seul chemin de raisonnement, on en génère plusieurs par échantillonnage, puis on vote majoritairement sur la réponse finale.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-b1477d",
          "titre": "Wang et al., \"Self-Consistency Improves Chain of Thought Reasoning in Language Models\", ICLR 2023",
          "url": "https://arxiv.org/abs/2203.11171",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Chain-of-Thought — comment faire réfléchir un LLM à voix haute",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/raisonnement-cot",
        "url_en": "https://labo-llm.fr/en/fondamentaux/raisonnement-cot",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "raisonnement-cot#proposent-decomposition-prealable",
      "enonce": "(2022, [arXiv:2205.10625](https://arxiv.org/abs/2205.10625)) proposent une décomposition préalable : identifier les sous-problèmes du plus simple au plus difficile, puis les résoudre séquentiellement, chaque solution servant d'entrée à la suivante.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-155f5d",
          "titre": "Zhou et al., \"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models\", ICLR 2023",
          "url": "https://arxiv.org/abs/2205.10625",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Chain-of-Thought — comment faire réfléchir un LLM à voix haute",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/raisonnement-cot",
        "url_en": "https://labo-llm.fr/en/fondamentaux/raisonnement-cot",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "reasoning-techniques-decryptees#o1-aime-79",
      "enonce": "Sur le benchmark AIME 2024 (mathématiques de compétition), GPT-4 résolvait environ 9 % des problèmes, contre 79 % pour o1 avec son budget de raisonnement étendu.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-35480c",
          "titre": "OpenAI, \"Learning to Reason with LLMs\", septembre 2024",
          "url": "https://openai.com/index/learning-to-reason-with-llms/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Techniques de raisonnement LLM — CoT, ToT, ReAct décryptées",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/reasoning-techniques-decryptees",
        "url_en": "https://labo-llm.fr/en/fondamentaux/reasoning-techniques-decryptees",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "scaling-laws#chinchilla-surpasse",
      "enonce": "Résultat : Chinchilla surpasse Gopher (280B), GPT-3 (175B) et Megatron-Turing NLG (530B) sur la majorité des benchmarks.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-ac31af",
          "titre": "Hoffmann et al. (2022). Training Compute-Optimal Large Language Models (Chinchilla). NeurIPS 2022. — arXiv:2203.15556",
          "url": "https://arxiv.org/abs/2203.15556",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Lois d'échelle — pourquoi plus grand veut dire meilleur",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/scaling-laws",
        "url_en": "https://labo-llm.fr/en/fondamentaux/scaling-laws",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "scaling-laws#epoch-300-trillions",
      "enonce": "Epoch AI estime que le texte humain public de qualité, une fois les doublons retirés, représente environ 300 trillions de tokens.",
      "nature": "extrapolation",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-20e5d7",
          "titre": "Epoch AI (2022). Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data. — arXiv:2211.04325",
          "url": "https://arxiv.org/abs/2211.04325",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Lois d'échelle — pourquoi plus grand veut dire meilleur",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/scaling-laws",
        "url_en": "https://labo-llm.fr/en/fondamentaux/scaling-laws",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "societe-pensee-agents-debat-emergent#documente-phenomene-original",
      "enonce": "DeepSeek-AI documente le phénomène dès le papier original DeepSeek-R1 (arXiv:2501.12948, publié dans *Nature* en 2025).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-497d93",
          "titre": "DeepSeek-AI, \"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning\", arXiv / Nature 2025",
          "url": "https://arxiv.org/abs/2501.12948",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Society of Thought — quand le raisonnement collectif émerge sans instruction",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/societe-pensee-agents-debat-emergent",
        "url_en": "https://labo-llm.fr/en/fondamentaux/societe-pensee-agents-debat-emergent",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "societe-pensee-agents-debat-emergent#irving-christiano-amodei",
      "enonce": "Irving, Christiano et Amodei (arXiv:1805.00899, 2018) proposent d'entraîner des agents par self-play sur un jeu de débat zéro-sum : deux agents débattent à tour de rôle devant un juge humain.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-658869",
          "titre": "Irving, G., Christiano, P., Amodei, D., \"AI safety via debate\", arXiv 2018",
          "url": "https://arxiv.org/abs/1805.00899",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Society of Thought — quand le raisonnement collectif émerge sans instruction",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/societe-pensee-agents-debat-emergent",
        "url_en": "https://labo-llm.fr/en/fondamentaux/societe-pensee-agents-debat-emergent",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "societe-pensee-agents-debat-emergent#ligne-multi-agent",
      "enonce": "La ligne de recherche sur le Multi-Agent Debate (Du, Li, Torralba, Tenenbaum et Mordatch, arXiv:2305.14325, ICML 2024) avait montré dès 2023 que plusieurs instances de LLM débattant en plusieurs tours améliorent la factualité et le raisonnement.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-09377a",
          "titre": "Du, Y. et al., \"Improving Factuality and Reasoning in Language Models through Multiagent Debate\", ICML 2024",
          "url": "https://arxiv.org/abs/2305.14325",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Society of Thought — quand le raisonnement collectif émerge sans instruction",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/societe-pensee-agents-debat-emergent",
        "url_en": "https://labo-llm.fr/en/fondamentaux/societe-pensee-agents-debat-emergent",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "tokenisation-avancee#fertilite-1000-langues",
      "enonce": "Petrov et al. (2023, NeurIPS) ont étendu cette mesure à plus de 1000 langues et ont montré une corrélation entre fertilité élevée et dégradation des performances.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "petrov-a-et-al-202-1aa3e4",
          "titre": "Petrov, A. et al. (2023). Language Model Tokenizers Introduce Unfairness Between Languages. NeurIPS 2023",
          "url": "https://arxiv.org/abs/2305.15425",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Tokenisation avancée — au-delà du BPE",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/tokenisation-avancee",
        "url_en": "https://labo-llm.fr/en/fondamentaux/tokenisation-avancee",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "tokens-et-tokenisation#decoupe-1234",
      "enonce": "Le nombre *\"1234\"* peut être découpé en *\"12\"* et *\"34\"*, ou en *\"1\"*, *\"234\"*, ou encore en *\"1234\"* comme token unique — selon le vocabulaire et les fréquences vues à l'entraînement.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-4f0535",
          "titre": "arxiv.org — Tokenization and arithmetic performance",
          "url": "https://arxiv.org/html/2402.14903v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Tokens et tokenisation — comment les LLM lisent le texte",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/tokens-et-tokenisation",
        "url_en": "https://labo-llm.fr/en/fondamentaux/tokens-et-tokenisation",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "training-pipeline#cadre-corrige-chercheurs",
      "enonce": "Ce cadre a été corrigé en 2022 par des chercheurs de DeepMind (Hoffmann et al., [arXiv:2203.15556](https://arxiv.org/abs/2203.15556)), avec ce qui est devenu la *loi Chinchilla*.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-ac31af",
          "titre": "Hoffmann J. et al., \"Training Compute-Optimal Large Language Models\" (Chinchilla), DeepMind, 2022",
          "url": "https://arxiv.org/abs/2203.15556",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pipeline d'entraînement des LLM — du texte brut au modèle utile",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/training-pipeline",
        "url_en": "https://labo-llm.fr/en/fondamentaux/training-pipeline",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "training-pipeline#documente-cout-modeles",
      "enonce": "(2024, [arXiv:2405.21015](https://arxiv.org/abs/2405.21015)) ont documenté que le coût des modèles frontier croît d'environ 2,4 fois par an depuis 2016.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-4f7170",
          "titre": "Cottier B. et al., \"The rising costs of training frontier AI models\", 2024",
          "url": "https://arxiv.org/abs/2405.21015",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pipeline d'entraînement des LLM — du texte brut au modèle utile",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/training-pipeline",
        "url_en": "https://labo-llm.fr/en/fondamentaux/training-pipeline",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "training-pipeline#popularise-approche-instructgpt",
      "enonce": "OpenAI a popularisé cette approche avec InstructGPT (Ouyang et al., 2022, [arXiv:2203.02155](https://arxiv.org/abs/2203.02155)).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a3655f",
          "titre": "Ouyang L. et al., \"Training language models to follow instructions with human feedback\" (InstructGPT), OpenAI, 2022",
          "url": "https://arxiv.org/abs/2203.02155",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Pipeline d'entraînement des LLM — du texte brut au modèle utile",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/training-pipeline",
        "url_en": "https://labo-llm.fr/en/fondamentaux/training-pipeline",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "alternative-ai-accelerators-2026#groq-absorbe",
      "enonce": "| **Groq** | Absorbé. L'acquisition par Nvidia, 20 milliards de dollars, se clôt en décembre 2025. |",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "fortune-groq-nvidia",
          "titre": "Fortune — \"Nvidia-Groq deal puts AI chip startups in play\", 5 janvier 2026",
          "url": "https://fortune.com/2026/01/05/nvidia-groq-deal-ai-chip-startups-in-play/",
          "classe": "S1",
          "origine": "fortune.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alternatives ASIC inference 2026 — cinq startups qui repensent la puce pour les LLM",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/alternative-ai-accelerators-2026",
        "url_en": "https://labo-llm.fr/en/infrastructure/alternative-ai-accelerators-2026",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "cooling-liquide-datacenters#liquide-46-marche",
      "enonce": "Ce déterminisme physique se traduit en chiffres de marché : les systèmes à base liquide représentent **46 %** du marché mondial du refroidissement datacenter en 2024, contre environ 10 % en 2020.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "uptime-institute-c-d2e3bd",
          "titre": "Uptime Institute, Cooling Systems Survey 2024 — Direct Liquid Cooling",
          "url": "https://intelligence.uptimeinstitute.com/resource/uptime-institute-cooling-systems-survey-2024-direct-liquid-cooling",
          "classe": "S1",
          "origine": "uptimeinstitute.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Refroidissement liquide — comment les datacenters IA dissipent 120 kW par rack",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/cooling-liquide-datacenters",
        "url_en": "https://labo-llm.fr/en/infrastructure/cooling-liquide-datacenters",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "cooling-liquide-datacenters#marche-15-7-milliards",
      "enonce": "Le marché du refroidissement liquide datacenter est passé de 1,5 milliard de dollars en 2024 à une projection de 7 milliards de dollars pour 2029.",
      "nature": "extrapolation",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "dell-oro-group-dat-308639",
          "titre": "Dell'Oro Group, Data Center Liquid Cooling Market to Approach $7 Billion by 2029, 2024",
          "url": "https://www.delloro.com/news/data-center-liquid-cooling-market-to-approach-7-billion-by-2029-as-ai-deployments-accelerate/",
          "classe": "S1",
          "origine": "delloro.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Refroidissement liquide — comment les datacenters IA dissipent 120 kW par rack",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/cooling-liquide-datacenters",
        "url_en": "https://labo-llm.fr/en/infrastructure/cooling-liquide-datacenters",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "cxl-memory-pooling#asplos-jiang-dissecting",
      "enonce": "L'étude ASPLOS 2025 (Jiang et al., \"Dissecting CXL Memory Performance at Scale\", arXiv 2409.14317) a testé 4 devices CXL 1.1 réels sur 265 workloads :",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "asplos-2025-jiang-7795c8",
          "titre": "ASPLOS 2025 — Jiang et al., \"Dissecting CXL Memory Performance at Scale\". [arXiv:2409.14317]",
          "url": "https://arxiv.org/abs/2409.14317",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "CXL et memory pooling — partager la mémoire entre serveurs",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/cxl-memory-pooling",
        "url_en": "https://labo-llm.fr/en/infrastructure/cxl-memory-pooling",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "cxl-memory-pooling#tract-documente-complexite",
      "enonce": "TraCT (arXiv 2512.18194) documente la complexité d'un mécanisme à deux tiers pour assurer la consistance du KV cache partagé entre nœuds de prefill et decode.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-2512-18194-t-48ac7d",
          "titre": "arXiv:2512.18194 — TraCT, \"Disaggregated LLM Serving with CXL Shared Memory KV Cache\", déc. 2025. [early research]",
          "url": "https://arxiv.org/abs/2512.18194",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "CXL et memory pooling — partager la mémoire entre serveurs",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/cxl-memory-pooling",
        "url_en": "https://labo-llm.fr/en/infrastructure/cxl-memory-pooling",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "datacenters-energie#dc-415-twh",
      "enonce": "En 2024, les datacenters consomment 415 TWh d'électricité dans le monde — soit environ 1,5 % de la consommation mondiale totale.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "iea-56523e",
          "titre": "International Energy Agency, \"Energy and AI\", avril 2025",
          "url": "https://www.iea.org/reports/energy-and-ai",
          "classe": "P2",
          "origine": "iea.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Datacenters et énergie — ce que l'IA consomme vraiment",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/datacenters-energie",
        "url_en": "https://labo-llm.fr/en/infrastructure/datacenters-energie",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "datacenters-energie#dc-945-2030",
      "enonce": "L'Agence internationale de l'énergie projette que ce chiffre atteindra 945 TWh en 2030, un doublement en six ans tiré en grande partie par les charges d'intelligence artificielle.",
      "nature": "extrapolation",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "iea-56523e",
          "titre": "International Energy Agency, \"Energy and AI\", avril 2025",
          "url": "https://www.iea.org/reports/energy-and-ai",
          "classe": "P2",
          "origine": "iea.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Datacenters et énergie — ce que l'IA consomme vraiment",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/datacenters-energie",
        "url_en": "https://labo-llm.fr/en/infrastructure/datacenters-energie",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "datacenters-energie#dc-croissance-30",
      "enonce": "Les charges IA croissent à 30 % par an, contre 9 % pour les charges serveurs conventionnelles (IEA, *Energy and AI*, 2025).",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "iea-56523e",
          "titre": "International Energy Agency, \"Energy and AI\", avril 2025",
          "url": "https://www.iea.org/reports/energy-and-ai",
          "classe": "P2",
          "origine": "iea.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Datacenters et énergie — ce que l'IA consomme vraiment",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/datacenters-energie",
        "url_en": "https://labo-llm.fr/en/infrastructure/datacenters-energie",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "datacenters-energie#gpt3-facteur-26",
      "enonce": "Pour GPT-3 (OpenAI, 2020), les estimations de Google (Patterson et al., 2021) donnent ~552 tCO₂e avec un mix énergétique typique américain.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-73760a",
          "titre": "Patterson et al. (Google), \"Carbon and the Narrow Path to a Low-Carbon, Large-Scale AI\", arXiv, 2021",
          "url": "https://arxiv.org/abs/2104.10350",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Datacenters et énergie — ce que l'IA consomme vraiment",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/datacenters-energie",
        "url_en": "https://labo-llm.fr/en/infrastructure/datacenters-energie",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "edge-ai-inference#int4-75",
      "enonce": "Une quantification INT4 réduit l'empreinte mémoire de 75 % par rapport au FP16.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-9d8292",
          "titre": "Production-Grade Local LLM Inference on Apple Silicon: A Comparative Study — arXiv 2511.05502.",
          "url": "https://arxiv.org/abs/2511.05502",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Votre téléphone a une puce IA — voici ce qu'elle sait faire",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/edge-ai-inference",
        "url_en": "https://labo-llm.fr/en/infrastructure/edge-ai-inference",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "empreinte-environnementale#estimations-patterson-donnent",
      "enonce": "Pour GPT-3 (OpenAI, 2020), les estimations de Google (Patterson et al., 2021) donnent ~552 tCO₂e avec un mix énergétique typique américain.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-73760a",
          "titre": "Patterson et al. (Google), \"Carbon and the Narrow Path to a Low-Carbon, Large-Scale AI\", arXiv, 2021",
          "url": "https://arxiv.org/abs/2104.10350",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "IA et environnement — énergie, eau, carbone",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/empreinte-environnementale",
        "url_en": "https://labo-llm.fr/en/infrastructure/empreinte-environnementale",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "gpu-nvidia-cuda#h100-specs",
      "enonce": "Fabriqué en 4 nm chez TSMC, il intègre 80 milliards de transistors et introduit le Transformer Engine — une unité dédiée au calcul en FP8 (8 bits flottants), ce qui permet de doubler le débit d'inférence par rapport au BF16.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "developer-a8bc1c",
          "titre": "Nvidia Corporation, \"NVIDIA Hopper Architecture In-Depth\", whitepaper technique, 2022",
          "url": "https://developer.nvidia.com/blog/nvidia-hopper-architecture-in-depth/",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "GPU Nvidia et CUDA — pourquoi ils dominent le calcul IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/gpu-nvidia-cuda",
        "url_en": "https://labo-llm.fr/en/infrastructure/gpu-nvidia-cuda",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpu-nvidia-cuda#b200-transistors",
      "enonce": "Le résultat : 208 milliards de transistors, 192 Go de HBM3e à 8 To/s, NVLink 5.0 à 1 800 Go/s.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nvidia-ba1d1c",
          "titre": "Nvidia Corporation, \"NVIDIA Blackwell Architecture Technical Brief\", whitepaper technique, 2024",
          "url": "https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "GPU Nvidia et CUDA — pourquoi ils dominent le calcul IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/gpu-nvidia-cuda",
        "url_en": "https://labo-llm.fr/en/infrastructure/gpu-nvidia-cuda",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "gpu-nvidia-cuda#h100-16896-coeurs",
      "enonce": "Le H100 de Nvidia intègre 16 896 cœurs de calcul.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "developer-a8bc1c",
          "titre": "Nvidia Corporation, \"NVIDIA Hopper Architecture In-Depth\", whitepaper technique, 2022",
          "url": "https://developer.nvidia.com/blog/nvidia-hopper-architecture-in-depth/",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "GPU Nvidia et CUDA — pourquoi ils dominent le calcul IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/gpu-nvidia-cuda",
        "url_en": "https://labo-llm.fr/en/infrastructure/gpu-nvidia-cuda",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "hbm-memoire#h200-141-go",
      "enonce": "Le H200 embarque 141 Go de HBM3e pour 4,8 TB/s de bande passante totale — 43 % de plus que le H100.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "resources-86964e",
          "titre": "Nvidia, \"NVIDIA H100 Tensor Core GPU Architecture Whitepaper\", NVIDIA Technical Blog, 2022",
          "url": "https://resources.nvidia.com/en-us-tensor-core/gtc22-whitepaper-hopper",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "High Bandwidth Memory — quand la mémoire bride les GPU IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/hbm-memoire",
        "url_en": "https://labo-llm.fr/en/infrastructure/hbm-memoire",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "inference-vs-training-costs#tarif-gpt4-lancement",
      "enonce": "Au lancement (mars 2023), l'inférence GPT-4 était facturée **30 à 60 dollars par million de tokens** (input/output 8K).",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "openai-8d1e66",
          "titre": "OpenAI pricing page (2024) — Tarifs historiques GPT-4, GPT-4o, o1, o1-pro. — openai.com/api/pricing/",
          "url": "https://openai.com/api/pricing/",
          "classe": "P2",
          "origine": "openai.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Économie de l'IA — pourquoi l'inférence coûte désormais plus cher que l'entraînement",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/inference-vs-training-costs",
        "url_en": "https://labo-llm.fr/en/infrastructure/inference-vs-training-costs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "inference-vs-training-costs#gpt4-fourchette-training",
      "enonce": "Trois sources triangulent une fourchette de 63 à 100 M$",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": false,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "newsletter-a4e173",
          "titre": "SemiAnalysis — Dylan Patel & Gerald Wong (juil. 2023) — GPT-4 Architecture, Infrastructure, Training Dataset, Costs. — newsletter.semianalysis.com",
          "url": "https://newsletter.semianalysis.com/p/gpt-4-architecture-infrastructure",
          "classe": "S1",
          "origine": "semianalysis.com",
          "consulte_le": null
        },
        {
          "id": "epoch-4d7c00",
          "titre": "Epoch AI — Trends in dollar training cost (2022) — Méthode computationnelle, données 2009-2022. — epoch.ai/blog/trends-in-the-dollar-training-cost-of-machine-learning-systems",
          "url": "https://epoch.ai/blog/trends-in-the-dollar-training-cost-of-machine-learning-systems",
          "classe": "S1",
          "origine": "epoch.ai",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Économie de l'IA — pourquoi l'inférence coûte désormais plus cher que l'entraînement",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/inference-vs-training-costs",
        "url_en": "https://labo-llm.fr/en/infrastructure/inference-vs-training-costs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "interconnects-optiques-co-packaged#ayar-500m",
      "enonce": "En mars 2026, Ayar Labs a levé **500 millions de dollars** pour passer à la production de masse de chiplets CPO, avec des investisseurs incluant AMD, MediaTek et Alchip.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "theregister-970943",
          "titre": "The Register — \"Ayar Labs raises $500M to mass-produce CPO chiplets\", mars 2026. — theregister.com",
          "url": "https://www.theregister.com/2026/03/03/ayar_labs_500m/",
          "classe": "S1",
          "origine": "theregister.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "CPO et interconnects optiques — quand la lumière remplace le cuivre dans les datacenters IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/interconnects-optiques-co-packaged",
        "url_en": "https://labo-llm.fr/en/infrastructure/interconnects-optiques-co-packaged",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "networking-haute-performance#megatron-narayanan-rapporte",
      "enonce": "L'article Megatron-LM de 2021 (Narayanan et al.) rapporte 502 pétaflops mesurés sur 3 072 GPU, soit 52 % d'efficacité théorique.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-ee53d2",
          "titre": "Narayanan et al., \"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM\", SC'21, 2021",
          "url": "https://arxiv.org/abs/2104.04473",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Networking haute performance — le pilier invisible de l'IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/networking-haute-performance",
        "url_en": "https://labo-llm.fr/en/infrastructure/networking-haute-performance",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "networking-haute-performance#megascale-jiang-decrit",
      "enonce": "En 2024, l'article MegaScale (Jiang et al.) décrit un cluster de 12 288 GPU atteignant 55,2 % de MFU (Model FLOP Utilization).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-1340bd",
          "titre": "Jiang et al., \"MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs\", NSDI 2024",
          "url": "https://arxiv.org/abs/2402.15627",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Networking haute performance — le pilier invisible de l'IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/networking-haute-performance",
        "url_en": "https://labo-llm.fr/en/infrastructure/networking-haute-performance",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "networking-haute-performance#zero-wang-reduit",
      "enonce": "ZeRO++ (Wang et al., 2023) réduit le volume de communication de 4x en quantifiant les poids et en restructurant les échanges, ce qui se traduit par un débit 2,16x supérieur sur un cluster de 384 GPU.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-3dfdee",
          "titre": "Wang et al., \"ZeRO++: Extremely Efficient Collective Communication for Giant Model Training\", 2023",
          "url": "https://arxiv.org/abs/2306.10209",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Networking haute performance — le pilier invisible de l'IA",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/networking-haute-performance",
        "url_en": "https://labo-llm.fr/en/infrastructure/networking-haute-performance",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "nvidia-roadmap-vera-rubin#cadence-annuelle",
      "enonce": "Nvidia aligne désormais une génération par an : **Blackwell Ultra (B300)** en H2 2025, **Vera Rubin (R100)** en H2 2026, **Rubin Ultra (R300)** en H2 2027, et **Feynman** en 2028.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "s3-nvidia-gtc-202-5650ed",
          "titre": "[S3] NVIDIA GTC 2025 keynote Jensen Huang, mars 2025 (source primaire)",
          "url": "https://www.nvidia.com/en-us/on-demand/session/gtc25-s72484/",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        },
        {
          "id": "s1-nvidia-technic-343fb4",
          "titre": "[S1] NVIDIA Technical Blog, \"Inside NVIDIA Blackwell Ultra\" — developer.nvidia.com (source primaire)",
          "url": "https://developer.nvidia.com/blog/inside-nvidia-blackwell-ultra-the-chip-powering-the-ai-factory-era/",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        },
        {
          "id": "s7-nextplatform-n-cb9946",
          "titre": "[S7] NextPlatform, \"Nvidia Draws GPU System Roadmap Out To 2028\", mars 2025 (analyse tiers)",
          "url": "https://www.nextplatform.com/2025/03/19/nvidia-draws-gpu-system-roadmap-out-to-2028/",
          "classe": "S2",
          "origine": "nextplatform.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Roadmap Nvidia 2025-2028 — de Blackwell Ultra à Feynman, quatre générations en cadence annuelle",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/nvidia-roadmap-vera-rubin",
        "url_en": "https://labo-llm.fr/en/infrastructure/nvidia-roadmap-vera-rubin",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "puces-alternatives#mi300x-192go",
      "enonce": "Le MI300X embarque 192 Go de mémoire HBM3 — contre 80 Go pour le H100 de Nvidia — avec une bande passante de 5,3 To/s.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "amd-e499fc",
          "titre": "AMD, \"AMD Instinct MI350 Series and Beyond: Accelerating the Future of AI and HPC\", amd.com, 2025",
          "url": "https://www.amd.com/en/blogs.html",
          "classe": "P2",
          "origine": "amd.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alternatives à Nvidia — qui attaque vraiment le marché des puces IA ?",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/puces-alternatives",
        "url_en": "https://labo-llm.fr/en/infrastructure/puces-alternatives",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "puces-alternatives#mi350-288go",
      "enonce": "La génération MI350 (2025) monte encore : 288 Go de mémoire, 8 To/s de bande passante.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "amd-e499fc",
          "titre": "AMD, \"AMD Instinct MI350 Series and Beyond: Accelerating the Future of AI and HPC\", amd.com, 2025",
          "url": "https://www.amd.com/en/blogs.html",
          "classe": "P2",
          "origine": "amd.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alternatives à Nvidia — qui attaque vraiment le marché des puces IA ?",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/puces-alternatives",
        "url_en": "https://labo-llm.fr/en/infrastructure/puces-alternatives",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "puces-alternatives#trainium3-specs",
      "enonce": "La puce Trainium3, lancée fin 2025 en procédé 3nm chez TSMC, affiche 2,52 petaflops FP8 par puce, 144 Go de mémoire HBM3e et une bande passante de 4,9 To/s — soit 4,4 fois plus de capacité de calcul que Trainium2.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "newsletter-8a8da9",
          "titre": "SemiAnalysis, \"Amazon's AI Resurgence: AWS & Anthropic's Multi-Gigawatt Trainium Expansion\", newsletter.semianalysis.com, 2025",
          "url": "https://newsletter.semianalysis.com/p/amazons-ai-resurgence-aws-anthropics-multi-gigawatt-trainium-expansion",
          "classe": "S1",
          "origine": "semianalysis.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Alternatives à Nvidia — qui attaque vraiment le marché des puces IA ?",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/puces-alternatives",
        "url_en": "https://labo-llm.fr/en/infrastructure/puces-alternatives",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "sovereign-cloud-europe#nabuchodonosor-1016",
      "enonce": "L'entreprise déploie **Nabuchodonosor**, son supercalculateur Paris : 1 016 GPU NVIDIA H100 Tensor Core sur infrastructure DGX H100.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "scaleway-scaleway-2b1dde",
          "titre": "Scaleway — scaleway.com (Managed Inference, Generative APIs, Nabuchodonosor) + nvidia.com/blog — triangulé",
          "url": null,
          "classe": "P2",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Cloud souverain européen — quand l'hébergement devient affaire de droit",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/sovereign-cloud-europe",
        "url_en": "https://labo-llm.fr/en/infrastructure/sovereign-cloud-europe",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "supply-chain-semiconducteurs#tsmc-90-pourcent",
      "enonce": "TSMC produit environ 90 % des puces les plus avancées (en dessous de 7 nm) à l'échelle mondiale, selon le rapport SIA 2023.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": false,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "sia-2023-state-of-e9125f",
          "titre": "SIA, \"2023 State of the Industry Report\", Semiconductor Industry Association, 2023 (publication PDF retirée du serveur public — référence éditoriale)",
          "url": null,
          "classe": "P2",
          "origine": null,
          "consulte_le": null
        },
        {
          "id": "bcg-aae1b9",
          "titre": "BCG / SIA, \"Strengthening the Global Semiconductor Supply Chain in an Uncertain Era\", avril 2021",
          "url": "https://www.bcg.com/publications/2021/strengthening-the-global-semiconductor-supply-chain",
          "classe": "S2",
          "origine": "bcg.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Supply chain des semiconducteurs — pourquoi votre GPU vient de partout sauf de chez vous",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/supply-chain-semiconducteurs",
        "url_en": "https://labo-llm.fr/en/infrastructure/supply-chain-semiconducteurs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "supply-chain-semiconducteurs#euv-prix-machine",
      "enonce": "Une machine EUV standard coûte entre 150 et 200 millions d'euros.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "asml-a6ad00",
          "titre": "ASML, \"EXE:5000 High-NA EUV System\", communications investisseurs, 2023-2024",
          "url": "https://www.asml.com/en/products/euv-lithography-systems/twinscan-exe-5000",
          "classe": "P2",
          "origine": "asml.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Supply chain des semiconducteurs — pourquoi votre GPU vient de partout sauf de chez vous",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/supply-chain-semiconducteurs",
        "url_en": "https://labo-llm.fr/en/infrastructure/supply-chain-semiconducteurs",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "tpu-vs-gpu-2026#tpu8-superpod",
      "enonce": "| Échelle | superpod de 9 600 puces, 2 Po de HBM partagée, 121 ExaFLOPS | — |",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "blog-tpu8",
          "titre": "Google, \"Our eighth generation TPUs: two chips for the agentic era\", 2026",
          "url": "https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/eighth-generation-tpu-agentic-era/",
          "classe": "P1",
          "origine": "blog.google",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "TPU vs GPU en 2026 — le vrai face-à-face Ironwood contre Blackwell",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/tpu-vs-gpu-2026",
        "url_en": "https://labo-llm.fr/en/infrastructure/tpu-vs-gpu-2026",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "tpu-vs-gpu-2026#tpu8-perfwatt",
      "enonce": "Les deux puces sont annoncées à « jusqu'à 2× la performance par watt » d'Ironwood, et à une disponibilité générale « plus tard dans l'année ».",
      "nature": "extrapolation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "blog-tpu8",
          "titre": "Google, \"Our eighth generation TPUs: two chips for the agentic era\", 2026",
          "url": "https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/eighth-generation-tpu-agentic-era/",
          "classe": "P1",
          "origine": "blog.google",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "TPU vs GPU en 2026 — le vrai face-à-face Ironwood contre Blackwell",
        "territoire": "infrastructure",
        "url": "https://labo-llm.fr/infrastructure/tpu-vs-gpu-2026",
        "url_en": "https://labo-llm.fr/en/infrastructure/tpu-vs-gpu-2026",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "comment-on-en-est-arrive-la#instructgpt-85-testeurs",
      "enonce": "Le résultat est spectaculaire : un modèle cent fois plus petit, mais corrigé avec cette méthode, est préféré par les testeurs humains dans 85 % des cas par rapport à GPT-3 brut.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a3655f",
          "titre": "Ouyang et al., \"Training language models to follow instructions with human feedback\" (InstructGPT), arXiv 2022",
          "url": "https://arxiv.org/abs/2203.02155",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Comment on en est arrivé là — petite histoire des IA qui parlent",
        "territoire": "fondamentaux",
        "url": "https://labo-llm.fr/fondamentaux/comment-on-en-est-arrive-la",
        "url_en": "https://labo-llm.fr/en/fondamentaux/comment-on-en-est-arrive-la",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "qui-fabrique-ces-ia#deepseek-200-personnes",
      "enonce": "Début 2025, une startup de Hangzhou (Chine) d'environ 200 personnes a publié un modèle appelé DeepSeek R1.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "corrobore",
      "niveau_libelle": "Corroboré",
      "source_unique": true,
      "origines_independantes": 0,
      "sources": [
        {
          "id": "cacm-66f952",
          "titre": "DeepSeek / Communications of the ACM, \"DeepSeek Inside: Origins, Technology, and Impact\", 2025",
          "url": "https://cacm.acm.org/opinion/deepseek-inside-origins-technology-and-impact/",
          "classe": "S1",
          "origine": "acm.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Qui fabrique ces IA — les entreprises derrière ChatGPT, Claude et les autres",
        "territoire": "acteurs",
        "url": "https://labo-llm.fr/acteurs/qui-fabrique-ces-ia",
        "url_en": "https://labo-llm.fr/en/acteurs/qui-fabrique-ces-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "a2a-google-protocole#stabilite-grande-echelle",
      "enonce": "La stabilité à grande échelle en production reste non testée (arXiv:2505.02279).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-3b22d3",
          "titre": "arXiv:2505.02279 — Survey Agent Protocols",
          "url": "https://arxiv.org/html/2505.02279v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "A2A de Google — le protocole manquant",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/a2a-google-protocole",
        "url_en": "https://labo-llm.fr/en/outils/a2a-google-protocole",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "a2a-google-protocole#protocole-concurrent-agent",
      "enonce": "Un protocole concurrent, ANP (Agent Network Protocol), est cité dans arXiv:2505.02279 mais",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-3b22d3",
          "titre": "arXiv:2505.02279 — Survey Agent Protocols",
          "url": "https://arxiv.org/html/2505.02279v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "A2A de Google — le protocole manquant",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/a2a-google-protocole",
        "url_en": "https://labo-llm.fr/en/outils/a2a-google-protocole",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "anatomie-skill-cc#skills-116-93",
      "enonce": "Sur 116 skills analysés, 108 (93 %) sont des monolithes purs : un seul fichier `SKILL.md`, sans aucune dépendance.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nos-observations-116skills",
          "titre": "Nos observations : analyse de 116 skills publics de la communauté Everything Claude Code (architecture, taille, structure)",
          "url": null,
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Anatomie d'un skill Claude Code — structure et bonnes pratiques",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/anatomie-skill-cc",
        "url_en": "https://labo-llm.fr/en/outils/anatomie-skill-cc",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "anatomie-skill-cc#skills-mediane-240",
      "enonce": "La taille médiane observée est de 240 lignes — un repère utile pour calibrer ses propres skills sans sous-spécifier ni sur-documenter.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nos-observations-116skills",
          "titre": "Nos observations : analyse de 116 skills publics de la communauté Everything Claude Code (architecture, taille, structure)",
          "url": null,
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Anatomie d'un skill Claude Code — structure et bonnes pratiques",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/anatomie-skill-cc",
        "url_en": "https://labo-llm.fr/en/outils/anatomie-skill-cc",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "claude-code#defaut-4-fois",
      "enonce": "La gamme par défaut a changé quatre fois entre avril et juillet 2026, ce qui en dit long sur la cadence de l'outil.",
      "nature": "interpretation",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "code-whatsnew",
          "titre": "Claude Code — « What's new », digest hebdomadaire officiel (consulté le 2026-09-06)",
          "url": "https://code.claude.com/docs/en/whats-new",
          "classe": "P1",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Claude Code — assistant de code en ligne de commande",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/claude-code",
        "url_en": "https://labo-llm.fr/en/outils/claude-code",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "claude-code#nesting-tombe",
      "enonce": "depuis juin 2026, un sous-agent peut en lancer d'autres, les chaînes d'arrière-plan étant plafonnées à cinq niveaux",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "code-whatsnew",
          "titre": "Claude Code — « What's new », digest hebdomadaire officiel (consulté le 2026-09-06)",
          "url": "https://code.claude.com/docs/en/whats-new",
          "classe": "P1",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Claude Code — assistant de code en ligne de commande",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/claude-code",
        "url_en": "https://labo-llm.fr/en/outils/claude-code",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "claude-code#auto-mode-defaut",
      "enonce": "Il devient le mode par défaut des nouvelles sessions sur les offres Pro, Max et Team le 14 août 2026",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "code-whatsnew",
          "titre": "Claude Code — « What's new », digest hebdomadaire officiel (consulté le 2026-09-06)",
          "url": "https://code.claude.com/docs/en/whats-new",
          "classe": "P1",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Claude Code — assistant de code en ligne de commande",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/claude-code",
        "url_en": "https://labo-llm.fr/en/outils/claude-code",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "ecosysteme-memoire-agents-2026#survey-graph-based",
      "enonce": "Le survey *Graph-based Agent Memory* (Yang et al., arXiv:2602.05665, février 2026) recense l'écosystème des outils de mémoire graphe pour agents.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-817ca5",
          "titre": "Yang et al., Graph-based Agent Memory: Taxonomy, Techniques, and Applications, arXiv:2602.05665, février 2026",
          "url": "https://arxiv.org/abs/2602.05665",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Mémoire agent en 2026 — SurrealDB, Cognee et les autres",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/ecosysteme-memoire-agents-2026",
        "url_en": "https://labo-llm.fr/en/outils/ecosysteme-memoire-agents-2026",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "fine-tuning-vs-rag#qlora-65b-48go",
      "enonce": "Résultat : fine-tuner un modèle de 65 milliards de paramètres sur un seul GPU de 48 Go, avec 99,3 % des performances de ChatGPT sur les benchmarks testés.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-03851d",
          "titre": "Dettmers et al., \"QLoRA: Efficient Finetuning of Quantized LLMs\", NeurIPS 2023",
          "url": "https://arxiv.org/abs/2305.14314",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Fine-tuning vs RAG — quand choisir quoi",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/fine-tuning-vs-rag",
        "url_en": "https://labo-llm.fr/en/outils/fine-tuning-vs-rag",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "fine-tuning-vs-rag#lora-rang-faible",
      "enonce": "En 2022, LoRA (Low-Rank Adaptation) a changé la donne : au lieu d'ajuster tous les paramètres, on entraîne des matrices de faible rang (~1/1000 des paramètres) insérées dans les couches du transformeur.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-7a2270",
          "titre": "Hu et al., \"LoRA: Low-Rank Adaptation of Large Language Models\", ICLR 2022",
          "url": "https://arxiv.org/abs/2106.09685",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Fine-tuning vs RAG — quand choisir quoi",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/fine-tuning-vs-rag",
        "url_en": "https://labo-llm.fr/en/outils/fine-tuning-vs-rag",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "mcp-servers#mcp-95-contexte",
      "enonce": "Résultat mesuré : jusqu'à 95 % de réduction de consommation de contexte pour les environnements avec de nombreux serveurs actifs.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "code-eb2b49",
          "titre": "Connect Claude Code to tools via MCP — Claude Code Docs",
          "url": "https://code.claude.com/docs/en/mcp",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Model Context Protocol — comment MCP connecte les LLM au monde",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/mcp-servers",
        "url_en": "https://labo-llm.fr/en/outils/mcp-servers",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "observabilite-agents#semconv-depot-dedie",
      "enonce": "les conventions GenAI ont quitté le dépôt principal pour un dépôt dédié, `open-telemetry/semantic-conventions-genai`",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "otel-semconv-genai",
          "titre": "OpenTelemetry — dépôt open-telemetry/semantic-conventions-genai",
          "url": "https://opentelemetry.io/docs/specs/semconv/gen-ai/",
          "classe": "P1",
          "origine": "opentelemetry.io",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Observabilité des agents LLM — outils, standards, limites",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/observabilite-agents",
        "url_en": "https://labo-llm.fr/en/outils/observabilite-agents",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "observabilite-agents#socle-attributs",
      "enonce": "`gen_ai.request.model`, `gen_ai.usage.input_tokens`, `gen_ai.usage.output_tokens`, `gen_ai.response.finish_reasons`, et le contenu des échanges dans `gen_ai.input.messages` / `gen_ai.output.messages` quand l'application est configurée pour l'enregistrer",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "otel-genai-2026",
          "titre": "OpenTelemetry, \"Inside the LLM Call: GenAI Observability with OpenTelemetry\", 2026",
          "url": "https://opentelemetry.io/blog/2026/genai-observability/",
          "classe": "P1",
          "origine": "opentelemetry.io",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Observabilité des agents LLM — outils, standards, limites",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/observabilite-agents",
        "url_en": "https://labo-llm.fr/en/outils/observabilite-agents",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "optimiser-consommation-claude-code#cache-read-39-41",
      "enonce": "Sur nos 30 jours, le cache read a représenté 3,9 milliards de tokens sur 4,1 milliards — sans ce mécanisme, le coût aurait été multiplié par un facteur significatif.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nos-observations-s-2eb414",
          "titre": "Nos observations sur 30 jours d'usage intensif (4,1B tokens, 30 jours actifs, orchestration multi-agents quotidienne)",
          "url": null,
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Optimiser sa consommation Claude Code — guide praticien",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/optimiser-consommation-claude-code",
        "url_en": "https://labo-llm.fr/en/outils/optimiser-consommation-claude-code",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "optimiser-consommation-claude-code#opus-tarif-15-75",
      "enonce": "Sur API, le coût est direct : Opus 4.6 facture $15/MTok en input et $75/MTok en output.",
      "nature": "fait",
      "portee": "courante",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "code-c29a0e",
          "titre": "Anthropic, \"Claude Code costs\", Documentation officielle",
          "url": "https://code.claude.com/docs/en/costs",
          "classe": "P2",
          "origine": "anthropic.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Optimiser sa consommation Claude Code — guide praticien",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/optimiser-consommation-claude-code",
        "url_en": "https://labo-llm.fr/en/outils/optimiser-consommation-claude-code",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "prompting#cot-gsm8k-30-40",
      "enonce": "| Calcul, raisonnement multi-étapes, logique | Chain-of-thought (« réfléchis étape par étape ») | Réduit les erreurs de saut, améliore la précision de 30 à 40 % sur GSM8K. |",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "cloud-6d0fb2",
          "titre": "Google Cloud — What is prompt engineering",
          "url": "https://cloud.google.com/discover/what-is-prompt-engineering",
          "classe": "P2",
          "origine": "google.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le prompting — principes fondamentaux",
        "territoire": "outils",
        "url": "https://labo-llm.fr/outils/prompting",
        "url_en": "https://labo-llm.fr/en/outils/prompting",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agentic-ai#benchmarks-specialises-bench",
      "enonce": "Les benchmarks spécialisés (SWE-bench, WebArena, GAIA) sont plus pertinents mais contestés : des travaux de 2025 (Kapoor et al.) montrent que des agents ne faisant rien réussissent 38 % des tâches de certains benchmarks, faute de critères robustes.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-c56eb8",
          "titre": "Kapoor et al., \"Establishing Best Practices for Building Rigorous Agentic Benchmarks\", arXiv 2507.02825, 2025",
          "url": "https://arxiv.org/abs/2507.02825",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "IA agentique — les LLM qui passent à l'action",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/agentic-ai",
        "url_en": "https://labo-llm.fr/en/techniques/agentic-ai",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agents-auto-evolutifs-zero-data#agent0-qwen3-8b",
      "enonce": "Sur le modèle Qwen3-8B-Base, Agent0 obtient +18 % en raisonnement mathématique et +24 % en raisonnement général par rapport au modèle de base, en surpassant plusieurs méthodes concurrentes.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-b2a7b2",
          "titre": "Xia et al., \"Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning\", arXiv 2025",
          "url": "https://arxiv.org/abs/2511.16043",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agent0 — apprendre à s'améliorer sans aucune donnée humaine",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/agents-auto-evolutifs-zero-data",
        "url_en": "https://labo-llm.fr/en/techniques/agents-auto-evolutifs-zero-data",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agents-auto-evolutifs-zero-data#agent0-rtool-72",
      "enonce": "Sans cette récompense Rtool, les performances chutent de 7,2 % en moyenne selon l'ablation.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-b2a7b2",
          "titre": "Xia et al., \"Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning\", arXiv 2025",
          "url": "https://arxiv.org/abs/2511.16043",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agent0 — apprendre à s'améliorer sans aucune donnée humaine",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/agents-auto-evolutifs-zero-data",
        "url_en": "https://labo-llm.fr/en/techniques/agents-auto-evolutifs-zero-data",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agents-llm#kapoor-identifie-problemes",
      "enonce": "Une recherche de 2025 (Kapoor et al., arXiv 2507.02825) identifie des problèmes de validité sérieux dans les benchmarks agents : des agents qui ne font *rien* réussissent 38 % des tâches de certains benchmarks, faute de critères d'évaluation robustes.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-c56eb8",
          "titre": "Kapoor et al., \"Establishing Best Practices for Building Rigorous Agentic Benchmarks\", arXiv 2507.02825, 2025",
          "url": "https://arxiv.org/abs/2507.02825",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agents LLM — comment un modèle de langage passe à l'action",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/agents-llm",
        "url_en": "https://labo-llm.fr/en/techniques/agents-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "agents-llm#analyse-agent-index",
      "enonce": "Une analyse de l'AI Agent Index 2025 (arXiv 2602.17753) révèle que la délégation de la sécurité aux utilisateurs finaux est la pratique dominante parmi les systèmes déployés — une approche que les chercheurs jugent insuffisante.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-0f6ec6",
          "titre": "Shlapentokh-Rothman et al., \"The 2025 AI Agent Index\", arXiv 2602.17753, 2025",
          "url": "https://arxiv.org/abs/2602.17753",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agents LLM — comment un modèle de langage passe à l'action",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/agents-llm",
        "url_en": "https://labo-llm.fr/en/techniques/agents-llm",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "audit-automatise-multi-agents#framework-agent-judge",
      "enonce": "Le framework **Agent-as-a-Judge** ([arXiv:2410.10934](https://arxiv.org/abs/2410.10934)) montre qu'un agent évaluateur dédié surpasse significativement LLM-as-a-Judge classique et se rapproche de la fiabilité d'une évaluation humaine sur des tâches complexes.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-84598e",
          "titre": "Zhuge et al., \"Agent-as-a-Judge: Evaluate Agents with Agents\", arXiv:2410.10934, 2024",
          "url": "https://arxiv.org/abs/2410.10934",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Audit automatisé multi-agents — quand les agents vérifient leur propre système",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/audit-automatise-multi-agents",
        "url_en": "https://labo-llm.fr/en/techniques/audit-automatise-multi-agents",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "audit-automatise-multi-agents#agentauditor-applique-principe",
      "enonce": "AgentAuditor ([arXiv:2602.09341](https://arxiv.org/abs/2602.09341)) applique ce principe en construisant un arbre de raisonnement sur les points de divergence critiques, surpassant le vote majoritaire et LLM-as-a-Judge sur six architectures testées.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-3fa28a",
          "titre": "Zhong et al., \"Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge\", arXiv:2602.09341, 2026",
          "url": "https://arxiv.org/html/2602.09341v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Audit automatisé multi-agents — quand les agents vérifient leur propre système",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/audit-automatise-multi-agents",
        "url_en": "https://labo-llm.fr/en/techniques/audit-automatise-multi-agents",
        "date_revision": "2026-09-06"
      }
    },
    {
      "id": "automatisation-recherche-ia#iclr-1000-papiers",
      "enonce": "Validé sur 1 000 papiers ICLR (2017–2024) : précision équilibrée de 69 %, contre 66 % pour les reviewers humains selon l'expérience de cohérence NeurIPS 2021.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "doi-a829d3",
          "titre": "Lu et al., \"Towards end-to-end automation of AI research\", Nature Vol. 651, 2026",
          "url": "https://doi.org/10.1038/s41586-026-10265-5",
          "classe": "P1",
          "origine": "doi.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Automatisation de la recherche en IA — jusqu'où ça marche ?",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/automatisation-recherche-ia",
        "url_en": "https://labo-llm.fr/en/techniques/automatisation-recherche-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "automatisation-recherche-ia#post-cutoff-66",
      "enonce": "Sur des papiers post-cutoff (2025, absents de l'entraînement), la précision tombe à 66 %, ce qui reste comparable aux humains.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "doi-a829d3",
          "titre": "Lu et al., \"Towards end-to-end automation of AI research\", Nature Vol. 651, 2026",
          "url": "https://doi.org/10.1038/s41586-026-10265-5",
          "classe": "P1",
          "origine": "doi.org",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Automatisation de la recherche en IA — jusqu'où ça marche ?",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/automatisation-recherche-ia",
        "url_en": "https://labo-llm.fr/en/techniques/automatisation-recherche-ia",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "chain-of-debate#mass-multi-agent",
      "enonce": "MASS (Multi-Agent System Search, arXiv 2502.02533) aborde un problème pratique : comment configurer optimalement un système multi-agents de débat ?",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-07beef",
          "titre": "Zhang et al., \"Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies (MASS)\", arXiv 2502.02533, 2025",
          "url": "https://arxiv.org/html/2502.02533v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Chain-of-Debate — quand les agents argumentent pour mieux décider",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/chain-of-debate",
        "url_en": "https://labo-llm.fr/en/techniques/chain-of-debate",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "context-engineering#framework-agentic-context",
      "enonce": "Le framework **ACE** (Agentic Context Engineering, Zhang et al., arXiv 2510.04618, octobre 2025) propose de traiter le contexte comme un \"playbook évolutif\" qui se met à jour en fonction des retours de performance.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-8a4bcf",
          "titre": "Zhang, Q. et al., \"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models\", arXiv 2025",
          "url": "https://arxiv.org/abs/2510.04618",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Context engineering — au-delà du prompt engineering",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/context-engineering",
        "url_en": "https://labo-llm.fr/en/techniques/context-engineering",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "context-prompting-guide#aucune-technique-domine",
      "enonce": "Une étude systématique sur 14 techniques de prompting, 10 tâches d'ingénierie logicielle et 4 LLM montre qu'aucune technique ne domine universellement (Santana Junior et al., 2025).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-ace4da",
          "titre": "Santana Junior et al., \"Which Prompting Technique Should I Use?\", arXiv 2025",
          "url": "https://arxiv.org/abs/2506.05614",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Context prompting — guide pratique par niveau d'usage",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/context-prompting-guide",
        "url_en": "https://labo-llm.fr/en/techniques/context-prompting-guide",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "context-prompting-guide#format-40-pourcent",
      "enonce": "La variation de performance selon le format du prompt atteint 40 % selon les mesures de He et al.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-547a31",
          "titre": "He, Q. et al., \"Does Prompt Formatting Have Any Impact on LLM Performance?\", soumis NAACL 2025",
          "url": "https://arxiv.org/abs/2411.10541",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Context prompting — guide pratique par niveau d'usage",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/context-prompting-guide",
        "url_en": "https://labo-llm.fr/en/techniques/context-prompting-guide",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "deploiement-35-agents-paralleles#plafond-litterature-9",
      "enonce": "La littérature académique teste au maximum 9 agents outillés dans des conditions contrôlées (Kim et al., 2025).",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-fd4e0b",
          "titre": "Kim et al., \"Towards a Science of Scaling Agent Systems\", arXiv 2025",
          "url": "https://arxiv.org/abs/2512.08296",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "35 agents LLM en parallèle — anatomie et positionnement",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/deploiement-35-agents-paralleles",
        "url_en": "https://labo-llm.fr/en/techniques/deploiement-35-agents-paralleles",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "deploiement-35-agents-paralleles#park-25-agents",
      "enonce": "L'étude Generative Agents (Park et al., 2023) simule 25 agents dans un environnement social pour \"des milliers de dollars\".",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-6cdbc9",
          "titre": "Park et al., \"Generative Agents: Interactive Simulacra of Human Behavior\", ACM UIST 2023",
          "url": "https://arxiv.org/abs/2304.03442",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "35 agents LLM en parallèle — anatomie et positionnement",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/deploiement-35-agents-paralleles",
        "url_en": "https://labo-llm.fr/en/techniques/deploiement-35-agents-paralleles",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "deploiement-agents-production#langchain-57",
      "enonce": "57 % des organisations ont des agents en production selon LangChain (n=1 300+).",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "langchain-6fc65b",
          "titre": "LangChain, \"State of Agent Engineering\", 2025",
          "url": "https://www.langchain.com/state-of-agent-engineering",
          "classe": "P2",
          "origine": "langchain.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agents en production : ce que disent 1 200 cas réels",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/deploiement-agents-production",
        "url_en": "https://labo-llm.fr/en/techniques/deploiement-agents-production",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "distillation-modeles#chaine-14x-85",
      "enonce": "Une chaîne complète peut passer d'un modèle de 2,7B paramètres en float32 à un modèle équivalent de 700M en int8 — soit une réduction d'environ 14× — en conservant 85% des performances du teacher.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "developer-e3432e",
          "titre": "NVIDIA (2025). — Pruning and Distilling LLMs Using NVIDIA TensorRT Model Optimizer",
          "url": "https://developer.nvidia.com/blog/pruning-and-distilling-llms-using-nvidia-tensorrt-model-optimizer/",
          "classe": "P2",
          "origine": "nvidia.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Distillation de modèles — transférer le savoir du grand au petit",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/distillation-modeles",
        "url_en": "https://labo-llm.fr/en/techniques/distillation-modeles",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "escalade-humaine-vs-recovery#framework-runtime-enforcement",
      "enonce": "Le framework de runtime enforcement documenté dans [arXiv:2503.18666](https://arxiv.org/abs/2503.18666) formalise trois mécanismes d'auto-recovery.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-25fee9",
          "titre": "\"Runtime Enforcement for Safe and Reliable LLM Agents\", arXiv:2503.18666, 2025",
          "url": "https://arxiv.org/html/2503.18666v1",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Escalade humaine vs auto-recovery — qui corrige l'agent ?",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/escalade-humaine-vs-recovery",
        "url_en": "https://labo-llm.fr/en/techniques/escalade-humaine-vs-recovery",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "escalade-humaine-vs-recovery#parallele-juin-argumente",
      "enonce": "En parallèle, [arXiv:2506.03056](https://arxiv.org/abs/2506.03056) (juin 2025) argumente qu'un modèle entraîné explicitement pour la corrigibilité développe un bassin d'attraction stable vers ce comportement.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e3a501",
          "titre": "\"Corrigibility as a Singular Target\", arXiv:2506.03056, 2025",
          "url": "https://arxiv.org/pdf/2506.03056",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Escalade humaine vs auto-recovery — qui corrige l'agent ?",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/escalade-humaine-vs-recovery",
        "url_en": "https://labo-llm.fr/en/techniques/escalade-humaine-vs-recovery",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "fiabilite-orchestration-174-agents#174-agents-173",
      "enonce": "Sur 174 exécutions d'agents individuels, 173 ont produit un livrable jugé recevable.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nos-observations-o-174ag",
          "titre": "Nos observations : 15 déploiements d'orchestration multi-agents, 174 agents lancés en parallèle, 1 incident classé partiel",
          "url": null,
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "174 agents, 0 échec : fiabilité réelle ou biais de mesure ?",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/fiabilite-orchestration-174-agents",
        "url_en": "https://labo-llm.fr/en/techniques/fiabilite-orchestration-174-agents",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "hacrl-apprentissage-collaboratif#hacpo-33-gspo",
      "enonce": "L'algorithme associé, HACPO, obtient en moyenne +3,3 % sur la baseline GSPO tout en consommant deux fois moins de rollouts.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e78878",
          "titre": "Zhang et al., \"Heterogeneous Agent Collaborative Reinforcement Learning\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.02604",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "HACRL — quand des LLM de tailles différentes s'entraînent ensemble",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/hacrl-apprentissage-collaboratif",
        "url_en": "https://labo-llm.fr/en/techniques/hacrl-apprentissage-collaboratif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "hacrl-apprentissage-collaboratif#hacpo-aime-amc",
      "enonce": "Les gains sont concentrés sur les tâches difficiles : +13,7 % sur AIME2025 et +12,5 % sur AMC23 pour le modèle Qwen3-4B.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e78878",
          "titre": "Zhang et al., \"Heterogeneous Agent Collaborative Reinforcement Learning\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.02604",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "HACRL — quand des LLM de tailles différentes s'entraînent ensemble",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/hacrl-apprentissage-collaboratif",
        "url_en": "https://labo-llm.fr/en/techniques/hacrl-apprentissage-collaboratif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "hacrl-apprentissage-collaboratif#hacpo-7500-math",
      "enonce": "Toutes les expériences utilisent 7 500 questions MATH comme données d'entraînement, avec G=8 rollouts par prompt.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-e78878",
          "titre": "Zhang et al., \"Heterogeneous Agent Collaborative Reinforcement Learning\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.02604",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "HACRL — quand des LLM de tailles différentes s'entraînent ensemble",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/hacrl-apprentissage-collaboratif",
        "url_en": "https://labo-llm.fr/en/techniques/hacrl-apprentissage-collaboratif",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "harnesses-agents-langage-naturel#benchmarks-code-environ",
      "enonce": "Sur des benchmarks de code, environ 90 % des tokens et appels d'outils se déroulent dans les agents enfants, non dans l'orchestrateur parent (Pan et al., 2026).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-1c5a1a",
          "titre": "Pan et al., \"Natural-Language Agent Harnesses\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.25723",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Harnesses d'agents — l'architecture qui enveloppe le LLM",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/harnesses-agents-langage-naturel",
        "url_en": "https://labo-llm.fr/en/techniques/harnesses-agents-langage-naturel",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "lambda-rlm-raisonnement-contexte#attaquent-probleme-autrement",
      "enonce": "(arXiv:2512.24601), attaquent ce problème autrement.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-398707",
          "titre": "Zhang et al., \"Recursive Language Models\", arXiv:2512.24601, 2026",
          "url": "https://arxiv.org/abs/2512.24601",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "λ-RLM — du λ-calcul pour fiabiliser le raisonnement des LLM",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/lambda-rlm-raisonnement-contexte",
        "url_en": "https://labo-llm.fr/en/techniques/lambda-rlm-raisonnement-contexte",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-code#codex-288",
      "enonce": "Il atteignait 28,8 % sur le benchmark HumanEval — la référence de l'époque — et est devenu la base technique de GitHub Copilot lors de son lancement commercial en 2022.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-2d3901",
          "titre": "Chen, M. et al. (OpenAI), \"Evaluating Large Language Models Trained on Code\", arXiv:2107.03374, 2021",
          "url": "https://arxiv.org/abs/2107.03374",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "LLM et génération de code — ce que les benchmarks ne disent pas",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/llm-code",
        "url_en": "https://labo-llm.fr/en/techniques/llm-code",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-code#codellama-537",
      "enonce": "**CodeLlama** (Meta, 2023) a porté ce score à 53,7 % sur HumanEval avec sa variante Python de 34 milliards de paramètres.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-447649",
          "titre": "Rozière, B. et al. (Meta), \"Code Llama: Open Foundation Models for Code\", arXiv:2308.12950, 2023",
          "url": "https://arxiv.org/abs/2308.12950",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "LLM et génération de code — ce que les benchmarks ne disent pas",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/llm-code",
        "url_en": "https://labo-llm.fr/en/techniques/llm-code",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "llm-code#deepseekcoder-902",
      "enonce": "**DeepSeek-Coder** (2024) atteint 90,2 % pour sa version 236 milliards de paramètres — au niveau de GPT-4o.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-7c0e94",
          "titre": "Guo, D. et al. (DeepSeek), \"DeepSeek-Coder\", arXiv:2401.14196, 2024",
          "url": "https://arxiv.org/abs/2401.14196",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "LLM et génération de code — ce que les benchmarks ne disent pas",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/llm-code",
        "url_en": "https://labo-llm.fr/en/techniques/llm-code",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "memevolve-meta-apprentissage#memevolve-zhang-decembre",
      "enonce": "MemEvolve (Zhang et al., arXiv:2512.18746, décembre 2025) identifie une limite structurelle des systèmes mémoire actuels pour agents IA : leur architecture reste figée même quand la base de connaissances de l'agent progresse.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-cd5c0d",
          "titre": "Zhang, G., Ren, H., Zhan, C., Zhou, Z., Wang, J., Zhu, H., Zhou, W., Yan, S. (2025). MemEvolve: Meta-Evolution of Agent Memory Systems. arXiv:2512.18746.",
          "url": "https://arxiv.org/abs/2512.18746",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "MemEvolve — quand la mémoire agent s'auto-optimise",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/memevolve-meta-apprentissage",
        "url_en": "https://labo-llm.fr/en/techniques/memevolve-meta-apprentissage",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "meta-harness-optimisation#mh-486-vs-409",
      "enonce": "Sur trois datasets (USPTO-50k, Symptom2Disease, LawBench), Meta-Harness atteint 48,6% de précision moyenne contre 40,9% pour ACE, soit +7,7 points.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "github-e6b013",
          "titre": "Code artifact Meta-Harness TerminalBench-2",
          "url": "https://github.com/stanford-iris-lab/meta-harness-tbench2-artifact",
          "classe": "P1",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Meta-Harness — optimiser automatiquement le code autour du LLM",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/meta-harness-optimisation",
        "url_en": "https://labo-llm.fr/en/techniques/meta-harness-optimisation",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "meta-harness-optimisation#mh-terminalbench",
      "enonce": "Avec Claude Haiku 4.5 comme modèle de base, Meta-Harness atteint 37,6% sur TerminalBench-2, premier rang parmi tous les agents Haiku 4.5 rapportés — devant Goose (35,5%), Terminus-KIRA (33,7%), Mini-SWE-Agent (29,8%) et Claude Code (27,5%).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "github-e6b013",
          "titre": "Code artifact Meta-Harness TerminalBench-2",
          "url": "https://github.com/stanford-iris-lab/meta-harness-tbench2-artifact",
          "classe": "P1",
          "origine": "github.com",
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Meta-Harness — optimiser automatiquement le code autour du LLM",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/meta-harness-optimisation",
        "url_en": "https://labo-llm.fr/en/techniques/meta-harness-optimisation",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "modeles-vocaux-speech#moshi-latence-160",
      "enonce": "Latence théorique : 160 ms (80 ms pour le frame Mimi + 80 ms de délai acoustique).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-7323c1",
          "titre": "Défossez et al., \"Moshi: a speech-text foundation model\", arXiv, 2024",
          "url": "https://arxiv.org/abs/2410.00037",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Modèles vocaux — l'IA qui parle et qui écoute",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/modeles-vocaux-speech",
        "url_en": "https://labo-llm.fr/en/techniques/modeles-vocaux-speech",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "optimisation-inference#vllm-gaspillage-60-80",
      "enonce": "Les implémentations naïves réservent de la mémoire au maximum possible — ce qui gaspille de 60 à 80% des ressources GPU selon les mesures de l'équipe vLLM.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-65ff33",
          "titre": "Kwon et al., \"Efficient Memory Management for Large Language Model Serving with PagedAttention\", SOSP 2023",
          "url": "https://arxiv.org/abs/2309.06180",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Optimisation de l'inférence LLM — comment l'industrie coupe la facture",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/optimisation-inference",
        "url_en": "https://labo-llm.fr/en/techniques/optimisation-inference",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "panorama-rag-2026#colbert-degrade-longues",
      "enonce": "Limite 2026 (Ghosh et al.) : ColBERT dégrade fortement (chute de 86 à 97 %) sur les requêtes longues narratives au-delà de ~20 mots, à cause du plafonnement intrinsèque de MaxSim.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-3e8fc9",
          "titre": "Retriever biases — Goyal et al., 2026 — arXiv:2604.06097",
          "url": "https://arxiv.org/abs/2604.06097",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Panorama RAG avril 2026 — vectoriel, vectorless et approches émergentes",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/panorama-rag-2026",
        "url_en": "https://labo-llm.fr/en/techniques/panorama-rag-2026",
        "date_revision": "2026-04-20"
      }
    },
    {
      "id": "panorama-rag-2026#trec-covid-rrf",
      "enonce": "Résultat de référence 2026 : sur TREC-COVID (benchmark de 171 000 articles COVID), RRF(SPLADE + BGE) atteint nDCG@10 = 0,828, dépassant le dense seul (Prajapati 2026).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-5aacb7",
          "titre": "Hybrid Retrieval (RRF SPLADE+BGE, TREC-COVID) — Prajapati, 2026 — arXiv:2604.13728",
          "url": "https://arxiv.org/abs/2604.13728",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Panorama RAG avril 2026 — vectoriel, vectorless et approches émergentes",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/panorama-rag-2026",
        "url_en": "https://labo-llm.fr/en/techniques/panorama-rag-2026",
        "date_revision": "2026-04-20"
      }
    },
    {
      "id": "paradoxe-llm-langage#config-116-93",
      "enonce": "L'analyse de 116 fichiers de configuration de workflows IA réels montre que 93% utilisent des structures à sections fixes — aucun n'utilise de prose libre comme format principal.",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "nos-observations-116skills",
          "titre": "Nos observations : analyse de 116 skills publics de la communauté Everything Claude Code (architecture, taille, structure)",
          "url": null,
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le paradoxe LLM/langage — pourquoi les machines préfèrent le langage machine",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/paradoxe-llm-langage",
        "url_en": "https://labo-llm.fr/en/techniques/paradoxe-llm-langage",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "plus-agents-pas-mieux#novembre-sciagent-revendiquait",
      "enonce": "En novembre 2025, le papier SciAgent ([arXiv:2511.08151](https://arxiv.org/abs/2511.08151)) revendiquait des performances de médaille d'or à l'IMO 2025 grâce à un système hiérarchique multi-agents.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-c070c8",
          "titre": "Li, X. et al., \"SciAgent: A Unified Multi-Agent System for Generalistic Scientific Reasoning\", arXiv 2025 — RETIRÉ par les auteurs",
          "url": "https://arxiv.org/abs/2511.08151",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Plus d'agents ≠ meilleurs résultats — le paradoxe du scaling multi-agents",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/plus-agents-pas-mieux",
        "url_en": "https://labo-llm.fr/en/techniques/plus-agents-pas-mieux",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "prompt-chaining-vs-agent#daao-accepte-propose",
      "enonce": "DAAO (Xu et al., arXiv:2509.11079, accepté WWW2026) propose une orchestration adaptative par requête : le workflow est construit dynamiquement selon la difficulté estimée de chaque entrée, et non appliqué uniformément.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-a7c764",
          "titre": "Xu et al. \"Difficulty-Aware Agentic Orchestration\" (DAAO). arXiv:2509.11079. Accepté WWW2026.",
          "url": "https://arxiv.org/abs/2509.11079",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Prompt chaining vs agent autonome — lequel choisir ?",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/prompt-chaining-vs-agent",
        "url_en": "https://labo-llm.fr/en/techniques/prompt-chaining-vs-agent",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "quantization#qat-96-hellaswag",
      "enonce": "Sur des modèles plus petits, PyTorch QAT récupère jusqu'à 96 % de la dégradation observée en PTQ sur le benchmark HellaSwag avec Llama 3.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "triangule",
      "niveau_libelle": "Triangulé",
      "source_unique": false,
      "origines_independantes": 2,
      "sources": [
        {
          "id": "pytorch-eec4e9",
          "titre": "PyTorch — QAT for LLMs",
          "url": "https://pytorch.org/blog/quantization-aware-training/",
          "classe": "P2",
          "origine": "pytorch.org",
          "consulte_le": null
        },
        {
          "id": "arxiv-40b668",
          "titre": "Hasan, \"Optimizing Large Language Models through Quantization: A Comparative Analysis of PTQ and QAT Techniques\", arXiv:2411.06084",
          "url": "https://arxiv.org/abs/2411.06084",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Quantization — réduire un LLM sans le casser",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/quantization",
        "url_en": "https://labo-llm.fr/en/techniques/quantization",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "quantization#fp16-140-go",
      "enonce": "Un modèle 70 milliards de paramètres stocké en FP16 occupe environ 140 Go de mémoire GPU.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-04-19",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-03851d",
          "titre": "Dettmers et al., \"QLoRA: Efficient Finetuning of Quantized LLMs\", arXiv:2305.14314",
          "url": "https://arxiv.org/abs/2305.14314",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Quantization — réduire un LLM sans le casser",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/quantization",
        "url_en": "https://labo-llm.fr/en/techniques/quantization",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "red-teaming-agentic#dreadnode-asr-85",
      "enonce": "un taux de succès d'attaque (*attack success rate*, ASR) de 85 % sur Llama Scout 17B en 7 727 essais, sans code humain",
      "nature": "fait",
      "portee": "datee",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "dreadnode-2605",
          "titre": "Dheekonda et al. (Dreadnode, mai 2026) — arXiv:2605.04019",
          "url": "https://arxiv.org/abs/2605.04019",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Red teaming agentique — quand le LLM n'est plus la cible principale",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/red-teaming-agentic",
        "url_en": "https://labo-llm.fr/en/techniques/red-teaming-agentic",
        "date_revision": "2026-05-06"
      }
    },
    {
      "id": "rlvr-multi-reponses-entrainer-douter#modeles-testes-leng",
      "enonce": "Les modèles Llama-3 et Mistral-7B testés par Leng et al.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-aa12da",
          "titre": "Leng et al., \"Taming Overconfidence in LLMs: Reward Calibration in RLHF\", arXiv 2024",
          "url": "https://arxiv.org/abs/2410.09724",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "RLVR multi-réponses — entraîner un modèle à explorer",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/rlvr-multi-reponses-entrainer-douter",
        "url_en": "https://labo-llm.fr/en/techniques/rlvr-multi-reponses-entrainer-douter",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "securite-adversariale#injecagent-24",
      "enonce": "Le benchmark InjecAgent, qui couvre 17 types d'outils sur plus de 1 000 cas de test, montre que GPT-4 en mode agent est vulnérable dans 24% des cas.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-6dfe28",
          "titre": "Zhan, Q. et al., \"InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM Agents\", arXiv:2403.02691, ACL 2024",
          "url": "https://arxiv.org/abs/2403.02691",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Sécurité adversariale des LLM — attaques et défenses",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/securite-adversariale",
        "url_en": "https://labo-llm.fr/en/techniques/securite-adversariale",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "securite-adversariale#classifiers-86-44",
      "enonce": "La première génération (2025) a réduit le taux de jailbreak de 86% à 4,4%, mais au prix d'une surcharge computationnelle de 23,7% et d'un taux de faux positifs jugé trop élevé pour la production.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-5ad21e",
          "titre": "Anthropic, \"Constitutional Classifiers: Defending against Universal Jailbreaks\", arXiv:2501.18837, 2025",
          "url": "https://arxiv.org/abs/2501.18837",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Sécurité adversariale des LLM — attaques et défenses",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/securite-adversariale",
        "url_en": "https://labo-llm.fr/en/techniques/securite-adversariale",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "securite-adversariale#classifiers-pp-005",
      "enonce": "La version améliorée (Constitutional Classifiers++, 2026) résout le problème de coût — surcharge de 1% seulement — et atteint 0,05% de faux positifs sur le trafic réel.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-0bddd3",
          "titre": "Anthropic, \"Constitutional Classifiers++\", arXiv:2601.04603, 2026",
          "url": "https://arxiv.org/abs/2601.04603",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Sécurité adversariale des LLM — attaques et défenses",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/securite-adversariale",
        "url_en": "https://labo-llm.fr/en/techniques/securite-adversariale",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "self-consistency-prompting#ttrl-exploite-signal",
      "enonce": "TTRL (Zuo et al., 2025) exploite ce signal pour entraîner Qwen-2.5-Math-7B uniquement sur des données non étiquetées : le pass@1 sur AIME 2024 augmente de ~211%.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "zuo-y-et-al-2025-t-c0cf63",
          "titre": "Zuo, Y. et al. (2025). TTRL: Test-Time Reinforcement Learning. arXiv:2504.16084",
          "url": "https://arxiv.org/abs/2504.16084",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Self-Consistency — lancer 3 fois le même prompt",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/self-consistency-prompting",
        "url_en": "https://labo-llm.fr/en/techniques/self-consistency-prompting",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "strategies-agents-asynchrones#caid-sonnet-gains",
      "enonce": "Sur Claude Sonnet 4.5, CAID (4 ingénieurs) améliore le taux de passage de 53,1% à 59,1% sur Commit0-Lite, et de 57,2% à 63,3% sur PaperBench.",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-033d02",
          "titre": "Geng et Neubig, \"Effective Strategies for Asynchronous Software Engineering Agents\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.21489",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agents codeurs asynchrones — stratégies de coordination efficaces",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/strategies-agents-asynchrones",
        "url_en": "https://labo-llm.fr/en/techniques/strategies-agents-asynchrones",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "strategies-agents-asynchrones#caid-sequentiel-cout",
      "enonce": "l'approche séquentielle atteint 66,8% mais multiplie le temps d'exécution (3884s contre 2080s) et le coût ($12,6 contre $9,3)",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "arxiv-033d02",
          "titre": "Geng et Neubig, \"Effective Strategies for Asynchronous Software Engineering Agents\", arXiv 2026",
          "url": "https://arxiv.org/abs/2603.21489",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Agents codeurs asynchrones — stratégies de coordination efficaces",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/strategies-agents-asynchrones",
        "url_en": "https://labo-llm.fr/en/techniques/strategies-agents-asynchrones",
        "date_revision": "2026-04-25"
      }
    },
    {
      "id": "web-agents-ia-transition#agentcompany-303",
      "enonce": "Les agents IA ne navigueront pas seuls le web demain : le meilleur agent évalué sur un benchmark de tâches de bureau réalistes plafonne à 30,3 % (TheAgentCompany, CMU).",
      "nature": "fait",
      "portee": "intemporelle",
      "verifie_le": "2026-09-06",
      "niveau_preuve": "primaire",
      "niveau_libelle": "Source primaire",
      "source_unique": true,
      "origines_independantes": 1,
      "sources": [
        {
          "id": "agentcompany-2412",
          "titre": "TheAgentCompany (CMU, décembre 2024) — arXiv:2412.14161",
          "url": "https://arxiv.org/abs/2412.14161",
          "classe": "P1",
          "origine": null,
          "consulte_le": null
        }
      ],
      "article": {
        "titre": "Le web qui se prépare aux agents IA — où la transition a vraiment lieu",
        "territoire": "techniques",
        "url": "https://labo-llm.fr/techniques/web-agents-ia-transition",
        "url_en": "https://labo-llm.fr/en/techniques/web-agents-ia-transition",
        "date_revision": "2026-05-06"
      }
    }
  ]
}