En bref
Quand un LLM évalue la qualité d’un output, il accepte comme valides plus de trois outputs invalides sur quatre : le taux de vrais négatifs (TNR) mesuré sur 14 modèles est inférieur à 25 % (Zhao et al., 2025). Un système de review automatisé fondé sur GPT-4o atteint 69 % de précision équilibrée sur des papers scientifiques, et tombe à 66 % hors distribution (Lu et al., 2026). Des papers entièrement fabriqués, sans aucune expérience réelle, passent les filtres LLM dans jusqu’à 82 % des cas (Dang et al., 2025). Ces chiffres posent une question méthodologique précise : peut-on quantifier la fiabilité d’un juge LLM, et si oui, comment ?
En clair : pensez à un correcteur de copies trop indulgent. Il accepte 96% des bonnes copies (TPR=96%) — bon point — mais il accepte aussi 75% des mauvaises (TNR=25%). Sur un paquet où la majorité est correcte, son taux de bonnes notes paraît élevé. Mais si vous filtrez les copies frauduleuses avec ce correcteur, trois sur quatre passent. C’est exactement la signature des juges LLM : permissifs structurels, masqués par un accord global qui flatte.
Le FPR du juge automatique
Le paradigme LLM-as-judge — utiliser un grand modèle de langage pour noter ou classer des outputs à la place d’un évaluateur humain — s’est imposé depuis 2023 comme une alternative économique aux annotations humaines. L’article de Zheng et al. (2023), qui introduit MT-Bench et Chatbot Arena, établit que GPT-4 atteint un accord supérieur à 80 % avec les préférences humaines. Ce chiffre est souvent cité comme validation du paradigme.
Le problème est qu’un accord global de 80 % ne dit rien sur la distribution des erreurs. En classification binaire, la métrique pertinente est la décomposition en taux de vrais positifs (TPR — outputs valides correctement acceptés) et taux de vrais négatifs (TNR — outputs invalides correctement rejetés). Or cette décomposition révèle une asymétrie sévère.
Zhao et al. (2025) mesurent sur 14 LLMs évalués sur 366 programmes Python le profil TPR/TNR complet. Résultat : le TPR dépasse 96 %, le TNR reste inférieur à 25 %. La traduction directe est un taux de faux positifs (FPR) implicite supérieur à 75 % sur les outputs invalides. Les LLMs acceptent comme corrects des outputs défaillants dans plus de trois cas sur quatre.
Ce déséquilibre porte un nom dans la littérature : l’agreeableness bias. Les LLMs sont structurellement entraînés à produire des outputs coopératifs et validants. Ce comportement se transfère au rôle de juge : évaluer négativement un output exige de résister à une pression d’accord que le modèle a internalisée pendant l’entraînement. Les deux surveys de synthèse (Gu et al., 2024 ; Li et al., 2024) convergent sur ce point : le déséquilibre TPR élevé / TNR bas est le pattern empirique dominant dans la littérature LLM-as-judge.
La conséquence pratique est immédiate. Un pipeline d’évaluation automatique qui utilise un LLM comme filtre de qualité ne rejette pas les mauvais outputs — il les laisse passer. Le juge ne sert plus de filtre ; il sert de tampon de validation.
69 % de précision : la baseline AI Scientist (Nature 2026)
Lu et al. (2026) publient dans Nature les résultats du système AI Scientist de Sakana AI. Ce système génère des idées de recherche, conduit des expériences simulées, rédige des articles et effectue une revue automatique via un Automated Reviewer. Ce reviewer constitue un cas de LLM-as-judge à grande échelle, avec un protocole rigoreux calqué sur les directives NeurIPS.
Le reviewer ensembles cinq évaluations indépendantes et agit comme Area Chair. Le modèle utilisé est GPT-4o. Les auteurs notent explicitement que tous les autres modèles testés présentent un “positivity bias” ou refusent de se conformer au format de sortie requis — GPT-4o est le seul modèle utilisable dans ce rôle.
Les performances mesurées sur papers OpenReview (2017–2024) : 69 % de balanced accuracy (précision équilibrée, définie comme la moyenne du TPR et du TNR). Sur un dataset 2025 “propre” — papers postérieurs à la fenêtre d’entraînement probable du modèle — la balanced accuracy chute à 66 %. La perte de 3 points absolus hors distribution indique une dépendance partielle aux features superficielles des papers vus en entraînement.
La balanced accuracy est la métrique correcte ici, et son choix n’est pas anodin. Dror et al. (2024) démontrent que la balanced accuracy est équivalente à l’indice J de Youden (BA = (J+1)/2), et que les métriques alternatives sont biaisées par le déséquilibre de classes. Un juge avec TPR=96 % et TNR=25 % obtient une accuracy apparente très élevée si les outputs valides sont majoritaires dans le dataset — mais sa balanced accuracy n’est que 60,5 %. La balanced accuracy rend visible le FPR masqué par les métriques habituelles.
Les 69 % de l’AI Scientist doivent être lus dans ce contexte : c’est un système optimisé pour cette tâche, avec un protocole rigoureux, qui reste à 31 points d’erreur en précision équilibrée sur des papers de conférence ML.
La calibration forcée multiplie le pouvoir discriminant
Un juge LLM produit des scores bruités. Le “Noisy but Valid” framework de Chen et al. (2026) formalise cette intuition : un juge imparfait peut rester statistiquement utile si ses paramètres d’erreur (TPR et FPR réels) sont estimés empiriquement, puis intégrés dans un test d’hypothèse corrigé.
Le principe opératoire est simple. On constitue un calibration set humain de petite taille — entre 50 et 200 exemples annotés manuellement. Ce set permet d’estimer les vrais TPR et FPR du juge sur le domaine cible. On applique ensuite un seuil de décision corrigé de la variance sur un grand dataset étiqueté par le juge seul. Chen et al. montrent que cette procédure peut augmenter la puissance statistique au-delà d’une évaluation directe sur le même budget humain : les jugements LLM bruités, une fois calibrés, apportent plus d’information que les labels humains seuls sur un budget identique.
L’approche de régression de Zhao et al. (2025) opère sur le même principe, avec une implémentation différente : correction post-hoc des scores du juge calibrée sur un petit ensemble humain. La réduction du RMSE (erreur quadratique moyenne) atteint 72 % dans certaines configurations. La correction ne corrige pas le biais structurel du modèle — elle l’estime et le compense numériquement.
La minority-veto est une troisième technique, plus simple à implémenter. Dans un ensemble de juges LLMs, quelques votes “invalide” suffisent à forcer le label invalide de l’ensemble — même si la majorité vote “valide”. Cette règle asymétrique contrebalance directement l’agreeableness bias en pénalisant davantage le faux positif que le faux négatif. Zhao et al. (2025) et les deux surveys de synthèse (Gu et al., 2024 ; Li et al., 2024) identifient la minority-veto et la régression calibrée comme les deux approches les plus efficaces pour augmenter le TNR.
Un autre levier est la correction du biais de verbosité. Dubois et al. (2024) montrent que la corrélation Spearman entre AlpacaEval brut et Chatbot Arena est de 0,93–0,94. Après contrôle statistique de la longueur des réponses, cette corrélation monte à 0,98. Un seul facteur de correction — la longueur — apporte 4 à 5 points de corrélation de rang. La length-controlled win rate est devenue le défaut dans AlpacaEval 2.0 précisément parce que le biais de verbosité était exploitable : un modèle pouvait gonfler son win rate sans amélioration de qualité, simplement en produisant des réponses plus longues.
Le coût de la permissivité
La permissivité d’un juge LLM n’est pas qu’une anomalie statistique. Elle a des conséquences concrètes quand le juge opère dans un pipeline automatisé.
Dang et al. (2025) testent ce scénario directement. Leur système BadScientist génère des papers de recherche entièrement fabriqués — sans expériences réelles, en utilisant cinq stratégies de manipulation nommées TooGoodGains, BaselineSelect, StatTheater, CoherencePolish et ProofGap. Ces papers sont soumis à des systèmes de review LLM multi-modèles (o3, o4-mini, GPT-4.1, calibrés sur les standards ICLR 2025). Résultat : les papers fabriqués sont acceptés dans jusqu’à 82 % des cas.
Le détail le plus frappant n’est pas le taux d’acceptation lui-même. C’est que les reviewers LLM signalent fréquemment des problèmes d’intégrité dans leurs évaluations textuelles — puis assignent malgré tout des scores d’acceptation. Les auteurs nomment ce pattern le “concern-acceptance conflict” : le modèle identifie le problème mais ne tire pas la conclusion qui s’impose. La conclusion des auteurs est sans ambiguïté : “LLMs are not ready for autonomous review.”
Li et al. (2025) documentent une forme complémentaire de ce problème dans LLM-REVal. Dans un protocole de simulation multi-tours, les reviewers LLM gonflent systématiquement les scores des papers générés par des LLMs par rapport aux papers humains. Le mécanisme identifié est un linguistic feature bias : le style d’écriture caractéristique des textes LLM est favorisé indépendamment du contenu scientifique. À l’inverse, les papers humains contenant des formulations explicites sur les risques ou l’équité sont systématiquement sous-scorés, même après révision.
Ces deux études convergent vers le même diagnostic : dans un pipeline d’évaluation automatique entièrement LLM, les outputs générés par des LLMs bénéficient d’un avantage structurel que le contenu ne justifie pas. La permissivité n’est pas uniformément distribuée — elle est orientée, et elle favorise précisément les outputs qui ressemblent stylistiquement aux textes LLM.
Pour les applications pratiques — sélection de modèles, filtrage de données d’entraînement, évaluation de systèmes RAG — cette orientation implique une contamination systématique : les pipelines qui utilisent des LLMs pour générer et évaluer leurs données de supervision tendent à sur-représenter les outputs à style LLM, indépendamment de leur qualité réelle. Les deux surveys de synthèse (Gu et al., 2024 ; Li et al., 2024) nomment ce phénomène “preference leakage”.
Comment mesurer la fiabilité d’un juge LLM
La littérature converge vers un ensemble de recommandations méthodologiques concrètes.
Utiliser la balanced accuracy, pas l’accuracy ni le F1. Dror et al. (2024) montrent qu’un juge avec TPR=96 % et TNR=25 % obtient une accuracy apparente très élevée dès lors que les outputs valides sont majoritaires dans le dataset, mais une balanced accuracy de seulement 60,5 %. Le F1 est également biaisé par le déséquilibre de classes et peut sélectionner des juges avec un FPR catastrophique tout en semblant performant. La balanced accuracy — moyenne du TPR et du TNR — est la seule métrique qui pénalise également les deux types d’erreur.
Construire un calibration set humain. Chen et al. (2026) démontrent qu’un ensemble de 50 à 200 exemples annotés manuellement suffit à estimer les vrais paramètres TPR/FPR d’un juge sur le domaine cible. Sans ce calibration set, les paramètres du juge sont inconnus et les corrections statistiques ne peuvent pas être appliquées. L’écart de performance entre paramètres connus parfaitement et paramètres estimés empiriquement — l‘“Oracle Gap” de Chen et al. — quantifie le gain potentiel d’un effort d’annotation même minimal.
Mesurer le TNR indépendamment du TPR. La pratique courante de rapporter un accord global cache l’asymétrie TPR/TNR. Un juge qui accepte tout a un TPR de 100 % et une accuracy de classe majoritaire — mais un TNR de 0 %. Tout protocole d’évaluation de juge LLM doit inclure une mesure explicite du TNR sur un sous-ensemble d’outputs invalides confirmés.
Appliquer la minority-veto ou la régression calibrée. Quand un ensemble de juges est utilisé, la minority-veto — quelques votes négatifs suffisent à forcer le rejet — compense l’agreeableness bias directement. La régression calibrée post-hoc (Zhao et al., 2025) réduit le RMSE de 72 % dans certaines configurations et ne nécessite qu’un petit calibration set humain.
Tester hors distribution. Les 69 % de balanced accuracy de l’AI Scientist sur les papers 2017–2024 tombent à 66 % sur les papers 2025. Lu et al. (2026) signalent ce risque de contamination des données d’entraînement. Tout benchmark de juge LLM doit inclure une évaluation sur des données postérieures à la fenêtre d’entraînement probable du modèle.
Surveiller le linguistic feature bias. Li et al. (2025) documentent que les textes à style LLM bénéficient d’un avantage systématique indépendant du contenu. Dans un pipeline où les données évaluées sont elles-mêmes générées par des LLMs, ce biais amplifie la permissivité au lieu de la corriger.
Quelle correction selon le contexte ?
| Contexte | Correction recommandée | Pourquoi |
|---|---|---|
| Calibration set humain disponible (50-200 ex.) | Régression calibrée (Zhao et al.) | -72% RMSE, gain immédiat sur le bruit du juge |
| Ensemble de plusieurs juges LLM | Minority-veto | Asymétrique en faveur du rejet — compense l’agreeableness directement |
| Évaluation de longueur libre | Length-controlled win rate (Dubois) | +4-5 points Spearman, défaut désormais d’AlpacaEval 2.0 |
| Pas de calibration humaine accessible | Refuser le LLM-as-Judge sur cette dimension | Sans calibration set, les paramètres TPR/FPR sont inconnus — pas de correction possible |
En clair : la correction du biais d’un juge LLM coûte un effort initial (annoter manuellement 50-200 exemples) qui semble lourd, mais c’est ce qui rend le juge utilisable à grande échelle. Sans cette calibration, vos métriques sont décoratives. Avec elle, vous transformez un instrument biaisé en mesure approximativement fiable — pas parfait, mais discriminant.
Ce qu’il faut retenir
-
Sur 14 LLMs testés, le TNR est inférieur à 25 % : plus de trois outputs invalides sur quatre sont acceptés comme valides (Zhao et al., 2025). L’agreeableness bias n’est pas un phénomène marginal — c’est la norme empirique.
-
La balanced accuracy est la seule métrique qui rend ce problème visible. Un accord global de 80 % avec les humains (Zheng, 2023) et une balanced accuracy de 60,5 % (Dror et al., 2024, sur le profil TPR=96 %/TNR=25 %) sont compatibles — la première métrique masque ce que la seconde révèle.
-
Un système de review automatisé optimisé — cinq juges LLM ensemblés, protocole NeurIPS, modèle GPT-4o — plafonne à 69 % de balanced accuracy (Lu et al., 2026). C’est la limite pratique actuelle dans les meilleures conditions documentées.
-
Les papers scientifiques entièrement fabriqués passent les filtres LLM dans jusqu’à 82 % des cas (Dang et al., 2025). Le “concern-acceptance conflict” — le modèle signale le problème mais ne le rejette pas — est le mécanisme central.
-
La correction statistique est possible et efficace : régression calibrée sur petit ensemble humain (réduction RMSE de 72 %, Zhao et al., 2025), minority-veto, correction du biais de verbosité (+4–5 points de corrélation Spearman, Dubois et al., 2024). Ces techniques ne corrigent pas le biais structurel — elles le compensent numériquement.