En bref

Depuis 2023, le paradigme LLM-as-Judge s’est généralisé : un LLM note les sorties d’un autre LLM, voire les siennes propres. GPT-4 utilisé comme juge atteint un taux d’accord de plus de 80 % avec les préférences humaines — un chiffre comparable à l’accord inter-humain, et suffisamment élevé pour justifier le remplacement d’une partie des annotations manuelles. Mais le même article qui établit ce résultat documente trois biais systémiques. La littérature ultérieure en a ajouté un quatrième, puis a montré que les tentatives de correction restaient fragiles. Ce n’est pas un problème d’alignement au sens large : c’est un problème de métrologie. Quand l’instrument de mesure est fabriqué dans le même matériau que ce qu’il mesure, l’indépendance est structurellement limitée.

En clair : pensez à un thermomètre fait à partir d’un échantillon de l’air qu’il doit mesurer. Il donne une lecture, mais cette lecture intègre les propriétés du matériau plus que celles de l’objet mesuré. Le LLM-juge présente exactement ce défaut : il évalue un texte généré avec des biais qui sont aussi les siens — préférence pour la longueur, pour son propre style, surconfiance. La métrologie cesse d’être objective.


Quatre biais documentés

1. Le biais de position

L’ordre dans lequel les réponses sont présentées au juge LLM influence le verdict. Wang et al. (2023) ont testé ce phénomène sur 80 requêtes : en changeant simplement l’ordre de présentation, Vicuna-13B bat ChatGPT dans 66 cas sur 80 quand ChatGPT est juge. Le mécanisme précis — primacy bias, recency bias, ou artefact d’attention — reste débattu. Ce qui est établi : le classement n’est pas stable face à une permutation des entrées.

2. Le biais de verbosité

Les juges LLM préfèrent systématiquement les réponses plus longues, indépendamment de leur qualité réelle. Dubois et al. (2024) ont quantifié ce biais sur AlpacaEval : après contrôle de la longueur par régression, la corrélation entre scores LLM-judge et préférences humaines passe de 0,94 à 0,98. Ce biais a une implication pratique directe : les modèles entraînés sur des signaux LLM-judge apprennent à produire des réponses longues plutôt que des réponses utiles.

3. Le biais de préférence pour soi

Un modèle utilisé comme juge favorise ses propres outputs. Panickssery et al. (2024) établissent une causalité, pas seulement une corrélation : GPT-4 et Llama 2 peuvent distinguer leurs propres générations de celles d’autres modèles avec une précision significative. Et il existe une corrélation linéaire entre la capacité de self-recognition et la force du biais de préférence. Autrement dit, les modèles les plus capables de reconnaître leur propre style sont aussi les plus biaisés dans leur jugement.

4. La surconfiance systématique

Prasad et Nguyen (2025) ont organisé des débats adversariaux entre LLMs et mesuré les probabilités de victoire auto-déclarées. La moyenne observée est de 72,9 % — contre une baseline rationnelle de 50 % pour un débat à deux participants. Dans 61,7 % des débats, les deux modèles revendiquent simultanément une probabilité de victoire supérieure ou égale à 75 %. Un seul peut avoir raison.

En clair : ces quatre biais — position, verbosité, préférence pour soi, surconfiance — ne sont pas des bizarreries marginales mais des propriétés structurelles. Ils s’additionnent. Un juge LLM sans correction donne une réponse qui ressemble à une note objective et qui est en réalité un cocktail de signaux non liés à la qualité réelle.


La calibration : ce que les modèles savent d’eux-mêmes

Kadavath et al. (2022, Anthropic) ont montré que les grands modèles sont généralement bien calibrés sur des questions à choix multiples dans des formats adaptés. Quand on leur demande d’estimer leur propre probabilité de connaître une réponse — le signal P(IK) — ils généralisent partiellement à travers les tâches. Cette calibration se détériore hors distribution, mais le point de base reste solide.

Le problème surgit quand la calibration rencontre l’itération. Huang et al. (2025) montrent que l’auto-amélioration itérative — un modèle qui s’évalue puis se ré-entraîne sur ses propres jugements — amplifie l’overconfidence si aucun mécanisme de régulation n’est introduit. L’Expected Calibration Error augmente à chaque cycle. Ce résultat a des conséquences directes pour les pipelines qui reposent sur des boucles d’auto-évaluation, notamment RLHF. [NON VÉRIFIÉ — la généralisation à d’autres architectures RLHF que celles testées dans le papier n’est pas documentée dans les sources collectées.]


L’auto-correction : une indépendance partielle

Une approche pour contourner l’auto-évaluation biaisée consiste à forcer le modèle à vérifier ses propres affirmations via des questions séparées, sans accès à la réponse initiale. C’est le principe de la Chain-of-Verification (Dhuliawala et al., 2023, Meta) : générer des questions de vérification, y répondre indépendamment, puis réviser.

La limite est structurelle. Le modèle qui vérifie et le modèle qui a généré partagent les mêmes paramètres, donc les mêmes biais encodés. L’indépendance obtenue est partielle. [NON VÉRIFIÉ — cette limite est discutée dans la littérature mais sans quantification directe dans les sources collectées.]

Gulli (2025, Ch.4) formalise ce problème sous le nom de biais cognitif d’auto-révision et propose le pattern Producer-Critic : deux agents distincts, l’un génère, l’autre critique avec une perspective fraîche dédiée à la détection d’erreurs. La séparation des rôles réduit le biais, mais ne l’élimine pas si les deux agents sont issus du même modèle de base.


Débiaisement : des gains réels, une robustesse fragile

Plusieurs approches réduisent les biais mesurés. Wang et al. (2023) proposent un cadre en trois étapes — calibration multi-preuves, calibration de position équilibrée, humain dans la boucle. D’autres travaux (FairJudge, RBD, AutoRubric) améliorent la précision de 10 à 18 % en moyenne sur les benchmarks statiques.

Mais Ding et al. (2026) montrent que les rubriques d’évaluation — souvent présentées comme la solution au biais — constituent elles-mêmes une surface d’attaque. Des modifications subtiles de rubrique induisent des dérives de préférence directionnelles et réduisent la précision jusqu’à 27,9 %, tout en passant les validations benchmark standard. Les méthodes de débiaisement sont robustes aux perturbations aléatoires, pas aux perturbations adversariales ciblées.


L’état de la mesure en 2026

Zhou et al. (2026) ont introduit JudgeBiasBench, un benchmark couvrant 12 types de biais représentatifs. Leurs résultats montrent que les juges actuels présentent des patterns de biais significatifs et diversifiés. BiasScope (Lai et al., 2026) détecte automatiquement les biais à grande échelle et révèle que même les LLMs puissants utilisés comme évaluateurs affichent des taux d’erreur supérieurs à 50 %. Fang et al. (2026) ajoutent un biais émergent : les juges LLM préfèrent de plus en plus les textes générés par LLM aux textes humains, indépendamment de la qualité réelle.

Lau (2026) documente un problème de reproductibilité distinct des biais de position : à temperature=0, des modèles différents produisent des scores substantiellement variés pour les mêmes inputs. Ce n’est plus un problème de biais intra-modèle, c’est un problème de variance inter-modèles.

Le résultat de référence du domaine — plus de 80 % d’accord entre GPT-4 et les préférences humaines — est lui-même contesté. Feng et al. (2025) montrent via le benchmark Sage que les LLMs présentent des problèmes de fiabilité significatifs dans des settings structurés. La question centrale reste ouverte : un accord élevé avec les humains reflète-t-il une qualité élevée, ou des biais partagés entre humains et LLMs ?


Ce qu’il faut retenir

  • Les juges LLM présentent quatre biais documentés : position, verbosité, préférence pour soi, surconfiance. Ils s’accumulent et interagissent.
  • La calibration des modèles sur leurs propres connaissances est généralement correcte sur des tâches structurées, mais se dégrade hors distribution et sous itération.
  • L’auto-correction partage les mêmes paramètres que la génération initiale. Le pattern Producer-Critic avec deux agents distincts réduit ce problème sans l’éliminer.
  • Les techniques de débiaisement améliorent les scores sur benchmarks statiques mais restent vulnérables aux perturbations adversariales ciblées.
  • En 2026, les taux d’erreur des meilleurs juges LLM sur des benchmarks spécialisés dépassent encore 50 %.