En bref
Le RLVR (Reinforcement Learning with Verifiable Rewards) améliore la précision des LLM en mathématiques et en code, mais son signal binaire correct/incorrect pousse les modèles à converger vers une seule stratégie de réponse, appauvrissant leur capacité d’exploration. Une variante récente — l’entraînement multi-réponses — demande au modèle de produire K candidats en un seul passage et récompense l’ensemble : sur le benchmark de code MBPP, la précision top-1 progresse de +69 % et la consommation de tokens chute de 54 %. La calibration, mesurée par le Brier score, passe de 0,55 à 0,18.
Le problème : quand mieux répondre signifie moins explorer
RLVR : le raccourci du signal vérifiable
Imaginez deux étudiants qui apprennent à résoudre des équations. Le premier reçoit des notes d’un correcteur humain qui aime les rédactions assurées et bien tournées — il finit par apprendre à formuler avec confiance, parfois au détriment de la justesse. Le second reçoit des notes d’une calculatrice qui ne récompense que les réponses justes — il apprend à être correct, sans se soucier de la formulation. RLHF est le premier ; RLVR est le second.
RLHF (Reinforcement Learning from Human Feedback) entraîne d’abord un modèle de récompense à partir d’annotations humaines, puis optimise la politique du LLM en conséquence. Ce pipeline est coûteux et introduit un risque : les annotateurs humains récompensent les réponses qui paraissent assurées plutôt que celles qui sont factuellement correctes, ce qui pousse les modèles vers la surconfiance verbale (Leng et al., 2024).
RLVR court-circuite ce modèle de récompense intermédiaire. Pour les domaines où une vérité terrain existe de façon programmatique — mathématiques, code, logique formelle —, un vérificateur automatique (compilateur, oracle de test, calculateur) émet directement un signal binaire : 1 si la réponse est correcte, 0 sinon. On ne peut pas convaincre un compilateur qu’un programme faux est juste. Ce signal net est l’un des facteurs qui a permis à DeepSeek-R1-Zero, entraîné via GRPO sans aucune phase de fine-tuning supervisé, d’atteindre 71,0 % sur AIME 2024 contre 15,6 % pour le modèle de base.
La contrepartie : RLVR ne fonctionne que là où un oracle déterministe existe. La rédaction créative, l’argumentation nuancée, toute tâche subjective restent hors de portée.
L’effondrement silencieux de la diversité
En 2025, plusieurs travaux indépendants documentent un effet paradoxal : l’entraînement RLVR améliore la précision sur une tentative unique (Pass@1) tout en dégradant la probabilité qu’au moins une réponse parmi K tentatives soit correcte (Pass@k pour K grand).
Yang Yue et al. (NeurIPS 2025) mesurent ce phénomène directement : au fil de l’entraînement, Pass@1 monte de 26,1 % à 42,5 % sur les données d’entraînement, tandis que Pass@256 décroît de façon continue. Leur explication : RLVR ne génère pas de nouveaux patterns de raisonnement — il rend simplement plus probables les chemins déjà présents dans le modèle de base qui ont obtenu des récompenses positives, au détriment des autres. À comparer avec la distillation, qui introduit de véritables nouveaux chemins depuis un modèle enseignant.
Li et al. (ICLR 2026) formalisent le mécanisme sous-jacent. L’algorithme GRPO, comme PPO, utilise la reverse-KL divergence comme régularisation. Cette divergence est mass-seeking : elle concentre la politique sur les modes de haute probabilité et étouffe activement les distributions de faible probabilité. Leur alternative, DPH-RL, substitue des f-divergences mass-covering (forward-KL, JS-divergence) qui forcent le modèle à maintenir une couverture large. Résultat : Pass@1 et Pass@k s’améliorent simultanément, et l’oubli catastrophique hors-domaine diminue.
Ce phénomène porte aussi le nom de policy entropy collapse : en fin d’entraînement, les sorties du modèle convergent vers un petit nombre de stratégies presque identiques.
En clair : RLVR rend le modèle plus précis sur sa première tentative, mais réduit la diversité des stratégies qu’il sait produire. C’est comme un étudiant qui devient excellent sur une seule méthode, au détriment de toutes les autres méthodes qu’il avait dans son répertoire avant.
L’approche multi-réponses : reformuler l’objectif
Produire un ensemble plutôt que choisir un mode
L’intuition centrale de Puri et al. (MIT CSAIL, mars 2026) est une reformulation de l’objectif d’entraînement. Au lieu de demander au modèle la bonne réponse, on lui demande de produire K réponses candidates en un seul passage, couvrant la distribution des réponses correctes possibles. La fonction de récompense somme les corrections sur l’ensemble :
R_multi_RLVR = Σ (1 si réponse i ∈ réponses correctes)
Ce changement d’objectif est plus profond qu’il n’y paraît. Dans GRPO standard (DeepSeek-R1), le modèle génère déjà K=16 réponses par question — mais les récompenses restent individuellement binaires et servent uniquement à estimer un avantage relatif intra-groupe. Chaque réponse est évaluée indépendamment ; leur diversité n’est pas récompensée. Avec la récompense multi-RLVR, la somme des corrections force le modèle à explorer l’espace des solutions : il ne peut pas « choisir » de converger sur une seule réponse sans sacrifier des points de récompense sur les K-1 autres.
Un effet de bord notable : le raisonnement conjoint sur K hypothèses dans un seul passage réduit les chaînes de raisonnement redondantes. Quand un modèle génère K réponses indépendantes (K appels séparés), il reproduit souvent le même préambule de raisonnement. En production conjointe, il est contraint d’emprunter des chemins distincts.
Ce précédent de l’inférence : self-consistency
Ce principe n’est pas sans précédent. Wang et al. (ICLR 2023) avaient montré qu’à l’inférence, générer un ensemble diversifié de chaînes de raisonnement puis agréger par vote majoritaire améliore substantiellement les performances : +17,9 % sur GSM8K, +11,0 % sur SVAMP, +12,2 % sur AQuA. La self-consistency opère sans modifier le modèle — elle exploite de façon post-hoc la diversité que le modèle possède déjà.
L’entraînement multi-réponses va un cran plus loin : il forme le modèle à produire nativement cette diversité, en intégrant l’exploration à l’objectif lui-même plutôt qu’en l’exploitant seulement à l’inférence.
En clair : au lieu de demander UNE bonne réponse, on demande K candidats distincts en un seul passage, et on récompense la couverture. Le modèle ne peut plus “s’enfermer” dans une seule stratégie — il doit explorer pour gagner. Conséquence directe : +69 % de précision top-1 sur MBPP avec -54 % de tokens par rapport au baseline single-answer.
Les résultats
Code : MBPP
Sur le benchmark MBPP de génération de code Python :
| Métrique | Single-answer RLVR | Multi-RLVR |
|---|---|---|
| Top-1 accuracy | 0,29 | 0,49 (+69 %) |
| Tokens utilisés | 512 | 235 (-54 %) |
| Brier score | 0,55 | 0,18 (RLCR-Multi) |
Le gain de +69 % en précision accompagné d’une réduction de 54 % des tokens n’est pas un compromis — les deux s’améliorent simultanément. L’explication : le modèle multi-réponses distribue son budget de tokens sur K chemins courts et distincts plutôt que sur un seul chemin long qui tente d’être exhaustif.
Diagnostic médical : DDXPlus
DDXPlus est un benchmark de diagnostic différentiel — tâche naturellement multi-réponses puisqu’un patient peut présenter plusieurs diagnostics valides simultanément.
| Métrique | Single-RLVR | Multi-RLVR |
|---|---|---|
| Couverture diagnostics corrects | 0,62 | 0,79 |
| Diagnostics uniques par question | ~4 | ~8 |
| ECE (calibration) | non rapporté | 0,02 (RLCR-Multi) |
L’ECE de 0,02 représente une calibration quasi-parfaite : quand le modèle déclare 80 % de confiance sur un diagnostic, il a raison dans environ 80 % des cas à ce niveau. C’est obtenu via la variante RLCR (RL with Calibration Rewards), qui ajoute au signal de récompense une pénalité proportionnelle à l’écart entre confiance déclarée et correction observée.
Pourquoi la calibration est distincte de la précision
Un modèle peut être précis sans être bien calibré — il prédit correctement mais à des niveaux de confiance qui ne correspondent pas à sa précision empirique réelle. RLHF dégrade la calibration parce que les annotateurs humains récompensent les réponses qui paraissent assurées ; le modèle apprend à projeter de la confiance indépendamment de la correction factuelle. Les modèles Llama-3 et Mistral-7B testés par Leng et al. exhibent des ECE entre 0,12 et 0,40.
RLVR binaire reproduit le même problème sous une forme différente : Puri et al. mesurent une surconfiance systématique à tous les niveaux de confiance sur les modèles entraînés avec récompense binaire simple. RLCR corrige cet artefact en rendant la confiance déclarée coûteuse quand elle est fausse.
Quand utiliser quel signal d’entraînement
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Domaine subjectif (rédaction, dialogue) | RLHF ou DPO | Pas d’oracle déterministe possible — feedback humain irremplaçable |
| Math/code, oracle disponible, réponse unique | RLVR (GRPO) | Signal binaire net, pas de coût d’annotateurs |
| Math/code, multiples solutions valides | Multi-RLVR | Préserve diversité, exploration native, +69 % MBPP |
| Diagnostic différentiel, exigence calibration | RLCR (RL with Calibration Rewards) | ECE = 0,02 — confiance déclarée alignée sur précision |
| Modèle small (≤ 7B) à finetuner sur tâche difficile | DPH-RL (forward-KL/JS) | Évite l’effondrement de diversité, préserve Pass@k |
Limites et questions ouvertes
Ce qui n’est pas documenté
L’entraînement multi-réponses a été évalué sur des tâches où plusieurs réponses correctes existent naturellement (code avec solutions multiples, diagnostic différentiel). La généralisation aux benchmarks mathématiques standard (GSM8K, AIME, MATH), où la réponse est unique, n’est pas documentée dans ce travail. On ne sait pas si le gain se transfère ou si de nouvelles pathologies émergent (redondance forcée, fausse diversité).
La comparaison directe entre Multi-RLVR et GRPO à budget computationnel identique n’existe pas non plus. GRPO génère déjà 16 réponses par question — la différence d’objectif est claire conceptuellement, mais l’écart de performance sur la même base ne fait pas l’objet d’une comparaison contrôlée dans la littérature actuelle.
Le reward hacking multi-réponses
Un vecteur d’exploitation spécifique à la récompense multi-réponses n’est pas documenté mais est plausible : un modèle pourrait apprendre à générer K réponses superficiellement différentes (formulations lexicalement distinctes) mais identiques dans leur structure de raisonnement, maximisant la récompense sans couvrir de nouveaux modes. Ce serait une forme de reward hacking adaptée au signal multi-réponses. La littérature sur le reward hacking (Weng, 2024) ne traite pas ce cas spécifiquement.
DAPO (ByteDance/Tsinghua, 2025) aborde partiellement le problème pour GRPO standard via le Dynamic Sampling : les questions où le modèle obtient 0 % ou 100 % de réussite sont filtrées du batch, forçant l’entraînement sur des problèmes à variance non nulle. Ce mécanisme de maintien d’exploration reste à explorer dans le cadre multi-réponses.
Le coût de la calibration explicite
RLCR requiert que le modèle génère des estimations de confiance numériques explicites pour chaque réponse. Cette contrainte de format sur les outputs ajoute une obligation structurelle. Il n’est pas établi que cette contrainte est gratuite en performance sur des domaines où la calibration n’a pas été explicitement entraînée, ni comment elle interagit avec d’éventuelles formes de reward hacking de format.
Ce qu’il faut retenir
- La récompense binaire correct/incorrect améliore la précision sur une tentative mais appauvrit la diversité des stratégies explorées — c’est documenté empiriquement par la dégradation de Pass@k pendant l’entraînement.
- L’entraînement multi-réponses reformule l’objectif : récompenser un ensemble de K candidats plutôt qu’une réponse unique force le modèle à explorer l’espace des solutions nativement.
- Sur MBPP (code), Multi-RLVR obtient +69 % de précision top-1 avec -54 % de tokens par rapport au baseline single-answer ; sur DDXPlus (médecine), la couverture diagnostique monte de 0,62 à 0,79.
- La variante RLCR, qui ajoute une pénalité calibration par Brier score, atteint ECE = 0,02 — la confiance déclarée par le modèle s’aligne quasi-parfaitement avec sa précision empirique.
- Les gains sont établis sur des tâches multi-réponses naturelles. La généralisation aux tâches à réponse unique et la robustesse au reward hacking spécifique au signal multi-réponses restent des questions ouvertes.