En bref
La self-consistency (SC) est une stratégie d’inférence introduite par Wang et al. (2023) : au lieu de produire une seule réponse au prompt, on génère N chemins de raisonnement indépendants via temperature sampling, puis on sélectionne la réponse qui revient le plus souvent (vote majoritaire). La méthode ne modifie ni le modèle ni les prompts — elle change uniquement le processus de décodage. Sur des tâches de raisonnement arithmétique et logique, les gains sont documentés et reproductibles.
Pourquoi une seule réponse est insuffisante
Imaginez un sondage où l’on demande la même question à 40 personnes différentes et où l’on retient la réponse majoritaire. Si la majorité converge, on a un signal fort sur la vérité. Si les réponses divergent largement, c’est un signal qu’il y a quelque chose à creuser. La self-consistency applique exactement cette logique au LLM : on lui pose 40 fois la même question, et on retient la réponse qui revient le plus souvent.
Un modèle de langage génère des tokens en sélectionnant à chaque étape le token le plus probable (greedy decoding). Cette stratégie produit toujours le même chemin de raisonnement — et amplifie les erreurs systématiques du modèle : si une étape intermédiaire diverge, toute la chaîne part dans la mauvaise direction.
L’intuition de Wang et al. est simple : pour un problème de raisonnement, plusieurs chemins différents peuvent mener à la même réponse correcte. Si l’on échantillonne un ensemble de chemins avec une température non nulle, et que la bonne réponse revient plus souvent que les mauvaises, le vote majoritaire la sélectionne. La cohérence entre chemins devient un signal de fiabilité.
Mécanisme opérationnel
La SC s’applique sur un prompt Chain-of-Thought (few-shot ou zero-shot) :
- Même prompt, N exécutions — le prompt reste identique ; la température est relevée (typiquement 0,5–1,0) pour introduire de la diversité.
- Échantillonnage des chemins — le modèle produit N raisonnements complets, chacun aboutissant à une réponse finale.
- Vote majoritaire — on extrait les réponses finales et on retient celle qui apparaît le plus souvent.
La SC est une technique test-time : elle ne nécessite aucun entraînement supplémentaire et s’applique à tout LLM existant.
Gains quantifiés (Wang et al., 2023)
Sur cinq benchmarks, à modèle et prompt identiques, SC surpasse le CoT greedy :
| Benchmark | Domaine | Gain |
|---|---|---|
| GSM8K | Arithmétique | +17,9 pts |
| SVAMP | Raisonnement arithmétique | +11,0 pts |
| AQuA | Algèbre | +12,2 pts |
| StrategyQA | Bon sens | +6,4 pts |
| ARC-challenge | Sciences | +3,9 pts |
Ces gains sont obtenus avec N = 40 échantillons. Le papier fondateur utilise PaLM comme modèle de référence.
Coût computationnel et optimisations
N = 40 signifie 40 inférences complètes par requête — un facteur 40 sur le coût d’inférence. C’est le principal frein à l’adoption en production.
En clair : si un appel LLM coûte 0,01 €, une réponse SC à N=40 coûte 0,40 €. Pour une question, c’est encore acceptable ; pour 1 000 questions/jour en production, on passe de 10 € à 400 €/jour. Les optimisations qui suivent (Blend-ASC, arrêt adaptatif) visent à réduire cette inflation à un facteur 5-10 plutôt que 40.
Trois directions réduisent ce coût :
Allocation dynamique (Blend-ASC) — Feng et al. (2025) montrent que le nombre optimal d’échantillons dépend de la difficulté de la question. Leur méthode Blend-ASC alloue dynamiquement les échantillons par question et utilise en moyenne 6,8x moins d’appels que la SC vanilla à précision équivalente.
Règle d’arrêt adaptative — Cordero-Encinar & Duncan (2025) formalisent SC sur des bases statistiques. Ils démontrent que le majority voting constitue un “certificat statistique” de fiabilité sous certaines conditions, et introduisent une règle d’arrêt séquentielle (Martingale Majority Certificate) qui détermine quand assez d’échantillons ont été collectés — sans itérer jusqu’à N fixe.
Repeated sampling à grande échelle — Brown et al. (2024) montrent que la coverage (probabilité qu’au moins un échantillon soit correct) suit une loi puissance log-linéaire. Sur SWE-bench Lite, le taux de résolution passe de 15,9% (1 échantillon) à 56% (250 échantillons). Les premiers échantillons apportent le plus de valeur marginale.
Parallèle vs séquentiel : une remise en question
Wang et al. supposent que les N chemins sont indépendants — hypothèse nécessaire pour que le vote majoritaire soit statistiquement valide. Sharma & Chopra (2025) testent directement cette hypothèse en comparant SC parallèle (chemins indépendants) à SC séquentielle (chaque tentative voit les précédentes).
Résultat : la mise à l’échelle séquentielle surpasse la SC parallèle dans 95,6% des configurations testées, avec des gains jusqu’à 46,7%. Ils introduisent également le “weighted voting par entropie inverse” — sans entraînement supplémentaire.
Implication : si les chemins ne sont pas indépendants, les erreurs corrélées du modèle peuvent être sur-comptées par le vote majoritaire, annulant le bénéfice de la méthode. L’hypothèse d’indépendance est rarement vérifiée empiriquement. [NON VÉRIFIÉ — Sharma & Chopra l’évoquent sans mesure directe de la corrélation des erreurs]
En clair : faire 40 sondages identiques en parallèle ne marche que si les sondés ne se parlent pas entre eux. Pour un LLM, c’est plus subtil : ses biais sont les mêmes à chaque échantillon, donc 40 réponses indépendantes peuvent toutes converger vers la même mauvaise réponse. La SC séquentielle (chaque tentative voit les précédentes) corrige partiellement ce biais.
SC comme signal d’entraînement
Au-delà du décodage, majority voting est utilisé comme proxy de vérité terrain pour du reinforcement learning sans labels. TTRL (Zuo et al., 2025) exploite ce signal pour entraîner Qwen-2.5-Math-7B uniquement sur des données non étiquetées : le pass@1 sur AIME 2024 augmente de ~211%.
L’idée : si N chemins convergent sur la même réponse, cette réponse sert de signal de récompense pour l’entraînement. SC bootstrappe ainsi un processus de fine-tuning qui rend le modèle plus fiable à l’inférence — réduisant à terme le besoin de SC elle-même.
Limites
Tâches à réponse unique vérifiable — SC fonctionne bien sur des problèmes où une seule réponse correcte existe (arithmétique, logique formelle). Pour des tâches de génération ouverte ou à réponses multiples valides, le vote majoritaire n’a pas de sens clair.
Biais systématiques — Si le modèle a un biais fort sur un type d’erreur, les N chemins peuvent converger sur la même mauvaise réponse. La SC amplifie alors l’erreur au lieu de la corriger.
Coût en production — La littérature évalue SC principalement sur des modèles large (PaLM 540B, GPT-4). L’efficacité sur des modèles de 7B–13B paramètres est moins documentée. [NON VÉRIFIÉ — peu de benchmarks SC sur petits modèles publiés]
Applicabilité aux tâches longues — SC agrège des réponses finales, pas des raisonnements intermédiaires. Pour des chaînes multi-étapes où une erreur précoce se propage, SC ne détecte pas l’erreur dans le chemin — elle vote sur des réponses toutes potentiellement fausses.
Quand utiliser SC vs alternatives
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Problème arithmétique/logique vérifiable, coût acceptable | Self-Consistency N=20-40 | +6 à +18 pts sur GSM8K/SVAMP/AQuA, robuste, simple |
| Production fort volume, budget tokens limité | Blend-ASC | Allocation dynamique, 6,8× moins d’appels à précision équivalente |
| Tâche exploratoire, planification importante | Tree of Thoughts (ToT) | Backtracking explicite, 74 % vs 4 % CoT sur Game of 24 |
| Résolution itérative avec apprentissage cross-tentatives | SC séquentielle | +46,7 % vs SC parallèle sur 95,6 % des configs (Sharma 2025) |
| Tâche ouverte (rédaction, brainstorming) | Pas de SC | Pas de “réponse majoritaire” valide, vote sans signal |
Relation avec d’autres techniques
La SC s’inscrit dans une hiérarchie de techniques de raisonnement (Gulli, 2025, App. A) :
- CoT linéaire — un seul chemin de raisonnement exposé ; base de SC.
- Self-Consistency — plusieurs chemins CoT en parallèle + vote majoritaire.
- Tree of Thoughts (ToT) — exploration arborescente avec backtracking explicite ; préférable quand la planification et l’exploration de l’espace des solutions importent. Sur Game of 24 : 74% (ToT) vs 4% (CoT standard) avec GPT-4.
SC est une stratégie de décodage ; ToT est une stratégie de recherche. Les deux partent de CoT mais répondent à des profils de problèmes différents.
Ce qu’il faut retenir
- La self-consistency génère N raisonnements indépendants et retient la réponse majoritaire — sans modifier le modèle ni le prompt.
- Les gains sont documentés sur des tâches de raisonnement vérifiable : +6 à +18 points selon le benchmark (Wang et al., 2023, ICLR).
- Le coût est le frein principal : N = 40 signifie 40 appels par requête. Des méthodes d’allocation dynamique (Blend-ASC) réduisent ce facteur de 6,8x.
- L’hypothèse d’indépendance des chemins est critiquée : la SC séquentielle surpasse la SC parallèle dans la majorité des configurations testées.
- SC ne s’applique pas aux tâches ouvertes ou aux chaînes longues où l’erreur se propage entre étapes.