En bref
Chain-of-Debate (CoD) fait débattre plusieurs instances de LLM sur une même question : chaque modèle propose une réponse, critique les réponses des autres, et révise la sienne en plusieurs tours. Graph-of-Debate (GoD) étend ce mécanisme en structurant les arguments sous forme de graphe non-linéaire plutôt que d’une chaîne séquentielle. L’idée centrale : un biais ou une erreur présent dans un modèle individuel est détecté et corrigé par les autres participants au débat. MASS (Multi-Agent System Search) va plus loin en optimisant automatiquement ces architectures de débat.
En clair : un seul juriste qui rédige un avis voit ce que sa formation lui a appris à voir. Une cour de plusieurs juges qui plaident contradictoirement repère ce qu’un seul aurait raté. Chain-of-Debate fait pareil avec des LLM : on les met à plusieurs autour d’une question, ils argumentent, ils s’attaquent les arguments, et on prend la décision qui a survécu aux objections. Le coût : N modèles × R tours d’inférence — autant de fois la facture qu’une réponse simple.
Du raisonnement individuel au raisonnement collectif
Chain-of-Thought (CoT), introduit comme technique de prompting, force un LLM à décomposer un problème en étapes intermédiaires explicites. Cette approche est individuelle : un seul modèle raisonne, et ses biais sont ses propres biais.
CoD part d’une hypothèse différente : si plusieurs modèles indépendants raisonnent sur la même question, leurs erreurs ne seront pas corrélées. Les divergences entre agents signalent les zones d’incertitude. Le consensus émergent est plus robuste qu’une réponse individuelle, même issue d’un modèle plus grand.
La structure de base de CoD fonctionne en trois étapes :
- Proposition initiale : chaque agent produit sa réponse et son raisonnement de façon indépendante.
- Critique croisée : chaque agent lit les réponses des autres et formule ses objections.
- Révision : chaque agent met à jour sa position en tenant compte des critiques reçues.
Ces tours se répètent jusqu’à convergence ou jusqu’à un nombre maximal de rounds prédéfini.
En clair : la mécanique reproduit un séminaire de lecture. Chaque participant prépare son commentaire seul (proposition), puis chacun écoute les autres et formule ses désaccords (critique), puis chacun ajuste sa position (révision). Le travail individuel pose les bases ; les passes suivantes affinent collectivement. Sans la phase critique, c’est juste un sondage avec moyenne.
Chain-of-Debate vs Graph-of-Debate
CoD est linéaire et séquentiel : les arguments circulent d’agent en agent dans un ordre fixe, comme des maillons d’une chaîne. Cette structure est simple à implémenter mais introduit un biais d’ordre — les arguments formulés en dernier ont plus de chance d’influencer le consensus.
GoD restructure les arguments sous forme de graphe orienté : chaque argument est un nœud, les relations entre arguments (soutien, réfutation, nuance) sont des arêtes. La conclusion finale correspond au nœud de consensus le mieux justifié dans le graphe, pas nécessairement le dernier produit.
| Dimension | Chain-of-Debate | Graph-of-Debate |
|---|---|---|
| Structure | Linéaire, tours séquentiels | Graphe non-linéaire |
| Arguments | Flux ordonné | Nœuds interconnectés |
| Biais d’ordre | Présent | Réduit |
| Complexité | Faible | Élevée |
| Parallélisation | Partielle | Forte |
GoD permet également à plusieurs agents de critiquer le même argument simultanément, ce que la structure en chaîne ne permet pas efficacement.
Comment le débat élimine les biais individuels
Un LLM seul est vulnérable à plusieurs biais systématiques : ancrage sur les premières hypothèses, sur-confiance dans des domaines mal couverts par son entraînement, tendance à produire des réponses plausibles plutôt que vraies.
Le mécanisme de débat crée une pression correctrice externe. Des travaux publiés à ICML 2024 sur le débat multi-agents (Du et al., 2023) montrent empiriquement que cette approche améliore la factualité et réduit les hallucinations sur des tâches de raisonnement mathématique et stratégique, sans modifier les modèles sous-jacents. Des expériences sur la condensation de connaissances dialectiques par débat (CoD knowledge distillation) montrent des améliorations moyennes de +4,3% sur MMMU, +3,8% sur MathVista et +2,6% sur CMMMU par rapport aux baselines individuels.
Deux conditions sont nécessaires pour que le débat soit correcteur plutôt que convergent vers la même erreur :
- Diversité des agents : les modèles doivent être suffisamment distincts (prompts différents, températures variées, ou modèles différents) pour que leurs erreurs ne soient pas corrélées.
- Critique substantielle : les agents doivent produire des objections argumentées, pas seulement valider la majorité.
MASS : optimiser automatiquement l’architecture de débat
MASS (Multi-Agent System Search, arXiv 2502.02533) aborde un problème pratique : comment configurer optimalement un système multi-agents de débat ? Le nombre d’agents, leurs rôles, la topologie des échanges et les prompts forment un espace de configurations énorme.
MASS propose une optimisation en trois phases séquentielles :
- Optimisation par bloc : optimiser les prompts de chaque agent individuellement avant composition.
- Optimisation de la topologie : rechercher la configuration de workflow la plus performante, guidée par une mesure d’influence de chaque composant.
- Optimisation globale : affiner les prompts en tenant compte des interdépendances dans le système complet.
Les résultats publiés montrent une performance moyenne de 78,8% sur Gemini 1.5 Pro (8 tâches), dépassant les architectures manuelles de 8+ points de pourcentage, avec une meilleure efficacité en tokens que le simple ajout d’agents.
MASS valide empiriquement que l’optimisation des prompts a plus d’impact que le scaling du nombre d’agents — une conclusion contre-intuitive qui remet en question l’approche “plus d’agents = meilleur résultat”.
Matrice de décision : quand utiliser quel pattern de débat
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Question factuelle simple, latence critique | Réponse directe (pas de débat) | Coût débat = 12× ; gain marginal sur questions triviales. |
| Raisonnement composé, gain de factualité visé | CoD 3 agents × 2 rounds | Setup minimal qui détecte biais individuels (+3-5 pts MMMU). |
| Problème ouvert, plusieurs hypothèses concurrentes | GoD 4-5 agents | Graphe d’arguments, biais d’ordre réduit, parallélisation forte. |
| Nouvelle architecture inconnue, optimisation budget | MASS | Optimisation automatique, +8 pts vs configurations manuelles. |
| Domaine où agents convergent (même modèle, prompts similaires) | Diversifier d’abord | Sans diversité, le débat amplifie l’erreur commune au lieu de la corriger. |
Forces et limites
Forces :
- Détection d’erreurs croisée sans modification des modèles de base.
- Réduction documentée des hallucinations sur des tâches factuelles.
- Applicable à n’importe quelle paire de LLM existants.
- GoD permet une structuration formelle des arguments, utile pour l’audit de raisonnement.
Limites :
- Coût computationnel : N agents × R rounds = N×R fois le coût d’une inférence simple. Pour N=4 agents et R=3 rounds, le coût est 12× supérieur à une réponse directe.
- Convergence vers le consensus majoritaire : si la majorité des agents partagent le même biais (probable quand les agents sont issus du même modèle de base), le débat amplifie l’erreur au lieu de la corriger.
- Biais d’ordre (CoD) : les derniers arguments influencent davantage la conclusion dans une structure linéaire.
- Évaluation difficile : mesurer la qualité du processus de débat, pas seulement de la réponse finale, reste un problème ouvert.
- Critiques superficielles : sans mécanisme forçant des objections substantielles, les agents tendent à valider les réponses des pairs plutôt qu’à les challenger (phénomène documenté dans “Can LLM Agents Really Debate?”, arXiv 2511.07784).
Ce qu’il faut retenir
- CoD fait débattre plusieurs LLM indépendants pour corriger mutuellement leurs erreurs — sans modifier les modèles de base.
- GoD structure ce débat en graphe d’arguments, réduisant le biais d’ordre des chaînes séquentielles.
- L’efficacité du débat dépend de la diversité réelle des agents : des agents trop similaires convergent vers les mêmes erreurs.
- MASS automatise l’optimisation de ces architectures de débat et démontre que la qualité des prompts prévaut sur la quantité d’agents.
- Le coût computationnel (N×R inférences) est la contrainte pratique principale pour le déploiement en production.