En bref

Imaginez une assemblée délibérante interne. Une voix propose une réponse, une autre la conteste, une troisième propose une reformulation, et une dernière tranche. Cette mise en scène n’a pas été écrite par un metteur en scène — elle s’organise spontanément dans les traces de raisonnement des modèles comme DeepSeek-R1 ou QwQ-32B, quand on les entraîne par renforcement à résoudre des problèmes difficiles. Ces structures conversationnelles internes — questionnement, changement de point de vue, conflit entre positions, puis réconciliation — n’ont jamais été explicitement demandées. Une étude publiée en janvier 2026 établit un lien causal entre ces patterns et les gains de précision sur les benchmarks les plus exigeants.


Une distinction à poser d’emblée

Contrairement au chain-of-debate, où le débat est orchestré par le prompt — plusieurs instances de modèle se répondent explicitement sur plusieurs tours —, les modèles de raisonnement développent ces structures conversationnelles spontanément sous entraînement par renforcement, à l’intérieur d’une seule trace de pensée, sans qu’aucune instruction ne le demande.

Ce n’est pas une technique d’ingénierie de prompt. C’est un phénomène émergent observé après entraînement RL, dont les mécanismes précis restent à caractériser.


Ce qu’observent Kim et al. (2026)

L’étude “Reasoning Models Generate Societies of Thought” (Kim, Lai, Scherrer, Agüera y Arcas et Evans, arXiv:2601.10825) analyse 8 262 problèmes tirés de six benchmarks de haut niveau — BigBench Hard, GPQA, MATH Hard, MMLU-Pro, MUSR, IFEval — en utilisant un LLM-as-judge pour détecter les patterns conversationnels dans les traces de raisonnement de DeepSeek-R1 et QwQ-32B.

Quatre structures émergent de façon statistiquement distincte par rapport aux modèles instruction-tuned de taille comparable :

  • Question-Answering interne : le modèle se pose des questions à lui-même et y répond (β=0,345, p<10⁻³²³ pour DeepSeek-R1).
  • Perspective shifts : des changements de point de vue explicites apparaissent dans la trace (β=0,213).
  • Conflict of perspectives : des désaccords sont formulés entre “voix” internes distinctes.
  • Reconciliation : ces positions conflictuelles convergent vers une réponse unifiée.

Ce qui frappe dans ces chiffres : tous les modèles instruction-tuned testés, de 8 à 671 milliards de paramètres, affichent une faible prévalence de ces comportements. La taille du modèle ne suffit pas à les produire — c’est le type d’entraînement qui compte.

En clair : un grand modèle classique (instruction-tuné) répond directement, comme un orateur seul à la tribune. Un modèle entraîné par renforcement sur des problèmes difficiles devient une assemblée — il s’interroge, se contredit, ajuste. Cette différence n’est pas dans la taille mais dans la méthode d’entraînement : c’est le RL sur signal de récompense binaire qui produit la “société interne”, pas l’ajout de paramètres.

La mesure s’appuie sur un LLM-as-judge annoté pour détecter ces structures dans le texte libre des traces de raisonnement. Cette méthode introduit une source potentielle de biais : le juge peut lui-même produire des artefacts de classification. Kim et al. contrôlent cet effet en comparant des familles de modèles distinctes, ce qui rend le biais systématique peu probable — mais la méthode n’est pas sans limite. L’annotation manuelle d’un sous-échantillon aurait constitué une validation plus forte ; les auteurs ne la mentionnent pas explicitement comme étant effectuée.


Le lien causal avec la performance

Montrer que des patterns existent dans les traces ne prouve pas qu’ils causent la performance — ils pourraient simplement être corrélés avec d’autres propriétés du modèle. Kim et al. abordent cette question par structural equation modeling.

Le résultat central : le steering conversationnel prédit l’accuracy avec β=0,228 (p<10⁻²²), médié par quatre stratégies cognitives mesurables — vérification d’étapes (Δ=5,815), backtracking (Δ=0,881), décomposition en sous-objectifs (Δ=0,621), raisonnement à rebours (Δ=0,809).

La démonstration la plus directe utilise un modèle Qwen-2.5-3B entraîné par PPO sur la tâche Countdown. En appliquant un steering conversationnel positif (+10), l’accuracy passe de 27,1 % à 54,8 %. Un steering négatif (−10) la ramène à 23,8 %. Ce n’est pas une corrélation observée après coup : c’est une manipulation causale.

En clair : le steering est un levier qu’on peut tourner dans un sens ou dans l’autre. Si on amplifie les patterns conversationnels internes du modèle, sa précision double presque (27 % → 55 %). Si on les réprime, elle baisse. Ce sont les patterns qui font la performance — pas l’inverse.

Les auteurs relèvent également une diversité de “personnalités” dans les traces — agreeableness diversity (β=0,297) et neuroticism (β=0,567) pour DeepSeek-R1 — ce qui suggère que les voix internes ne sont pas homogènes. Ils s’appuient ici, avec prudence, sur les travaux de Minsky (The Society of Mind, 1988) et les théories du “dialogic self” (Bakhtin, Mead), sans prétendre à une correspondance neurale directe.


Pourquoi le RL sans supervision produit ces structures

La question sous-jacente est : pourquoi un entraînement RL sur signal de récompense binaire (réponse correcte ou non) fait-il émerger des structures sociales dans le raisonnement ?

DeepSeek-AI documente le phénomène dès le papier original DeepSeek-R1 (arXiv:2501.12948, publié dans Nature en 2025). L’entraînement utilise GRPO — Group Relative Policy Optimization — un algorithme qui supprime le modèle de valeur de PPO et estime les avantages directement depuis la distribution intra-groupe. Le signal de récompense est entièrement rule-based : format correct + réponse correcte. Aucune supervision sur la qualité du raisonnement intermédiaire.

Pourtant, des comportements non récompensés émergent : self-reflection, vérification d’étapes, adaptation dynamique de stratégie, et — fait documenté par les auteurs — un “aha moment” où un modèle intermédiaire développe spontanément la capacité de reconsidérer ses propres raisonnements sur un ton anthropomorphique. Les performances parlent : sur AIME 2024, DeepSeek-R1 passe de 15,6 % (zero-shot) à 71,0 % (pass@1) et 86,7 % avec majority voting, au niveau d’OpenAI-o1 — sans que ces comportements émergents aient été ciblés par le signal de récompense.

En clair : on n’a jamais dit au modèle « débats avec toi-même ». On lui a juste dit « réponds correctement ». Mais le chemin le plus efficace vers cette récompense passe par le doute, la vérification, le retour en arrière. Le modèle a découvert ces stratégies adaptatives parce qu’elles fonctionnent, pas parce qu’on les lui a montrées.

L’intuition derrière ce résultat : un modèle optimisé pour trouver des réponses correctes à des problèmes difficiles doit, à un moment, apprendre à douter de ses propres solutions intermédiaires. La vérification, le backtracking, la reformulation depuis un angle différent — ce sont des comportements adaptatifs rationnels face à des problèmes qui résistent à une approche directe. Le modèle les découvre non parce qu’ils lui ont été montrés, mais parce qu’ils constituent le chemin vers la récompense.

Ce phénomène s’inscrit dans un cadre plus large, le paradigme RLVR (Reinforcement Learning with Verifiable Rewards) : des signaux de récompense objectifs et vérifiables — réponses correctes, tests unitaires, preuves formelles — déclenchent l’émergence de nouveaux patterns de solution que personne n’a explicitement programmés. Le raisonnement par code sur tâches mathématiques passe de 65 % à plus de 90 % après RLVR sans instruction spécifique. Med-RLVR produit un raisonnement clinique par étapes dans des domaines médicaux sans une seule annotation de raisonnement.

La structure conversationnelle interne semble être une solution que le modèle découvre parce qu’elle fonctionne — pas parce qu’elle a été conçue.

Une racine théorique : AI Safety via Debate (2018)

L’idée que la structure adversariale améliore la qualité épistémique d’un système a une racine formelle plus ancienne. Irving, Christiano et Amodei (arXiv:1805.00899, 2018) proposent d’entraîner des agents par self-play sur un jeu de débat zéro-sum : deux agents débattent à tour de rôle devant un juge humain. Le résultat théorique est solide — avec un jeu optimal, le débat peut répondre à toutes les questions dans PSPACE avec des juges de temps polynomial, contre NP seulement pour le jugement direct.

Ce cadre opère avec des agents externes explicitement adversariaux, entraînés pour ça. Ce que montre Kim et al. est d’une nature différente : les structures de débat s’instancient à l’intérieur d’un seul modèle, sans jeu, sans adversaire, sans instruction. La forme est comparable ; le mécanisme est distinct.


Ce que cela change par rapport au débat multi-agents externe

La ligne de recherche sur le Multi-Agent Debate (Du, Li, Torralba, Tenenbaum et Mordatch, arXiv:2305.14325, ICML 2024) avait montré dès 2023 que plusieurs instances de LLM débattant en plusieurs tours améliorent la factualité et le raisonnement. C’est la démonstration que la structure collective aide — mais elle opère sur des modèles non entraînés pour débattre, et organise le débat au niveau du prompt.

La question que pose Kim et al. est différente : ces structures émergent-elles spontanément à l’intérieur d’un seul modèle, sans orchestration externe ? La réponse semble être oui, mais avec une réserve importante : en 2026, aucun papier ne compare directement, sur les mêmes tâches et avec le même budget computationnel, l’émergence interne et les frameworks MAD externes. Les deux lignes progressent en parallèle sans pont expérimental.

Il y a aussi des limites connues du côté MAD externe : Wang et al. (ACL 2024, arXiv:2402.18272) montrent qu’un single-agent avec un prompt fort atteint les mêmes performances que les meilleurs frameworks MAD sur une large gamme de tâches. L’analyse ICLR 2025 confirme que les frameworks MAD homogènes convertissent fréquemment des réponses correctes en incorrectes, et que Self-Consistency surpasse la majorité des approches MAD sur neuf benchmarks. Seule la coopération hétérogène — mélange de modèles différents — montre des gains cohérents.

La “Society of Thought” interne échappe à ces critiques spécifiques, parce qu’elle n’est pas une technique de prompting. Mais elle soulève ses propres questions ouvertes.

Une perspective complémentaire vient de Riedl (arXiv:2510.05174, 2025), qui mesure si un système multi-agents LLM forme un collectif intégré ou une simple agrégation d’instances indépendantes. Sa méthode — décomposition d’information partielle de l’information mutuelle retardée dans le temps — révèle que des personas différenciées combinées à des instructions de modélisation des autres agents produisent une complémentarité orientée vers l’objectif. Ce résultat provient de l’externe ; la question de savoir si la “société interne” des modèles RL présente les mêmes propriétés d’intégration informationnelle reste sans réponse.


Limites et questions non résolues

Causalité ou épiphénomène ? Kim et al. établissent un lien causal par structural equation modeling, mais l’identifiabilité causale n’est pas entière. Les patterns conversationnels pourraient être une conséquence des mêmes paramètres qui améliorent la précision, plutôt qu’en être une cause distincte. Le papier ne réfute pas directement cette objection.

Mécanisme neural inconnu. La correspondance entre les structures observées dans les traces de raisonnement et les circuits internes du transformer — quelles têtes d’attention, quels circuits activent ces “voix” distinctes — n’est pas établie. C’est un gap reconnu par les auteurs comme direction future.

Généralisation hors des domaines formels. Les résultats portent sur des tâches mathématiques et de raisonnement formel, où une récompense binaire est possible. Les domaines ouverts — écriture créative, argumentation nuancée — restent hors portée du paradigme RLVR. On ne sait pas si l’émergence conversationnelle se reproduit dans ces contextes.

Réplicabilité. Les résultats de Kim et al. reposent sur DeepSeek-R1 et QwQ-32B. La présence de structures “Society of Thought” dans d’autres familles de modèles (Llama, Mistral, GPT-4o sous RL) n’est pas documentée à ce jour. DeepSeek-R1 et QwQ-32B sont tous deux issus de labs asiatiques avec des processus d’entraînement similaires — il reste plausible que des familles de modèles entraînées différemment produisent ou non ces structures.

Ce que ce phénomène ne dit pas. L’émergence de structures conversationnelles internes ne doit pas être confondue avec la présence de “sous-esprits” ou d’entités cognitives distinctes à l’intérieur du transformer. Kim et al. observent des patterns dans des traces de texte, mesurés par un classificateur. Ces patterns sont causalement liés à la performance — c’est le résultat central et solide. Mais l’interprétation en termes de “société” ou de “personnalités” est une métaphore utile pour l’analyse, pas une description de l’architecture interne du modèle.


Ce qu’il faut retenir

  • DeepSeek-R1 et QwQ-32B développent spontanément, sous entraînement RL sans supervision de raisonnement, des structures conversationnelles internes : questionnement, désaccord, réconciliation.
  • Ces patterns ne sont pas instruits par le prompt — ils émergent parce qu’ils améliorent la performance sur des signaux de récompense binaires.
  • Un lien causal a été établi : le steering de ces structures modifie l’accuracy de façon directe et mesurable.
  • La taille du modèle ne suffit pas à produire ces comportements ; c’est le type d’entraînement (RL sur récompenses vérifiables) qui les déclenche.
  • Le mécanisme neural sous-jacent reste non caractérisé, et la généralisation hors des domaines formels est une question ouverte.