En bref

Pensez à un détective qui résout une enquête. Parfois, il suit un raisonnement linéaire d’indice en indice (Chain-of-Thought). Parfois, il explore plusieurs hypothèses en parallèle, écarte celles qui ne tiennent pas, retourne en arrière (Tree-of-Thought). Parfois, il alterne entre réflexion et terrain — il pense, va vérifier sur place, revient avec de nouvelles informations (ReAct). Et parfois, le déclic vient simplement parce qu’on lui a laissé plus de temps pour réfléchir (Scaling Inference Law). Quatre techniques structurent aujourd’hui le raisonnement des LLM, et elles ne s’excluent pas — elles couvrent des cas d’usage distincts et se combinent dans les systèmes avancés. Un modèle plus petit qui “réfléchit plus longtemps” peut surpasser un modèle plus grand qui répond directement.


Pourquoi ces techniques existent

Par défaut, un LLM produit une réponse token par token, sans expliciter ses étapes intermédiaires. Pour des questions simples, cette génération directe suffit. Pour des problèmes qui exigent plusieurs étapes logiques — calcul, planification, diagnostic — elle échoue souvent.

La raison est structurelle : le modèle n’a pas de “brouillon”. Tout son raisonnement doit tenir dans la probabilité du prochain token. Les techniques de raisonnement contournent cette limite en forçant l’externalisation des étapes intermédiaires dans la séquence générée.

L’enjeu n’est pas de rendre les modèles “plus intelligents” au sens vague du terme. C’est de structurer le processus de génération pour que chaque étape bénéficie des étapes précédentes — exactement comme un humain qui écrit ses calculs plutôt que de les faire de tête.

En clair : un LLM sans technique de raisonnement, c’est un humain à qui on demande de calculer 47 × 83 de tête, en parlant. Avec une technique de raisonnement, c’est le même humain qui prend un brouillon. Le brouillon n’est pas magique — il offre simplement de la mémoire externe que le modèle peut relire pendant qu’il génère son token suivant.


Chain-of-Thought (CoT) — raisonnement linéaire explicite

Principe

Le Chain-of-Thought consiste à demander au modèle de générer ses étapes intermédiaires avant de produire sa réponse finale. La formulation la plus connue est “pensez étape par étape” (think step by step). En pratique, on peut aussi fournir des exemples few-shot montrant la structure attendue du raisonnement.

Chaque étape de la chaîne décompose le problème original en un sous-problème plus simple. La réponse finale n’est produite qu’une fois la chaîne complète.

Ce que ça change

Le CoT améliore significativement les performances sur les tâches requérant plusieurs inférences enchaînées : arithmétique, raisonnement logique, déduction multi-étapes. La décomposition explicite réduit les erreurs de cohérence — le modèle peut “vérifier” ses propres étapes en les lisant dans le contexte.

Limites

Le CoT est linéaire : il suit un seul chemin de raisonnement. S’il emprunte une mauvaise direction dès les premières étapes, il n’y a pas de mécanisme de retour arrière. Pour des problèmes où plusieurs approches sont possibles et où certaines sont des impasses, cette linéarité est un handicap.

Le CoT opère aussi entièrement sur les représentations internes du modèle — il ne peut pas interroger des sources externes ni mettre à jour ses connaissances en cours de chaîne.

En clair : CoT, c’est le détective qui suit son intuition jusqu’au bout sans jamais se demander s’il s’est trompé d’hypothèse. Tant que l’intuition initiale est bonne, ça marche très bien et c’est rapide. Quand elle est mauvaise, on perd tout le temps consacré au raisonnement.


Tree-of-Thought (ToT) — exploration arborescente

Principe

Le Tree-of-Thought étend le CoT en autorisant l’exploration de multiples chemins de raisonnement en parallèle, organisés sous forme d’arbre. À chaque nœud, le modèle génère plusieurs branches candidates, évalue leur viabilité, et élague les chemins non prometteurs avant de poursuivre.

L’arbre peut être parcouru en profondeur (explorer un chemin jusqu’au bout avant d’en tester un autre) ou en largeur (évaluer tous les candidats d’un niveau avant de passer au niveau suivant). Des heuristiques — souvent le modèle lui-même agissant comme évaluateur — guident l’élagage.

Ce que ça change

Le ToT est conçu pour les problèmes où la solution exige des retours arrière stratégiques : planification, jeux de stratégie, diagnostic différentiel, génération de code avec contraintes multiples. Il permet de détecter les impasses avant d’y avoir investi tout le budget de génération.

Empiriquement, le ToT surpasse le CoT sur des benchmarks de planification et de raisonnement combinatoire où les chemins directs échouent fréquemment.

Limites

Le ToT est coûteux en tokens et en appels modèle. Évaluer et élaguer chaque branche multiplie le nombre d’inférences. Pour des problèmes simples ou bien structurés, ce coût n’est pas justifié — le CoT suffit et coûte moins.

La qualité de l’élagage dépend aussi de la qualité de l’heuristique d’évaluation. Un évaluateur médiocre élague de bonnes branches et conserve de mauvaises.

En clair : ToT multiplie le coût par 5 à 20 selon la profondeur d’arbre et la largeur de branches explorées. Sur des tâches type Game of 24, le gain (4 % → 74 %) justifie le coût. Sur une question simple, c’est utiliser un marteau-piqueur pour planter un clou.


ReAct — raisonnement entrelacé avec l’action

Principe

ReAct (Reasoning + Acting) brise la frontière entre raisonnement interne et interaction avec l’environnement. Le modèle opère selon une boucle itérative : Pensée → Action → Observation → Pensée…

  • Pensée : le modèle explicite son raisonnement sur l’état courant du problème.
  • Action : le modèle invoque un outil externe (recherche web, base de données, calculateur, API).
  • Observation : le résultat de l’action est injecté dans le contexte.
  • Le cycle recommence jusqu’à ce que la tâche soit résolue.

La clé est l’entrelacement : la pensée informe l’action, et l’observation modifie la pensée suivante. Le raisonnement n’est plus coupé du monde réel.

Ce que ça change

ReAct est la fondation opérationnelle des agents autonomes. Là où CoT et ToT restent confinés au contexte du modèle, ReAct permet d’agir sur l’environnement et d’en recevoir du feedback. Un agent ReAct peut corriger une erreur en temps réel : si une recherche ne retourne pas les résultats attendus, la pensée suivante l’intègre et ajuste l’action.

Des évaluations sur des benchmarks de question-réponse multi-étapes (HotPotQA, Fever) montrent que ReAct surpasse les modèles d’action pure tout en restant compétitif avec le CoT seul — et les combinaisons ReAct+CoT surpassent les deux prises séparément.

Limites

ReAct nécessite des outils accessibles et fiables. La boucle peut déraper si les observations retournées sont bruitées ou contradictoires. Sans mécanisme de terminaison explicite, le modèle peut entrer dans des boucles non convergentes.

La latence s’accumule à chaque appel d’outil — une tâche résolue en 8 itérations prend le temps de 8 appels successifs.

En clair : ReAct est la base des agents modernes. Il ne convient pas aux questions à réponse instantanée — c’est un cycle réflexion/action qui prend secondes voire minutes selon les outils sollicités. Mais il rend possible des tâches qu’un LLM seul ne peut pas faire : chercher en temps réel, exécuter du code, manipuler des fichiers.


Scaling Inference Law — réfléchir plus longtemps vaut mieux que modèle plus grand

Principe

La Scaling Inference Law (aussi appelée test-time compute scaling) postule que la performance d’un modèle s’améliore de façon prévisible avec les ressources computationnelles allouées à l’inférence — non à l’entraînement. Autrement dit : un même modèle, avec plus de “budget de réflexion”, produit de meilleures réponses.

OpenAI a matérialisé ce principe avec o1 (septembre 2024) : le modèle génère des tokens de raisonnement internes (thinking tokens) avant de produire sa réponse visible. Ces tokens constituent un brouillon structuré, invisible pour l’utilisateur mais central pour la qualité du résultat.

Ce que ça change

Les implications sont concrètes. Sur le benchmark AIME 2024 (mathématiques de compétition), GPT-4 résolvait environ 9 % des problèmes, contre 79 % pour o1 avec son budget de raisonnement étendu. Des travaux ultérieurs (DeepSeek-R1, 2025 ; s1, 2025) confirment que des modèles plus petits, entraînés avec du renforcement sur des réponses vérifiables (RLVR — Reinforcement Learning with Verifiable Rewards), rattrapent voire surpassent des modèles plus grands sur des tâches de raisonnement formalisé.

La Scaling Inference Law redéfinit le rapport coût/performance : plutôt que d’investir dans un modèle plus gros, on peut investir dans plus de tokens à l’inférence, ce qui est souvent moins cher et plus flexible.

Limites

Le gain est surtout visible sur des tâches à réponse vérifiable : mathématiques, code, logique formelle. Sur des tâches ouvertes (rédaction créative, conseil stratégique), l’effet est moins marqué — l’absence de signal de vérification limite l’apprentissage par renforcement qui sous-tend les modèles de raisonnement.

Générer davantage de tokens de raisonnement coûte plus cher à l’inférence. Le budget doit être calibré au type de tâche : utiliser o1 pour écrire un email simple revient à utiliser un marteau-piqueur pour planter un clou.

En clair : la Scaling Inference Law modifie l’économie. Au lieu d’investir dans un modèle 10× plus gros (coût d’entraînement), on paie pour 10× plus de tokens de réflexion à l’inférence (coût marginal). Le bénéfice se concentre sur les domaines où une “bonne réponse” est mesurable — sur la créativité, raisonner plus longtemps n’aide pas davantage qu’un humain qui rumine sur un poème.


Tableau comparatif — quand utiliser laquelle

TechniqueStructureForcesLimitesCas d’usage typiques
CoTLinéaireSimple, efficace, peu coûteuxPas de retour arrière, pas d’accès externeArithmétique, déduction logique, explication
ToTArborescentExploration multi-chemins, retour arrièreCoût élevé, dépend de l’évaluateurPlanification, diagnostic, puzzles combinatoires
ReActBoucle itérativeInteraction temps réel avec l’environnementLatence cumulée, risque de boucleAgents autonomes, recherche d’information, tâches multi-outils
Scaling InferenceBudget tokensFort gain sur tâches formalisées, flexibleCoût à l’inférence, limité aux tâches vérifiablesMathématiques, code, raisonnement formel

Combinaisons observées en pratique

Ces techniques ne s’excluent pas. Les implémentations modernes les combinent :

  • CoT + ReAct : le modèle raisonne explicitement (CoT) à chaque tour de la boucle ReAct. C’est le pattern de base de la plupart des agents actuels.
  • ToT + Scaling Inference : allouer plus de tokens à l’exploration arborescente améliore la qualité des chemins retenus.
  • ReAct + Scaling Inference : les modèles o1 et DeepSeek-R1 utilisent des tokens de raisonnement internes avant chaque action, ce qui revient à intégrer la Scaling Inference dans chaque itération ReAct.

Google DeepResearch (2025) illustre la composition : génération de requêtes initiales → recherches → analyse des lacunes → requêtes affinées → synthèse finale. Cette orchestration utilise implicitement CoT pour la planification, ReAct pour les interactions avec le moteur de recherche, et alloue un budget de raisonnement plus large aux étapes de synthèse.


Ce qu’il faut retenir

  • CoT : forcer le modèle à écrire ses étapes intermédiaires améliore les performances sur tout problème décomposable. Coût faible, adoption large.
  • ToT : utile quand plusieurs chemins de résolution existent et que certains sont des impasses — requiert un mécanisme d’évaluation des branches.
  • ReAct : le pattern fondamental des agents autonomes. Raisonnement et action s’alimentent mutuellement à chaque itération.
  • Scaling Inference Law : réfléchir plus longtemps avec le même modèle peut valoir un modèle plus grand. Le gain est maximal sur les tâches à réponse vérifiable (maths, code).
  • Ces techniques se combinent : les systèmes les plus performants utilisent CoT ou Scaling Inference à l’intérieur des boucles ReAct.