En bref

Le prompt chaining et l’agent autonome ne sont pas deux technologies concurrentes — ils occupent deux positions sur un même spectre. Le chaining décompose une tâche complexe en une séquence d’appels LLM prédéfinis, chaque sortie alimentant l’entrée suivante. L’agent autonome maintient une boucle observe → raisonne → agit → observe et décide lui-même de son prochain mouvement. Entre les deux existent plusieurs degrés intermédiaires. Choisir, c’est arbitrer entre contrôle et flexibilité, traçabilité et capacité d’adaptation.


Le continuum agentique

Imaginez une équipe de cuisine. Au plus simple, un seul cuisinier exécute une recette à la lettre — c’est l’appel LLM unique. Un peu plus loin, plusieurs postes de travail enchaînent les étapes prédéfinies (mise en place → cuisson → dressage) — c’est le prompt chaining. Plus loin encore, un chef qui voit ce qu’il a en stock et adapte le menu aux contraintes du moment — c’est l’agent autonome. Aucune de ces configurations n’est “meilleure” : chacune correspond à un contexte différent.

L’agentivité n’est pas binaire. Anthropic, LangGraph et la recherche académique décrivent un spectre à plusieurs niveaux :

  • Niveau 0 — LLM simple : appel unique, sans mémoire ni outil.
  • Niveau 1 — Prompt chaining : séquence d’appels prédéfinis. Déterministe, équivalent d’une machine à états.
  • Niveau 2 — Workflow augmenté : chaîne avec outils à des points fixes (routing, parallélisation).
  • Niveau 3 — Agent réactif : boucle ReAct (reason + act), sélection dynamique d’outils.
  • Niveau 4 — Agent planificateur : décomposition dynamique de tâches, planification multi-étapes.
  • Niveau 5 — Système multi-agents : coordination entre agents spécialisés, mémoire partagée.

La distinction formelle de LangGraph : les workflows suivent des “predetermined code paths” tandis que les agents “define their own processes and tool usage”. Mais cette frontière reste floue en pratique — il n’existe pas de nomenclature commune entre les sources (gap G4, non résolu dans la littérature).


Prompt chaining : décomposer pour fiabiliser

Le prompt chaining applique une stratégie de divide-and-conquer : “break down the original, daunting problem into a sequence of smaller, more manageable sub-problems” (Gulli, 2025, Ch.1). Chaque appel LLM est individuellement plus simple, ce qui réduit les erreurs de raisonnement et améliore la traçabilité.

Anthropic formule l’objectif ainsi : l’approche “exchanges latency for improved accuracy by making each LLM call individually simpler” (Schluntz & Zhang, “Building Effective Agents”).

Ce qui rend une chaîne robuste

  • Structured output : les résultats intermédiaires en JSON ou XML garantissent la transmission précise des données entre étapes. Une sortie ambiguë à l’étape N peut faire échouer N+1 (Gulli, 2025, Ch.1).
  • Gates programmatiques : des vérifications de code entre appels LLM interrompent la chaîne avant de propager une erreur, sans coût LLM supplémentaire.
  • Role assignment : attribuer un rôle distinct à chaque étape (“extracteur”, “analyste”, “rédacteur”) améliore la focalisation et la qualité de sortie.

Risque principal : la propagation d’erreur

Une erreur à l’étape N se répercute sur toutes les étapes suivantes. Les chaînes longues amplifient ce phénomène. La littérature le mentionne qualitativement, mais aucune étude systématique ne l’a mesuré expérimentalement (gap G3).

En clair : le prompt chaining est l’équivalent d’une chaîne de production industrielle. Si un poste produit une pièce défectueuse, tous les postes en aval reçoivent la pièce défectueuse. Pour limiter le risque, on ajoute des “contrôles qualité” entre étapes (gates programmatiques) — vérifications de format, validations métier, qui interrompent la chaîne avant propagation.


Agent autonome : déléguer la planification

L’agent autonome opère en boucle : le LLM “dynamically directs its own processes and tool usage, maintaining control over how it accomplishes tasks” (Anthropic, “Building Effective Agents”). Il n’existe pas de séquence prédéfinie — l’agent décide à chaque itération quelle action engager.

ReAct : le fondement théorique

Le papier ReAct (Yao et al., ICLR 2023) établit que la combinaison de reasoning traces et d’actions en mode interleaved surmonte les limitations du Chain-of-Thought pur. Résultats mesurés :

  • Sur HotpotQA et Fever : ReAct > CoT seul sur les tâches factuelles.
  • Sur ALFWorld : +34% de succès absolu vs méthodes d’imitation.
  • Sur WebShop : +10% avec seulement 1-2 exemples in-context.

Le meilleur résultat vient de la combinaison ReAct + CoT — les deux modes sont complémentaires, pas opposés.

Coût et contrôle

Les agents consomment nettement plus de tokens qu’un appel unique. Des estimations non publiées mentionnent 4x vs chat standard, jusqu’à 15x dans les systèmes multi-agents [NON VÉRIFIÉ — source secondaire, méthodologie non documentée]. Ce surcoût peut être justifié si l’agent évite une escalade humaine plus coûteuse.

Le débogage est plus difficile : une boucle agentique peut diverger, consommer des ressources sans borne, ou bloquer sur un sous-problème imprévu. L’expérience des systèmes AutoGPT-style (2024) a rendu cette limite visible.

En clair : un agent autonome dépense entre 4 et 15 fois plus de tokens qu’un appel unique pour la même tâche. Ce surcoût n’est justifié que si la tâche dépasse réellement les capacités d’un workflow plus simple, ou évite un coût humain supérieur (escalade support, traitement manuel d’incident).


Le routage : pont entre les deux

Le routage introduit de la logique conditionnelle dans une séquence linéaire : “enabling a shift from a fixed execution path to a model where the agent dynamically evaluates specific criteria to select from a set of possible subsequent actions” (Gulli, 2025, Ch.2).

Un pipeline avec routage n’est plus un simple chaining — il peut adapter son flux selon le contexte, sans pour autant déléguer la planification complète au LLM. C’est le niveau 2 du spectre (workflow augmenté).

Trois mécanismes de routage sont documentés :

  • Basé sur règles (if-else, mots-clés) : rapide, peu flexible.
  • Basé sur LLM : l’entrée est analysée pour déterminer la route ; plus flexible, plus coûteux.
  • Basé sur embeddings : similarité sémantique entre la requête et les routes disponibles ; efficace sur les inputs nuancés.

LangGraph implémente un quatrième paradigme : le routage contingent à l’état global accumulé du système (state-based graph architecture), adapté aux workflows complexes à décisions multiples.


Tableau comparatif

CritèrePrompt chainingAgent autonome
PlanificationDéfinie à l’avance par le développeurDéfinie dynamiquement par le LLM
TraçabilitéHaute — chaque étape est auditéeFaible — la boucle peut diverger
Coût tokensContrôlé (séquence fixe)Élevé (boucle itérative, nombre d’étapes variable)
Propagation d’erreurEn cascade (atténuée par gates)Possible, mais l’agent peut se corriger
Tâches adaptéesTâches structurées, workflow connu à l’avanceTâches ouvertes, exploration, résultats imprévisibles
DébogageSimple — étape identifiableDifficile — la cause est dans la boucle
Conformité réglementaireFavorable (reproductible, auditable)Défavorable (comportement variable)
LatencePlus élevée (plusieurs appels séquentiels)Variable selon le nombre d’itérations

Ce que dit la tendance 2025

L’évolution depuis 2023 est documentée par plusieurs comparatifs de frameworks :

  • 2023 : le focus est sur les “Chains” (LangChain) — séquences linéaires déterministes.
  • 2024 : émergence des “Loops” (AutoGPT, BabyAGI) — autonomie étendue, mais peu contrôlable en production.
  • 2025 : le standard pratique est la bounded agency — autonomie dans un espace de problème délimité par des guardrails architecturaux explicites.

Kief Morris (Martin Fowler blog, 2025) formalise trois postures humain/agent :

  • Outside the loop : tout est délégué à l’agent.
  • In the loop : l’humain inspecte chaque action (micromanagement).
  • On the loop : l’humain conçoit le harness (specs, quality checks, guardrails) sans inspecter chaque output. C’est la posture recommandée pour la production.

La recommandation dominante d’Anthropic — “start simple, add agents only when simpler solutions fall short” — est pragmatique. Elle n’est cependant pas quantifiable : il n’existe pas de critère formel pour décider à quel niveau du spectre se placer pour une tâche donnée (gap G1, non résolu).

Orchestration adaptative : un troisième chemin

DAAO (Xu et al., arXiv:2509.11079, accepté WWW2026) propose une orchestration adaptative par requête : le workflow est construit dynamiquement selon la difficulté estimée de chaque entrée, et non appliqué uniformément. Les auteurs démontrent une amélioration sur 6 benchmarks vs systèmes multi-agents à workflow fixe. Ce pattern remet en question l’opposition statique/dynamique : un workflow peut être généré dynamiquement sans être pleinement agentique.


Ce qu’il faut retenir

  • Le prompt chaining et l’agent autonome ne s’opposent pas — ils occupent des positions différentes sur un spectre continu. Le choix dépend du degré de prévisibilité de la tâche.
  • Le chaining est adapté aux tâches structurées où le workflow est connu à l’avance : il offre traçabilité, contrôle des coûts et reproductibilité.
  • L’agent autonome est nécessaire quand la tâche ne peut pas être décomposée a priori : il adapte son plan en cours d’exécution, au prix d’une complexité de débogage plus élevée.
  • Le routage est le mécanisme intermédiaire clé : il rend un pipeline adaptatif sans déléguer la planification complète au LLM.
  • En 2025, la posture de production dominante est la bounded agency : un agent avec des guardrails explicites, supervisé on the loop.
  • Il n’existe pas encore de critère formel pour choisir le bon niveau du spectre pour une tâche donnée.