En bref

Un LLM classique reçoit une entrée et produit une sortie — puis s’arrête. Un système agentique enchaîne perception, raisonnement et action en boucle : il décompose un objectif, appelle des outils, observe les résultats et réajuste son plan jusqu’à completion. Ce changement de paradigme, passé de l’expérimentation à la production industrielle entre 2023 et 2025, transforme les modèles de langage en systèmes capables d’agir dans le monde — avec des gains réels et des risques nouveaux.

En clair : un LLM classique, c’est un consultant qui répond à votre question puis raccroche. Un système agentique, c’est un assistant qui ouvre l’agenda, passe les coups de fil, prend des notes, vérifie le résultat, recommence si nécessaire — jusqu’à ce que la mission soit faite. Le modèle reste le même cerveau ; ce qui change, c’est qu’on lui donne les mains pour agir et les yeux pour vérifier.


La boucle fondamentale : perception, raisonnement, action

Un agent IA repose sur un cycle répétitif que la littérature résume en trois temps.

Perception : l’agent reçoit un état du monde — une requête utilisateur, un résultat d’outil, un message d’un autre agent, ou le contenu d’une base de données. Cet état est encodé dans le contexte du modèle.

Raisonnement : le modèle analyse l’état, décide de l’action suivante et, dans les architectures avancées, produit une trace de pensée explicite avant d’agir.

Action : l’agent exécute une action concrète — appel d’API, requête web, écriture dans une base de données, génération de code, ou délégation à un autre agent. Le résultat modifie l’état du monde et devient la prochaine perception.

Cette boucle distingue structurellement un agent d’un LLM en mode question-réponse. Un LLM conversationnel produit du texte ; un agent produit des effets. La même différence sépare un assistant qui décrit une marche à suivre d’un assistant qui l’exécute lui-même.

En clair : la boucle perception-raisonnement-action, c’est exactement ce que fait un cuisinier qui goûte sa sauce. Il perçoit (le goût), il raisonne (manque-t-il du sel ?), il agit (ajout, mélange), puis il regoûte. Un LLM agentique fait la même chose avec son contexte au lieu de papilles : chaque action change l’état, chaque nouvel état alimente la décision suivante.


Quatre briques constitutives

Tool use

La capacité à appeler des outils externes — moteurs de recherche, APIs, interpréteurs de code, bases de données — est le prérequis de toute architecture agentique. Sans outils, l’agent est limité à ce que son contexte contient. Toolformer (Schick et al., Meta AI, 2023) a démontré qu’un modèle pouvait apprendre seul quand et comment appeler des outils. Depuis, le function calling est intégré nativement dans les principales APIs commerciales.

Mémoire

Les agents opèrent avec plusieurs types de mémoire complémentaires. La mémoire à court terme correspond au contexte actif de la fenêtre du modèle. La mémoire à long terme repose sur des bases vectorielles ou des bases de données que l’agent peut interroger. Certaines architectures distinguent aussi mémoire sémantique (faits généraux), mémoire épisodique (traces d’interactions passées) et mémoire procédurale (procédures réutilisables). La gestion de ces mémoires reste un chantier actif : une revue de 2025 sur les mécanismes mémoire dans les systèmes multi-agents documente l’absence de standards consolidés.

Planification

Pour les tâches longues, l’agent doit décomposer un objectif en sous-tâches ordonnées. Le pattern ReAct (Yao et al., ICLR 2023) entrelace traces de raisonnement et appels d’outils dans la même séquence, ce qui réduit les hallucinations par rapport au raisonnement pur. Le pattern plan-and-execute sépare la planification globale (produite par un LLM puissant) de l’exécution locale (confiée à un composant plus léger et moins coûteux). Des benchmarks montrent que les architectures plan-and-execute peuvent atteindre 92 % de taux de complétion avec une accélération de 3,6× par rapport à une exécution ReAct séquentielle.

Orchestration

Quand plusieurs agents coopèrent, il faut coordonner leurs échanges. L’orchestrateur décide qui fait quoi, dans quel ordre, et comment les résultats sont agrégés. Dans les architectures centralisées, un agent pilote distribue les tâches aux agents spécialisés. Dans les architectures décentralisées, les agents négocient directement entre eux.

En clair : ces quatre briques fonctionnent comme l’équipage d’un voilier de course. Le tool use, ce sont les mains qui hissent la voile. La mémoire, c’est le carnet de bord — on note ce qu’on a déjà essayé. La planification, c’est le navigateur qui calcule la route. L’orchestration, c’est le skipper qui distribue les rôles. Enlever une brique, et le bateau dérive.


Architectures : agent unique vs multi-agents

Agent unique

Un agent unique dispose d’un ensemble d’outils et pilote lui-même sa boucle perception-raisonnement-action. Cette architecture est simple à déployer, facile à déboguer, et suffisante pour la majorité des tâches. Elle atteint ses limites sur les tâches très longues (saturation du contexte), les tâches nécessitant des expertises hétérogènes, et les tâches parallélisables.

Multi-agents

Un système multi-agents distribue le travail entre agents spécialisés qui opèrent en parallèle ou en séquence. L’efficacité dépend moins du nombre d’agents que de la qualité des protocoles de coordination : des échanges non structurés entre agents produisent du bruit plutôt que de la valeur. Les frameworks récents (LangGraph, CrewAI, AutoGen) proposent des primitives différentes — graphe d’états, rôles organisationnels, conversation asynchrone — mais aucun ne s’impose comme standard universel.

Patterns de conception

Trois patterns structurent la majorité des architectures agentiques :

  • ReAct : boucle Pensée / Action / Observation, adaptée aux tâches moyennement longues nécessitant des ajustements fréquents.
  • Plan-and-execute : planification globale puis exécution étape par étape, adaptée aux tâches longues avec objectif fixe.
  • Reflection : l’agent critique ses propres outputs et les améliore sans modifier ses poids. Reflexion (Shinn et al., NeurIPS 2023) atteint 91 % de réussite sur HumanEval sans ré-entraînement.

Matrice de décision : quel pattern choisir

ContexteRecommandationPourquoi
Tâche < 10 étapes, environnement imprévisible (web scraping, exploration)ReActRéactivité étape par étape, ajuste aux observations en temps réel.
Tâche longue (≥ 20 étapes) avec objectif clair (reporting, ETL)Plan-and-executePlan global pré-calculé, exécution déterministe, accélération 3,6×.
Sortie créative ou techniquement exigeante (code, rédaction)ReflectionAuto-critique itérative, +20-30 points sur HumanEval sans ré-entraînement.
Spécialisations hétérogènes (recherche + analyse + rédaction)Multi-agents centraliséUn orchestrateur dispatche aux agents spécialisés.
Volume parallélisable (audit 100 fichiers, classif corpus)Multi-agents fan-outWorkers indépendants, consolidation finale, throughput linéaire.

Positionnement : ni RAG, ni fine-tuning

L’IA agentique ne remplace pas les approches existantes — elle les complète.

RAG et IA agentique sont complémentaires. Le RAG connecte un LLM à une base de connaissances pour ancrer ses réponses dans des faits vérifiables. L’IA agentique prend le RAG comme outil : un agent peut décider d’interroger une base vectorielle, puis d’appeler une API, puis de synthétiser les deux résultats. Le RAG répond à “qu’est-ce que cette base sait ?” ; l’agent répond à “comment atteindre cet objectif avec les ressources disponibles ?”.

Fine-tuning et IA agentique sont orthogonaux. Le fine-tuning modifie les poids du modèle pour spécialiser ses capacités intrinsèques. L’IA agentique laisse les poids intacts et ajoute des capacités par l’outillage et l’orchestration. On peut faire tourner un modèle fine-tuné dans une architecture agentique — les deux s’accumulent.

Prompt engineering et IA agentique fonctionnent à des niveaux différents. Les techniques de prompting (chaîne de pensée, few-shot) opèrent à l’échelle d’un seul appel. L’architecture agentique opère à l’échelle d’un pipeline complet de plusieurs dizaines ou centaines d’appels.


Standards émergents : MCP et A2A

L’interopérabilité est le problème structurel des systèmes agentiques : chaque framework définissait jusqu’ici ses propres interfaces.

MCP (Model Context Protocol), publié par Anthropic en novembre 2024 et désormais sous gouvernance de la Linux Foundation, standardise la façon dont un agent accède à des outils et des ressources externes. MCP opère verticalement : il définit le contrat entre un agent et ses outils.

A2A (Agent-to-Agent Protocol), lancé par Google en avril 2025 et cédé à la Linux Foundation en juin 2025, standardise la communication entre agents — découverte, délégation, résolution de conflits. A2A opère horizontalement : il définit le contrat entre agents qui coopèrent.

Les deux protocoles sont complémentaires. En décembre 2025, l’Agentic AI Foundation (AAIF) réunit OpenAI, Anthropic, Google, Microsoft, AWS et Block autour de ces standards.


Limites

Hallucination amplifiée : dans une boucle multi-étapes, une erreur de raisonnement à l’étape N se propage et s’amplifie aux étapes suivantes. Un taux d’erreur de 5 % par étape devient supérieur à 60 % sur 20 étapes composées. Les études sur des systèmes déployés documentent des taux d’hallucination allant de 0,7 % à 29,9 % selon les modèles et les tâches.

Coût computationnel : une tâche agentique peut générer des dizaines à des centaines d’appels LLM. Des incidents documentés en 2025 rapportent des agents entrant en boucle récursive, générant des factures cloud à six chiffres. Le budget de tokens est une contrainte opérationnelle concrète, pas théorique.

Complexité d’évaluation : les benchmarks classiques (perplexité, exactitude sur QCM) ne capturent pas la performance agentique. Les benchmarks spécialisés (SWE-bench, WebArena, GAIA) sont plus pertinents mais contestés : des travaux de 2025 (Kapoor et al.) montrent que des agents ne faisant rien réussissent 38 % des tâches de certains benchmarks, faute de critères robustes.

Sécurité : le prompt injection indirect — des instructions malveillantes cachées dans des données traitées par l’agent (emails, pages web) — est la vulnérabilité la plus documentée. Elle permet de détourner un agent vers des actions non autorisées. L’exploit EchoLeak (CVE-2025-32711) contre Microsoft Copilot en 2025 en est une démonstration en conditions réelles.

En clair : un agent autonome amplifie les forces ET les faiblesses du modèle qui le pilote. Là où une réponse erronée d’un chatbot coûte un message à corriger, une décision erronée d’un agent peut déclencher 50 appels API derrière, vider un budget cloud, ou exécuter une action irréversible. La supervision humaine reste le seul filet vraiment robuste.


Ce qu’il faut retenir

  • Un agent IA est un LLM placé dans une boucle perception-raisonnement-action avec accès à des outils, une mémoire et un mécanisme de planification.
  • Les patterns ReAct, plan-and-execute et reflection couvrent la majorité des architectures agentiques actuelles.
  • L’IA agentique est complémentaire au RAG et orthogonale au fine-tuning — les trois approches s’accumulent dans les architectures hybrides.
  • MCP et A2A sont les standards d’interopérabilité qui émergent, tous deux sous gouvernance Linux Foundation depuis fin 2025.
  • Les limites principales sont la propagation des erreurs, le coût computationnel, la difficulté d’évaluation et les vulnérabilités de sécurité spécifiques aux agents.