En bref

Pensez à la différence entre un livre et un assistant. Le livre vous donne des informations en réponse à une lecture, mais reste passif — il ne lit pas le contexte, ne consulte rien, ne corrige pas. L’assistant peut consulter un agenda, vérifier la météo, déléguer une tâche à un collègue, revenir corriger sa réponse. Tous les systèmes LLM ne sont pas des agents. La distinction n’est pas cosmétique : elle repose sur la présence ou l’absence d’une boucle perception-planification-action. Gulli (2025) propose quatre niveaux de sophistication, de L0 (raisonnement seul) à L3 (équipes d’agents spécialisés), chaque niveau ajoutant une capacité d’interaction avec l’environnement. Un article de recherche sur arXiv (Huang, 2024) recense indépendamment cinq niveaux selon un axe similaire. Les deux cadres convergent sur un point : ce qui fait un agent n’est pas la taille du modèle, mais l’architecture qui l’entoure.


La boucle comme critère de distinction

Un LLM standard transforme une entrée en sortie — une fois, sans retour. Un agent, lui, opère en boucle itérative : il perçoit son environnement (entrée utilisateur, résultats d’outils, état de la mémoire), planifie les prochaines étapes en fonction d’un objectif, puis agit (génère du texte, appelle un outil, délègue à un autre agent). Il observe le résultat, puis recommence.

Cette boucle perception-planification-action (parfois appelée boucle PSAA : Perception-Scan-Action-Apprentissage) est le critère central. Un système qui l’implémente est un agent. Un système qui s’en passe est un pipeline LLM — utile, mais fondamentalement différent.

“An AI agent is a system designed to perceive its environment and take actions to achieve a specific goal.” — Gulli (2025), p. 14

La boucle n’est pas binaire : elle peut être partielle, peu fréquente, ou fortement contrainte par l’humain. D’où l’intérêt d’une classification par niveaux.

En clair : un système Q&R sur documentation statique = pipeline LLM, pas agent. Un système qui interroge une API en temps réel et adapte sa réponse = agent. La différence : l’un attend tout son monde dans son contexte initial ; l’autre va le chercher en cours de route. C’est un seuil architectural, pas une continuité.


Les quatre niveaux (L0 → L3)

L0 — Moteur de raisonnement pur

Le LLM génère des réponses à partir de sa connaissance pré-entraînée. Pas d’outil, pas de mémoire persistante, pas d’interaction avec l’extérieur.

Capacité : produire du texte cohérent, raisonner sur un problème dans la limite du contexte. Limite structurelle : la connaissance est gelée à la date d’entraînement. Le modèle ne peut ni vérifier une information ni exécuter une action.

Exemple typique : un chatbot de Q&R sur documentation statique, un assistant de reformulation de texte.

L1 — Solveur connecté (tool use)

L’agent dispose d’outils externes : moteur de recherche, API, interpréteur de code, base de données. Il peut appeler ces outils, observer les résultats, et les intégrer dans son raisonnement.

Transition décisive : le modèle peut dépasser sa connaissance interne. Un agent L1 peut consulter un prix en temps réel, exécuter du code, ou lire un fichier. Limite : l’agent ne gère pas stratégiquement ce qu’il met dans son contexte. Sur des tâches longues, le contexte se sature ou devient incohérent.

Exemple typique : un assistant de recherche qui lance des requêtes web et résume les résultats. La plupart des assistants IA grand public avec accès à la recherche opèrent à ce niveau.

L2 — Solveur stratégique (context engineering)

L’agent applique ce que Gulli appelle le context engineering : la sélection, le packaging et la gestion stratégiques de l’information pertinente à chaque étape. Plutôt que d’accumuler tous les résultats dans la fenêtre de contexte, il filtre, résume et structure l’information pour maintenir la cohérence sur des tâches longues.

“Context engineering is the discipline that accomplishes this by strategically selecting, packaging, and managing the most critical information from all available sources.” — Gulli (2025), p. 89

À L2 s’ajoute également la proactivité : l’agent peut demander des feedbacks sur ses propres processus, générer des critiques de ses outputs, et affiner son plan sans instruction explicite (pattern Reflexion).

Transition décisive : l’agent gère son propre état cognitif, pas seulement les appels d’outils. Limite : un agent L2 reste un système unique. Les tâches très larges ou très hétérogènes le saturent.

Exemple typique : Google DeepResearch — il planifie une recherche, identifie des lacunes en cours de route, et replanifie avant de produire le rapport final.

L3 — Systèmes multi-agents

Plusieurs agents spécialisés collaborent, coordonnés par un agent orchestrateur. Chaque agent a un rôle délimité, un contexte propre, et communique avec les autres via des interfaces définies.

“Complex challenges are often best solved not by a single generalist, but by a team of specialists working in concert.” — Gulli (2025), p. 119

Ce niveau rejette le modèle du “super-agent généraliste” au profit d’une division du travail analogue à celle d’une organisation humaine. Gulli recense six topologies de collaboration : agent simple, réseau pair-à-pair, superviseur, superviseur-outil, hiérarchique, et topologie personnalisée.

Transition décisive : la complexité n’est plus absorbée par un seul modèle mais distribuée sur plusieurs unités spécialisées. Limite : la coordination inter-agents introduit de nouveaux points de défaillance. Les coûts de communication et de synchronisation augmentent rapidement. Une ontologie partagée entre agents est nécessaire pour éviter les malentendus.

En clair : entre L0 et L3, le coût opérationnel typique est multiplié par 10 à 100. L0 = un appel LLM (1-3 secondes, ~10 tokens entrée/sortie). L1 = appel + 1-3 outils (5-15 secondes). L2 = stratégie complète (30 secondes à plusieurs minutes). L3 = orchestration multi-agents (minutes à heures pour les tâches complexes). Choisir le bon niveau, c’est aussi choisir un budget.


Tableau récapitulatif

NiveauDésignationCapacité cléLimite principale
L0Moteur de raisonnementGénération à partir du modèle seulConnaissance figée, pas d’action
L1Solveur connectéAppel d’outils, accès externeGestion du contexte non stratégique
L2Solveur stratégiqueContext engineering, auto-améliorationAgent unique, saturation sur tâches larges
L3Équipe d’agentsSpécialisation, division du travailCoordination complexe, coûts de synchronisation

Quand un LLM devient-il un agent ?

La transition L0 → L1 est la plus nette : dès qu’un système peut appeler un outil externe et intégrer son résultat dans le raisonnement, la boucle perception-planification-action est présente dans sa forme minimale.

La transition L1 → L2 est plus graduelle. Elle intervient quand l’agent prend des décisions sur ce qu’il retient dans son contexte, pas seulement sur ce qu’il appelle. Un proxy pratique : si l’agent peut identifier qu’une information est devenue inutile et l’écarter, il opère à L2.

La transition L2 → L3 est architecturale. Elle implique la mise en place d’un protocole de communication inter-agents, d’une mémoire partagée ou d’un mécanisme de délégation explicite. Un agent qui s’appelle lui-même récursivement n’est pas un système L3 — c’est un L2 avec de la récursion.

Ces frontières restent [NON VÉRIFIÉ] au sens d’une standardisation formelle : la classification par niveaux est un cadre pédagogique, pas une norme industrielle établie.

Quel niveau pour quel besoin

ContexteRecommandationPourquoi
FAQ, Q&R sur documentation figéeL0 (LLM seul)Pas d’outils, latence < 2s, coût minimal. Suffisant si la documentation tient dans la fenêtre de contexte.
Assistant temps réel (recherche web, lecture documents, calculs)L1 (tool use)Outils prédéfinis, latence acceptable. Pattern dominant en production 2025-2026.
Recherche approfondie, projet multi-étapes (DeepResearch, Manus AI)L2 (context engineering)LLM gère son propre contexte, capable de replanifier. Coût et latence plus élevés mais robustesse.
Automatisation hétérogène complexe (analyse + design + revue + correction)L3 (multi-agents)Spécialisation, parallélisation, résilience. Réservé aux cas où L2 sature.

Limites du cadre

La taxonomie L0-L3 simplifie volontairement. D’autres dimensions existent :

  • Degré d’autonomie dans la boucle : un système peut être L2 sur l’architecture mais nécessiter une validation humaine à chaque étape (human-in-the-loop). L’autonomie effective est distincte de la sophistication architecturale.
  • Mémoire : les niveaux ne distinguent pas mémoire à court terme (fenêtre de contexte) et mémoire à long terme (base vectorielle). Un agent L1 avec mémoire persistante peut surpasser un agent L2 sans mémoire sur certaines tâches.
  • Topologie des systèmes L3 : six modèles de collaboration existent selon Gulli (2025). La classification “L3” regroupe des systèmes dont la complexité varie d’un facteur 10.

D’autres taxonomies existent. Vellum AI (2025) propose six niveaux en séparant “conscience du contexte” et “orientation vers les objectifs”. La recherche sur arXiv (Huang, 2024) distingue les agents basés sur des règles, l’apprentissage par renforcement, et les LLM en cinq niveaux. Le cadre L0-L3 de Gulli reste le plus utilisé dans la littérature pratique orientée implémentation.


Ce qu’il faut retenir

  • La boucle perception-planification-action est le critère qui distingue un agent d’un pipeline LLM. Sans elle : L0.
  • L1 ajoute les outils. L2 ajoute la gestion stratégique du contexte. L3 ajoute la collaboration entre agents spécialisés.
  • Chaque niveau ajoute des capacités et de nouveaux points de défaillance.
  • La classification est pédagogique, pas normative. Un même système peut opérer à des niveaux différents selon les tâches.
  • L’autonomie effective (degré de supervision humaine) est une dimension orthogonale à la sophistication architecturale.