En bref
Pensez à un employé qui débute dans un atelier. Au premier jour, il sait répondre aux questions sur ce qu’il a appris en formation, mais il ne touche à aucun outil. Plus tard, on lui confie un téléphone, une calculatrice et un accès aux dossiers — il devient capable d’agir, mais selon des procédures fixes. Avec l’expérience, il apprend à choisir lui-même quoi consulter, quoi mettre de côté, comment organiser sa journée. Enfin, on lui adjoint une équipe : il devient chef d’orchestre. Un agent IA suit la même graduation. La taxonomie L0–L3 proposée par Gulli (2025) organise cette progression selon la nature de l’interaction entre le LLM et son environnement : de la génération textuelle brute (L0) aux systèmes multi-agents collaboratifs (L3). Comprendre ces niveaux permet de choisir l’architecture adaptée à un problème donné, et d’évaluer lucidement ce qu’un système “agentique” signifie vraiment.
L0 — Le moteur de raisonnement nu
Au niveau 0, le LLM opère seul, sans outils, sans mémoire externe, sans accès à l’environnement. Il répond à partir de sa connaissance pré-entraînée uniquement. La génération est déterministe par rapport à l’entrée : même prompt, même contexte, même réponse probable.
Ce niveau correspond à l’usage le plus courant — un chatbot conversationnel sans branchement vers des APIs ou des bases de données. La limite est structurelle : la connaissance du modèle est figée à sa date de coupure, il ne peut ni vérifier ni agir.
Yu Huang (arXiv:2405.06643) catégorise L0 comme “No AI” dans sa propre échelle, réservant le terme “agent” à partir du moment où un système est capable de décision autonome. La formule de Lilian Weng confirme cette coupure : un agent minimal requiert LLM + memory + planning + tool use — L0 ne remplit aucun de ces critères additionnels.
En clair : à L0, le LLM est un répétiteur sophistiqué. Il connaît son cours mais n’a ni téléphone, ni calculatrice, ni cahier de notes. La date de coupure d’entraînement (souvent 6 à 24 mois en arrière) le rend incapable de toute information récente.
L1 — Le solveur connecté
Le passage à L1 s’effectue quand le LLM accède à des outils externes : moteurs de recherche, APIs, bases de données vectorielles (RAG), exécution de code. Il peut désormais dépasser sa connaissance interne et agir sur des données en temps réel.
Gulli décrit L1 comme un “solveur connecté” : l’agent reçoit une mission, interroge son environnement, et produit une réponse enrichie. Le modèle reste cependant guidé par des chemins en grande partie prédéfinis — il ne choisit pas librement sa stratégie globale.
Anthropic nomme cette classe “workflows” dans son guide “Building Effective Agents” : “systems where LLMs and tools are orchestrated through predefined code paths.” Les 5 patterns identifiés (prompt chaining, routing, parallelization, orchestrator-workers, evaluator-optimizer) correspondent tous à ce registre. HuggingFace adopte une lecture plus fluide : l’agentivité est un spectre continu, et L1 représente un segment de ce spectre où le LLM influence partiellement le flux de contrôle.
L2 — Le solveur stratégique
L2 introduit trois capacités supplémentaires absentes à L1 : le context engineering actif, la proactivité continue, et l’auto-amélioration par feedback.
Le context engineering — défini par Gulli comme “the discipline of strategically selecting, packaging, and managing the most critical information from all available sources” — permet à l’agent de construire son propre environnement informationnel à chaque étape, plutôt que de recevoir un contexte fixe. L’agent ne se contente plus de répondre : il filtre, agrège et reformate l’information avant de raisonner.
La proactivité continue signifie que l’agent anticipe les besoins futurs (données météo, disponibilité calendrier) sans attendre une instruction explicite. L’auto-amélioration par feedback ferme la boucle : l’agent sollicite une évaluation de ses propres sorties et ajuste son comportement.
Ce niveau correspond à ce qu’Anthropic appelle un “augmented LLM” : LLM + retrieval + tools + memory, où le LLM contrôle dynamiquement l’utilisation de chacun de ces composants. La frontière L1/L2 se situe au niveau du degré de contrôle que le modèle exerce sur son propre processus.
En clair : ce qui distingue L1 et L2, ce n’est pas l’accès aux outils — c’est qui décide. À L1, le code décide quels outils appeler dans quel ordre, le LLM exécute. À L2, le LLM décide à quel moment et avec quel contenu il faut appeler tel outil — il pilote son propre processus.
L3 — Les systèmes multi-agents
L3 franchit un seuil qualitatif : au lieu d’un agent unique polyvalent, plusieurs agents spécialisés collaborent sous la coordination d’un agent orchestrateur. Gulli reformule la logique de Conway — “complex challenges are often best solved not by a single generalist, but by a team of specialists working in concert.”
L’architecture type : un agent manager décompose la tâche, délègue à des agents spécialisés (recherche, rédaction, validation, design), puis intègre les résultats. Chaque sous-agent optimise un sous-problème ; le système global résout ce qu’un agent unique ne résoudrait pas de façon fiable.
Deux propriétés émergentes distinguent L3 de L2. Premièrement, la résilience : si un sous-agent échoue, l’orchestrateur peut réaffecter ou relancer sans reconstruire l’ensemble du pipeline. Deuxièmement, la parallélisation effective : des sous-tâches indépendantes s’exécutent simultanément, réduisant la latence totale.
Gulli mentionne également des systèmes “métamorphiques” — des architectures multi-agents capables de créer, dupliquer ou supprimer des agents selon l’analyse de performance en cours d’exécution. [NON VÉRIFIÉ — cette capacité n’est pas documentée dans les sources académiques consultées ; elle provient du seul chapitre Gulli.]
En clair : L3 n’est pas “L2 répliqué N fois”. C’est un saut architectural — la capacité à découper un problème en sous-tâches qu’on délègue à des agents spécialisés (recherche, rédaction, validation), puis à recoller leurs résultats. Le coût d’orchestration ajouté est considérable : la majorité des cas d’usage ne le justifie pas.
Quel niveau choisir selon votre besoin
| Contexte | Recommandation | Pourquoi |
|---|---|---|
| Chatbot Q&R sur connaissances stables | L0 (LLM seul) | Pas d’outils, latence minimale, coût le plus bas. Bonne option si la documentation est figée. |
| Recherche d’information temps réel, RAG simple | L1 (tool use) | Outils prédéfinis (web search, RAG), code orchestrateur déterministe. 80 % des cas en production. |
| Tâches longues type recherche approfondie, projet exploratoire | L2 (context engineering) | Le LLM décide quoi garder, quoi compresser, quand replanifier. Coût plus élevé mais robustesse sur durée. |
| Workflows hétérogènes (analyse + rédaction + design + revue) | L3 (multi-agents) | Spécialisation par rôle, parallélisation, résilience. Mais coordination coûteuse — réservé aux cas où L2 sature. |
Taxonomies alternatives : pourquoi L0–L3 n’est pas le seul cadre
La taxonomie Gulli n’est pas isolée, mais elle n’est pas universelle non plus.
Yu Huang (arXiv:2405.06643) propose une échelle L0–L5 inspirée des niveaux SAE de conduite autonome. Sa coupure critique se situe entre L2 (apprentissage par imitation ou renforcement) et L3 (LLM comme contrôleur cognitif) — ce qui correspond précisément au pivot entre systèmes pré-LLM et systèmes LLM-pilotés. Les niveaux L4 (apprentissage autonome) et L5 (personnalité et multi-agents) étendent le cadre au-delà du périmètre couvert par Gulli.
Mitchell et al. (arXiv:2502.02649, HuggingFace) définissent 5 niveaux fonctionnels, du simple exécuteur d’instructions au générateur de code autonome, avec une position normative explicite : les niveaux 4–5 présentent des risques croissants qui justifient selon eux de ne pas les développer.
Feng, McDonald et Zhang (arXiv:2506.12469) adoptent un angle orthogonal : leurs 5 niveaux mesurent le rôle de l’utilisateur dans l’interaction (opérateur, collaborateur, consultant, approbateur, observateur) plutôt que les capacités techniques de l’agent. Leur thèse centrale — “autonomy is a property that can be designed independently of capability” — implique qu’un agent L3-capable peut délibérément fonctionner avec un niveau d’autonomie L1 si on le contraint à consulter l’utilisateur avant chaque action.
Google DeepMind (arXiv:2311.02462) ajoute une distinction supplémentaire : l’autonomie n’est pas “déterminée” par les capacités, seulement “déverrouillée”. Ce point est pertinent pour les déploiements : un système L3 n’est pas condamné à l’autonomie maximale.
HuggingFace adopte une position plus fluide encore dans son cours officiel (smolagents + agents-course) : “Agency is not a discrete, 0 or 1 definition: instead, agency evolves on a continuous spectrum, as you give more or less power to the LLM on your workflow.” La définition opérationnelle retenue par HuggingFace — “AI Agents are programs where LLM outputs control the workflow” — mesure l’agentivité par la part du flux de contrôle que le LLM influence effectivement, par opposition au code déterministe. Cette lecture rend les frontières L0–L3 perméables : un pipeline peut être L1 pour certaines branches et L2 pour d’autres selon la configuration.
L’enquête arXiv:2601.12560 formalise quant à elle les agents comme des POMDP (Partially Observable Markov Decision Process) et organise le champ en 6 dimensions orthogonales (composants, architecture cognitive, apprentissage, multi-agents, environnements, évaluation/sécurité). Ce cadre ne hiérarchise pas les niveaux mais les décompose — ce qui est utile pour diagnostiquer un système existant, moins pour communiquer une progression pédagogique.
Ce qu’il faut retenir
- L0 à L3 décrit une progression de l’isolation (génération pure) à la collaboration (multi-agents coordonnés), avec deux pivots principaux : l’accès aux outils (L0→L1) et le contrôle dynamique du processus par le LLM lui-même (L1→L2).
- Le context engineering — sélection et packaging stratégique de l’information à chaque étape — est la compétence centrale qui différencie L2 de L1 ; il ne s’acquiert pas automatiquement avec les outils.
- L3 ne signifie pas “autonomie totale” : la question du niveau d’autonomie accordé à un système multi-agents est une décision de conception distincte de ses capacités techniques (Feng et al., DeepMind).
- Plusieurs taxonomies coexistent dans la littérature avec des découpages différents (L0–L5 chez Yu Huang, 5 niveaux fonctionnels chez Mitchell et al.) ; L0–L3 de Gulli est un cadre opérationnel parmi d’autres, orienté praticien.
- Un résultat négatif important : aucune taxonomie consultée ne fournit de validation empirique sur benchmark — les niveaux restent à ce stade des catégories conceptuelles, non des mesures de performance vérifiées.