En bref
Un agent IA gère trois types de mémoire distincts, importés de la psychologie cognitive : la mémoire sémantique (connaissances sur le monde), la mémoire épisodique (expériences passées) et la mémoire procédurale (savoir-faire et instructions). Le framework CoALA (Sumers et al., 2023) formalise cette taxonomie pour les agents à base de LLM en y ajoutant une quatrième composante, la mémoire de travail, qui fait le lien entre les trois autres et le cycle de décision en cours.
En clair : un être humain qui voit un panneau « café » mobilise trois mémoires distinctes — il sait ce qu’est un café (sémantique), il se souvient être passé devant ce café hier (épisodique), il sait comment commander un espresso (procédurale). Et tout cela est filtré par sa mémoire de travail, le scratchpad immédiat. Un agent IA persistant, pour fonctionner avec cohérence, doit reconstruire ces quatre couches — c’est ce que formalise CoALA.
Pourquoi distinguer les types de mémoire
Un LLM sans architecture mémoire est un système sans état : chaque requête repart de zéro. Dès qu’un agent doit maintenir une cohérence sur plusieurs échanges, apprendre d’erreurs passées ou généraliser des comportements acquis, il faut séparer explicitement ce qui relève du contexte immédiat de ce qui doit persister.
La distinction n’est pas arbitraire. Elle reflète des contraintes techniques concrètes : la fenêtre de contexte est bornée, coûteuse et volatile ; le stockage externe est persistant mais son accès demande une politique de récupération explicite. Choisir quel type de mémoire héberge quelle information détermine directement les capacités et les limites de l’agent.
La mémoire de travail : hub central du cycle de décision
La mémoire de travail (working memory) contient l’information active pendant le cycle de décision en cours. Elle agrège les entrées issues des autres types de mémoire et dirige les sorties vers le stockage ou l’exécution d’actions.
Concrètement, elle correspond à la fenêtre de contexte du LLM : ce qui est là est immédiatement disponible, mais la capacité est limitée et rien ne survit à la session sans mécanisme de persistance explicite. ReAct (Yao et al., 2022) illustre ce rôle : les traces de raisonnement intercalées entre les actions constituent une forme de mémoire de travail externalisée et temporaire. Cette approche a produit une amélioration de 34 % sur ALFWorld et 10 % sur WebShop par rapport aux méthodes d’imitation et de renforcement classiques.
En clair : la mémoire de travail, c’est le bureau actif. Tout ce qui n’est pas dessus est inaccessible immédiatement. La fenêtre de contexte LLM joue ce rôle, mais avec une limite physique : 200K tokens, c’est environ 150 000 mots, soit l’équivalent d’un roman court. Au-delà, il faut soit oublier (ce qui sort), soit ranger ailleurs (consolidation vers une mémoire persistante).
La mémoire sémantique : connaissances sur le monde
La mémoire sémantique stocke les connaissances factuelles et conceptuelles de l’agent — sur le monde et sur lui-même. Elle peut s’initialiser depuis des bases de données externes (encyclopédies, manuels techniques) ou se construire dynamiquement par apprentissage autonome de l’agent.
Contrairement aux systèmes RAG classiques en lecture seule, CoALA prévoit des lectures et des écritures : l’agent enrichit activement sa base de connaissances. Les Generative Agents de Park et al. (2023) en illustrent le mécanisme : les agents génèrent des réflexions de niveau supérieur à partir de leurs observations et les stockent pour orienter leurs comportements futurs — un processus de consolidation spontané.
LD-Agent (Li et al., 2024) combine mémoire épisodique et sémantique dans un système de dialogue : une banque de mémoire long terme stocke les profils des interlocuteurs et les informations persistantes, tandis qu’une banque court terme capture la session en cours. Une approche de récupération par sujets améliore la précision d’accès par rapport à la similarité vectorielle brute. [NON VÉRIFIÉ : comparaison directe récupération par sujets vs vectorielle sur benchmarks communs]
La mémoire épisodique : expériences passées
La mémoire épisodique enregistre les événements vécus par l’agent : paires entrée-sortie d’interactions antérieures, trajectoires de décision, historique de sessions. Elle sert à deux usages principaux : fournir des exemples few-shot pendant la planification, et permettre un apprentissage sans modification des poids.
Reflexion (Shinn et al., 2023) démontre ce second usage de façon directe : un buffer épisodique stocke les réflexions textuelles après chaque essai ; l’agent utilise ce retour verbal pour améliorer sa stratégie lors de l’essai suivant, sans fine-tuning. Résultat mesuré : 91 % de précision sur HumanEval, contre 80 % pour GPT-4 à l’époque de la publication. [NON VÉRIFIÉ : comparaison directe buffer épisodique vs fine-tuning sur tâches générales hors code et ALFWorld]
MemGPT (Packer et al., 2023) aborde la mémoire épisodique sous l’angle des systèmes d’exploitation : un recall storage conserve l’historique des interactions (équivalent d’un journal système), distinct du stockage archival (persistant et interrogeable) et du contexte actif (équivalent RAM). Des interruptions gèrent les transferts entre niveaux, ce qui permet de traiter des documents dépassant la taille de la fenêtre contextuelle.
La mémoire procédurale : savoir-faire et instructions
La mémoire procédurale encode le comportement de l’agent. CoALA distingue deux formes :
- Implicite : connaissance encodée dans les poids du LLM, héritée de l’entraînement.
- Explicite : procédures écrites dans le code de l’agent (actions, politique de décision).
Cette deuxième forme est modifiable à l’exécution — ce qui la rend puissante et risquée. CoALA note explicitement qu’écrire sur la mémoire procédurale est “significativement plus risqué” que modifier la mémoire épisodique ou sémantique, car une erreur peut introduire des bugs dans le comportement de l’agent.
Voyager (Wang et al., 2023) contourne ce risque en implémentant la mémoire procédurale comme une bibliothèque de compétences en code exécutable, versionnable et composable. Les compétences acquises s’accumulent sans écraser les précédentes, ce qui évite l’oubli catastrophique observé lors du fine-tuning sur poids. [NON VÉRIFIÉ : généralisation de cette approche au-delà d’environnements où le code est directement exécutable et vérifiable comme Minecraft]
Le pattern Reflection (Gulli, 2025, Ch.8) offre une troisième voie : l’agent consulte ses instructions courantes et l’historique de la session, génère de nouvelles instructions améliorées, puis les persiste — une itération contrôlée sur la mémoire procédurale explicite.
Matrice décision — quelle mémoire pour quel besoin
| Besoin agent | Type de mémoire | Implémentation type |
|---|---|---|
| Garder le fil d’une conversation longue (≤ session) | Travail (fenêtre contexte) | Résumé tournant, prompt caching |
| Stocker les préférences utilisateur sur plusieurs sessions | Sémantique | Vector store + clé utilisateur |
| Apprendre d’erreurs passées sans fine-tuning | Épisodique | Reflexion-style buffer textuel + récupération |
| Capitaliser des compétences réutilisables (skills) | Procédurale explicite | Bibliothèque de fonctions versionnée (Voyager pattern) |
| Audit/traçabilité (qui a dit quoi quand) | Épisodique avec timestamp | Journal append-only structuré |
| Connaissance domaine stable (encyclopédie, manuels) | Sémantique | RAG classique sur corpus de référence |
Tensions et questions ouvertes
Deux taxonomies coexistent sans consensus. CoALA défend 4 types (working + episodic + semantic + procedural). MemGPT adopte 3 niveaux inspirés des OS (in-context / archival / recall). Aucun papier ne propose de benchmark comparatif direct entre les deux frameworks sur les mêmes tâches. [NON VÉRIFIÉ]
La récupération reste un problème ouvert. Trois paradigmes sont actifs dans la littérature : similarité vectorielle dense (dominant dans RAG), règles symboliques (mentionné dans CoALA), récupération par sujets (LD-Agent). Aucun benchmark comparatif sur corpus et tâches communs. [NON VÉRIFIÉ]
L’interaction entre types de mémoire est peu formalisée. Les mécanismes de coordination — quand escalader de la mémoire de travail vers l’épisodique, quand consolider l’épisodique en sémantique — restent non spécifiés en dehors de CoALA, qui demeure un framework conceptuel sans implémentation de référence partagée.
En clair : CoALA donne un vocabulaire utile pour penser la mémoire d’un agent, mais aucun framework standard n’orchestre encore ces quatre couches en production. Chaque équipe (LangChain, Letta/MemGPT, Mem0, Zep) propose sa propre orchestration. Choisir un framework, c’est aussi choisir une opinion sur quand consolider, quand oublier, quand récupérer.
Ce qu’il faut retenir
- Un agent IA structure sa mémoire en quatre composantes : travail (contexte actif), sémantique (connaissances), épisodique (expériences), procédurale (comportements). La taxonomie vient de la psychologie cognitive, formalisée pour les LLM par CoALA (Sumers et al., 2023).
- La mémoire épisodique peut remplacer le fine-tuning pour l’amélioration itérative : Reflexion atteint 91 % sur HumanEval sans modifier les poids.
- La mémoire procédurale explicite (code) est modifiable mais risquée : une erreur peut corrompre le comportement de l’agent.
- Deux taxonomies concurrentes (CoALA vs MemGPT) coexistent sans benchmark commun.
- Les mécanismes de coordination entre les types de mémoire restent le principal gap non résolu.