En bref

Cinq systèmes de knowledge base maintenus par LLM, conçus indépendamment, convergent vers la même architecture : fichiers Markdown comme substrat, index centralisé pour la navigation, maintenance automatisée comme condition de survie. Ce n’est pas une revue de littérature — c’est un constat empirique. La convergence porte sur la structure, pas sur les détails d’implémentation.

En clair : pensez à un bibliothécaire qui doit ranger sa propre bibliothèque sans assistance. Tant qu’il n’a que cinquante livres, il s’en sort. À cinq mille, il abandonne. C’est exactement le destin des wikis personnels avant les LLM. Quand l’assistant peut classer, indexer et corriger seul à coût quasi-nul, le bibliothécaire — qu’il soit chercheur, financier ou ingénieur — peut enfin maintenir sa bibliothèque vivante.


Le constat

En avril 2026, cinq systèmes indépendants de gestion de connaissances par LLM sont documentés publiquement. Leurs auteurs ne se sont pas coordonnés. Leurs contextes d’usage sont différents : recherche personnelle, framework d’agents, outil open source, finance d’entreprise, recherche sur les LLM.

Et pourtant, quand on pose les architectures côte à côte, le même pattern apparaît.

Les cinq systèmes :

  • LLM Wiki — Andrej Karpathy (2026). Architecture formalisée dans un gist public. Trois couches : sources immutables, wiki LLM-maintained, schema co-évolué humain/LLM.
  • Deep Agents Memory — LangChain (2026). Module mémoire du framework Deep Agents. Fichiers Markdown via edit_file, trois scopes (agent, user, org), consolidation hot path et background.
  • agentmemory — rohitg00 (2026). Système open source de mémoire persistante pour agents de code. Quatre tiers de consolidation, recherche hybride BM25/vecteurs/graphe, auto-nettoyage.
  • CFO Brain — Jon Dorsey (2026). Stack personnelle Claude + Granola + Obsidian pour un directeur financier. Cinq dossiers Obsidian, deux skills Claude Code (/call, /today).
  • Notre lab — labo-llm.fr (2025-2026). Knowledge State en fichiers Markdown, index centralisé, lint structurel, lab notebook chronologique, opérateur humain dans la boucle.

Le tableau

C’est la pièce centrale. Six axes comparatifs, cinq systèmes.

AxeLLM Wiki (Karpathy)Deep Agents (LangChain)agentmemory (rohitg00)CFO Brain (Dorsey)Notre lab
Substrat mémoireFichiers .md dans répertoireFichiers via edit_file, backends configurablesDB embarquée + snapshots gitFichiers .md dans ObsidianFichiers .md dans repo git
Navigationindex.md → drill-down par pageWorkspace index, chargement dans le system promptRecherche hybride BM25 + vecteurs + knowledge graph (RRF)Wiki-links Obsidian + fichiers indexKNOWLEDGE_STATE.md → KS_{AXE}.md
Maintenance / lintLint périodique : contradictions, pages orphelines, claims obsolètes, gapsNon documentéTTL, détection contradiction (Jaccard > 0.9), éviction basse valeur, cascadeNon documentélint_ks.py : 9 catégories de détection
Logginglog.md append-only, format parsable (grep)Traces LangSmith (tool calls)Non documentéNon documentélab_notebook/ chronologique
ConsolidationIngest = fanout 10-15 pages, réinjection des bonnes réponsesHot path (synchrone) + background (cron/scheduled, agent séparé)Compression LLM automatique sur 4 tiers (Working → Episodic → Semantic → Procedural)Skills CC déclenchés manuellement (/call traite les transcripts, /today génère le brief)Semi-automatisé : CC produit les claims et fiches, opérateur valide
Division humain / LLMHumain = sourcing, exploration, cadrage. LLM = résumé, cross-référencement, classement, bookkeepingHumain = définition tâche. Agent = exécution autonomeAutomatique (hooks, cron). Humain = configuration initialeHumain = sourcing (Granola capture). CC = traitement et propagationOpérateur = décide et valide. CC = exécute le bookkeeping

Trois constantes traversent les cinq systèmes :

  1. Le Markdown comme substrat. Quatre sur cinq utilisent directement des fichiers .md. Le cinquième (agentmemory) utilise une base de données mais expose les résultats en texte structuré. Le format est lisible par l’humain et par le LLM sans conversion.

  2. Un index centralisé. Chaque système maintient un point d’entrée qui permet au LLM de savoir ce qui existe avant de chercher. L’approche varie — fichier index, wiki-links, recherche hybride — mais la fonction est identique : éviter que le LLM travaille à l’aveugle.

  3. Le LLM fait le bookkeeping. La division du travail converge : l’humain apporte le matériau et pose les questions, le LLM fait le travail de classement, de cross-référencement et de mise à jour que personne ne veut faire manuellement.

En clair : la convergence n’est pas un effet de mode mais une réponse à une contrainte structurelle. Le Markdown est lisible par les deux populations — humains et modèles —, l’index agit comme table des matières, et le bookkeeping est précisément le travail que le LLM fait à coût marginal nul là où il déborde l’humain.


Ce que ça implique

Karpathy formule le point central : les humains abandonnent les wikis quand le coût de maintenance croît plus vite que la valeur. Le LLM résout ce problème parce que le coût marginal de maintenance tend vers zéro.

C’est la thèse du Memex de Vannevar Bush (1945) — un système de connaissance personnel avec des “trails associatifs” entre documents — dont le problème non résolu était précisément la maintenance soutenue. Quatre-vingts ans plus tard, le LLM fournit le mécanisme manquant.

Pour notre recherche, la convergence à cinq sources renforce un signal : la frontière entre déterministe et probabiliste, au coeur de nos travaux, se matérialise dans ces architectures. Le substrat (fichiers, index, lint) est déterministe — vérifiable, versionné, auditable. Le traitement (ingestion, consolidation, cross-référencement) est probabiliste — délégué au LLM, non garanti. Les cinq systèmes gèrent cette frontière différemment, mais aucun ne l’élimine.

La division du travail humain/LLM, elle, n’est pas un choix de design — c’est une conséquence de cette frontière. L’humain intervient là où le déterminisme est nécessaire (validation, sourcing, décisions). Le LLM intervient là où le probabilisme est suffisant (résumé, classement, maintenance).


Les gaps — ce qu’on ne sait pas

La convergence est un signal, pas une preuve. Plusieurs limites empêchent de conclure.

Pas de benchmark cross-systèmes. Aucun des cinq systèmes n’est comparé formellement aux autres. agentmemory publie des métriques internes (Recall@10 = 64.1%, réduction 92% de tokens par rapport au context-dumping), mais sur son propre jeu de test (240 observations, 30 sessions). Les quatre autres systèmes ne publient aucune mesure quantitative.

Échelles incomparables. LLM Wiki fonctionne “surprisingly well” à ~100 sources et quelques centaines de pages [NON VÉRIFIÉ]. Notre lab opère sur ~550 claims et ~23 fiches expériences. agentmemory est benchmarké sur 240 observations. CFO Brain est un système personnel avec deux skills. Deep Agents est un framework sans données d’usage publiées. On compare des architectures, pas des performances.

Tout est qualitatif sauf agentmemory. Karpathy ne publie aucun chiffre. Dorsey décrit son système comme “VERY early” et admet ne pas savoir si ses fichiers index sont nécessaires. Notre lab mesure la structure (lint) mais pas la rétention. Seul agentmemory propose des métriques formelles — et elles portent sur la recherche, pas sur la consolidation.

La consolidation reste un problème ouvert. Trois approches divergentes coexistent : full automatique (agentmemory, compression 4 tiers), semi-automatique (Deep Agents, hot path + cron), manuelle déclenchée (CFO Brain, skills). Aucune donnée ne permet de dire laquelle produit la meilleure rétention à long terme.

Le nettoyage automatique n’est pas validé. agentmemory supprime automatiquement les souvenirs anciens à faible importance. Le taux de faux positifs de cette éviction n’est pas documenté. Les quatre autres systèmes ne font pas de nettoyage automatique — ce qui ne signifie pas que c’est mieux, juste qu’on ne sait pas.


Ce qu’il faut retenir

  • Cinq systèmes indépendants convergent vers la même architecture : fichiers Markdown, index centralisé, LLM comme mainteneur.
  • La convergence porte sur la structure, pas sur l’implémentation — les mécanismes de consolidation divergent fortement.
  • Le pattern résout le problème historique du Memex (Bush, 1945) : la maintenance soutenue d’une base de connaissances personnelle.
  • Aucun benchmark cross-systèmes n’existe. La comparaison reste qualitative et architecturale.
  • Le signal est fort mais les données manquent pour passer du constat à la conclusion.