
🎁 BONUS :
➜ Fiche récapitulative de l’article
➜ Fiche du système d’Andrej Karpathy
🌐 gist GitHub : llm-wiki
Tout usager de l’IA rêve (en tout cas c’est mon cas !) d’un J.A.R.V.I.S., cet assistant intelligent, toujours disponible, capable de conseiller Tony Stark, de l’aider à résoudre des problèmes et de faire fonctionner ses équipements…
En dehors de la fiction, le besoin est donc simple : que l’assistant puisse se rappeler ce dont on a déjà parlé, retrouver une décision prise la semaine dernière, reprendre un travail sans tout réexpliquer.
Le 25 juin 2024, Anthropic y répond une première fois avec une fonctionnalité nommée « Projet« , un espace persistant qui conserve instructions, documents et historique de conversations d’une session à l’autre.
Le besoin de rappel est couvert, mais seulement lui. Le Projet garde ce qu’on y dépose, mais il ne travaille pas dessus tout seul. C’est l’utilisateur qui revient chercher le dépôt, jamais l’agent qui va spontanément vérifier, corriger ou faire avancer quoi que ce soit.
Ce besoin n’est pas une hypothèse. Eliott Meunier, que cette série retrouvera à l’article 6, le formule ainsi dans un enregistrement du 1er septembre 2026 : il faut que l’IA, « en un clic, une seule requête », puisse retrouver tout ce qu’il a « jamais pensé et lu, entendu » sur un projet, et que ce contexte reste « maintenable dans le temps » plutôt que simplement supposé une fois puis laissé à dériver.
Il va jusqu’à chiffrer l’enjeu, avançant que la qualité d’un résultat IA tiendrait pour 20 % au modèle, et pour 80 % à d’autres facteurs, dont 50 à 60 % au contexte fourni. Je partage totalement.
Le besoin s’étend vite au-delà du simple rappel. Il ne s’agit plus seulement de retrouver ce qui a été décidé, mais que quelque chose continue d’y travailler entre 2 sessions. Fin 2025 et début 2026, deux harnais agentiques indépendants, OpenClaw (encore nommé Clawd) et Hermes Agent, y répondent chacun à leur manière. L’agent lui-même conserve ce qui compte d’une session à l’autre, sans attendre qu’on le lui redemande :
- OpenClaw préserve sa mémoire avant chaque compaction dès janvier 2026 ;
- Hermes se présente, fin mars 2026, comme « self-improving », une boucle qui affine ses compétences et retient de l’information dans des fichiers externes.
Ce basculement, un agent qui écrit et entretient lui-même une mémoire plutôt que d’être seulement nourri et consulté par l’humain, porte un nom dans cette série, celui d’Infrastructure Agentique Personnelle (IAP). C’est le terme qu’on retiendra pour désigner tout ce qui suit en se protégeant des superlatifs de la hype des influenceurs.
C’est dans ce paysage déjà en mouvement que, le 2 avril 2026, dans un tweet, Andrej Karpathy écrit qu’une grande partie de son activité récente avec l’IA va désormais moins vers la manipulation de code et plus vers la manipulation de connaissance.
Deux jours plus tard, le 4 avril, il publie sur GitHub un texte de quelques pages qui explique comment il s’y prend. Pas un logiciel, pas une entreprise : un texte, gratuit, pensé pour être copié tel quel dans un agent de codage pour que chaque utilisateur qui le souhaite puisse édifier son système personnel.
Quelques mois plus tard, des dizaines d’implémentations en découlent, dont les 8 systèmes que cette série va explorer.
Pour comprendre ce que Karpathy propose, il faut d’abord voir ce qu’il critique.
La plupart des IA personnelles fonctionnent aujourd’hui sur un principe qu’on appelle RAG (Retrieval-Augmented Generation : « génération à enrichissement contextuel »). À chaque question, l’agent refouille vos documents, retrouve les passages pertinents et construit une réponse. Karpathy résume ce cycle en 5 mots : documents, recherche, génération, oubli, recommencer.
Le problème, dit-il, c’est que rien de ce travail ne s’accumule, si bien que la prochaine question relance tout depuis zéro.
Sa proposition inverse la logique : documents, compilation, connaissance persistante, maintenance, réutilisation.
Je trouve l’image qu’il emploie lui-même très parlante. Un RAG classique est un interpréteur, il retraduit tout à chaque fois qu’on l’interroge. Son système, lui, est un compilateur, il ne traduit qu’une fois et garde le résultat sous la main pour la prochaine fois.
C’est aussi, plus concrètement, la différence entre relire un livre de recettes en entier à chaque repas et écrire une bonne fois pour toutes la fiche recette sur laquelle on jettera un œil la prochaine fois.
Concrètement, le système tient sur 3 dossiers. Les sources restent dans un dossier « raw », jamais modifiées par l’IA. C’est la preuve, la matière brute. Le wiki, lui, est un dossier de pages Markdown entièrement écrit et réécrit par l’IA à mesure que les sources arrivent. Et un troisième fichier, AGENTS.md, sert de règlement intérieur, non pas un savoir sur le sujet traité mais des règles sur la façon de le traiter (comment nommer une page, quand en fusionner deux, comment signaler une contradiction).
Karpathy résume la répartition par une formule imagée : Obsidian est l’IDE (l’environnement où l’on travaille), le LLM est le programmeur, le wiki est le codebase.
Trois opérations font vivre ce système :
- Ingest, déclenché par l’arrivée d’une nouvelle source : l’agent la lit, met à jour les pages concernées, et une seule source peut ainsi modifier 10 à 15 pages en une seule fois.
- Query se déclenche quand vous posez une question : l’agent ne relit pas les sources brutes, il consulte d’abord la carte du wiki puis les pages déjà rédigées.
- Et Lint, le plus discret des trois, une passe de vérification qui traque les contradictions, les pages orphelines, les informations dépassées, un peu comme un système immunitaire pour la mémoire.
Qui décide, qui agit ? C’est une question qui reviendra tout au long de cette série (approfondie à l’article 3), et Karpathy prend position dès le premier système. Il se situe du côté qu’on appellera Human-First : l’humain choisit et oriente, l’IA exécute (plutôt que AI-First, où l’IA déciderait aussi). Il dit lui-même préférer traiter les sources une à une, lire les synthèses produites, garder la main sur ce qui compte.
Le besoin des usagers explique pourquoi ce texte trouve un public prêt à l’accueillir. Mais la proposition elle-même, la façon précise dont Karpathy choisit d’y répondre, vient de plus loin :
- Il s’inscrit dans une lignée qui commence en 1945, quand Vannevar Bush imagine le Memex, une mémoire externe navigable.
- Elle passe par 1995, quand Ward Cunningham invente le premier wiki, une communauté humaine de personnes qui maintiennent un savoir ensemble.
- Elle continue en 2020, quand le RAG est formalisé comme technique de recherche.
- Et en 2023, quand MemGPT pose la première théorie académique d’une mémoire activement gérée, pas seulement stockée.
Le jugement porté sur Karpathy dans les analyses de cette série d’articles résume bien la situation : il n’est « ni l’inventeur de la mémoire augmentée, ni celui des agents persistants », mais un cristallisateur arrivé au bon moment.
Reste la question du coût, et je préfère être honnête plutôt que vendeur. Karpathy affirme payer plus cher une fois, à l’ingestion, pour payer beaucoup moins cher ensuite, à chaque question.
une étude indépendante publiée en mai 2026 a justement voulu la vérifier, sur un corpus de 24 articles scientifiques et 13 questions test. Résultat : sur le coût par question, c’est l’inverse qui a été mesuré, et largement, le wiki compilé consomme 21 fois plus de tokens qu’un RAG classique pour répondre à une question, pas moins. Sur le coût d’ingestion lui-même, les auteurs de l’étude reconnaissent ne pas avoir pu trancher, faute d’instruments de mesure assez précis. Autrement dit, l’échange que Karpathy décrit reste, pour l’instant, une promesse plausible, pas un fait mesuré.
Ce genre de nuance reviendra souvent dans cette série. Je préfère vous le dire maintenant, à la source, plutôt qu’à la fin.
Ce texte de quelques pages a, malgré tout, déclenché quelque chose de réel : des dizaines d’implémentations communautaires en quelques mois, 8 d’entre elles assez abouties et assez différentes pour composer le reste de cette série.
Comment s’y retrouver entre huit implémentations si différentes ? La première étape n’est pas de leur faire confiance ou de s’en méfier, c’est de les classer sur ce qu’elles font réellement. C’est le sujet du prochain article.
Série de 9 articles pour Comprendre les Infrastructures Agentiques Personnelles :
- Le texte qui a tout déclenché
- Trois familles, pas un classement
- Trois questions avant de croire un vocabulaire
- La bibliothèque qui s’écrit elle-même
- Le partenaire qui vous connaît déjà
- L’atelier qui produit en circuit court
- Le meilleur système n’existe pas
- La mémoire qui se trompe en se corrigeant
- Le terrain sous les 9 systèmes

