
Aucune Infrastructure Agentique Personnelle n’est un système parfait.
C’était déjà la conclusion de l’article précédent sur les 9 systèmes étudiés : pas de meilleur système dans l’absolu, seulement des compromis.
Une mémoire qui se réécrit elle-même n’échappe pas à la règle, elle l’illustre même plus nettement que les autres composants, parce que c’est elle qui décide, seule, de ce qui reste vrai d’une session à l’autre.
Le sujet IA souffre d’un problème plus large que la technique : c’est un domaine où tout le monde expérimente, se fait un avis et le communique, souvent de bonne foi, presque toujours trop vite pour vérifier. La désinformation qui en résulte n’est pas toujours un mensonge délibéré. Elle vient surtout de l’écart entre le rythme auquel le sujet change et celui auquel on peut le vérifier.
Je viens d’en avoir la preuve sur mon propre travail : les deux notes de recherche qui nourrissent cet article citaient 56 sources au total, et deux d’entre elles attribuaient un papier réel au mauvais auteur, un nom emprunté à une étude voisine du même champ, invisible sans recouper chaque référence une par une. Pas d’invention, pas de mensonge, juste une confusion plausible qu’aucune relecture rapide n’aurait repérée. Si ça arrive à un travail qui cite ses sources et qu’on a pris la peine de vérifier, ça arrive plus facilement encore à une opinion partagée… sans source du tout.
Cette désinformation circule dans les deux sens : elle fait passer des systèmes pour plus fiables qu’ils ne le sont, mais elle fait aussi passer des critiques exagérées pour des lois établies. Avant d’aborder les vrais risques, voici 4 affirmations qu’on croise souvent et qui méritent donc d’être rétablies, parce qu’elles sont fausses ou beaucoup trop absolues :
- « Un gros coffre de notes sature la fenêtre contextuelle du modèle »
Faux, sauf si l’architecture choisit d’y envoyer tout le corpus d’un coup. Un système doté d’une couche de recherche correcte transmet seulement quelques passages pertinents, quelle que soit la taille du stockage (Liu et al., Lost in the Middle, TACL 2024). - « Il faut absolument un RAG, et le dernier en date, GraphRAG, serait forcément meilleur »
Faux comme hiérarchie universelle. Le RAG classique (Lewis et al., 2020) reste très bien adapté à une recherche locale de faits. Les architectures en graphe apportent un vrai bénéfice sur les questions relationnelles ou de vue d’ensemble, au prix d’une indexation plus lourde (projet GraphRAG, Microsoft Research). Le bon choix dépend de la question posée, pas d’un classement de nouveauté. - « Les erreurs d’une mémoire qui se réécrit s’amplifient mécaniquement »
Faux comme loi. Rien n’oblige une architecture à transformer automatiquement une sortie du modèle en fait persistant. Le risque devient réel seulement si la politique d’écriture le permet sans vérification ni provenance, ce qu’on retrouvera justement plus loin dans cet article. - « Un second cerveau appauvrit la mémoire, ou n’est que du ‘productivity porn' »
Trop absolu. La recherche sur l’externalisation cognitive est mixte, pas univoque : elle montre des bénéfices réels de performance dans de nombreuses tâches, aux côtés de coûts documentés dans d’autres (Richmond & Taylor, Nature Reviews Psychology, 2025). Ce qu’elle montre surtout, c’est que le résultat dépend de l’usage qu’on en fait, pas de l’existence de l’outil.
Le détail sourcé de ces quatre points, avec les risques réels qui leur font face, est regroupé en 5 familles accessibles, disponibles en Bonus.
Ce dernier point mérite qu’on s’y arrête, parce qu’il éclaire tout le reste de cet article. Une IAP a une utilité remarquable et vérifiable : mettre à disposition d’un modèle un contexte personnel, construit sur ce que vous savez déjà de vous-même, pour gagner en qualité de réponse et sortir du contenu générique que tout le monde reçoit, que l’on appelle « AI Slop ».
Mais cette utilité ne s’obtient jamais par défaut. Elle suppose des choix, d’organisation, de règles, d’outils, adaptés à des besoins précis et ces choix ne peuvent être faits que par un utilisateur éclairé, qui comprend ce qu’il installe. C’est seulement à cette condition qu’on peut dire d’un système qu’il admet ses propres angles morts plutôt que de les gommer : une caractéristique normale d’un outil aussi récent, pas un vice caché.
Il faut ici distinguer deux coûts qu’on confond trop souvent.
Le premier se paie une fois : celui de concevoir une architecture qui sépare le stockage du contexte transmis, qui exige une provenance avant d’écrire un fait, qui sait s’abstenir.
Le second se paie sans arrêt : celui de relire, d’arbitrer, de valider ce que le système propose.
La plupart des problèmes qui suivent ne sont pas des malédictions de l’outil : ce sont des coûts d’usage qu’on refuse de payer, en cherchant le meilleur résultat pour l’effort le plus faible possible. Un système bien conçu réduit le premier coût. Aucun ne supprime le second.
Une IAP dont la mémoire se réécrit elle-même est plus fragile qu’un simple carnet de notes, pas moins. Chaque réécriture est une occasion de perdre un peu de nuance, comme une photocopie de photocopie qui s’éloigne un peu plus de l’original à chaque passage. Cinq mécanismes distincts l’expliquent, chacun étudié séparément dans la littérature récente sur les mémoires compilées :
- La dérive sémantique : une affirmation nuancée, « vrai sous les conditions A et B », perd ses qualifications au fil des résumés successifs, jusqu’à devenir une affirmation absolue, simplement « vrai ». Ce risque concerne tout système qui recompile ses propres synthèses plutôt que de toujours revenir à la source d’origine pour vérifier.
- L’enkystement : une hypothèse faible accumule tant de confirmations internes au système qu’elle finit par devenir centrale et difficile à corriger. Le mécanisme est le même que celui d’une rumeur qui devient un fait établi à force d’être répétée dans le même cercle fermé. La règle d’Agrici Daniel existe précisément pour empêcher ça : préserver les contradictions plutôt que de choisir silencieusement un gagnant entre 2 sources qui se contredisent.
- Le piège de l’auto-confirmation : un agent qui exécute une tâche, juge lui-même s’il a réussi, puis en tire une leçon pour la fois suivante, peut très bien valider une erreur cohérente avec elle-même et la propager. C’est un peu comme se corriger son propre examen, puis rédiger le corrigé à partir de ce qu’on vient d’écrire. Le risque grandit avec l’autonomie du système.
- La mémoire périmée : le système continue de tenir pour vrais des faits qui ne le sont plus, faute d’un mécanisme qui détecte leur péremption. Garry Tan est le seul système étudié à documenter une alerte automatique explicite, déclenchée dès qu’une page compilée devient plus ancienne que la dernière preuve disponible sur le même sujet.
- L’empoisonnement de la mémoire : un contenu hostile, glissé dans un document importé, peut persister d’une session à l’autre et influencer durablement le comportement de l’agent, sans que personne ne s’en aperçoive tout de suite. Ce risque concerne tout système qui accepte des sources externes sans validation humaine systématique avant intégration. Ce n’est pas qu’une hypothèse d’école : dès qu’un import tourne sans intervention, du contenu que personne n’a relu entre dans l’espace où l’agent travaille. Le canal d’entrée existe, que quelqu’un l’exploite un jour ou non.
Face à ces 5 risques, aucun système étudié ne se protège de tous à la fois, mais plusieurs en neutralisent une partie, avec des méthodes réelles plutôt que de simples promesses.
La règle d’Agrici Daniel contre l’enkystement, déjà vue plus haut, en est un exemple direct.
Eugeniu Ghelbur ajoute des critères d’arbitrage sourcés, fraîcheur et autorité de la source, et renvoie les cas ambigus à l’utilisateur plutôt que de forcer une décision automatique.
Garry Tan, de son côté, complète son alerte de péremption par un historique de versions réversible, un filet de rattrapage qui couvre plusieurs de ces risques d’un coup.
Trois autres systèmes étudiés, Nick Milo, Tiago Forte et Eliott Meunier, choisissent une stratégie complètement différente : laisser la réécriture entièrement à l’humain. Ce choix élimine la possibilité même d’une dérive purement automatique, puisqu’il n’y a simplement rien qui se réécrive tout seul. Le prix à payer, déjà vu à l’article précédent, c’est un effort de maintenance plus élevé, réparti dans le temps plutôt que délégué.
Un dernier constat : ce n’est probablement pas un hasard si les systèmes qui réécrivent le plus activement leur propre mémoire, Agrici Daniel, Eugeniu Ghelbur, Garry Tan, sont aussi ceux qui documentent le plus de garde-fous explicites contre ces 5 risques. Je le note avec un certain soulagement : plus un système délègue, plus sa gouvernance semble devenir centrale, presque par nécessité plutôt que par vertu.
Le dernier article prend de la hauteur : le terrain technique sur lequel ces 9 systèmes ont poussé et ce qui se construit autour d’eux.
Série de 9 articles pour Comprendre les Infrastructures Agentiques Personnelles :
- Le texte qui a tout déclenché
- Trois familles, pas un classement
- Trois questions avant de croire un vocabulaire
- La bibliothèque qui s’écrit elle-même
- Le partenaire qui vous connaît déjà
- L’atelier qui produit en circuit court
- Le meilleur système n’existe pas
- La mémoire qui se trompe en se corrigeant
- Le terrain sous les 9 systèmes

