Aller au contenu
VENKAI
Pilote

Mémoire IA

Qu'est-ce que la mémoire d'un agent IA ?

La mémoire d'un agent IA, c'est tout ce qu'il peut récupérer sur un travail passé et qui ne tient pas dans sa fenêtre de contexte courante. Elle se décline en trois familles, et celle qui manque n'est presque jamais celle qu'on lui donne.

Ce qu'est la mémoire d'un agent IA

La mémoire d'un agent IA, c'est tout ce que l'agent peut récupérer d'un travail passé et qui n'est pas déjà dans sa fenêtre de contexte courante. La définition est volontairement mécanique, parce que le mécanisme est tout le sujet : un modèle de langage ne conserve aucun état entre deux appels, donc tout ce qu'il semble se rappeler a été placé dans le prompt par quelque chose d'extérieur au modèle.

C'est pour cela que la mémoire est une question d'architecture et non de modèle. Un modèle plus capable raisonne mieux sur ce qu'on lui donne. Il ne change pas ce qu'on lui donne.

Les trois familles de mémoire d'agent

L'historique de conversation, c'est le relevé de ce qui a été dit. C'est le plus simple à conserver et le moins utile à relire : il grossit sans limite, et l'information qu'il contient est noyée dans l'échange qui l'a produite.

La recherche documentaire, c'est le relevé de ce qui est écrit quelque part. Un corpus est préparé à l'avance par des humains, indexé, puis interrogé. Il répond à des questions portant sur un savoir qui existe indépendamment de l'agent.

L'état opérationnel, c'est le relevé de ce qui a été décidé, fait, contraint. Il est écrit par les agents eux-mêmes au fil du travail, il est petit au regard de la transcription qui l'a produit, et c'est ce dont un autre agent a besoin pour continuer au lieu de recommencer.

Celle qui manque réellement

La plupart des systèmes qui se décrivent comme ayant une mémoire possèdent l'une des deux premières. On conserve et rejoue l'historique, ou on greffe un index vectoriel qu'on interroge. Ce sont deux capacités réelles, et aucune ne répond à la question que se pose un agent qui reprend le travail d'un autre : qu'est-ce qui a déjà été tranché ici, et qu'est-ce qui reste ouvert ?

Cette question relève de l'état opérationnel, et l'état opérationnel doit être produit délibérément. Rien ne le génère comme effet de bord. Un agent à qui l'on n'a jamais demandé d'enregistrer une décision n'en aura enregistré aucune, quelle que soit la part de sa transcription conservée.

En quoi cela diffère d'un RAG

Un RAG indexe des documents et répond à « quelle information existe ici ? ». Une mémoire d'agent conserve l'état d'un travail en cours et répond à « qu'est-ce qui a déjà été décidé, et que reste-t-il à faire ? ». La distinction ne porte pas sur la technologie de stockage, souvent le même index vectoriel dans les deux cas. Elle porte sur qui écrit, et quand.

Un corpus de RAG est rédigé à l'avance et reste stable entre deux requêtes. Une mémoire est écrite par les agents à l'exécution et évolue avec le travail, ce qui l'oblige à représenter la substitution : un fait vrai la semaine dernière et faux aujourd'hui. Un index documentaire n'a aucun moyen naturel de dire cela.

Les deux couches cohabitent. Un système peut récupérer une politique interne dans un corpus et, séparément, se rappeler que l'équipe a décidé d'y déroger pour un client il y a trois sessions.

Ce que cela implique quand on en construit une

Stocker davantage n'est pas l'objectif, et c'est en général le mode d'échec. Chaque élément écrit devra être relu par un agent futur sous contrainte de budget de tokens : la mémoire utile est la petite, typée, pas l'exhaustive.

Venkai est un stockage pour la troisième famille. Il conserve faits, décisions, contraintes, préférences, événements et relations sous forme d'objets typés, récupérables par pertinence d'une session à l'autre et d'un modèle à l'autre, en REST, SDK Python ou MCP. Il n'orchestre rien et ne remplace aucun index documentaire.

FAQ

Une mémoire d'agent, est-ce juste une base de données ?

Elle repose sur une base, comme un système de fichiers repose sur un disque. Ce qui en fait une mémoire plutôt qu'un stockage, c'est que l'agent décide de ce qui s'écrit, et que la lecture renvoie ce qui est pertinent pour la tâche en cours plutôt que tout ce qui correspond à une clé.

Un agent a-t-il besoin de mémoire si la fenêtre de contexte est assez grande ?

Une fenêtre, quelle que soit sa taille, repart vide à la session suivante. La taille détermine ce qu'un agent peut tenir d'un coup ; la mémoire détermine ce qui revient une fois la fenêtre refermée. Ce sont deux limites différentes et une seule se règle avec un modèle plus grand.

Que faut-il ne pas stocker ?

Le dialogue lui-même. Les transcriptions tour par tour concentrent le volume et l'information la moins durable. Ce qui survit à une tâche, ce sont les faits qu'elle a établis, les décisions qu'elle a prises et les contraintes qu'elle a découvertes.