RAG
Le RAG récupère. Il ne mémorise pas.
La récupération répond à « qu'est-ce qui ressemble à cette question ». Une large part des vraies questions d'entreprise sont en réalité « qu'est-ce qui dépend de quoi, et est-ce toujours vrai » — une autre question que la similarité ne peut pas résoudre.
Ce que la récupération calcule réellement
Un pipeline RAG encode un corpus de documents en vecteurs, puis, au moment de la requête, encode la question et renvoie les passages dont les vecteurs sont les plus proches. C'est un calcul de similarité : il trouve du texte qui ressemble au texte de la requête, classé par distance dans un espace d'embeddings. Il n'évalue pas si un passage est à jour, s'il a été remplacé par une décision ultérieure, ou comment il se rapporte à un autre passage — ce ne sont pas des propriétés que la recherche par similarité représente.
Là où cela fonctionne
Cela fonctionne bien quand une réponse est réellement autonome dans un document et que la requête est formulée assez près pour l'atteindre — une fiche produit, une page d'aide, une politique énoncée en un seul endroit sans historique de révision. Dans ce cas, le plus proche voisin de la requête est généralement le bon passage, et le modèle le cite ou le paraphrase avec exactitude.
Là où cela échoue en silence
Cela échoue quand deux versions d'une même politique existent — une remplacée, une actuelle — et que les deux sont à peu près équidistantes de la requête dans l'espace d'embeddings, parce que rien dans la distance d'embedding n'encode la fraîcheur ou l'autorité. Cela échoue quand la réponse exige de relier plusieurs documents qui ne partagent pas de vocabulaire : une clause contractuelle, un rapport d'incident et une exception tarifaire, qui ne se mentionnent pas entre eux mais sont liés causalement. Et cela échoue quand la question porte réellement sur une relation — « pourquoi cette règle existe-t-elle », « que casserait-on en la supprimant » — parce qu'une relation n'est pas un passage qu'un modèle d'embedding a appris à récupérer.
L'échec est silencieux précisément parce que le passage récupéré est souvent plausible sur le plan thématique. Le modèle ne refuse pas de répondre ; il répond avec aisance à partir d'un document qui se trouve être faux pour l'instant, et rien dans le pipeline ne le signale.
Ce qu'apporte une couche relationnelle
Le correctif n'est pas un meilleur modèle d'embedding — c'est une structure qui représente la relation directement plutôt que d'espérer que la similarité l'approxime. Un système qui enregistre quelle décision a produit quelle contrainte, et ce qui l'a modifiée ensuite, peut répondre à « est-ce toujours en vigueur » parce que c'est une consultation de structure, pas un espoir sur une distance. Venkai construit cette structure et la sert aux côtés ou en dessous d'une étape de récupération — la récupération trouve toujours le bon document ; la couche relationnelle indique s'il est celui qui est actuellement en vigueur.