Aller au contenu
VENKAI

Ingénierie du contexte

Ce que le contexte signifie réellement pour un modèle d'IA

Un modèle n'a aucune notion de « savoir » quelque chose en dehors de ses poids. Le contexte, c'est les tokens présents dans la fenêtre au moment de l'inférence, point final — ce qui fait de leur origine tout le problème d'ingénierie.

Un seul mécanisme, plusieurs noms

« Contexte » désigne tour à tour un prompt, un historique de chat, un ensemble de documents récupérés, et l'idée plus vague de « ce que le modèle sait de la situation ». Mécaniquement, il n'y a qu'une seule chose : la séquence de tokens présente dans l'entrée du modèle au moment où il génère une réponse. Rien en dehors de cette séquence n'a d'effet sur la sortie — ni un fait vrai, ni un document qui existe quelque part, ni une décision prise par l'entreprise la semaine dernière. Si ce n'est pas dans les tokens, ce n'est pas du contexte, quoi qu'en pense un tableau de bord ailleurs dans la chaîne.

Pourquoi ce cadrage compte

Cela recadre toute affirmation qu'une IA « sait » quelque chose comme une affirmation sur un pipeline : quelque chose en amont de l'inférence a décidé quels tokens inclure, dans quel ordre, tronqués à quelle longueur. « L'assistant connaît notre politique de remboursement » signifie en réalité « une étape de récupération, un prompt système, ou un fine-tune a placé les tokens de cette politique devant le modèle assez récemment pour qu'ils y soient encore ». Changer n'importe quelle partie de ce pipeline change la connaissance apparente du modèle avec, instantanément et complètement, parce que rien n'a jamais été stocké à l'intérieur du modèle entre deux appels.

Le problème d'ingénierie que cela crée

Une fois le contexte compris comme une entrée assemblée plutôt qu'une connaissance accumulée, le vrai problème devient la sélection et la fraîcheur : parmi tout ce qu'une entreprise pourrait fournir, quels tokens sont pertinents pour cette requête précise, et sont-ils toujours exacts. Se tromper sur la sélection prive le modèle de ce dont il a besoin, ou le noie sous du texte non pertinent qui rivalise pour la même fenêtre limitée. Se tromper sur la fraîcheur fait énoncer au modèle un fait périmé avec la même confiance qu'un fait actuel, parce qu'une séquence de tokens ne porte aucun horodatage que le modèle puisse raisonner seul.

C'est le problème qu'une couche de mémoire résout réellement — non pas donner au modèle une fenêtre plus grande, mais décider, correctement et à jour à l'instant présent, quels tokens appartiennent à la fenêtre dont il dispose.