Infrastructure IA
Des fenêtres de contexte plus grandes ne sont pas de la mémoire
Une fenêtre d'un million de tokens et un système de mémoire résolvent des problèmes différents. L'une augmente ce qu'un modèle peut lire en une requête. L'autre décide de ce qu'un modèle sait encore demain.
Ce qu'apporte réellement une fenêtre plus grande
Les fenêtres de contexte sont passées de quelques milliers de tokens à des centaines de milliers, et au-delà du million pour certains modèles. Cette croissance supprime réellement une vraie contrainte : un modèle peut désormais lire un dépôt de code entier, un long contrat, ou un fil de support complet en un seul passage, sans avoir besoin d'un pré-résumé ou d'un découpage. C'est utile, et c'est aussi tout le bénéfice — c'est une affirmation sur la quantité lisible en une requête, pas sur ce qui survit après la fin de cette requête.
Pourquoi la taille n'implique pas la persistance
Rien dans la taille de la fenêtre ne change ce qui se passe quand la session se termine : les tokens sont abandonnés, et la session suivante démarre avec une fenêtre vide, quelle que soit la taille que cette fenêtre peut atteindre. Une fenêtre d'un million de tokens utilisée une fois puis abandonnée a conservé exactement autant entre les sessions qu'une fenêtre de quatre mille tokens utilisée une fois puis abandonnée — zéro. La persistance est une propriété de quelque chose en dehors du modèle qui décide quoi remettre dans la fenêtre la prochaine fois, et la taille de la fenêtre ne dit rien sur l'existence de cette chose.
Pourquoi la taille n'implique pas la pertinence
Une fenêtre plus grande ne résout pas non plus la sélection. Donner à un modèle plus de tokens qu'il n'en a besoin ne le rend pas meilleur pour savoir lesquels comptent pour la question en cours — cela peut même dégrader la performance, puisque davantage d'informations concurrentes donnent au modèle plus d'occasions de pondérer la mauvaise partie, ou de traiter un document périmé côtoyant un document actuel comme également fiable. Une fenêtre plus grande peut contenir tout l'historique des révisions d'une politique à la fois ; elle ne peut pas à elle seule dire laquelle des révisions est encore en vigueur.
Ce qui doit réellement exister à la place
Persistance et pertinence sont fournies par quelque chose situé en dehors de tout appel d'inférence isolé : un système qui décide, par requête, ce que l'entreprise sait actuellement de pertinent ici, et maintient ce jugement à jour à mesure que l'entreprise change. C'est un problème d'infrastructure — construire et maintenir une structure de ce qui est vrai maintenant et de comment cela se rapporte à ce qui a précédé — pas un problème de capacité de modèle, et il ne se réduit pas quand les fenêtres de contexte grandissent. C'est précisément le manque qu'une couche de mémoire comme Venkai est construite pour combler, indépendamment de ce qu'un modèle donné peut lire en une seule fois.