Recherche
Vérifié, expérimental, prévu, hypothèse.
Quatre colonnes séparées, jamais mélangées. Une capacité qui existe dans le dépôt n'est pas pour autant une capacité démontrée.
Quarantaine
Les anciens benchmarks ne sont plus publiés
Le site a longtemps publié des chiffres de réduction de coût et de continuité. Un audit adversarial mené le 10 août 2026 a montré que ces mesures provenaient d'un harnais qui modélisait l'économie au lieu de la mesurer, avec plusieurs valeurs codées en dur dans le script de benchmark lui-même.
Ils ont été retirés du site, et non reformulés. Une mesure de coût LLM réelle demande de faire tourner de vrais agents avec et sans Venkai, sur le même travail ; ce travail n'a pas été fait. Tant qu'il ne l'est pas, Venkai n'avance aucun chiffre de coût.
Statut
L'état de chaque brique
- VERIFIED
Persistance et handoff
80/80 tests core, 19/19 checks de handoff, dont un passage vers un agent utilisant un autre modèle.
- VERIFIED
Récupération classée
Similarité, récence, importance et fréquence, couverts par des tests dédiés, dont un test anti-auto-renforcement.
- VERIFIED
Isolation, versioning, accès
Filtrage par organisation, instantané à chaque écriture, JWT et clés API, export et suppression RGPD.
- EXPERIMENTAL
Graphe de connaissance sécurité
Import CWE/CAPEC/OWASP et analyse AST ; les tests passent, mais rien n'a été validé sur données vivantes. Indépendant du cœur du produit.
- EXPERIMENTAL
Semantic Modification Engine
Ligne de produit distincte de cette couche : modification de code minimale guidée par l'AST. Le moteur s'exécute et il est gardé par des tests ; ses anciens chiffres publiés ont été retirés et ne sont pas remplacés ici. Ce n'est pas ce que la couche de continuité fait — ce n'est pas abandonné pour autant.
- EXPERIMENTAL
Serveur MCP en conditions réelles
Sept outils testés en local, jamais branchés à un client MCP tiers.
- PLANNED
PostgreSQL et déploiement
Migrations écrites, Docker et Caddy présents, aucun des deux exécuté ni validé.
- PLANNED
Embeddings sémantiques
Le classement accepte un vrai modèle d'embeddings ; le défaut reste un hachage sans généralisation.
- PLANNED
Boucle de retour
Les retours positifs et négatifs sont collectés, mais n'influencent pas encore le classement.
- LIMIT
Couche de gouvernance
Elle existe dans le dépôt et n'est reliée ni à l'API, ni au SDK, ni au MCP. Elle n'est donc pas une fonctionnalité et n'est pas présentée comme telle.
Hypothèses
Ce que nous pensons sans l'avoir démontré
Formulé comme hypothèse parce que c'en est une. Rien ici ne doit être lu comme un résultat.
L'état pèse moins que l'historique
Transmettre des objets typés devrait coûter moins qu'un dump de conversation, à qualité de reprise égale. Non mesuré.
Le coût réel est le travail défait
Nous supposons que la perte de contexte coûte surtout en travail répété et en décisions annulées, plus qu'en tokens. Non mesuré.
Écrire est le point dur
Nous supposons que la difficulté d'adoption est de faire écrire les agents au bon moment, pas de faire lire. À vérifier en pilote.
Construire une couche de continuité pour vos agents.
Décrivez votre workflow multi-agents et l'endroit où le contexte se perd. Nous répondons avec un périmètre de pilote, ou avec la raison pour laquelle Venkai n'est pas la bonne pièce.
Décrivez votre workflow