Aller au contenu
VENKAI
Pilote

Recherche

Vérifié, expérimental, prévu, hypothèse.

Quatre colonnes séparées, jamais mélangées. Une capacité qui existe dans le dépôt n'est pas pour autant une capacité démontrée.

Quarantaine

Les anciens benchmarks ne sont plus publiés

Le site a longtemps publié des chiffres de réduction de coût et de continuité. Un audit adversarial mené le 10 août 2026 a montré que ces mesures provenaient d'un harnais qui modélisait l'économie au lieu de la mesurer, avec plusieurs valeurs codées en dur dans le script de benchmark lui-même.

Ils ont été retirés du site, et non reformulés. Une mesure de coût LLM réelle demande de faire tourner de vrais agents avec et sans Venkai, sur le même travail ; ce travail n'a pas été fait. Tant qu'il ne l'est pas, Venkai n'avance aucun chiffre de coût.

Statut

L'état de chaque brique

  • VERIFIED

    Persistance et handoff

    80/80 tests core, 19/19 checks de handoff, dont un passage vers un agent utilisant un autre modèle.

  • VERIFIED

    Récupération classée

    Similarité, récence, importance et fréquence, couverts par des tests dédiés, dont un test anti-auto-renforcement.

  • VERIFIED

    Isolation, versioning, accès

    Filtrage par organisation, instantané à chaque écriture, JWT et clés API, export et suppression RGPD.

  • EXPERIMENTAL

    Graphe de connaissance sécurité

    Import CWE/CAPEC/OWASP et analyse AST ; les tests passent, mais rien n'a été validé sur données vivantes. Indépendant du cœur du produit.

  • EXPERIMENTAL

    Semantic Modification Engine

    Ligne de produit distincte de cette couche : modification de code minimale guidée par l'AST. Le moteur s'exécute et il est gardé par des tests ; ses anciens chiffres publiés ont été retirés et ne sont pas remplacés ici. Ce n'est pas ce que la couche de continuité fait — ce n'est pas abandonné pour autant.

  • EXPERIMENTAL

    Serveur MCP en conditions réelles

    Sept outils testés en local, jamais branchés à un client MCP tiers.

  • PLANNED

    PostgreSQL et déploiement

    Migrations écrites, Docker et Caddy présents, aucun des deux exécuté ni validé.

  • PLANNED

    Embeddings sémantiques

    Le classement accepte un vrai modèle d'embeddings ; le défaut reste un hachage sans généralisation.

  • PLANNED

    Boucle de retour

    Les retours positifs et négatifs sont collectés, mais n'influencent pas encore le classement.

  • LIMIT

    Couche de gouvernance

    Elle existe dans le dépôt et n'est reliée ni à l'API, ni au SDK, ni au MCP. Elle n'est donc pas une fonctionnalité et n'est pas présentée comme telle.

Hypothèses

Ce que nous pensons sans l'avoir démontré

Formulé comme hypothèse parce que c'en est une. Rien ici ne doit être lu comme un résultat.

  • L'état pèse moins que l'historique

    Transmettre des objets typés devrait coûter moins qu'un dump de conversation, à qualité de reprise égale. Non mesuré.

  • Le coût réel est le travail défait

    Nous supposons que la perte de contexte coûte surtout en travail répété et en décisions annulées, plus qu'en tokens. Non mesuré.

  • Écrire est le point dur

    Nous supposons que la difficulté d'adoption est de faire écrire les agents au bon moment, pas de faire lire. À vérifier en pilote.

Construire une couche de continuité pour vos agents.

Décrivez votre workflow multi-agents et l'endroit où le contexte se perd. Nous répondons avec un périmètre de pilote, ou avec la raison pour laquelle Venkai n'est pas la bonne pièce.

Décrivez votre workflow