Aller au contenu
VENKAI

Benchmarks

SME Benchmark v0.1

v0.1 — 04/08/2026

Chaque chiffre de ce site nomme la commande qui le reproduit. Cette page est la méthodologie derrière ces commandes — dataset, environnement, et ce qui n'est pas encore mesuré.

Dataset

damage_lite300 : 455 cas de mutation injectée contre le monorepo de Venkai lui-même, 207 structurellement à portée de dégât. see_bench : un corpus de symboles réels tirés du même dépôt, pas des fixtures synthétiques.

Environnement

Exécution hors ligne, réseau désactivé, sur une seule base de code (le monorepo de Venkai). Aucune source envoyée ailleurs, aucune clé qui transite par Venkai.

Benchmarks

Ce qui est comparé

Deux bras, tous deux mesurés. Un troisième ne l'est pas — dit ici plutôt que passé sous silence.

Gouverné par SME : le modèle décrit une intention, SME résout l'ancre et applique une opération typée avec annulation en cas d'échec.

Non gouverné : le modèle édite directement — réécriture complète du fichier, diff unifié, ou écriture shell brute, sans résolution d'ancre ni annulation.

Pas encore mesuré : un bras LLM+RAG. Aucune référence par récupération augmentée n'a été exécutée sur ce dataset — cette comparaison, c'est la v0.2, pas une affirmation faite aujourd'hui.

Benchmarks

Comparative Metrics Matrix

Agent alone vs. Agent + RAG vs. Agent + SME. Unmeasured cells explicitly display 'Not measured yet'.

MetricAgent AloneAgent + RAGAgent + SME
Token Usage100% baseline (147 t/edit)Not measured yet-95.9% (19 t/edit)
Cost100% baselineNot measured yet-95.9% payload cost
Execution TimeBaseline latencyNot measured yetUnder 1s overhead
Intent AccuracyNot measured yetNot measured yetNot measured yet
Regression RiskNot measured yetNot measured yetNot measured yet
Silent Damage Rate53.6%Not measured yet0.5% (Enforced)

Silent damage rate — autonomous AI agent execution

0.5% vs 53.6%

Silent damage rate (Venkai governed vs direct agent)

Direct un-governed agent execution(silent damage rate)53.6%
Venkai governed execution channel(verified & recorded)0.5%

$ python benchmarks/edit_damage_bench.py --limit 300 --offline

Measured 2026-08-04. Measures unverified modifications, unauthorized data accesses, and policy violations that execute without raising runtime exceptions. Figures are the silent rate among cases where damage was structurally reachable (455 cases run, 207 in reach) — a narrower, harder number than the raw silent rate across all cases. Full breakdown: /benchmarks/.

Secondary metric — token payload efficiency per edit

−95.9%

token reduction per execution

Model rewrites whole file / symbol(raw output tokens)17,553
Venkai governed semantic call(governed delta)713

$ python benchmarks/see_bench.py --limit 25

Measured 2026-08-03. Measured token output reduction when passing governed semantic diffs versus full-file re-generation.

Benchmarks

Feuille de route v0.2

Un bras de comparaison par récupération augmentée (RAG), et un corpus tiré d'une base de code que Venkai ne possède pas.