Benchmarks
SME Benchmark v0.1
v0.1 — 04/08/2026
Chaque chiffre de ce site nomme la commande qui le reproduit. Cette page est la méthodologie derrière ces commandes — dataset, environnement, et ce qui n'est pas encore mesuré.
Dataset
damage_lite300 : 455 cas de mutation injectée contre le monorepo de Venkai lui-même, 207 structurellement à portée de dégât. see_bench : un corpus de symboles réels tirés du même dépôt, pas des fixtures synthétiques.
Environnement
Exécution hors ligne, réseau désactivé, sur une seule base de code (le monorepo de Venkai). Aucune source envoyée ailleurs, aucune clé qui transite par Venkai.
Benchmarks
Ce qui est comparé
Deux bras, tous deux mesurés. Un troisième ne l'est pas — dit ici plutôt que passé sous silence.
Gouverné par SME : le modèle décrit une intention, SME résout l'ancre et applique une opération typée avec annulation en cas d'échec.
Non gouverné : le modèle édite directement — réécriture complète du fichier, diff unifié, ou écriture shell brute, sans résolution d'ancre ni annulation.
Pas encore mesuré : un bras LLM+RAG. Aucune référence par récupération augmentée n'a été exécutée sur ce dataset — cette comparaison, c'est la v0.2, pas une affirmation faite aujourd'hui.
Benchmarks
Comparative Metrics Matrix
Agent alone vs. Agent + RAG vs. Agent + SME. Unmeasured cells explicitly display 'Not measured yet'.
| Metric | Agent Alone | Agent + RAG | Agent + SME |
|---|---|---|---|
| Token Usage | 100% baseline (147 t/edit) | Not measured yet | -95.9% (19 t/edit) |
| Cost | 100% baseline | Not measured yet | -95.9% payload cost |
| Execution Time | Baseline latency | Not measured yet | Under 1s overhead |
| Intent Accuracy | Not measured yet | Not measured yet | Not measured yet |
| Regression Risk | Not measured yet | Not measured yet | Not measured yet |
| Silent Damage Rate | 53.6% | Not measured yet | 0.5% (Enforced) |
Silent damage rate — autonomous AI agent execution
0.5% vs 53.6%
Silent damage rate (Venkai governed vs direct agent)
| Direct un-governed agent execution(silent damage rate) | 53.6% |
|---|---|
| Venkai governed execution channel(verified & recorded) | 0.5% |
$ python benchmarks/edit_damage_bench.py --limit 300 --offline
Measured 2026-08-04. Measures unverified modifications, unauthorized data accesses, and policy violations that execute without raising runtime exceptions. Figures are the silent rate among cases where damage was structurally reachable (455 cases run, 207 in reach) — a narrower, harder number than the raw silent rate across all cases. Full breakdown: /benchmarks/.
Secondary metric — token payload efficiency per edit
−95.9%
token reduction per execution
| Model rewrites whole file / symbol(raw output tokens) | 17,553 |
|---|---|
| Venkai governed semantic call(governed delta) | 713 |
$ python benchmarks/see_bench.py --limit 25
Measured 2026-08-03. Measured token output reduction when passing governed semantic diffs versus full-file re-generation.
Benchmarks
Feuille de route v0.2
Un bras de comparaison par récupération augmentée (RAG), et un corpus tiré d'une base de code que Venkai ne possède pas.