Aller au contenu

Banc d'étalonnage prédictif Hermes : leaderboard compétitif des modèles


Explorez le classement officiel des modèles, comparez des confrontations en face-à-face, analysez la décomposition de Murphy ou saisissez vos propres prévisions dans le bac à sable :

Modèle Leader
Hermes Forecast Engine
#1 Score de Brier : 0.1043
Gain d'Information (BSS)
+58.3%
vs Hasard Naïf (0.2500)
Incertitude du Corpus (UNC)
0.16
UNC = ō(1 - ō) (5 cas)
Victoires vs EPSS Brut
80% (4/5)
Avantage prédictif précoce
📊

Classement Officiel des Modèles (Score de Brier & Compétence)

BENCH-2026-001
Rang Modèle Prédictif Score de Brier (BS) Compétence (BSS) Fiabilité (REL ↓) Résolution (RES ↑) Taux vs EPSS Catégorie
🥇 #1
Hermes Forecast Engine Champion
0.1043 +58.3% 0.001 0.0246 80% (4/5) ELITE (Superforecaster)
🥈 #2
Crowd Consensus Baseline Aggregated Human
0.1232 +50.7% 0.001 0.0216 80% (4/5) PROFICIENT
🥉 #3
CVSS Severity Heuristic Enterprise Standard
0.1751 +30% 0.0151 0 80% (4/5) PROFICIENT
#4
Uninformed Random Guess Coin Flip
0.25 0% 0.09 0 80% (4/5) BASELINE
#5
Raw EPSS First-Day Baseline Population-Wide
0.6223 -148.9% 0.4719 0.0096 0% UNCALIBRATED
📐

Décomposition de Murphy : Pourquoi Hermes surpasse les heuristiques ?

BS = REL - RES + UNC

La décomposition d'Allan H. Murphy (1973) sépare l'erreur de calibration pure (Fiabilité REL, à minimiser) du pouvoir réel de séparation des menaces (Résolution RES, à maximiser) face à l'incertitude inhérente du corpus (UNC).

Hermes Forecast Engine BS: 0.1043
Fiabilité (Pénalité REL ↓) 0.001
Résolution (Séparation RES ↑) 0.0246
Résolution maximale : discrimine immédiatement les vraies attaques des faux signaux sans dérive de calibration.
Crowd Consensus Baseline BS: 0.1232
Fiabilité (Pénalité REL ↓) 0.001
Résolution (Séparation RES ↑) 0.0216
Modèle de compromis intermédiaire.
CVSS Severity Heuristic BS: 0.1751
Fiabilité (Pénalité REL ↓) 0.0151
Résolution (Séparation RES ↑) 0
Forte résolution mais pénalité d'excès de confiance sur les faux positifs (ex: Langflow).
Uninformed Random Guess BS: 0.25
Fiabilité (Pénalité REL ↓) 0.09
Résolution (Séparation RES ↑) 0
Modèle de compromis intermédiaire.
Raw EPSS First-Day Baseline BS: 0.6223
Fiabilité (Pénalité REL ↓) 0.4719
Résolution (Séparation RES ↑) 0.0096
Pénalité de calibration massive sur CVEs précoces (scores initiaux trop comprimés).
⚔️

Comparateur Face-à-Face Cas par Cas

VS
🎮

Bac à Sable : Défiez le Leaderboard !

Saisissez vos propres estimations de probabilité sur les 5 cas résolus. Le banc calcule votre Score de Brier en temps réel et vous positionne immédiatement dans le classement face à Hermes, l'EPSS et le marché !

PRED-001 CVE-2026-76460 REALIZED (1)
DeepSeek-V3 LLM Prompt Execution CISA KEV Addition
Votre Prédiction : 50%
PRED-002 CVE-2026-75650 REALIZED (1)
StyleSmuggler E-Commerce CSS Injection Weaponization
Votre Prédiction : 50%
PRED-003 CVE-2025-3248 EXPIRED (0)
Langflow Sandbox Memory Corruption Mass Internet Scanning
Votre Prédiction : 50%
PRED-004 CVE-2025-26319 REALIZED (1)
AutoGPT Indirect Prompt Injection Shell Escape CISA KEV Listing
Votre Prédiction : 50%
PRED-005 CVE-2024-3400 REALIZED (1)
Palo Alto Networks PAN-OS Command Injection Mass Exploitation
Votre Prédiction : 50%
Votre Score de Brier : 0.2500 Rang Estimé : #4
Ajustez les curseurs ci-dessus pour battre Hermes (0.1043) !

1. Pourquoi la cybersécurité a besoin d’un banc d’étalonnage public

Section intitulée « 1. Pourquoi la cybersécurité a besoin d’un banc d’étalonnage public »

Le renseignement sur les cybermenaces (CTI) a trop longtemps opéré dans un vide de responsabilité empirique :

  1. Évaluations unilatérales : les éditeurs évaluent leurs modèles sur des corpus propriétaires, sélectionnés après coup (cherry-picking).
  2. Échecs dissimulés : quand des alertes critiques ne se matérialisent jamais, elles sont discrètement éludées des communications commerciales.
  3. Comparaisons trompeuses : des métriques aux horizons incompatibles (probabilité à vie vs fenêtre de 30 jours) sont régulièrement confondues.

Le Banc d’Étalonnage Prédictif Hermes lève ces ambiguïtés selon quatre principes stricts :

  • Corpus d’événements identique : tous les modèles sont évalués sur le même ensemble de CVE résolues avec des dates d’observation identiques.
  • Règle de score strictement propre : le score de Brier (BS) empêche tout contournement opportuniste (sur-enchère ou couverture artificielle).
  • API REST ouverte : l’intégralité des prédictions, scores et duels est exportée de manière statique sur /api/benchmark/index.json.

Le banc d’essai suit cinq paradigmes prédictifs distincts, algorithmiques et humains :

IdentifiantModèleCatégorieMécanisme principal
HFE-v2.0Hermes forecast engineIA AgentiqueTélémétrie multimodale, décomposition structurelle en 6 locus du Génome de Vulnérabilité, et trajectoire de risque cinétique.
CROWD-WISDOMConsensus de fouleAgrégation HumaineAgrégation d’experts communautaires simulant les panels Metaculus et Good Judgment Project.
CVSS-HEURISTICHeuristique CVSS d’entrepriseRéférence MétierRègle courante en entreprise assimilant la sévérité CVSS v3.1 brute à une probabilité (Critique $\implies 90-95%$).
RANDOM-BASELINELancer de pièce non informéPlancher StatistiqueProbabilité constante à 50/50 (P = 0.50, BS = 0.2500 constant).
EPSS-RAWEPSS brut du premier jourRéférence GlobaleProbabilité brute EPSS v3 publiée par FIRST.org au premier jour de divulgation de la CVE.

3. Pourquoi l’EPSS brut sous-performe sur les zero-days (le paradoxe de la référence)

Section intitulée « 3. Pourquoi l’EPSS brut sous-performe sur les zero-days (le paradoxe de la référence) »

Une interrogation fréquente est : « Pourquoi l’EPSS brut affiche-t-il un Brier Skill Score négatif (-148.9%) sur les CVE critiques émergentes ? »

L’explication réside dans la dilution par le taux de base (base-rate dilution) :

  • L’EPSS est optimisé pour classer plus de 250 000 CVE historiques à l’échelle de l’écosystème logiciel global, où le taux moyen d’exploitation réelle est inférieur à 3%.
  • En conséquence, lorsqu’un zero-day critique est divulgué (ex. Cisco SEG CVE-2026-76461 ou DeepSeek CVE-2026-76460), le modèle EPSS au jour J attribue des probabilités très prudentes (entre 0.04 et 0.15), en attendant la détection de scans massifs dans les pots de miel plusieurs semaines plus tard.
  • Lorsqu’un exploit distant non authentifié est militarisé en 48 heures, une prédiction de P = 0.07 subit une pénalité de Brier sévère :
BS_i = (0.07 - 1)^2 = 0.8649

Hermes HFE intègre le Génome de Vulnérabilité (faiblesse structurelle de l’architecture) et la Trajectoire de Menace (signaux précurseurs sur les canaux d’échange), prédisant par exemple P = 0.88 (BS_i = 0.0144) et surclassant l’EPSS brut sur 80% des zero-days critiques récents.


Les données du banc d’étalonnage sont compilées statiquement pour les chercheurs et les chaînes d’évaluation automatisées :

Fenêtre de terminal
# Récupérer le classement actuel du benchmark via CLI
curl -s https://hermes-codex.vercel.app/api/benchmark/leaderboard.json | jq .