Banc d'étalonnage prédictif Hermes : leaderboard compétitif des modèles
Banc d’essai interactif de l’étalonnage
Section intitulée « Banc d’essai interactif de l’étalonnage »Explorez le classement officiel des modèles, comparez des confrontations en face-à-face, analysez la décomposition de Murphy ou saisissez vos propres prévisions dans le bac à sable :
Classement Officiel des Modèles (Score de Brier & Compétence)
| Rang | Modèle Prédictif | Score de Brier (BS) | Compétence (BSS) | Fiabilité (REL ↓) | Résolution (RES ↑) | Taux vs EPSS | Catégorie |
|---|---|---|---|---|---|---|---|
| 🥇 #1 | Hermes Forecast Engine Champion | 0.1043 | +58.3% | 0.001 | 0.0246 | 80% (4/5) | ELITE (Superforecaster) |
| 🥈 #2 | Crowd Consensus Baseline Aggregated Human | 0.1232 | +50.7% | 0.001 | 0.0216 | 80% (4/5) | PROFICIENT |
| 🥉 #3 | CVSS Severity Heuristic Enterprise Standard | 0.1751 | +30% | 0.0151 | 0 | 80% (4/5) | PROFICIENT |
| #4 | Uninformed Random Guess Coin Flip | 0.25 | 0% | 0.09 | 0 | 80% (4/5) | BASELINE |
| #5 | Raw EPSS First-Day Baseline Population-Wide | 0.6223 | -148.9% | 0.4719 | 0.0096 | 0% | UNCALIBRATED |
Décomposition de Murphy : Pourquoi Hermes surpasse les heuristiques ?
La décomposition d'Allan H. Murphy (1973) sépare l'erreur de calibration pure (Fiabilité REL, à minimiser) du pouvoir réel de séparation des menaces (Résolution RES, à maximiser) face à l'incertitude inhérente du corpus (UNC).
Comparateur Face-à-Face Cas par Cas
Bac à Sable : Défiez le Leaderboard !
Saisissez vos propres estimations de probabilité sur les 5 cas résolus. Le banc calcule votre Score de Brier en temps réel et vous positionne immédiatement dans le classement face à Hermes, l'EPSS et le marché !
1. Pourquoi la cybersécurité a besoin d’un banc d’étalonnage public
Section intitulée « 1. Pourquoi la cybersécurité a besoin d’un banc d’étalonnage public »Le renseignement sur les cybermenaces (CTI) a trop longtemps opéré dans un vide de responsabilité empirique :
- Évaluations unilatérales : les éditeurs évaluent leurs modèles sur des corpus propriétaires, sélectionnés après coup (cherry-picking).
- Échecs dissimulés : quand des alertes critiques ne se matérialisent jamais, elles sont discrètement éludées des communications commerciales.
- Comparaisons trompeuses : des métriques aux horizons incompatibles (probabilité à vie vs fenêtre de 30 jours) sont régulièrement confondues.
Le Banc d’Étalonnage Prédictif Hermes lève ces ambiguïtés selon quatre principes stricts :
- Corpus d’événements identique : tous les modèles sont évalués sur le même ensemble de CVE résolues avec des dates d’observation identiques.
- Règle de score strictement propre : le score de Brier (
BS) empêche tout contournement opportuniste (sur-enchère ou couverture artificielle). - API REST ouverte : l’intégralité des prédictions, scores et duels est exportée de manière statique sur
/api/benchmark/index.json.
2. Les modèles en compétition
Section intitulée « 2. Les modèles en compétition »Le banc d’essai suit cinq paradigmes prédictifs distincts, algorithmiques et humains :
| Identifiant | Modèle | Catégorie | Mécanisme principal |
|---|---|---|---|
HFE-v2.0 | Hermes forecast engine | IA Agentique | Télémétrie multimodale, décomposition structurelle en 6 locus du Génome de Vulnérabilité, et trajectoire de risque cinétique. |
CROWD-WISDOM | Consensus de foule | Agrégation Humaine | Agrégation d’experts communautaires simulant les panels Metaculus et Good Judgment Project. |
CVSS-HEURISTIC | Heuristique CVSS d’entreprise | Référence Métier | Règle courante en entreprise assimilant la sévérité CVSS v3.1 brute à une probabilité (Critique $\implies 90-95%$). |
RANDOM-BASELINE | Lancer de pièce non informé | Plancher Statistique | Probabilité constante à 50/50 (P = 0.50, BS = 0.2500 constant). |
EPSS-RAW | EPSS brut du premier jour | Référence Globale | Probabilité brute EPSS v3 publiée par FIRST.org au premier jour de divulgation de la CVE. |
3. Pourquoi l’EPSS brut sous-performe sur les zero-days (le paradoxe de la référence)
Section intitulée « 3. Pourquoi l’EPSS brut sous-performe sur les zero-days (le paradoxe de la référence) »Une interrogation fréquente est : « Pourquoi l’EPSS brut affiche-t-il un Brier Skill Score négatif (-148.9%) sur les CVE critiques émergentes ? »
L’explication réside dans la dilution par le taux de base (base-rate dilution) :
- L’EPSS est optimisé pour classer plus de 250 000 CVE historiques à l’échelle de l’écosystème logiciel global, où le taux moyen d’exploitation réelle est inférieur à 3%.
- En conséquence, lorsqu’un zero-day critique est divulgué (ex. Cisco SEG
CVE-2026-76461ou DeepSeekCVE-2026-76460), le modèle EPSS au jour J attribue des probabilités très prudentes (entre0.04et0.15), en attendant la détection de scans massifs dans les pots de miel plusieurs semaines plus tard. - Lorsqu’un exploit distant non authentifié est militarisé en 48 heures, une prédiction de
P = 0.07subit une pénalité de Brier sévère :
BS_i = (0.07 - 1)^2 = 0.8649Hermes HFE intègre le Génome de Vulnérabilité (faiblesse structurelle de l’architecture) et la Trajectoire de Menace (signaux précurseurs sur les canaux d’échange), prédisant par exemple P = 0.88 (BS_i = 0.0144) et surclassant l’EPSS brut sur 80% des zero-days critiques récents.
4. Accès par API REST
Section intitulée « 4. Accès par API REST »Les données du banc d’étalonnage sont compilées statiquement pour les chercheurs et les chaînes d’évaluation automatisées :
- Catalogue et matrice complète :
/api/benchmark/index.json - Classement officiel (leaderboard) :
/api/benchmark/leaderboard.json - Fiches détaillées des modèles :
/api/benchmark/models.json
# Récupérer le classement actuel du benchmark via CLIcurl -s https://hermes-codex.vercel.app/api/benchmark/leaderboard.json | jq .