Aller au contenu

Méthodologie du banc d'étalonnage prédictif : évaluation compétitive & décomposition de murphy


1. La nécessité d’un banc d’étalonnage compétitif en cybersécurité

Section intitulée « 1. La nécessité d’un banc d’étalonnage compétitif en cybersécurité »

En météorologie prédictive et en économétrie financière, les modèles rivalisent sur des classements standardisés avec une vérification publique continue. À l’inverse, l’évaluation du cyber-risque souffre historiquement de trois faiblesses structurelles :

  1. Corpus d’évaluation opaques : les éditeurs publient des livres blancs rétrospectifs valorisant les alertes réussies, tout en passant sous silence les faux positifs massifs et les zero-days critiques manqués.
  2. Métriques inappropriées : le « taux d’exactitude » (accuracy) est trivial à contourner. Dans un secteur où seules ~3% des vulnérabilités sont effectivement exploitées dans la nature, un modèle simpliste prédisant « Aucune exploitation » pour 100% des failles affiche 97% d’exactitude tout en offrant une valeur défensive nulle.
  3. Absence de références comparatives : les modèles propriétaires ne sont quasiment jamais mesurés en face-à-face contre des heuristiques publiques élémentaires comme l’EPSS du premier jour, les paliers CVSS ou le consensus de foule.

Le Protocole du Banc d’Étalonnage Hermes résout ces travers par un banc d’essai immuable, auditable et soumis à des critères d’arbitrage déterministes.


Consultez le classement officiel, inspectez les composantes Fiabilité-Résolution de Murphy ou injectez vos propres probabilités dans le bac à sable de défi :

Modèle Leader
Hermes Forecast Engine
#1 Score de Brier : 0.1043
Gain d'Information (BSS)
+58.3%
vs Hasard Naïf (0.2500)
Incertitude du Corpus (UNC)
0.16
UNC = ō(1 - ō) (5 cas)
Victoires vs EPSS Brut
80% (4/5)
Avantage prédictif précoce
📊

Classement Officiel des Modèles (Score de Brier & Compétence)

BENCH-2026-001
Rang Modèle Prédictif Score de Brier (BS) Compétence (BSS) Fiabilité (REL ↓) Résolution (RES ↑) Taux vs EPSS Catégorie
🥇 #1
Hermes Forecast Engine Champion
0.1043 +58.3% 0.001 0.0246 80% (4/5) ELITE (Superforecaster)
🥈 #2
Crowd Consensus Baseline Aggregated Human
0.1232 +50.7% 0.001 0.0216 80% (4/5) PROFICIENT
🥉 #3
CVSS Severity Heuristic Enterprise Standard
0.1751 +30% 0.0151 0 80% (4/5) PROFICIENT
#4
Uninformed Random Guess Coin Flip
0.25 0% 0.09 0 80% (4/5) BASELINE
#5
Raw EPSS First-Day Baseline Population-Wide
0.6223 -148.9% 0.4719 0.0096 0% UNCALIBRATED
📐

Décomposition de Murphy : Pourquoi Hermes surpasse les heuristiques ?

BS = REL - RES + UNC

La décomposition d'Allan H. Murphy (1973) sépare l'erreur de calibration pure (Fiabilité REL, à minimiser) du pouvoir réel de séparation des menaces (Résolution RES, à maximiser) face à l'incertitude inhérente du corpus (UNC).

Hermes Forecast Engine BS: 0.1043
Fiabilité (Pénalité REL ↓) 0.001
Résolution (Séparation RES ↑) 0.0246
Résolution maximale : discrimine immédiatement les vraies attaques des faux signaux sans dérive de calibration.
Crowd Consensus Baseline BS: 0.1232
Fiabilité (Pénalité REL ↓) 0.001
Résolution (Séparation RES ↑) 0.0216
Modèle de compromis intermédiaire.
CVSS Severity Heuristic BS: 0.1751
Fiabilité (Pénalité REL ↓) 0.0151
Résolution (Séparation RES ↑) 0
Forte résolution mais pénalité d'excès de confiance sur les faux positifs (ex: Langflow).
Uninformed Random Guess BS: 0.25
Fiabilité (Pénalité REL ↓) 0.09
Résolution (Séparation RES ↑) 0
Modèle de compromis intermédiaire.
Raw EPSS First-Day Baseline BS: 0.6223
Fiabilité (Pénalité REL ↓) 0.4719
Résolution (Séparation RES ↑) 0.0096
Pénalité de calibration massive sur CVEs précoces (scores initiaux trop comprimés).
⚔️

Comparateur Face-à-Face Cas par Cas

VS
🎮

Bac à Sable : Défiez le Leaderboard !

Saisissez vos propres estimations de probabilité sur les 5 cas résolus. Le banc calcule votre Score de Brier en temps réel et vous positionne immédiatement dans le classement face à Hermes, l'EPSS et le marché !

PRED-001 CVE-2026-76460 REALIZED (1)
DeepSeek-V3 LLM Prompt Execution CISA KEV Addition
Votre Prédiction : 50%
PRED-002 CVE-2026-75650 REALIZED (1)
StyleSmuggler E-Commerce CSS Injection Weaponization
Votre Prédiction : 50%
PRED-003 CVE-2025-3248 EXPIRED (0)
Langflow Sandbox Memory Corruption Mass Internet Scanning
Votre Prédiction : 50%
PRED-004 CVE-2025-26319 REALIZED (1)
AutoGPT Indirect Prompt Injection Shell Escape CISA KEV Listing
Votre Prédiction : 50%
PRED-005 CVE-2024-3400 REALIZED (1)
Palo Alto Networks PAN-OS Command Injection Mass Exploitation
Votre Prédiction : 50%
Votre Score de Brier : 0.2500 Rang Estimé : #4
Ajustez les curseurs ci-dessus pour battre Hermes (0.1043) !

3. Formulation mathématique : la décomposition de murphy du score de brier (1973)

Section intitulée « 3. Formulation mathématique : la décomposition de murphy du score de brier (1973) »

Pour une séquence de N événements empiriques binaires où o_i représente le résultat observé (o_i = 1 si exploité, 0 sinon) et f_i la probabilité prédite (0.0 <= f_i <= 1.0), le score moyen de Brier (BS) est défini par :

BS = (1 / N) * SUM_{i=1}^N (f_i - o_i)^2

Bien que le BS constitue une règle de score strictement propre (0.0000 représente la perfection absolue, 0.2500 représente un lancer de pièce non informé à 50/50), il agrège deux dimensions fondamentales de la compétence prévisionnelle :

  • La calibration (fiabilité) : lorsque le modèle annonce 70%, l’événement se produit-il réellement dans 70% des cas ?
  • La discrimination (résolution) : le modèle sait-il isoler les attaques imminentes du bruit de fond, ou se borne-t-il à réciter le taux de base historique ?

3.2 partitionnement des prédictions par classes de probabilité

Section intitulée « 3.2 partitionnement des prédictions par classes de probabilité »

Pour dissocier la calibration de la discrimination, Allan H. Murphy (1973) a partitionné l’ensemble des prédictions en K classes distinctes de probabilité f_k (pour k = 1, ..., K). Soient :

  • n_k le nombre de prévisions émises dans la catégorie f_k, tel que SUM_{k=1}^K n_k = N.
  • o_bar_k la fréquence empirique observée des événements au sein de la catégorie k :
o_bar_k = (1 / n_k) * SUM_{i in k} o_i
  • o_bar le taux moyen global de l’échantillon (fréquence de base climatologique) :
o_bar = (1 / N) * SUM_{i=1}^N o_i

3.3 les trois composantes de la décomposition de murphy

Section intitulée « 3.3 les trois composantes de la décomposition de murphy »

Murphy a démontré que le score de Brier se décompose algébriquement de façon exacte :

BS = Fiabilite (REL) - Resolution (RES) + Incertitude (UNC)

Composante 1 : la fiabilité (REL) — la pénalité de calibration

Section intitulée « Composante 1 : la fiabilité (REL) — la pénalité de calibration »
REL = (1 / N) * SUM_{k=1}^K n_k * (f_k - o_bar_k)^2
  • Interprétation : mesure l’écart quadratique pondéré entre la probabilité annoncée f_k et la fréquence réelle constatée o_bar_k.
  • Objectif : tout prévisionniste cherche à minimiser REL. Un modèle parfaitement étalonné présente un REL = 0.0000.
  • Contexte cyber : une pénalité REL élevée sanctionne une sur-confiance dangereuse (ex. prédire 95% pour des menaces qui ne frappent que dans 50% des cas) ou un pessimisme disproportionné.

Composante 2 : la résolution (RES) — le pouvoir de discrimination de la menace

Section intitulée « Composante 2 : la résolution (RES) — le pouvoir de discrimination de la menace »
RES = (1 / N) * SUM_{k=1}^K n_k * (o_bar_k - o_bar)^2
  • Interprétation : mesure la distance entre les fréquences conditionnelles des catégories o_bar_k et la fréquence de base globale o_bar.
  • Objectif : le prévisionniste cherche à maximiser RES. Un modèle qui prédirait simplement le taux de base moyen o_bar pour chaque CVE obtient un RES = 0.0000.
  • Contexte cyber : c’est la haute résolution que recherchent les équipes opérationnelles (SOC/CERT). Un modèle à haute résolution sait isoler les attaques imminentes à probabilité extrême du bruit ambiant.

Composante 3 : l’incertitude (UNC) — l’entropie inhérente au domaine

Section intitulée « Composante 3 : l’incertitude (UNC) — l’entropie inhérente au domaine »
UNC = o_bar * (1 - o_bar)
  • Interprétation : représente la variance intrinsèque des événements empiriques du corpus évalué.
  • Propriété : UNC est totalement indépendant du modèle évalué. Si toutes les CVE sont exploitées (o_bar = 1) ou si aucune ne l’est (o_bar = 0), UNC = 0. Si la moitié l’est (o_bar = 0.5), UNC = 0.2500 (entropie maximale).

Pour mesurer le surcroît de compétence d’un modèle par rapport à une référence non informée, nous calculons le Brier Skill Score (BSS) :

BSS = 1 - (BS_modele / BS_reference)

Où BS_reference est le score de référence standard (ex. le tirage à pile ou face BS_ref = 0.2500, ou la base climatologique BS_clim = o_bar * (1 - o_bar)) :

  • BSS = 1.0 (+100%) : clairvoyance déterministe parfaite.
  • BSS > 0.0 (> 0%) : performance supérieure à la référence non informée.
  • BSS = 0.0 (0%) : compétence nulle par rapport à la référence.
  • BSS < 0.0 (< 0%) : performance dégradée, inférieure à un simple tirage aléatoire ou à la moyenne de base.

5. Matrice des confrontations directes (Face-à-Face)

Section intitulée « 5. Matrice des confrontations directes (Face-à-Face) »

Pour vérifier la supériorité statistique entre deux modèles M_A et M_B, le banc d’étalonnage calcule l’écart de pénalité cas par cas :

Delta_i = BS_i(M_A) - BS_i(M_B) = (f_{i,A} - o_i)^2 - (f_{i,B} - o_i)^2

Avec un seuil de tolérance epsilon = 0.005 :

  • Victoire modèle a : Delta_i < -epsilon (M_A subit une pénalité moindre)
  • Victoire modèle b : Delta_i > +epsilon (M_B subit une pénalité moindre)
  • Égalité : |Delta_i| <= epsilon

Le taux de victoire W_{A,B} est calculé sur les cas départagés :

W_{A,B} = (Victoires_A / (Victoires_A + Victoires_B)) * 100%

6. Analyse comparative des modèles de référence

Section intitulée « 6. Analyse comparative des modèles de référence »

Le banc d’étalonnage évalue cinq archétypes prédictifs distincts :

graph TD
A["Corpus d'Événements Historiques"] --> B["HFE-v2.0 : Génome Multimodal + Trajectoire"]
A --> C["EPSS-RAW : Référence FIRST.org Globale"]
A --> D["CVSS-HEURISTIC : Règle Métier Entreprise"]
A --> E["CROWD-WISDOM : Consensus Communautaire"]
A --> F["RANDOM-BASELINE : Lancer de Pièce 50/50"]
B --> G["Moteur de Calcul du Score de Brier"]
C --> G
D --> G
E --> G
F --> G
G --> H["Décomposition de Murphy : REL, RES, UNC"]
G --> I["Confrontations Directes Pair à Pair"]
G --> J["API REST Publique du Classement"]

6.1 le piège de sur-confiance de l’heuristique CVSS

Section intitulée « 6.1 le piège de sur-confiance de l’heuristique CVSS »

Les équipes de gestion des risques d’entreprise assimilent fréquemment le score CVSS de base à une probabilité d’exploitation :

  • Critique (9.0 - 10.0) implique 90-95%
  • Élevé (7.0 - 8.9) implique 70-80%

Si cette règle empirique dégage une Résolution positive (RES ≈ 0.07) en discriminant les failles sévères des failles mineures, elle subit une pénalité de Fiabilité catastrophique (REL ≈ 0.16). Comme seule une minorité des CVE classées 9+ subit une exploitation effective dans la nature, attribuer P = 0.95 à des failles non exploitées engendre d’immenses pénalités :

(0.95 - 0)^2 = 0.9025

6.2 le paradoxe de dilution de l’EPSS brut sur les zero-days

Section intitulée « 6.2 le paradoxe de dilution de l’EPSS brut sur les zero-days »

Le modèle EPSS de FIRST.org est entraîné sur des centaines de milliers de vulnérabilités accumulées sur des décennies. Ainsi, au premier jour de divulgation d’un zero-day (avant l’apparition de traces de scans massifs dans les honeypots), l’EPSS affiche des probabilités très conservatrices, souvent entre 0.04 et 0.15.

Lorsqu’un exploit d’exécution de code à distance non authentifié est militarisé en 48 heures par des groupes étatiques (o_i = 1), une prédiction de P = 0.07 subit une pénalité (0.07 - 1)^2 = 0.8649. Cela explique le score BSS négatif de l’EPSS brut sur les zero-days cinétiques, là où l’analyse du Génome de Vulnérabilité d’Hermes isole immédiatement les catalyseurs structurels d’exploitabilité.


7. Architecture des données ouvertes et vérification

Section intitulée « 7. Architecture des données ouvertes et vérification »

Conformément au Principe P8 (Priorité Statique & Reproductibilité Long Terme), l’ensemble du banc d’étalonnage est généré statiquement à la compilation sous forme d’artefacts JSON :

Point de terminaisonContenu
/api/benchmark/index.jsonMétadonnées globales, matrice des événements, prévisions et statistiques de synthèse.
/api/benchmark/leaderboard.jsonClassement officiel ordonné par score moyen de Brier et décomposition de Murphy.
/api/benchmark/models.jsonFiches détaillées des modèles, mécanismes d’inférence et historique des duels.

Le schéma de validation est vérifié rigoureusement via data/schemas/benchmark.schema.json lors de l’intégration continue.