Méthodologie du banc d'étalonnage prédictif : évaluation compétitive & décomposition de murphy
1. La nécessité d’un banc d’étalonnage compétitif en cybersécurité
Section intitulée « 1. La nécessité d’un banc d’étalonnage compétitif en cybersécurité »En météorologie prédictive et en économétrie financière, les modèles rivalisent sur des classements standardisés avec une vérification publique continue. À l’inverse, l’évaluation du cyber-risque souffre historiquement de trois faiblesses structurelles :
- Corpus d’évaluation opaques : les éditeurs publient des livres blancs rétrospectifs valorisant les alertes réussies, tout en passant sous silence les faux positifs massifs et les zero-days critiques manqués.
- Métriques inappropriées : le « taux d’exactitude » (accuracy) est trivial à contourner. Dans un secteur où seules ~3% des vulnérabilités sont effectivement exploitées dans la nature, un modèle simpliste prédisant « Aucune exploitation » pour 100% des failles affiche 97% d’exactitude tout en offrant une valeur défensive nulle.
- Absence de références comparatives : les modèles propriétaires ne sont quasiment jamais mesurés en face-à-face contre des heuristiques publiques élémentaires comme l’EPSS du premier jour, les paliers CVSS ou le consensus de foule.
Le Protocole du Banc d’Étalonnage Hermes résout ces travers par un banc d’essai immuable, auditable et soumis à des critères d’arbitrage déterministes.
2. Banc d’essai interactif de l’étalonnage
Section intitulée « 2. Banc d’essai interactif de l’étalonnage »Consultez le classement officiel, inspectez les composantes Fiabilité-Résolution de Murphy ou injectez vos propres probabilités dans le bac à sable de défi :
Classement Officiel des Modèles (Score de Brier & Compétence)
| Rang | Modèle Prédictif | Score de Brier (BS) | Compétence (BSS) | Fiabilité (REL ↓) | Résolution (RES ↑) | Taux vs EPSS | Catégorie |
|---|---|---|---|---|---|---|---|
| 🥇 #1 | Hermes Forecast Engine Champion | 0.1043 | +58.3% | 0.001 | 0.0246 | 80% (4/5) | ELITE (Superforecaster) |
| 🥈 #2 | Crowd Consensus Baseline Aggregated Human | 0.1232 | +50.7% | 0.001 | 0.0216 | 80% (4/5) | PROFICIENT |
| 🥉 #3 | CVSS Severity Heuristic Enterprise Standard | 0.1751 | +30% | 0.0151 | 0 | 80% (4/5) | PROFICIENT |
| #4 | Uninformed Random Guess Coin Flip | 0.25 | 0% | 0.09 | 0 | 80% (4/5) | BASELINE |
| #5 | Raw EPSS First-Day Baseline Population-Wide | 0.6223 | -148.9% | 0.4719 | 0.0096 | 0% | UNCALIBRATED |
Décomposition de Murphy : Pourquoi Hermes surpasse les heuristiques ?
La décomposition d'Allan H. Murphy (1973) sépare l'erreur de calibration pure (Fiabilité REL, à minimiser) du pouvoir réel de séparation des menaces (Résolution RES, à maximiser) face à l'incertitude inhérente du corpus (UNC).
Comparateur Face-à-Face Cas par Cas
Bac à Sable : Défiez le Leaderboard !
Saisissez vos propres estimations de probabilité sur les 5 cas résolus. Le banc calcule votre Score de Brier en temps réel et vous positionne immédiatement dans le classement face à Hermes, l'EPSS et le marché !
3. Formulation mathématique : la décomposition de murphy du score de brier (1973)
Section intitulée « 3. Formulation mathématique : la décomposition de murphy du score de brier (1973) »3.1 le score de brier classique
Section intitulée « 3.1 le score de brier classique »Pour une séquence de N événements empiriques binaires où o_i représente le résultat observé (o_i = 1 si exploité, 0 sinon) et f_i la probabilité prédite (0.0 <= f_i <= 1.0), le score moyen de Brier (BS) est défini par :
BS = (1 / N) * SUM_{i=1}^N (f_i - o_i)^2Bien que le BS constitue une règle de score strictement propre (0.0000 représente la perfection absolue, 0.2500 représente un lancer de pièce non informé à 50/50), il agrège deux dimensions fondamentales de la compétence prévisionnelle :
- La calibration (fiabilité) : lorsque le modèle annonce 70%, l’événement se produit-il réellement dans 70% des cas ?
- La discrimination (résolution) : le modèle sait-il isoler les attaques imminentes du bruit de fond, ou se borne-t-il à réciter le taux de base historique ?
3.2 partitionnement des prédictions par classes de probabilité
Section intitulée « 3.2 partitionnement des prédictions par classes de probabilité »Pour dissocier la calibration de la discrimination, Allan H. Murphy (1973) a partitionné l’ensemble des prédictions en K classes distinctes de probabilité f_k (pour k = 1, ..., K). Soient :
n_kle nombre de prévisions émises dans la catégorief_k, tel queSUM_{k=1}^K n_k = N.o_bar_kla fréquence empirique observée des événements au sein de la catégoriek:
o_bar_k = (1 / n_k) * SUM_{i in k} o_io_barle taux moyen global de l’échantillon (fréquence de base climatologique) :
o_bar = (1 / N) * SUM_{i=1}^N o_i3.3 les trois composantes de la décomposition de murphy
Section intitulée « 3.3 les trois composantes de la décomposition de murphy »Murphy a démontré que le score de Brier se décompose algébriquement de façon exacte :
BS = Fiabilite (REL) - Resolution (RES) + Incertitude (UNC)Composante 1 : la fiabilité (REL) — la pénalité de calibration
Section intitulée « Composante 1 : la fiabilité (REL) — la pénalité de calibration »REL = (1 / N) * SUM_{k=1}^K n_k * (f_k - o_bar_k)^2- Interprétation : mesure l’écart quadratique pondéré entre la probabilité annoncée
f_ket la fréquence réelle constatéeo_bar_k. - Objectif : tout prévisionniste cherche à minimiser
REL. Un modèle parfaitement étalonné présente unREL = 0.0000. - Contexte cyber : une pénalité
RELélevée sanctionne une sur-confiance dangereuse (ex. prédire 95% pour des menaces qui ne frappent que dans 50% des cas) ou un pessimisme disproportionné.
Composante 2 : la résolution (RES) — le pouvoir de discrimination de la menace
Section intitulée « Composante 2 : la résolution (RES) — le pouvoir de discrimination de la menace »RES = (1 / N) * SUM_{k=1}^K n_k * (o_bar_k - o_bar)^2- Interprétation : mesure la distance entre les fréquences conditionnelles des catégories
o_bar_ket la fréquence de base globaleo_bar. - Objectif : le prévisionniste cherche à maximiser
RES. Un modèle qui prédirait simplement le taux de base moyeno_barpour chaque CVE obtient unRES = 0.0000. - Contexte cyber : c’est la haute résolution que recherchent les équipes opérationnelles (SOC/CERT). Un modèle à haute résolution sait isoler les attaques imminentes à probabilité extrême du bruit ambiant.
Composante 3 : l’incertitude (UNC) — l’entropie inhérente au domaine
Section intitulée « Composante 3 : l’incertitude (UNC) — l’entropie inhérente au domaine »UNC = o_bar * (1 - o_bar)- Interprétation : représente la variance intrinsèque des événements empiriques du corpus évalué.
- Propriété :
UNCest totalement indépendant du modèle évalué. Si toutes les CVE sont exploitées (o_bar = 1) ou si aucune ne l’est (o_bar = 0),UNC = 0. Si la moitié l’est (o_bar = 0.5),UNC = 0.2500(entropie maximale).
4. Le brier skill score (BSS)
Section intitulée « 4. Le brier skill score (BSS) »Pour mesurer le surcroît de compétence d’un modèle par rapport à une référence non informée, nous calculons le Brier Skill Score (BSS) :
BSS = 1 - (BS_modele / BS_reference)Où BS_reference est le score de référence standard (ex. le tirage à pile ou face BS_ref = 0.2500, ou la base climatologique BS_clim = o_bar * (1 - o_bar)) :
BSS = 1.0(+100%) : clairvoyance déterministe parfaite.BSS > 0.0(> 0%) : performance supérieure à la référence non informée.BSS = 0.0(0%) : compétence nulle par rapport à la référence.BSS < 0.0(< 0%) : performance dégradée, inférieure à un simple tirage aléatoire ou à la moyenne de base.
5. Matrice des confrontations directes (Face-à-Face)
Section intitulée « 5. Matrice des confrontations directes (Face-à-Face) »Pour vérifier la supériorité statistique entre deux modèles M_A et M_B, le banc d’étalonnage calcule l’écart de pénalité cas par cas :
Delta_i = BS_i(M_A) - BS_i(M_B) = (f_{i,A} - o_i)^2 - (f_{i,B} - o_i)^2Avec un seuil de tolérance epsilon = 0.005 :
- Victoire modèle a :
Delta_i < -epsilon(M_Asubit une pénalité moindre) - Victoire modèle b :
Delta_i > +epsilon(M_Bsubit une pénalité moindre) - Égalité :
|Delta_i| <= epsilon
Le taux de victoire W_{A,B} est calculé sur les cas départagés :
W_{A,B} = (Victoires_A / (Victoires_A + Victoires_B)) * 100%6. Analyse comparative des modèles de référence
Section intitulée « 6. Analyse comparative des modèles de référence »Le banc d’étalonnage évalue cinq archétypes prédictifs distincts :
graph TD A["Corpus d'Événements Historiques"] --> B["HFE-v2.0 : Génome Multimodal + Trajectoire"] A --> C["EPSS-RAW : Référence FIRST.org Globale"] A --> D["CVSS-HEURISTIC : Règle Métier Entreprise"] A --> E["CROWD-WISDOM : Consensus Communautaire"] A --> F["RANDOM-BASELINE : Lancer de Pièce 50/50"]
B --> G["Moteur de Calcul du Score de Brier"] C --> G D --> G E --> G F --> G
G --> H["Décomposition de Murphy : REL, RES, UNC"] G --> I["Confrontations Directes Pair à Pair"] G --> J["API REST Publique du Classement"]6.1 le piège de sur-confiance de l’heuristique CVSS
Section intitulée « 6.1 le piège de sur-confiance de l’heuristique CVSS »Les équipes de gestion des risques d’entreprise assimilent fréquemment le score CVSS de base à une probabilité d’exploitation :
- Critique (9.0 - 10.0) implique 90-95%
- Élevé (7.0 - 8.9) implique 70-80%
Si cette règle empirique dégage une Résolution positive (RES ≈ 0.07) en discriminant les failles sévères des failles mineures, elle subit une pénalité de Fiabilité catastrophique (REL ≈ 0.16). Comme seule une minorité des CVE classées 9+ subit une exploitation effective dans la nature, attribuer P = 0.95 à des failles non exploitées engendre d’immenses pénalités :
(0.95 - 0)^2 = 0.90256.2 le paradoxe de dilution de l’EPSS brut sur les zero-days
Section intitulée « 6.2 le paradoxe de dilution de l’EPSS brut sur les zero-days »Le modèle EPSS de FIRST.org est entraîné sur des centaines de milliers de vulnérabilités accumulées sur des décennies. Ainsi, au premier jour de divulgation d’un zero-day (avant l’apparition de traces de scans massifs dans les honeypots), l’EPSS affiche des probabilités très conservatrices, souvent entre 0.04 et 0.15.
Lorsqu’un exploit d’exécution de code à distance non authentifié est militarisé en 48 heures par des groupes étatiques (o_i = 1), une prédiction de P = 0.07 subit une pénalité (0.07 - 1)^2 = 0.8649. Cela explique le score BSS négatif de l’EPSS brut sur les zero-days cinétiques, là où l’analyse du Génome de Vulnérabilité d’Hermes isole immédiatement les catalyseurs structurels d’exploitabilité.
7. Architecture des données ouvertes et vérification
Section intitulée « 7. Architecture des données ouvertes et vérification »Conformément au Principe P8 (Priorité Statique & Reproductibilité Long Terme), l’ensemble du banc d’étalonnage est généré statiquement à la compilation sous forme d’artefacts JSON :
| Point de terminaison | Contenu |
|---|---|
/api/benchmark/index.json | Métadonnées globales, matrice des événements, prévisions et statistiques de synthèse. |
/api/benchmark/leaderboard.json | Classement officiel ordonné par score moyen de Brier et décomposition de Murphy. |
/api/benchmark/models.json | Fiches détaillées des modèles, mécanismes d’inférence et historique des duels. |
Le schéma de validation est vérifié rigoureusement via data/schemas/benchmark.schema.json lors de l’intégration continue.