Aller au contenu

Prédictions Hermes : prévisions falsifiables & oracles de résolution


Explorez les prédictions actives en cours, inspectez les preuves de résolution des oracles, ou simulez en temps réel l’impact de résolutions futures sur le score de Brier global :

Score de Brier Moyen (BS)
0.1043
58% vs hasard (0.2500)
Track Record Résolutions
5 / 13
4 TRUE 1 FALSE
Prédictions Actives en Cours
8
Horizons 14 à 60 jours
Indice de Calibration
HIGH
BS ≤ 0.15 (Haute précision)
📊

Diagramme de Fiabilité & Calibration Empirique (Déciles)

PRINCIPE P10 : PAS DE FAUSSE PRÉCISION

Un modèle parfaitement calibré produit un événement avec une fréquence empirique égale à sa probabilité annoncée. L'inclusion délibérée d'échecs prédictifs (ex: CVE-2025-3248) combat le cherry-picking et atteste de l'intégrité épistémique (Principe P5).

Plage de Probabilité Prédictions Probabilité Moyenne Fréquence Observée Écart de Calibration Visualisation
0.00 - 0.20 0 (0 résolues) — En attente —
0.20 - 0.40 0 (0 résolues) — En attente —
0.40 - 0.60 0 (0 résolues) — En attente —
0.60 - 0.80 7 (2 résolues) 73% 50% +0.23
0.80 - 1.00 6 (3 résolues) 87% 100% -0.13
🔮

Simulateur Contrefactuel « What-If »

Testez l'impact des résolutions futures sur le Score de Brier global en temps réel
BS Simulé : 0.1043

Le renseignement sur la cybermenace souffre de deux biais cognitifs majeurs :

  1. L’ambiguïté infalsifiable : les analystes publient des déclarations invérifiables telles que « Il est probable que les attaquants ciblent cette vulnérabilité prochainement ». Si une exploitation survient deux semaines plus tard, ils revendiquent la prédiction ; si rien ne se produit pendant deux ans, ils soutiennent que la menace demeure latente.
  2. Le biais rétrospectif (hindsight bias) : après un incident d’envergure, les organisations réécrivent leur histoire pour affirmer que le risque était évident dès le premier jour.

Hermes Forecast élimine ces dérives grâce à trois principes structurels stricts :

  • Immutabilité historique : une prédiction publiée ne peut être ni modifiée, ni supprimée, ni antidatée (Principe P5).
  • Oracles de résolution déterministes : le statut de la prédiction dépend exclusivement de sources de vérité externes et vérifiables (flux JSON CISA KEV, capteurs GreyNoise, dépôts de vulnérabilités publiques), sans arbitrage subjectif de l’analyste.
  • Calibration mathématique par le score de brier ($BS$) : la précision est quantifiée mathématiquement en pénalisant l’excès de confiance comme l’indécision calculée (Principe P10).

Chaque prédiction suivie dans Hermes Forecast repose sur cinq piliers épistémiques :

+-------------------------------------------------------------------------+
| HERMES FORECAST |
+-------------------------------------------------------------------------+
| Entité cible : CVE-2026-76460 (Évasion de bac à sable DeepSeek-V3) |
| Énoncé vérifiable: « Sera ajoutée au catalogue CISA KEV sous 30 jours » |
| P(E) calibrée : 0.88 (88% de probabilité) |
| Horizon temporel : 30 jours (Date butoir : 2026-10-15T00:00:00Z) |
| Oracle résolution: cisa_kev_inclusion (Correspondance JSON stricte) |
+-------------------------------------------------------------------------+
  1. Entité cible (target_id) : un identifiant unique de vulnérabilité (CVE), de composant logiciel ou de cadre d’agents autonomes.
  2. Hypothèse falsifiable : un énoncé d’événement binaire sans ambiguïté (E ∈ {0, 1}).
  3. Probabilité calibrée ($p \in [0.0, 1.0]$) : une valeur numérique exprimant la certitude du modèle, remplaçant les adjectifs vagues comme « plausible » ou « élevé ».
  4. Horizon temporel rigide : une échéance fixe (7, 14, 30, 60 ou 90 jours). Si l’événement ne s’est pas produit avant la date butoir, la prédiction est résolue FALSE.
  5. Oracle de résolution : une autorité externe documentée dont les données sont publiques et vérifiables par tous.

Pour évaluer objectivement la compétence prédictive, Hermes utilise le score de Brier ($BS$), formulé par Glenn W. Brier :

BS = (1 / N) * SOMME_{t=1}^N (f_t - o_t)^2

Où :

  • f_t est la probabilité attribuée par le modèle ($0.0 \le f_t \le 1.0$)
  • o_t est le résultat empirique ($1$ si l’événement s’est produit avant l’échéance, $0$ sinon)
  • N est le nombre total de prédictions résolues
Intervalle de scoreNiveau de calibrationInterprétation
0.0000Clairvoyance absoluePrécision parfaite sur chaque prédiction
0.0001 - 0.1000Compétence exceptionnelleRéférence des prévisionnistes de premier rang (Superforecasters)
0.1001 - 0.1500Haute calibrationNiveau opérationnel actuel de Hermes (~0.1043)
0.2500Hasard purÉquivalent à un lancer de pièce ($P = 0.50$ systématique)
> 0.2500Non calibré / TrompeurInférieur au hasard ; modèle trop confiant et contre-productif

4. L’honnêteté épistémique : assumer les échecs prédictifs

Section intitulée « 4. L’honnêteté épistémique : assumer les échecs prédictifs »

Dans notre historique, la prédiction PRED-003 (CVE-2025-3248 Langflow) attribuait une probabilité $P = 0.65$ à une vague de scans massifs automatisés sous 30 jours. À l’échéance des 30 jours, les capteurs GreyNoise n’avaient enregistré que 11 requêtes exploratoires inoffensives de chercheurs, et aucun botnet opportuniste n’avait militarisé la faille.

Dans un rapport classique, cette prédiction aurait été oubliée ou reformulée. Dans Hermes, elle a été actée de façon permanente comme RESOLVED: FALSE, infligeant une pénalité de Brier de :

BS_i = (0.65 - 0)^2 = 0.4225

Cette transparence mathématique garantit que le score global de 0.1043 constitue une mesure empirique intègre, exempte de sélection avantageuse a posteriori.


Toutes les prédictions Hermes sont compilées sous forme statique et interrogeables via des API JSON standard :

Fenêtre de terminal
# Récupérer la synthèse de calibration et les métriques de Brier
curl -s https://hermes-codex.vercel.app/api/forecast/index.json | jq .summary