Prédictions Hermes : prévisions falsifiables & oracles de résolution
Banc d’essai interactif des prédictions Hermes
Section intitulée « Banc d’essai interactif des prédictions Hermes »Explorez les prédictions actives en cours, inspectez les preuves de résolution des oracles, ou simulez en temps réel l’impact de résolutions futures sur le score de Brier global :
Diagramme de Fiabilité & Calibration Empirique (Déciles)
Un modèle parfaitement calibré produit un événement avec une fréquence empirique égale à sa probabilité annoncée. L'inclusion délibérée d'échecs prédictifs (ex: CVE-2025-3248) combat le cherry-picking et atteste de l'intégrité épistémique (Principe P5).
| Plage de Probabilité | Prédictions | Probabilité Moyenne | Fréquence Observée | Écart de Calibration | Visualisation |
|---|---|---|---|---|---|
| 0.00 - 0.20 | 0 (0 résolues) | — | En attente | — | |
| 0.20 - 0.40 | 0 (0 résolues) | — | En attente | — | |
| 0.40 - 0.60 | 0 (0 résolues) | — | En attente | — | |
| 0.60 - 0.80 | 7 (2 résolues) | 73% | 50% | +0.23 | |
| 0.80 - 1.00 | 6 (3 résolues) | 87% | 100% | -0.13 |
Simulateur Contrefactuel « What-If »
Testez l'impact des résolutions futures sur le Score de Brier global en temps réel1. Ce que résout Hermes forecast
Section intitulée « 1. Ce que résout Hermes forecast »Le renseignement sur la cybermenace souffre de deux biais cognitifs majeurs :
- L’ambiguïté infalsifiable : les analystes publient des déclarations invérifiables telles que « Il est probable que les attaquants ciblent cette vulnérabilité prochainement ». Si une exploitation survient deux semaines plus tard, ils revendiquent la prédiction ; si rien ne se produit pendant deux ans, ils soutiennent que la menace demeure latente.
- Le biais rétrospectif (hindsight bias) : après un incident d’envergure, les organisations réécrivent leur histoire pour affirmer que le risque était évident dès le premier jour.
Hermes Forecast élimine ces dérives grâce à trois principes structurels stricts :
- Immutabilité historique : une prédiction publiée ne peut être ni modifiée, ni supprimée, ni antidatée (Principe P5).
- Oracles de résolution déterministes : le statut de la prédiction dépend exclusivement de sources de vérité externes et vérifiables (flux JSON CISA KEV, capteurs GreyNoise, dépôts de vulnérabilités publiques), sans arbitrage subjectif de l’analyste.
- Calibration mathématique par le score de brier ($BS$) : la précision est quantifiée mathématiquement en pénalisant l’excès de confiance comme l’indécision calculée (Principe P10).
2. Anatomie d’une prédiction falsifiable
Section intitulée « 2. Anatomie d’une prédiction falsifiable »Chaque prédiction suivie dans Hermes Forecast repose sur cinq piliers épistémiques :
+-------------------------------------------------------------------------+| HERMES FORECAST |+-------------------------------------------------------------------------+| Entité cible : CVE-2026-76460 (Évasion de bac à sable DeepSeek-V3) || Énoncé vérifiable: « Sera ajoutée au catalogue CISA KEV sous 30 jours » || P(E) calibrée : 0.88 (88% de probabilité) || Horizon temporel : 30 jours (Date butoir : 2026-10-15T00:00:00Z) || Oracle résolution: cisa_kev_inclusion (Correspondance JSON stricte) |+-------------------------------------------------------------------------+Les 5 attributs épistémiques
Section intitulée « Les 5 attributs épistémiques »- Entité cible (
target_id) : un identifiant unique de vulnérabilité (CVE), de composant logiciel ou de cadre d’agents autonomes. - Hypothèse falsifiable : un énoncé d’événement binaire sans ambiguïté (
E ∈ {0, 1}). - Probabilité calibrée ($p \in [0.0, 1.0]$) : une valeur numérique exprimant la certitude du modèle, remplaçant les adjectifs vagues comme « plausible » ou « élevé ».
- Horizon temporel rigide : une échéance fixe (7, 14, 30, 60 ou 90 jours). Si l’événement ne s’est pas produit avant la date butoir, la prédiction est résolue FALSE.
- Oracle de résolution : une autorité externe documentée dont les données sont publiques et vérifiables par tous.
3. La métrique de calibration de brier
Section intitulée « 3. La métrique de calibration de brier »Pour évaluer objectivement la compétence prédictive, Hermes utilise le score de Brier ($BS$), formulé par Glenn W. Brier :
BS = (1 / N) * SOMME_{t=1}^N (f_t - o_t)^2Où :
f_test la probabilité attribuée par le modèle ($0.0 \le f_t \le 1.0$)o_test le résultat empirique ($1$ si l’événement s’est produit avant l’échéance, $0$ sinon)Nest le nombre total de prédictions résolues
Interprétation des scores de brier
Section intitulée « Interprétation des scores de brier »| Intervalle de score | Niveau de calibration | Interprétation |
|---|---|---|
| 0.0000 | Clairvoyance absolue | Précision parfaite sur chaque prédiction |
| 0.0001 - 0.1000 | Compétence exceptionnelle | Référence des prévisionnistes de premier rang (Superforecasters) |
| 0.1001 - 0.1500 | Haute calibration | Niveau opérationnel actuel de Hermes (~0.1043) |
| 0.2500 | Hasard pur | Équivalent à un lancer de pièce ($P = 0.50$ systématique) |
| > 0.2500 | Non calibré / Trompeur | Inférieur au hasard ; modèle trop confiant et contre-productif |
4. L’honnêteté épistémique : assumer les échecs prédictifs
Section intitulée « 4. L’honnêteté épistémique : assumer les échecs prédictifs »Dans notre historique, la prédiction PRED-003 (CVE-2025-3248 Langflow) attribuait une probabilité $P = 0.65$ à une vague de scans massifs automatisés sous 30 jours. À l’échéance des 30 jours, les capteurs GreyNoise n’avaient enregistré que 11 requêtes exploratoires inoffensives de chercheurs, et aucun botnet opportuniste n’avait militarisé la faille.
Dans un rapport classique, cette prédiction aurait été oubliée ou reformulée. Dans Hermes, elle a été actée de façon permanente comme RESOLVED: FALSE, infligeant une pénalité de Brier de :
BS_i = (0.65 - 0)^2 = 0.4225Cette transparence mathématique garantit que le score global de 0.1043 constitue une mesure empirique intègre, exempte de sélection avantageuse a posteriori.
5. Accès API REST
Section intitulée « 5. Accès API REST »Toutes les prédictions Hermes sont compilées sous forme statique et interrogeables via des API JSON standard :
- Index global du catalogue :
/api/forecast/index.json - Point de terminaison individuel :
/api/forecast/<PRED-ID>.json(ex:/api/forecast/PRED-001.json)
# Récupérer la synthèse de calibration et les métriques de Briercurl -s https://hermes-codex.vercel.app/api/forecast/index.json | jq .summary