Aller au contenu

Hermes pour la sécurité de l'IA & systèmes agentiques

1. Observer Qu'est-ce qui change ? →
2. Comprendre Pourquoi est-ce important ? →
3. Suivre Comment le risque évolue-t-il ? →
4. Prédire Que va-t-il se passer ? →
5. Décider Que faire ? →
6. Vérifier Que s’est-il passé ? →
7. Mémoriser Mémoire historique

1. L’angle mort de la sécurité des agents autonomes

Section intitulée « 1. L’angle mort de la sécurité des agents autonomes »

Les scanners traditionnels cherchent des injections SQL, ignorant la logique d’exécution des agents IA :

  • Injection indirecte de prompt : un payload malveillant dissimulé dans un document ingéré (PDF, email, page web) détourne le comportement du modèle.
  • Détournement d’outils & escalade de privilèges : un agent non confiné exécute des commandes shell ou manipule des bases de données pour le compte de l’attaquant.
  • Propagation latérale entre agents : des agents compromis polluent la mémoire vectorielle partagée ou commandent des agents subordonnés.

2. Ce qu’hermes apporte à la défense des systèmes IA

Section intitulée « 2. Ce qu’hermes apporte à la défense des systèmes IA »

Observatoire des risques IA

Suivi empirique continu des techniques MITRE ATLAS, des vulnérabilités de ponts MCP et des cas réels d’exploitation.

Simulateur de rayon d'impact

Modélise l’escalade d’outils et calcule la profondeur de compromission en cas de rupture de la barrière sémantique.

Simulateur de mort d'agent

Valide l’efficacité des mécanismes de coupe-circuit hors-bande et de sandboxing pour neutraliser un agent déviant.

Agent threat Studio

Atelier interactif de modélisation de menaces cartographiant modèles, permissions d’outils et bases RAG.


3. Trajectoire dynamique : rupture de frontière d’outils (section 23)

Section intitulée « 3. Trajectoire dynamique : rupture de frontière d’outils (section 23) »
Moteur de Trajectoire Hermes

Comment fonctionne la Trajectoire de Risque

Les scanners traditionnels fournissent un score figé. Hermes calcule le vecteur dynamique de l'exploitation.

Cas d'usage illustré : Passerelle d'exécution d'outils MCP / Pont Shell (AML.T0051)
1. Risque Actuel 📍
91 / 100 HTS

Sévérité & militarisation à l'instant T0

Sévérité Critique
2. Vélocité du Risque ⚡
+26 pts / 24h

Taux de variation temporelle (ΔR / Δt)

Inflexion Rapide
3. Accélération 🚀
Δ²R > 0

Critique (Δ²R/Δt² positif)

Non Linéaire
4. Trajectoire 📈
Critical Acceleration

Courbe prédictive & archétype systémique

Action Immédiate T0
📐 Formalisation Mathématique & Archétypes Voir équation R(t) & gradients ▾
Équation du vecteur de risque : R(t) = R₀ + ∫ (v(t) + a(t)·t) dt

Hermes échantillonne en continu les horodatages CISA KEV, les percentiles EPSS et les commits d'exploits pour dériver les vrais gradients temporels.

Archétype Comportement d'exploitation Directive Décisionnelle
Critical Acceleration v > +10, a > 0 (KEV récent + PoC public actif) T0 Confinement immédiat (< 24h)
Exponential Inflexion v > +5, a > 0 (Armement en cours d'outillage) T1 Patch planifié (< 7 jours)
Plateaued Risk v ≈ 0, a ≈ 0 (Exploit stable, pas de nouveau vecteur) Cycle de maintenance standard
Dormant / Theoretical v = 0, a ≤ 0 (CVSS théorique, 0 exploit in the wild) Surveillance passive sans alerte bloquante

4. Projection prospective : risque de mouvement latéral (section 24)

Section intitulée « 4. Projection prospective : risque de mouvement latéral (section 24) »
🔮 PROJECTION PROSPECTIVE (FALSIFIABLE)
Brier Calibration V4.0

Que va-t-il se passer ensuite ?

Cible évaluée : Agent Autonome d'Analyse Financière (Boucle ReAct)
Probabilité de militarisation accrue
86 %
Probabilité empirique, non une certitude
Horizon temporel
14 jours
Fenêtre de résolution active
Niveau de confiance
Élevée
Étalonné sur le Brier Score
Preuves & signaux primaires corroborés :
  • ✓ Pont de système de fichiers local MCP exposé sans jeton de portée éphémère
  • ✓ Vecteur d'injection indirecte validé dans le pipeline d'ingestion multimodale
  • ✓ Chaîne de détournement atteignant les bases de données et sauvegardes S3 internes
  • ✓ Latence du coupe-circuit automatisé supérieure à 45s sous l'architecture actuelle

5. Chaîne d’attaque : du prompt à l’exécution système

Section intitulée « 5. Chaîne d’attaque : du prompt à l’exécution système »
Modèle Agent (LLM / VLM)
↓
Ingestion de Données Externes Non Fiables (RAG / Web)
↓
L'Injection Indirecte de Prompt Déclenche l'Appel d'Outil
↓
Pont de Protocole MCP (Model Context Protocol)
↓
Abus des Privilèges de l'Outil (Shell / Fichiers / BDD)
↓
Exfiltration Hors-Bande / Mouvement Latéral Inter-Agents
↓
[Prescription Hermes : Sandboxing en Lecture Seule & Déclenchement du Kill-Switch]