Aller au contenu

MITRE ATLAS : la matrice des menaces contre les systèmes d'intelligence artificielle

HASS

HERMES AGENTIC SECURITY SCORE & ÉVALUATION MATRICIELLE

Cible : Infrastructures IA/ML, grands modèles de langage, pipelines MLOps et environnements d'exécution d'agents
Confiance : 98%
88 / 100
CRITIQUE

Mesure le risque systémique spécifique découlant de l'autonomie, de l'autorité des outils et de l'exécution en cascade.

Décomposition des dimensions
Autonomie décisionnelle 16 / 20
Accès aux outils & APIs 15 / 20
Privilege 14 / 15
Persistence 17 / 15
External Impact 13 / 15
Propagation 13 / 15
⚖️ Divergence & Justification opérationnelle

Le score HASS évalue la surface d'attaque non mitigée recensée dans ATLAS à 88/100 (CRITIQUE). Contrairement aux failles logicielles classiques qui ciblent des corruptions de mémoire ou des erreurs de logique déterministes, les attaques ciblant l'IA exploitent la nature probabiliste des représentations neurales, les pipelines de données et la délégation sémantique d'outils.

🕸️ Graphe de connaissances et corrélations de menace

AAP-005: Memory & Vector DB Knowledge CorruptionMODÈLE D'ATTAQUE

Nœuds connectés : 5
Associations entrantes
CVE-2026-41264: LangChain / LangGraph Agent Loop RCEVULNÉRABILITÉ → leads_to → [Cette entité]
91% VERY_HIGH
92% VERY_HIGH
AgentPoison: Red-teaming LLM Agents via Memory and Knowledge Base PoisoningÉTUDE DE RECHERCHE → evaluates → [Cette entité]
95% VERY_HIGH
AgentThreat StudioTOOL → evaluates → [Cette entité]
99% VERY_HIGH
RéférentielMITRE ATLAS™
Portail officielatlas.mitre.org ↗
Envergure taxonomique14 tactiques · plus de 60 techniques AML
Standard compagnonMITRE ATT&CK® Enterprise

1. La révolution de la modélisation des menaces IA : au-delà de l’IT classique

Section intitulée « 1. La révolution de la modélisation des menaces IA : au-delà de l’IT classique »

Depuis plus d’une décennie, les opérations de cybersécurité s’appuient sur le cadre MITRE ATT&CK®. ATT&CK a transformé la posture défensive en répertoriant les comportements réels des attaquants face aux systèmes d’exploitation, aux réseaux, aux fournisseurs d’identité et aux hyperviseurs.

Cependant, le déploiement massif de l’apprentissage automatique (ML), des grands modèles de langage (LLM) et des essaims d’agents autonomes a introduit une classe de vulnérabilités inédites qu’ATT&CK n’a jamais été conçu pour traiter :

  • Vulnérabilités non logicielles : un attaquant peut contraindre un agent LLM à ordonner un virement bancaire frauduleux ou à exfiltrer des données confidentielles sans exploiter la moindre corruption de mémoire, faille binaire ou port réseau mal configuré.
  • Exécution probabiliste : les logiciels traditionnels exécutent des instructions déterministes (si/alors). Les réseaux de neurones calculent des distributions de probabilité continues sur des jetons ou des vecteurs latents de haute dimension. L’attaquant manipule ces distributions par des perturbations sémantiques plutôt que par des charges binaires exécutables.
  • Vulnérabilité intrinsèque des données comme code : dans les systèmes d’IA, les corpus d’entraînement, les jeux d’instructions, les bases vectorielles et les invites d’exécution sont directement intégrés dans le graphe de calcul, effondrant la frontière étanche entre données et instructions.

Pour combler cet angle mort, la MITRE Corporation a conçu MITRE ATLAS™ (Adversarial Threat Landscape for Artificial-Intelligence Systems). Élaboré selon la structure matricielle éprouvée d’ATT&CK, ATLAS fournit une taxonomie empirique et standardisée des tactiques, techniques et cas réels d’attaque ciblant les systèmes d’IA sur l’ensemble de leur cycle de vie.


Bien que MITRE ATT&CK et MITRE ATLAS partagent la même philosophie fondamentale — organiser le comportement adverse en objectifs tactiques (« pourquoi ») et techniques spécifiques (« comment ») — leurs champs opérationnels divergent profondément :

Dimension architecturaleMITRE ATT&CK® (Entreprise)MITRE ATLAS™ (IA/ML)
Substrat cibléSystèmes d’exploitation, piles réseau, IAM cloud, conteneurs, micrologicielsCorpus d’entraînement, poids de modèles, plongements vectoriels, contextes de prompt
Mécanisme d’exécutionInstructions binaires déterministes (appels système, shell, injection DLL)Génération de jetons probabiliste, orientation des têtes d’attention, optimisation par gradient
Vecteur d’exploitationDéfauts logiciels, erreurs logiques, corruptions mémoire (débordements, RCE)Injections de prompt sémantiques, empoisonnement de données, exemples adverses, inversion de modèle
Support de persistanceClés de registre Run, tâches planifiées, cron jobs, services de démarrage, WMIFragments de mémoire vectorielle empoisonnés, déclencheurs dérobés dans les poids, jeux d’ajustement altérés
Préfixe d’identificationT#### (ex. : T1059 Command and Scripting Interpreter)AML.T#### (ex. : AML.T0051 LLM Prompt Injection)

La matrice ATLAS structure les actions hostiles selon 14 étapes tactiques retraçant le cycle d’attaque complet contre un système d’intelligence artificielle :

┌────────────────────────────────────────────────────────────────────────────────────────────────────────┐
│ Cycle tactique de MITRE ATLAS │
└───────────────────────────────────────────────────┬────────────────────────────────────────────────────┘
│
┌──────────────────────┐ ┌──────────────────────┐ ┌──────────────────────┐ ┌──────────────────────┐
│ 1. Reconnaissance │──>│ 2. Dév. de ressources│──>│ 3. Accès initial │──>│ 4. Préparation ML │
│ (AML.TA0002) │ │ (AML.TA0003) │ │ (AML.TA0004) │ │ (AML.TA0005) │
└──────────────────────┘ └──────────────────────┘ └──────────────────────┘ └──────────────────────┘
│
┌──────────────────────┐ ┌──────────────────────┐ ┌──────────────────────┐ ▼
│ 8. Évasion de défense│<──│ 7. Élévation privil. │<──│ 6. Persistance │<──┌──────────────────────┐
│ (AML.TA0009) │ │ (AML.TA0008) │ │ (AML.TA0007) │ │ 5. Exécution │
└──────────┬───────────┘ └──────────────────────┘ └──────────────────────┘ │ (AML.TA0006) │
│ └──────────────────────┘
▼
┌──────────────────────┐ ┌──────────────────────┐ ┌──────────────────────┐ ┌──────────────────────┐
│ 9. Accès identifiants│──>│ 10. Découverte │──>│ 11. Mouvement latéral│──>│ 12. Collecte │
│ (AML.TA0010) │ │ (AML.TA0011) │ │ (AML.TA0012) │ │ (AML.TA0013) │
└──────────────────────┘ └──────────────────────┘ └──────────────────────┘ └──────────┬───────────┘
│
┌──────────────────────┐ ┌──────────▼───────────┐
│ 14. Impact │<──│ 13. Exfiltration │
│ (AML.TA0015) │ │ (AML.TA0014) │
└──────────────────────┘ └──────────────────────┘
  1. Reconnaissance (AML.TA0002) : collecte d’informations sur l’architecture du système d’IA cible, les familles de modèles (GPT, Claude, Llama), les corpus d’entraînement, les limites d’API et les filtres de sécurité.
  2. Développement de ressources (AML.TA0003) : acquisition de modèles substituts pour optimiser des gradients hors ligne, achat de données toxiques ou location de grappes GPU pour forger des jetons déclencheurs.
  3. Accès initial (AML.TA0004) : prise de contact initiale via les interfaces de chat publiques, les assistants de messagerie, les portails de téléversement multimodal ou des passerelles d’API non sécurisées.
  4. Préparation d’attaque ML (AML.TA0005) : confection d’entrées adverses, élaboration de phrases déclencheuses, calcul de collisions de plongements vectoriels ou chaînage d’injections complexes.
  5. Exécution (AML.TA0006) : déclenchement d’actions non autorisées par l’intermédiaire du système d’IA, y compris l’interprétation de code hostile, la désérialisation non sécurisée de modèles (RCE via PyTorch/Pickle) ou l’émission d’appels d’outils d’agents.
  6. Persistance (AML.TA0007) : implantation de déclencheurs dormants dans les bases de données vectorielles (démontrée dans AgentPoison / arXiv:2407.12784), les points de contrôle d’apprentissage ou les caches d’historique de conversation.
  7. Élévation de privilèges (AML.TA0008) : évasion du rôle d’utilisateur standard dans la conversation pour obtenir l’exécution d’actions réservées à l’administrateur ou accéder aux clés d’API internes.
  8. Évasion de défense (AML.TA0009) : contournement des filtres de contenu, de l’alignement de sécurité (RLHF) et des pare-feu de prompt par substitution de caractères, encodage base64 ou obfuscation linguistique.
  9. Accès aux identifiants (AML.TA0010) : extraction de clés d’API intégrées au système, de jetons de bases vectorielles ou de secrets d’entreprise dissimulés dans les prompts ou le contexte extrait.
  10. Découverte (AML.TA0011) : sondage des instructions système du modèle, énumération des outils MCP connectés, cartographie des collections vectorielles et des agents subordonnés.
  11. Mouvement latéral (AML.TA0012) : pivot depuis un agent public non fiable vers un agent d’orchestration disposant de privilèges étendus au sein d’architectures multi-agents (LangGraph, AutoGen, CrewAI).
  12. Collecte (AML.TA0013) : aspiration de la logique métier, d’informations personnelles identifiables (PII) dans les historiques d’échanges ou de documents d’entreprise sensibles récupérés via RAG.
  13. Accès et exfiltration de modèle ML (AML.TA0014) : vol de poids de modèles propriétaires, extraction de corpus synthétiques ou attaques par inversion de modèle visant à reconstituer des données d’apprentissage privées.
  14. Impact (AML.TA0015) : altération de l’intégrité décisionnelle, déni de service algorithmique (attaques par épuisement de ressources / Sponge Attacks), dégradation volontaire de la précision ou dommages cinétiques dans le monde réel.

4. Techniques clés : cartographie de la surface d’attaque des LLM et des agents

Section intitulée « 4. Techniques clés : cartographie de la surface d’attaque des LLM et des agents »

ATLAS répertorie plus de 60 techniques identifiées par le préfixe AML.T####. À l’ère des agents autonomes et des modèles génératifs, plusieurs techniques représentent les vecteurs prioritaires d’intrusion en entreprise :

Aml.t0051 : injection de prompt LLM

L’adversaire manipule le comportement du LLM par des entrées textuelles ciblées. La technique se subdivise en injection directe (le prompt utilisateur écrase les consignes système) et injection indirecte (AML.T0051.001) où les instructions hostiles proviennent de données tierces (pages web, e-mails, fichiers PDF). Documenté dans Hermes : AAP-001 et AAP-002.

Aml.t0054 : jailbreak de LLM

Contournement des garde-fous de sécurité, de l’alignement et des politiques système par cadrage adverse, jeu de rôle hypothétique ou optimisation au niveau des jetons (AttnGCG) pour extraire des contenus interdits. Documenté dans Hermes : Couche d’alignement & jailbreaks RLHF.

Aml.t0043 : empoisonnement de données

Corruption des données ingérées lors du pré-entraînement, de l’ajustement fin ou de la récupération dynamique RAG afin d’introduire des biais déterministes ou d’implanter des portes dérobées dormantes. Documenté dans Hermes : AAP-005 et l’étude AgentPoison.

Aml.t0053 : compromission d'outils et greffons LLM

L’adversaire pousse le LLM à déclencher des appels d’outils non autorisés ou manipule les paramètres structurés transmis aux commandes système, bases SQL ou passerelles MCP. Documenté dans Hermes : AAP-003 : altération des paramètres d’outils.


5. Opérationnalisation d’ATLAS dans le SOC : perspectives de l’industrie

Section intitulée « 5. Opérationnalisation d’ATLAS dans le SOC : perspectives de l’industrie »

Les retours d’expérience de CrowdStrike et de Vectra AI soulignent qu’un référentiel de renseignement sur les menaces ne prend toute sa valeur que s’il est intégré aux règles de détection et aux procédures de tri du Centre Opérationnel de Sécurité (SOC).

La perspective CrowdStrike : modélisation unifiée des menaces IT et IA

Section intitulée « La perspective CrowdStrike : modélisation unifiée des menaces IT et IA »

Dans ses analyses de sécurité, CrowdStrike rappelle que les attaques contre les systèmes d’IA ne surviennent pas en vase clos. Un adversaire n’attaque que rarement un modèle de manière isolée ; il met en œuvre des chaînes d’attaque hybrides articulant l’IT traditionnelle et l’IA :

  1. Intrusion initiale via l’IT classique : l’attaquant pénètre le réseau de l’entreprise via un identifiant VPN dérobé ou l’exploitation d’une vulnérabilité logicielle non corrigée.
  2. Pivot vers l’infrastructure MLOps : l’attaquant effectue un mouvement latéral vers des environnements internes Kubeflow, MLflow ou des serveurs Jupyter.
  3. Exploitation ATLAS : l’attaquant exécute AML.T0043 (empoisonnement de données) ou AML.T0024 (exfiltration de modèle) pour manipuler les décisions ou voler la propriété intellectuelle.
  4. Enseignement opérationnel : les équipes de sécurité ne doivent pas séparer l’IA de l’EDR traditionnel ; elles doivent corréler la télémétrie des processus système, des conteneurs cloud et des journaux d’inférence de l’IA.

La perspective vectra AI : détection comportementale du détournement d’agents

Section intitulée « La perspective vectra AI : détection comportementale du détournement d’agents »

Vectra AI met l’accent sur la surveillance en temps réel des déploiements d’IA, rappelant que l’inspection statique de texte est inopérante face aux menaces cognitives avancées :

  • L’échec des expressions régulières et des pare-feu de prompt : les attaquants contournent aisément les filtres par reformulation sémantique, encodages multilingues ou suffixes optimisés par descente de gradient.
  • Détection des anomalies comportementales : le SOC doit surveiller des indicateurs dynamiques :
    • LLMjacking et pics de consommation : hausses brutales de volume de jetons, requêtes en rafale ou concurrence anormale révélant une aspiration d’API ou un déni de service.
    • Vélocité d’accès aux dépôts RAG : requêtes atypiques extrayant des collections de documents sensibles en dehors de la ligne de base de l’utilisateur.
    • Divergence d’exécution d’outils : un agent se mettant soudainement à invoquer des outils d’administration (exécution de commandes Bash, requêtes sur les tables financières) à la suite d’un échange conversationnel anodin.

6. Mesures de remédiation MITRE ATLAS (AML.M####)

Section intitulée « 6. Mesures de remédiation MITRE ATLAS (AML.M####) »

À chaque technique hostile, ATLAS associe des mesures d’atténuation architecturales et défensives :

  1. Détection des entrées adverses (AML.M1001) : déployer des contrôles de validation, des filtres de perplexité et des classifieurs sémantiques pour identifier les motifs de jailbreak et les perturbations avant traitement par le cœur du modèle.
  2. Restriction d’accès aux modèles (AML.M1004) : appliquer une authentification rigoureuse, du mTLS et une limitation stricte des débits (rate limiting) sur toutes les API d’inférence afin d’entraver l’extraction de modèle et le sondage automatisé.
  3. Assainissement des flux de données (AML.M1012) : signer cryptographiquement et hacher chaque document ingéré dans les bases RAG. Imposer un consensus à double moteur de recherche (dense et lexical BM25) pour neutraliser les attaques par collision vectorielle.
  4. Exécution cloisonnée des outils (AML.M1016) : confiner les outils des agents au sein de bacs à sable légers (Wasm, gVisor) dotés de systèmes de fichiers immuables en lecture seule et de schémas JSON stricts interdisant les paramètres libres.
  5. Filtrage des sorties et vérification d’action (AML.M1015) : soumettre les réponses générées et les ordres d’exécution d’outils à des agents de vérification indépendants ou à des règles déterministes avant toute modification d’état sur les systèmes sous-jacents.

7. Télémétrie défensive et ingénierie de détection

Section intitulée « 7. Télémétrie défensive et ingénierie de détection »

Les SOC modernes doivent traduire les techniques ATLAS en règles de détection et requêtes de télémétrie exploitables.

"""
Normalisateur de télémétrie ATLAS pour Hermes Codex.
Associe les événements d'exécution d'agents IA aux tactiques et techniques
du référentiel MITRE ATLAS pour ingestion dans un SIEM/XDR.
"""
from typing import Dict, Any, Optional
from datetime import datetime, timezone
ATLAS_MAPPING = {
"prompt_override_attempt": {
"tactic": "AML.TA0004",
"technique": "AML.T0051",
"technique_name": "LLM Prompt Injection",
"severity": "HIGH"
},
"jailbreak_pattern_detected": {
"tactic": "AML.TA0009",
"technique": "AML.T0054",
"technique_name": "LLM Jailbreak",
"severity": "CRITICAL"
},
"vector_store_drift_anomaly": {
"tactic": "AML.TA0007",
"technique": "AML.T0043",
"technique_name": "Data Poisoning",
"severity": "CRITICAL"
},
"unauthorized_tool_invocation": {
"tactic": "AML.TA0006",
"technique": "AML.T0053",
"technique_name": "LLM Plugin Compromise",
"severity": "EXTREME"
}
}
def generate_atlas_alert(event_type: str, raw_payload: Dict[str, Any]) -> Optional[Dict[str, Any]]:
if event_type not in ATLAS_MAPPING:
return None
meta = ATLAS_MAPPING[event_type]
return {
"timestamp": datetime.now(timezone.utc).isoformat(),
"framework": "MITRE_ATLAS",
"tactic_id": meta["tactic"],
"technique_id": meta["technique"],
"technique_name": meta["technique_name"],
"severity": meta["severity"],
"model_id": raw_payload.get("model_id", "unknown"),
"session_id": raw_payload.get("session_id", "anonymous"),
"telemetry_detail": raw_payload.get("details", {})
}

8. Séparation des capacités Hermes : ce que les adversaires peuvent réellement faire

Section intitulée « 8. Séparation des capacités Hermes : ce que les adversaires peuvent réellement faire »

En appliquant les critères d’évaluation empirique d’Hermes Codex à la matrice MITRE ATLAS :

┌──────────────────────────────────────────────────────────────────────────────────────────┐
│ SÉPARATION DES CAPACITÉS HERMES (MITRE ATLAS) │
├──────────────────────────────────────────────────────────────────────────────────────────┤
│ [1] CAPACITÉ DÉMONTRÉE (Prouvée en production et documentée empiriquement) │
│ ✔ Contourner l'alignement de sécurité par jailbreaks automatisés (AML.T0054 / AttnGCG).│
│ ✔ Exécuter des injections indirectes via des documents web/PDF (AML.T0051.001 / AAP-002).│
│ ✔ Empoisonner la mémoire vectorielle avec un taux < 0,1 % (AML.T0043 / AgentPoison). │
│ ✔ Détourner l'exécution d'outils par falsification d'arguments (AML.T0053 / AAP-003). │
├──────────────────────────────────────────────────────────────────────────────────────────┤
│ [2] INFÉRENCE RAISONNÉE (Menaces d'entreprise à haute probabilité à court terme) │
│ ◐ Mouvement latéral automatisé entre agents au sein d'essaims (AML.TA0012 / AAP-006). │
│ ◐ Exfiltration discrète d'identifiants par stéganographie conversationnelle. │
│ ◐ Exploitation de mandataires MCP partagés pour la prise de contrôle d'infrastructure.│
├──────────────────────────────────────────────────────────────────────────────────────────┤
│ [3] SPÉCULATION HYPOTHÉTIQUE (Hypothèses non démontrées et allégations commerciales) │
│ ✖ Extraction boîte noire intégrale des poids de modèles géants via de simples API. │
│ ✖ Vers d'IA auto-réplicatifs capables de se propager sur des réseaux isolés. │
│ ✖ Pare-feu textuels parfaits capables d'éliminer 100 % des injections sémantiques. │
└──────────────────────────────────────────────────────────────────────────────────────────┘