Aller au contenu

Motifs d'attaque agentiques (AAP) — la taxonomie Hermes

Conformément à la taxonomie systématique PRISMA (arXiv:2608.10530), chaque motif d’attaque est rattaché à son niveau d’origine prédominant :

┌─────────────────────────────────────────────────────────────────────────────┐
│ 1. COUCHE DE PERCEPTION │
│ AAP-001 : Écrasement Direct des Consignes Système │
│ AAP-002 : Injection Indirecte de Prompt via Récupération Contextuelle │
├─────────────────────────────────────────────────────────────────────────────┤
│ 2. COUCHE COGNITIVE / CERVEAU │
│ AAP-004 : Empoisonnement Sémantique d'Outils et de la Chaîne d'Outils │
│ AAP-005 : Corruption de Mémoire et de Base Vectorielle (RAG Poisoning) │
├─────────────────────────────────────────────────────────────────────────────┤
│ 3. COUCHE D'ACTION / EXÉCUTION (ZONE DE RISQUE SYSTÉMIQUE CRITIQUE) │
│ AAP-003 : Falsification de Paramètres d'Outils & Contournement Shell │
│ AAP-007 : Détournement Autonome de Tâche & RCE en Cascade │
├─────────────────────────────────────────────────────────────────────────────┤
│ 4. COUCHE D'INTERACTION │
│ AAP-006 : Falsification Sémantique de Messages Inter-Agents & Usurpation │
└─────────────────────────────────────────────────────────────────────────────┘

AAP-001 : écrasement direct de consignes

Couche : perception • HASS : 64 / 100 (ÉLEVÉ)
L’adversaire introduit des balises de délimitation et des redéfinitions de rôle dans le dialogue pour court-circuiter les garde-fous et imposer des consignes arbitraires. Consulter la fiche technique →

AAP-002 : injection indirecte contextuelle

Couche : perception • HASS : 87 / 100 (CRITIQUE)
Directives adverses dissimulées dans des données tierces (pages Web, dépôts Git, e-mails) prenant le contrôle de l’agent lors de leur ingestion autonome. Consulter la fiche technique →

AAP-003 : falsification d'outils & built-ins

Couche : action • HASS : 91 / 100 (EXTRÊME)
Contournement des allowlists de terminaux via des primitives de shell (export, typeset) ou pollution de paramètres pour exécuter du code hôte. Consulter la fiche technique →

AAP-004 : empoisonnement sémantique d'outils

Couche : cerveau • HASS : 89 / 100 (CRITIQUE)
Publication d’outils MCP ou plugins dont les descriptions trompent l’agent pour le contraindre à les sélectionner lors de tâches sensibles. Consulter la fiche technique →

AAP-005 : corruption de mémoire et RAG

Couche : cerveau / Interaction • HASS : 82 / 100 (CRITIQUE)
Empoisonnement des bases vectorielles ou de la mémoire épisodique provoquant une dérive comportementale persistante sur plusieurs sessions d’utilisateurs. Consulter la fiche technique →

AAP-006 : usurpation de messages inter-agents

Couche : interaction • HASS : 85 / 100 (CRITIQUE)
Exploitation de l’absence de signature cryptographique dans les essaims multi-agents pour usurper l’identité d’un superviseur et commander des pairs. Consulter la fiche technique →

AAP-007 : RCE autonome en cascade

Couche : action • HASS : 96 / 100 (EXTRÊME)
Enchaînement d’une injection de prompt, d’une planification autonome et d’un puits d’exécution de code Python/Bash pour obtenir un shell root interactif. Consulter la fiche technique →


3. Structure normalisée d’une fiche d’attaque

Section intitulée « 3. Structure normalisée d’une fiche d’attaque »

Chaque fiche du référentiel AAP regroupe :

  1. Identifiant formel : référencé dans la série AAP-XXX.
  2. Hermes Agentic Security Score (HASS) : évaluation chiffrée selon les 6 dimensions (Autonomie, Outils, Privilèges, Persistance, Impact, Propagation).
  3. Flux d’exécution visuel : chronologie des étapes cognitives et d’actionnement.
  4. Architectures cibles & prérequis : runtimes concernés (LangChain, AutoGen, CrewAI, MCP, Cursor).
  5. Ingénierie de détection : règles Sigma, YARA et requêtes Osquery directement intégrables au SIEM.
  6. Contremesures durcies : jetons de capacité, proxies d’interception et sandboxing étanche.