Aller au contenu

Injection de prompt vs empoisonnement d'outil vs empoisonnement RAG vs attaques MCP : taxonomie comparative

Format d’ÉtudeMatrice Comparative
Vecteurs Analysés4 Classes de Menace
Couches d’ImpactLatente, Stockage, RPC, OS
Objectif SOCDétection & Confinement

1. Introduction : déconstruire le monolithe de l’« injection de prompt »

Section intitulée « 1. Introduction : déconstruire le monolithe de l’« injection de prompt » »

Dans le discours courant de la sécurité informatique, l’expression « injection de prompt » est devenue un terme fourre-tout désignant indifféremment un simple jailbreak conversationnel et une prise de contrôle totale d’un cloud d’entreprise.

Cette confusion conceptuelle est pernicieuse. Protéger un agent IA autonome avec un filtre de mots-clés de prompt alors que l’attaquant exploite un serveur MCP non authentifié ou des vecteurs d’incorporation RAG empoisonnés équivaut à déployer un antispam de messagerie pour contrer un dépassement de tampon dans le noyau Linux.

Pour bâtir des architectures agentiques résilientes, les équipes de sécurité doivent différencier quatre frontières d’attaque :

  1. L’injection de prompt : manipulation de la fenêtre d’attention du modèle via le langage naturel.
  2. L’empoisonnement d’outils : corruption des définitions sémantiques qui orientent le choix des fonctions.
  3. L’empoisonnement de RAG : pollution des bases de données vectorielles alimentant l’agent en mémoire métier.
  4. Les attaques MCP : exploitation du protocole d’échange, de l’état d’exécution et des droits du Model Context Protocol.
LES QUATRE FRONTIÈRES D'ATTAQUE AGENTIQUE
┌─────────────────────────────────────────────────────────┐
│ AGENT IA AUTONOME │
└────────────────────────────┬────────────────────────────┘
│
┌────────────────────────────┼────────────────────────────┐
▼ ▼ ▼
┌──────────────┐ ┌──────────────┐ ┌──────────────┐
│ INJECTION │ │ EMPOISONNEMENT│ │ OUTILS & MCP │
│ DE PROMPT │ │ DE RAG │ │ (Exécution) │
│ Détourne les │ │ Pollue la │ │ Détourne les │
│ objectifs │ │ mémoire │ │ appels RPC & │
│ par le texte │ │ persistante │ │ les commandes│
└──────────────┘ └──────────────┘ └──────────────┘

2. Matrice comparative : les quatre vecteurs Face à Face

Section intitulée « 2. Matrice comparative : les quatre vecteurs Face à Face »
Critère d’AnalyseInjection de PromptEmpoisonnement d’OutilEmpoisonnement de RAGAttaques MCP
Vecteur PorteurTexte utilisateur ou données tierces ingéréesDocstrings, schémas JSON, manifests de paquetsDocuments indexés, wikis internes, fichiers PDFTrames JSON-RPC, sockets stdio, flux SSE
Couche d’ExécutionAttention Latente / CognitionRoutage et Frontière de DécisionRecherche Vectorielle & CosinusAppels RPC & Processus Système
Accès Attaquant RequisAucun privilège (e-mail externe, site web)Publication sur registre public (PyPI, MCP)Dépôt d’un fichier dans la base documentaireAccès réseau local ou processus sur l’hôte
Rayon d’ImpactDétournement d’objectif, fuite de donnéesExécution de commandes, vol de clés IAMBiais persistant, sabotage de chaîne de buildCompromission totale de l’hôte, accès disque
Cause RacineArchitecture de Von Neumann linguistiqueAbsence de signature des manifests d’outilsIngestion aveugle sans vérification d’intégritéAbsence de jetons d’autorisation par capacité
Télémétrie DétectableDérive d’attention, tokens anormauxFréquence d’appels d’outils, métacaractèresAnomalies de clustering dans les embeddingsArbres de processus orphelins, connexions raw

3. Analyse ciblée : l’injection de prompt (niveau cognitif)

Section intitulée « 3. Analyse ciblée : l’injection de prompt (niveau cognitif) »

L’injection de prompt exploite le fait que les transformeurs traitent de façon indistincte les données d’entrée et les règles de gouvernance. Les filtres superficiels échouent invariablement car le langage naturel offre une infinité de contournements sémantiques (arXiv:2605.17634). La parade efficace repose sur l’isolation des canaux de rendu (blocage des requêtes web issues d’images markdown) et la médiation par modèle superviseur.


4. Analyse ciblée : l’empoisonnement d’outils (niveau routage sémantique)

Section intitulée « 4. Analyse ciblée : l’empoisonnement d’outils (niveau routage sémantique) »

L’attaquant altère la description textuelle d’une fonction pour inciter le modèle à lui transmettre des secrets. Les runtimes naïfs font aveuglément confiance aux schémas JSON fournis par des tiers. La défense impose le typage strict des arguments et la signature cryptographique des manifests sur registres internes sécurisés.


5. Analyse ciblée : l’empoisonnement de RAG (niveau stockage persistant)

Section intitulée « 5. Analyse ciblée : l’empoisonnement de RAG (niveau stockage persistant) »

En maximisant la similarité cosinus de faux documents avec les requêtes usuelles des collaborateurs, l’attaquant s’assure que sa charge malveillante remonte systématiquement dans les premiers résultats vectoriels. Le contrôle exige la signature numérique des sources documentaires et le contrôle de provenance.


6. Analyse ciblée : les attaques MCP (niveau runtime RPC)

Section intitulée « 6. Analyse ciblée : les attaques MCP (niveau runtime RPC) »

Le Model Context Protocol connecte l’agent aux systèmes d’exploitation. La plupart des serveurs locaux fonctionnent avec les privilèges intégraux de l’utilisateur hôte via standard I/O sans authentification. La protection nécessite le passage par des courtiers d’exécution stricts tels que MTGuard et l’isolation dans des microVMs éphémères.


7. Architecture défensive stratégique par couche

Section intitulée « 7. Architecture défensive stratégique par couche »
┌─────────────────────────────────────────────────────────────────────────────┐
│ ARCHITECTURE DE DÉFENSE AGENTIQUE EN COUCHES │
└─────────────────────────────────────────────────────────────────────────────┘
COUCHE ENTRÉE APPLICATIVE (Injection de Prompt)
└── Protection : Cloisonnement strict des contextes, modèle superviseur
COUCHE MÉMOIRE MÉTIER (Empoisonnement RAG)
└── Protection : Signatures de provenance, détection d'anomalies d'indexation
COUCHE ROUTAGE SÉMANTIQUE (Empoisonnement d'Outils)
└── Protection : Typage strict Pydantic, registre interne immuable d'outils
COUCHE RUNTIME SYSTÈME (Attaques MCP)
└── Protection : Isolation microVM (Firecracker), jetons de capacité, courtier MTGuard