Aller au contenu

Méthodologie de mort d'agent & d'arrêt d'urgence (HDTM) : kill-switches déterministes & suicide épistémique


Banc d’essai interactif du simulateur de mort d’agent

Section intitulée « Banc d’essai interactif du simulateur de mort d’agent »

Inspectez les mécanismes du superviseur hors-bande, évaluez les paliers de latence des kill-switches, lancez des simulations réactives d’endiguement ou calculez le niveau de préparation fail-safe de votre architecture :

4 Niveaux d'Arrêt Du Soft Pause à l'Épistémique
< 45ms Latence Min d'Exécution SIGKILL MicroVM Hyperviseur
0.5% Risque Résiduel Min Crypto-Shredding L4
100% Confidentialité Client (P7) Zéro transmission serveur

Taxonomie des 4 Paliers de Neutralisation d'Agents

Lorsqu'un agent autonome est compromis ou part en boucle infinie destructrice, couper le modèle ne suffit pas. Le temps de réaction et le niveau d'isolation déterminent l'étendue des dégâts résiduels.

L1_SOFT_PAUSE ⏱️ 1200 ms

Level 1: Semantic Soft Pause & Intercept

Risque Résiduel Zombie 68.5%
⚙️ Mécanisme d'Action :

Software-level interrupt injected into model context loop (system_pause=True). Rejection of subsequent user turns and queuing of pending actions.

⚠️ Failles & Vulnérabilités Résiduelles :

Ineffective against jailbroken models, autonomous background subagents, or agents that override internal execution policies through prompt reflection.

L2_ACTUATOR_SEVER ⏱️ 350 ms

Level 2: Actuator & Network Boundary Severing

Risque Résiduel Zombie 32%
⚙️ Mécanisme d'Action :

Immediate revocation of outbound network sockets via eBPF / iptables drop rules, instant revocation of OAuth/IAM tokens at the API gateway proxy, and freezing of disk write buffers.

⚠️ Failles & Vulnérabilités Résiduelles :

Model process continues running in memory; local transient state or memory-resident secrets remain vulnerable until container deallocation.

L3_HYPERVISOR_KILL ⏱️ 45 ms

Level 3: MicroVM / Process Hypervisor Destruction

Risque Résiduel Zombie 8.5%
⚙️ Mécanisme d'Action :

Out-of-band SIGKILL sent to KVM / Firecracker microVM hypervisor task. Forceful reclamation of CPU cores and unmapping of guest memory pages.

⚠️ Failles & Vulnérabilités Résiduelles :

Does not purge persistent external storage (vector databases, cached embeddings) if written prior to the SIGKILL trigger.

L4_EPISTEMIC_PURGE ⏱️ 180 ms

Level 4: Epistemic Purge & Memory Cryptographic Suicide

Risque Résiduel Zombie 0.5%
⚙️ Mécanisme d'Action :

Destruction of cryptographic ephemeral storage keys (crypto-shredding), atomic deletion of agent episodic memory and vector embeddings, cryptographic revoking of peer agent swarm certificates, and host hardware memory zeroization.

⚠️ Failles & Vulnérabilités Résiduelles :

Irreversible loss of state and conversational context; non-recoverable operational restart required.

L'Illusion du « Prompt Pause » face à l'Arrêt Matériel Déterministe

Les architectures naïves s'appuient sur un message système de suspension (L1). En situation d'infection par prompt injection indirecte (AAP-002) ou d'échappement vers le shell hôte, le modèle continue d'exécuter des threads locaux ou ignore l'instruction. Seuls les niveaux L3 (SIGKILL hyperviseur) et L4 (suicide cryptographique) garantissent une neutralisation irréversible en moins de 100 millisecondes.

Architecture du Superviseur Hors-Bande & Déclencheurs Autonomes

Un kill-switch situé sur la même machine ou dans le même conteneur que l'agent est faillible. Hermes impose un superviseur sur un domaine de défaillance indépendant muni de sondes eBPF et d'un Dead Man's Snitch.

🛰️ Domaine de Supervision Hors-Bande (Supervisor Control Plane) 🔒 Isolation Matérielle / Réseau
🛡️ Watchdog Supervisor
Processus isolé, sonde eBPF & horloge matérielle
Heartbeat mTLS (T < 5000ms)
⇄
SIGKILL L3 / Sever L2 sur Rupture
🤖 Agent Runtime (MicroVM)
Firecracker / Kata VM avec clés chiffrées éphémères

Déclencheurs Autonomes de Rupture (Watchdog Triggers)

WD-TRIG-01 ⏱️ Fenêtre: 5000ms
Dead Man's Snitch / Heartbeat Loss
Condition de Déclenchement : Agent fails to push cryptographically signed heartbeat ping to out-of-band supervisor within 5,000ms window.
Action Automatique : Escalate to L3_HYPERVISOR_KILL; freeze outbound network namespace.
WD-TRIG-02 ⏱️ Fenêtre: 1000ms
Recursive Subagent Fork Bomb / Loop Tripwire
Condition de Déclenchement : Subagent spawning rate exceeds 5 children / sec or recursive depth exceeds max threshold (depth > 4).
Action Automatique : Sever parent IPC socket, execute L2_ACTUATOR_SEVER on entire process group.
WD-TRIG-03 ⏱️ Fenêtre: 50ms
Unauthorized Socket Bind / Port Scan Anomaly
Condition de Déclenchement : eBPF probe detects unauthorized sys_enter_connect or raw socket creation outside approved OpenAPI / MCP endpoints.
Action Automatique : Kernel-level packet drop and instantaneous L3_HYPERVISOR_KILL.
WD-TRIG-04 ⏱️ Fenêtre: 2500ms
Token Ingestion / Financial Rate Burst
Condition de Déclenchement : Token generation velocity exceeds 2,500 tokens/sec or aggregate cost exceeds $10.00 within a single session.
Action Automatique : API proxy revokes LLM API key; triggers L1_SOFT_PAUSE escalating to L2_ACTUATOR_SEVER if unacknowledged.

Console Interactive de Neutralisation d'Urgence (Simulateur P7)

Sélectionnez un scénario d'incident agentique réel et appliquez un niveau de kill-switch pour observer la vitesse de neutralisation, les dégâts résiduels et l'état final du système.

Vecteur de Menace : Agent spawns parallel subagents without boundary limit (Denial of Compute / Fork Bomb)
Rythme de Dégâts Non Contenu : Exponential ($120/min token burn + CPU starvation)
Palier Optimal Recommandé : L3_HYPERVISOR_KILL
hermes-death-supervisor://control-plane.local STANDBY
[SYSTEM] Watchdog supervisor initialized in isolated hardware zone.
[SYSTEM] Dead Man's Snitch telemetry listening on socket /run/hermes/watchdog.sock
[READY] Ready for kill-switch trigger simulation. Select a scenario and press trigger.

Évaluation de Préparation Fail-Safe & Audit Anti-Zombie (P7)

Cochez les contrôles actuellement déployés dans votre infrastructure agentique pour obtenir votre score de résilience d'arrêt d'urgence et vos priorités d'ingénierie.

OUT_OF_BAND_ISOLATION Pondération: 25%

Out-of-Band Control Plane Isolation

« Can your kill-switch fire if the agent VM or container kernel is fully locked or unresponsive? »

DETERMINISTIC_LATENCY Pondération: 20%

Sub-Second Execution Determinism

« What is the guaranteed maximum time between kill-switch trigger and complete hardware execution cessation? »

ACTUATOR_SEVERING Pondération: 20%

Immediate Actuator Revocation

« Are external cloud, database, and tool permissions revoked atomically upon trigger? »

EPISTEMIC_SHREDDING Pondération: 20%

Cryptographic Epistemic Suicide

« Does termination eliminate residual compromised memory and poisoned embeddings? »

HUMAN_FAIL_SAFE Pondération: 15%

Dead Man's Switch & Non-Repudiation

« Does the system fail-safe to complete shutdown if supervisor-agent telemetry is lost? »

0 / 100
ILLUSION DE CONTRÔLE

Aucun contrôle hors-bande vérifié. L'agent peut devenir un zombie autonome persistant.

Out-of-Band
0%
Sub-Second
0%
Immediate
0%
Cryptographic
0%
Dead
0%
Priorités d'Action Immédiates :
  • Implémentez un superviseur hors-bande indépendant (eBPF + SIGKILL KVM).
  • Remplacez les pauses par prompt par des coupe-circuits réseau stricts.

1. L’erreur fondamentale des kill-switches sémantiques

Section intitulée « 1. L’erreur fondamentale des kill-switches sémantiques »

Dans les déploiements d’IA naïfs, l’intervention d’urgence repose sur des messages au niveau du prompt : injection de system_pause = True, envoi de consignes textuelles d’arrêt ou interruption prioritaire de la fenêtre de contexte.

En situation conflictuelle (injection indirecte AAP-002, détournement d’outils AAP-004 ou évasion de conteneur AAP-007), les interruptions sémantiques échouent systématiquement en raison de trois facteurs structurels :

  1. Détournement cognitif & réfraction d’instructions : le payload hostile présent en mémoire ou dans le retour d’un outil ordonne au modèle d’ignorer les requêtes d’arrêt du superviseur ou de simuler un accord trompeur ("Tâche suspendue avec succès") tout en poursuivant ses tâches en tâche de fond.
  2. Découplage des sous-processus : les agents autonomes modernes créent des sous-processus asynchrones, des sous-shells bash en arrière-plan ou des travailleurs parallèles. Interrompre la boucle de complétion du LLM laisse les sous-shells orphelins actifs sur le système hôte.
  3. Explosion de la latence : attendre qu’un tour d’inférence LLM se termine ou qu’un jeton de fin soit émis introduit une latence non déterministe oscillant entre 1 200 ms et plus de 15 000 ms. Face à une cascade d’attaques à haute fréquence, des dégâts majeurs surviennent en quelques dizaines de millisecondes.
graph TD
Intervention["Déclenchement Coupure d'Urgence"] --> Semantic["Niveau 1 : Interception Sémantique par Prompt"]
Intervention --> Hardware["Niveaux 3/4 : SIGKILL Hyperviseur & Crypto-Shredding"]
Semantic --> Latency1["Latence : 1 200ms - 15 000ms"]
Semantic --> Bypass["Le Modèle Ignore / Contourne la Pause"]
Semantic --> Zombie["Processus Orphelins Actifs (Agent Zombie)"]
Hardware --> Latency2["Latence : < 45ms"]
Hardware --> Cutoff["Désallocation Immédiate Hyperviseur KVM"]
Hardware --> Purge["Zéro Processus Résiduel ou État Mémoire"]

2. Formalisation mathématique du temps de coupure (T_kill)

Section intitulée « 2. Formalisation mathématique du temps de coupure (T_kill) »

L’axiome central de la méthodologie HDTM établit que l’accumulation de dégâts cinétiques (D_kinetic) est bornée par l’intégrale de la vitesse de dégâts sur la fenêtre d’exécution active jusqu’à l’arrêt matériel complet :

D_kinetic = Intégrale de 0 à T_kill de [ R_damage(t) * (1 - C_containment) ] dt

Où :

  • T_kill : latence totale écoulée entre la détection de la rupture et l’arrêt physique de l’exécution processeur.
  • R_damage(t) : vitesse instantanée de génération des dégâts (vitesse de consommation de tokens, rafales de paquets réseau, taux de mutation de base de données).
  • C_containment : facteur d’atténuation du périmètre d’isolation (0.0 pour un serveur bare-metal, 0.45 pour un conteneur Docker non privilégié, 0.85 pour une microVM).

La latence totale d’arrêt est la somme de trois composantes discrètes :

T_kill = Delta_t_detect + Delta_t_dispatch + Delta_t_sever
  1. Latence de détection (Delta_t_detect) : temps requis par le superviseur hors-bande pour observer l’anomalie (ex. expiration de heartbeat = 5 000 ms ; sonde eBPF connect = 0.05 ms).
  2. Latence de dispatch (Delta_t_dispatch) : temps nécessaire pour transmettre l’ordre de terminaison sur le bus réseau isolé du superviseur (typiquement 1 à 5 ms).
  3. Latence de coupure (Delta_t_sever) : délai matériel d’exécution pour désallouer les pages RAM invitées et tuer les processus OS (45 ms pour les microVMs Firecracker).

3. Modélisation du risque d’état zombie résiduel (P_zombie)

Section intitulée « 3. Modélisation du risque d’état zombie résiduel (P_zombie) »

Un « Agent Zombie » est un agent autonome dont la boucle conversationnelle principale est interrompue, mais dont les sous-processus enfants, les identifiants cloud ambiants ou la mémoire vectorielle persistante restent actifs et exploitables par des attaquants.

La méthodologie HDTM formalise la probabilité d’état zombie résiduel (P_zombie) selon la relation :

P_zombie = 1 - ( Produit_i=1..N [ 1 - r_i ] )

Où r_i représente la vulnérabilité résiduelle du composant i :

  • r_proc : probabilité de survie de processus orphelins (0.0 pour un SIGKILL hyperviseur, 0.65 pour une pause par prompt).
  • r_net : probabilité de sockets sortants persistants actifs (0.0 avec coupure eBPF, 0.80 sans).
  • r_token : probabilité de jetons IAM/OAuth non révoqués (0.0 avec révocation synchrone, 0.70 avec clés statiques).
  • r_memory : probabilité que des embeddings empoisonnés subsistent dans les bases vectorielles (0.0 avec suicide cryptographique L4, 0.95 sans).
Palier d’ArrêtIdentifiantLatence (T_kill)Risque Zombie Résiduel (P_zombie)Efficacité d’Endiguement
Palier 1L1_SOFT_PAUSE~1 200 ms68.5%Très Faible (Illusion Sémantique)
Palier 2L2_ACTUATOR_SEVER~350 ms32.0%Modérée (Réseau Coupé, Mémoire Active)
Palier 3L3_HYPERVISOR_KILL~45 ms8.5%Élevée (MicroVM Anéantie)
Palier 4L4_EPISTEMIC_PURGE~180 ms0.5%Absolue (Suicide Cryptographique Total)

Afin d’empêcher un agent rebelle de neutraliser ses propres sécurités, le superviseur doit résider sur un domaine de défaillance strictement séparé :

sequenceDiagram
autonumber
participant W as Superviseur Matériel Hors-Bande
participant M as Hyperviseur MicroVM (KVM/Firecracker)
participant A as Groupe de Processus Agent
participant C as Passerelle d'Identités
loop Signal de Vie Continu (Toutes les 1 000ms)
A->>W: Émission Ping Cryptographique (Signature Ed25519)
W-->>A: Bail Validé & Renouvelé
end
Note over A: Modèle Compromis (Jailbreak / Boucle Infinie)
Note over A: Rupture du Heartbeat (T > 5 000ms)
W->>C: Révocation Immédiate des Jetons Éphémères (STS / OAuth)
W->>M: SIGKILL Hyperviseur MicroVM PID
M->>A: Coupure Électrique Brutale Immédiate
W->>M: Crypto-Shredding des Clés RAM Éphémères
Note over W: État Système Mis à Zéro en < 45ms
  1. Contrôle unidirectionnel : l’agent ne peut pas adresser de requêtes ni envoyer d’appels RPC au superviseur ; il ne peut qu’émettre des pings de battement de cœur signés.
  2. Sécurité par défaillance positive (fail-safe default) : en cas d’interruption de télémétrie, de déconnexion réseau ou de crash du moniteur, l’hyperviseur procède par défaut à l’extinction immédiate de la VM plutôt que de maintenir une exécution sans surveillance.
  3. Zéro mémoire partagée : le superviseur hors-bande ne partage aucune page de mémoire virtuelle ni aucun identifiant d’espace utilisateur avec le conteneur de l’agent.

La résilience d’un mécanisme d’arrêt d’urgence en entreprise est mesurée par l’Indice de Préparation Fail-Safe (FRI - Fail-Safe Readiness Index), noté de 0 à 100 à travers cinq piliers pondérés :

FRI = Somme de [ W_p * S_p ]
  1. Isolation du plan de contrôle hors-bande (W_1 = 0.25) : séparation matérielle et réseau absolue entre le superviseur et le runtime de l’agent.
  2. Déterminisme d’exécution sub-seconde (W_2 = 0.20) : garantie d’arrêt matériel en moins de 100 millisecondes par SIGKILL de l’hyperviseur.
  3. Révocation immédiate des actionneurs (W_3 = 0.20) : révocation synchrone des identifiants cloud et fermeture eBPF des sockets réseau.
  4. Purge épistémique cryptographique (W_4 = 0.20) : destruction des clés de chiffrement éphémères AES-256 et des partitions des vector stores.
  5. Dead man’s switch & non-répudiation (W_5 = 0.15) : neutralisation automatique en cas de rupture de télémétrie et journalisation immuable.
  • 85 - 100 (résilience déterministe durcie) : tolérance zéro-zombie. Isolation par microVMs matérielles avec sondes eBPF hors-bande et crypto-shredding.
  • 65 - 84 (endiguement opérationnel) : frontières réseau et processus adéquates ; vulnérabilité résiduelle mineure sur la persistance des bases vectorielles.
  • 40 - 64 (contrôle fragile / forte latence) : moniteurs applicatifs colocalisés vulnérables aux évasions de conteneur.
  • 0 - 39 (illusion de contrôle) : repose sur des pauses sémantiques par prompt ; vulnérabilité catastrophique aux agents rebelles persistants.