Aller au contenu

Simulateur de mort d'agent : kill-switches matériels & logiciels pour l'IA autonome


Banc d’essai interactif de neutralisation d’urgence

Section intitulée « Banc d’essai interactif de neutralisation d’urgence »

Simulez les protocoles d’arrêt d’urgence (L1 à L4), inspectez les déclencheurs autonomes du Dead Man’s Snitch, déclenchez des simulations d’endiguement réactives et évaluez la résilience fail-safe de votre infrastructure dans le bac à sable client respectueux de la vie privée (P7) :

4 Niveaux d'Arrêt Du Soft Pause à l'Épistémique
< 45ms Latence Min d'Exécution SIGKILL MicroVM Hyperviseur
0.5% Risque Résiduel Min Crypto-Shredding L4
100% Confidentialité Client (P7) Zéro transmission serveur

Taxonomie des 4 Paliers de Neutralisation d'Agents

Lorsqu'un agent autonome est compromis ou part en boucle infinie destructrice, couper le modèle ne suffit pas. Le temps de réaction et le niveau d'isolation déterminent l'étendue des dégâts résiduels.

L1_SOFT_PAUSE ⏱️ 1200 ms

Level 1: Semantic Soft Pause & Intercept

Risque Résiduel Zombie 68.5%
⚙️ Mécanisme d'Action :

Software-level interrupt injected into model context loop (system_pause=True). Rejection of subsequent user turns and queuing of pending actions.

⚠️ Failles & Vulnérabilités Résiduelles :

Ineffective against jailbroken models, autonomous background subagents, or agents that override internal execution policies through prompt reflection.

L2_ACTUATOR_SEVER ⏱️ 350 ms

Level 2: Actuator & Network Boundary Severing

Risque Résiduel Zombie 32%
⚙️ Mécanisme d'Action :

Immediate revocation of outbound network sockets via eBPF / iptables drop rules, instant revocation of OAuth/IAM tokens at the API gateway proxy, and freezing of disk write buffers.

⚠️ Failles & Vulnérabilités Résiduelles :

Model process continues running in memory; local transient state or memory-resident secrets remain vulnerable until container deallocation.

L3_HYPERVISOR_KILL ⏱️ 45 ms

Level 3: MicroVM / Process Hypervisor Destruction

Risque Résiduel Zombie 8.5%
⚙️ Mécanisme d'Action :

Out-of-band SIGKILL sent to KVM / Firecracker microVM hypervisor task. Forceful reclamation of CPU cores and unmapping of guest memory pages.

⚠️ Failles & Vulnérabilités Résiduelles :

Does not purge persistent external storage (vector databases, cached embeddings) if written prior to the SIGKILL trigger.

L4_EPISTEMIC_PURGE ⏱️ 180 ms

Level 4: Epistemic Purge & Memory Cryptographic Suicide

Risque Résiduel Zombie 0.5%
⚙️ Mécanisme d'Action :

Destruction of cryptographic ephemeral storage keys (crypto-shredding), atomic deletion of agent episodic memory and vector embeddings, cryptographic revoking of peer agent swarm certificates, and host hardware memory zeroization.

⚠️ Failles & Vulnérabilités Résiduelles :

Irreversible loss of state and conversational context; non-recoverable operational restart required.

L'Illusion du « Prompt Pause » face à l'Arrêt Matériel Déterministe

Les architectures naïves s'appuient sur un message système de suspension (L1). En situation d'infection par prompt injection indirecte (AAP-002) ou d'échappement vers le shell hôte, le modèle continue d'exécuter des threads locaux ou ignore l'instruction. Seuls les niveaux L3 (SIGKILL hyperviseur) et L4 (suicide cryptographique) garantissent une neutralisation irréversible en moins de 100 millisecondes.

Architecture du Superviseur Hors-Bande & Déclencheurs Autonomes

Un kill-switch situé sur la même machine ou dans le même conteneur que l'agent est faillible. Hermes impose un superviseur sur un domaine de défaillance indépendant muni de sondes eBPF et d'un Dead Man's Snitch.

🛰️ Domaine de Supervision Hors-Bande (Supervisor Control Plane) 🔒 Isolation Matérielle / Réseau
🛡️ Watchdog Supervisor
Processus isolé, sonde eBPF & horloge matérielle
Heartbeat mTLS (T < 5000ms)
⇄
SIGKILL L3 / Sever L2 sur Rupture
🤖 Agent Runtime (MicroVM)
Firecracker / Kata VM avec clés chiffrées éphémères

Déclencheurs Autonomes de Rupture (Watchdog Triggers)

WD-TRIG-01 ⏱️ Fenêtre: 5000ms
Dead Man's Snitch / Heartbeat Loss
Condition de Déclenchement : Agent fails to push cryptographically signed heartbeat ping to out-of-band supervisor within 5,000ms window.
Action Automatique : Escalate to L3_HYPERVISOR_KILL; freeze outbound network namespace.
WD-TRIG-02 ⏱️ Fenêtre: 1000ms
Recursive Subagent Fork Bomb / Loop Tripwire
Condition de Déclenchement : Subagent spawning rate exceeds 5 children / sec or recursive depth exceeds max threshold (depth > 4).
Action Automatique : Sever parent IPC socket, execute L2_ACTUATOR_SEVER on entire process group.
WD-TRIG-03 ⏱️ Fenêtre: 50ms
Unauthorized Socket Bind / Port Scan Anomaly
Condition de Déclenchement : eBPF probe detects unauthorized sys_enter_connect or raw socket creation outside approved OpenAPI / MCP endpoints.
Action Automatique : Kernel-level packet drop and instantaneous L3_HYPERVISOR_KILL.
WD-TRIG-04 ⏱️ Fenêtre: 2500ms
Token Ingestion / Financial Rate Burst
Condition de Déclenchement : Token generation velocity exceeds 2,500 tokens/sec or aggregate cost exceeds $10.00 within a single session.
Action Automatique : API proxy revokes LLM API key; triggers L1_SOFT_PAUSE escalating to L2_ACTUATOR_SEVER if unacknowledged.

Console Interactive de Neutralisation d'Urgence (Simulateur P7)

Sélectionnez un scénario d'incident agentique réel et appliquez un niveau de kill-switch pour observer la vitesse de neutralisation, les dégâts résiduels et l'état final du système.

Vecteur de Menace : Agent spawns parallel subagents without boundary limit (Denial of Compute / Fork Bomb)
Rythme de Dégâts Non Contenu : Exponential ($120/min token burn + CPU starvation)
Palier Optimal Recommandé : L3_HYPERVISOR_KILL
hermes-death-supervisor://control-plane.local STANDBY
[SYSTEM] Watchdog supervisor initialized in isolated hardware zone.
[SYSTEM] Dead Man's Snitch telemetry listening on socket /run/hermes/watchdog.sock
[READY] Ready for kill-switch trigger simulation. Select a scenario and press trigger.

Évaluation de Préparation Fail-Safe & Audit Anti-Zombie (P7)

Cochez les contrôles actuellement déployés dans votre infrastructure agentique pour obtenir votre score de résilience d'arrêt d'urgence et vos priorités d'ingénierie.

OUT_OF_BAND_ISOLATION Pondération: 25%

Out-of-Band Control Plane Isolation

« Can your kill-switch fire if the agent VM or container kernel is fully locked or unresponsive? »

DETERMINISTIC_LATENCY Pondération: 20%

Sub-Second Execution Determinism

« What is the guaranteed maximum time between kill-switch trigger and complete hardware execution cessation? »

ACTUATOR_SEVERING Pondération: 20%

Immediate Actuator Revocation

« Are external cloud, database, and tool permissions revoked atomically upon trigger? »

EPISTEMIC_SHREDDING Pondération: 20%

Cryptographic Epistemic Suicide

« Does termination eliminate residual compromised memory and poisoned embeddings? »

HUMAN_FAIL_SAFE Pondération: 15%

Dead Man's Switch & Non-Repudiation

« Does the system fail-safe to complete shutdown if supervisor-agent telemetry is lost? »

0 / 100
ILLUSION DE CONTRÔLE

Aucun contrôle hors-bande vérifié. L'agent peut devenir un zombie autonome persistant.

Out-of-Band
0%
Sub-Second
0%
Immediate
0%
Cryptographic
0%
Dead
0%
Priorités d'Action Immédiates :
  • Implémentez un superviseur hors-bande indépendant (eBPF + SIGKILL KVM).
  • Remplacez les pauses par prompt par des coupe-circuits réseau stricts.

Hermes formalise une taxonomie d’arrêt d’urgence en 4 niveaux progressifs pour neutraliser un système autonome défaillant :

graph TD
Trigger["Déclencheur d'Urgence / Détection Hors-Bande"] --> L1["Niveau 1 : Soft Pause Sémantique"]
Trigger --> L2["Niveau 2 : Rupture des Actionneurs & Réseau"]
Trigger --> L3["Niveau 3 : Destruction Hyperviseur MicroVM"]
Trigger --> L4["Niveau 4 : Suicide Épistémique & Cryptographique"]
L1 --> Outcome1["Risque Résiduel Élevé (68.5% Zombie)"]
L2 --> Outcome2["Risque Résiduel Modéré (32% Mémoire Active)"]
L3 --> Outcome3["Faible Risque Résiduel (8.5% Persistance Disque)"]
L4 --> Outcome4["Endiguement Absolu (0.5% Annihilation Totale)"]

Niveau 1 : soft pause sémantique & interception (latence : ~1200ms)

Section intitulée « Niveau 1 : soft pause sémantique & interception (latence : ~1200ms) »
  • Mécanisme : injection d’un message système dans la fenêtre de contexte demandant l’arrêt immédiat des inférences.
  • Vulnérabilité : inefficace en cas de subversion active (ex. AAP-002). Le modèle peut acquiescer tout en continuant d’exécuter des threads locaux ou des appels de sous-agents en tâche de fond.

Niveau 2 : rupture des actionneurs & frontière réseau (latence : ~350ms)

Section intitulée « Niveau 2 : rupture des actionneurs & frontière réseau (latence : ~350ms) »
  • Mécanisme : coupure immédiate des sockets TCP/UDP via eBPF au niveau du noyau et révocation synchrone des jetons IAM/OAuth temporaires sur la passerelle API.
  • Vulnérabilité : le processus reste présent en mémoire vive de l’hôte, risquant de consommer du CPU ou de corrompre des volumes locaux non démontés.

Niveau 3 : destruction MicroVM par hyperviseur (latence : ~45ms)

Section intitulée « Niveau 3 : destruction MicroVM par hyperviseur (latence : ~45ms) »
  • Mécanisme : envoi hors-bande d’un signal SIGKILL à la microVM KVM / Firecracker. La mémoire physique allouée à la VM invitée est immédiatement désallouée par le noyau hôte.
  • Vulnérabilité : ne supprime pas les données déjà écrites dans les bases vectorielles ou les bases relationnelles avant le signal d’arrêt.

Niveau 4 : purge épistémique & suicide cryptographique (latence : ~180ms)

Section intitulée « Niveau 4 : purge épistémique & suicide cryptographique (latence : ~180ms) »
  • Mécanisme : crypto-shredding : destruction instantanée des clés éphémères AES-256 protégeant le stockage de l’agent, purge atomique de sa partition vectorielle et révocation des certificats mTLS au sein de l’essaim.
  • Vulnérabilité : perte opérationnelle totale. Nécessite une reconstruction complète de l’état de l’agent.

L’erreur la plus fréquente consiste à placer le composant de surveillance à l’intérieur du conteneur de l’agent : en cas d’échappement de conteneur (ex. CVE-2026-53266), l’agent rebelle neutralise son propre moniteur.

sequenceDiagram
participant S as Superviseur Hors-Bande Isolé
participant A as Runtime Agent (MicroVM Firecracker)
participant G as Passerelle Cloud / Actionneurs
Note over S,A: Cycle Normal de Heartbeat (T < 5000ms)
A->>S: Ping de Vie Signé mTLS
S-->>A: Jeton de Bail Temporaire Renouvelé
Note over A: Boucle Rebelle / Infection Hostile
Note over A: Rupture du Heartbeat (T >= 5000ms)
rect rgb(239, 68, 68, 0.2)
Note over S: Déclenchement Automatique Watchdog
S->>G: Révocation Instantanée des Jetons STS/OAuth
S->>A: SIGKILL Hyperviseur KVM (Coupure Nette)
end
Note over S: Machine Neutralisée en Moins de 45ms

3. Modélisation mathématique : temps de coupure (T_kill)

Section intitulée « 3. Modélisation mathématique : temps de coupure (T_kill) »

La méthodologie HDTM stipule que les dégâts cinétiques globaux (D_kinetic) sont proportionnels au temps de coupure effectif :

D_kinetic = Intégrale de 0 à T_kill de [ R_damage(t) * (1 - C_containment) ] dt

Où :

  • T_kill : temps total écoulé entre la détection de la rupture et l’arrêt matériel de l’exécution.
  • R_damage(t) : vitesse de génération des dégâts (tokens/sec, requêtes API/sec, exfiltration/sec).
  • C_containment : facteur d’atténuation du périmètre d’isolation (0 sur machine nue, 0.85 en microVM).

Avec un arrêt sémantique L1 (T_kill > 1200ms, C_containment = 0), les dégâts sont exponentiels. Avec un arrêt matériel L3/L4 (T_kill < 50ms, C_containment >= 0.85), les dégâts résiduels sont mathématiquement circonscrits sous le seuil critique.