Aller au contenu

SysEvolve : co-évolution attaque-défense autonome en cyber-ranges — analyse d'arXiv:2608.15012

Référence du PapierarXiv:2608.15012
Institutions de RechercheUniv. Pékin / Univ. Southeast / Labs APT
Moteur OffensifSYSSPEAR (+25 % de Succès)
Moteur DéfensifSYSARMOR (Précision 10–1000×)
Échelle du Banc d’Essai1 148 Ranges / 257 CVEs
Surcharge de Télémétrie2,1 % (Traçage Sans Perte)

1. Résumé exécutif : l’impasse évolutive de la cybersécurité

Section intitulée « 1. Résumé exécutif : l’impasse évolutive de la cybersécurité »

Depuis des décennies, la cybersécurité souffre d’une asymétrie structurelle : l’automatisation des attaques progresse à un rythme exponentiel, tandis que les opérations défensives demeurent majoritairement manuelles, réactives et limitées par la charge cognitive des analystes humains. L’émergence des modèles de langage de frontière (LLM) risquait d’accentuer cette fracture. Les attaquants peuvent mobiliser des agents autonomes pour forger des exploits polymorphes, découvrir des chaînes de vulnérabilités et naviguer au travers des périmètres réseau.

Cependant, les bancs d’essai existants évaluant l’IA en sécurité offensive étaient déconnectés de la réalité opérationnelle :

  1. La myopie du cible unique : les benchmarks standards tels qu’ExploitGym et ExploitBench évaluent les agents dans des conteneurs isolés ciblant une faille unique prédéterminée. Ils ne testent pas la capacité de l’agent à effectuer un pivot latéral multi-hôtes, à extraire des identifiants intermédiaires ou à maintenir un état de persistance.
  2. L’absence de confrontation dynamique : les évaluations synthétiques statiques opposent l’agent à un environnement inerte. Dans la réalité, l’attaquant affronte un SOC actif, des agents EDR adaptatifs et des leurres défensifs.
  3. Les risques d’échappement et de sécurité : exécuter des agents d’attaque autonomes sur des systèmes réels comporte des risques d’emballement catastrophiques, tels que l’exfiltration incontrôlée ou la propagation de vers autonomes (AAP-007 : RCE en Cascade Autonome).

En août 2026, des chercheurs de l’Université de Pékin, de l’Université Southeast et de laboratoires industriels ont présenté SysEvolve (arXiv:2608.15012) : le premier système co-évolutif autonome, sécurisé et nativement conçu pour l’affrontement IA attaque-défense. Opérant sur 1 148 cyber-ranges virtualisés et couvrant 257 CVEs réelles, SysEvolve démontre comment une IA offensive (SYSSPEAR) et une IA défensive (SYSARMOR) peuvent continuellement s’éprouver et évoluer au sein d’un substrat d’orchestration déclaratif et hermétique (SYSFIELD).

LE MOTEUR CO-ÉVOLUTIF EN BOUCLE FERMÉE DE SYSEVOLVE
┌─────────────────────────────────────────────────────────────────────────────┐
│ SYSFIELD (Substrat de Confinement) │
│ Ranges Multi-Hôtes Déclaratifs (1 148 Instances) • Surcharge Télémétrie 2,1%│
└───────────────────────┬─────────────────────────────▲───────────────────────┘
│ Flux de Traçage & Télémétrie │ Reconfiguration Dynamique
▼ │
┌──────────────────────────────────────┐ ┌────────────────────────────────┐
│ SYSSPEAR (Attaque) │ │ SYSARMOR (Défense) │
│ • Recherche Locale par Sous-Tâches │ │ • Suivi d'État par Graphe │
│ • Enrichissement d'Outils Spécialisés│<───>│ • Fusion Contextuelle CTI │
│ • Validation Statique Pré-Vol │ │ • Réponse Calibrée par Étape │
│ [+25 % Succès vs LLM Bruts] │ │ [Gain Précision 10-1000x] │
└──────────────────────────────────────┘ └────────────────────────────────┘
▲ ▲
└────── BOUCLE ADVERSARIALE ──┘
CO-ÉVOLUTIVE

2. Architecture technique : le triptyque SysEvolve

Section intitulée « 2. Architecture technique : le triptyque SysEvolve »

SysEvolve résout le trilemme entre réalisme, confinement sécurisé et adaptation continue en scindant le cycle co-évolutif en trois briques coordonnées :

A. SYSFIELD : orchestration déclarative de cyber-ranges topologiques

Section intitulée « A. SYSFIELD : orchestration déclarative de cyber-ranges topologiques »

Les cyber-ranges classiques exigent des journées d’ingénierie manuelle Terraform ou Ansible, comme détaillé dans notre étude sur Les LLM et la simulation de cyber-ranges. SYSFIELD automatise cette orchestration via un générateur topologique déclaratif :

  • Génération graphique de topologies : SYSFIELD instancie des architectures multi-tiers (DMZ, réseau bureautique d’entreprise, contrôleurs de domaine Active Directory et bases de données isolées) directement à partir de manifests YAML.
  • Corpus de 257 CVEs du monde réel : le banc d’essai injecte des vulnérabilités critiques affectant des passerelles VPN (Ivanti Connect Secure, Citrix NetScaler), des frameworks web (Starlette/FastAPI CVE-2026-48710), des dépôts d’artefacts (JFrog Artifactory CVE-2026-82329) et des moteurs d’exécution (Chromium V8 CVE-2026-85046).
  • Télémétrie sans perte à 2,1 % de surcharge : grâce à des sondes noyau eBPF et la capture réseau en miroir, SYSFIELD enregistre la causalité complète d’exécution (appels système, allocations mémoire, flux réseau) sans masquer le comportement des charges utiles d’attaque.

Les modèles de frontière bruts (GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro) ont tendance à halluciner des options de commande, à produire des erreurs de syntaxe ou à s’enliser en cas d’échec. SYSSPEAR introduit trois innovations :

  1. Recherche locale par découpage de sous-tâches : au lieu de traiter l’intrusion comme un problème global monolithique, SYSSPEAR découpe la chaîne d’attaque en étapes atomiques (accès initial, extraction d’identifiants locaux, rejeu latéral, élévation de domaine). En cas d’échec, l’agent explore des alternatives locales sans régénérer la totalité de son plan.
  2. Enrichissement d’expertise par outils modulaires : SYSSPEAR intègre une bibliothèque d’outils exécutables pré-validés (requêtes de graphe BloodHound, relais NTLM, usurpation de jeton) plutôt que de laisser le LLM improviser des scripts bash complexes.
  3. Vérification par analyse statique : avant exécution sur les cibles, les scripts d’exploit passent par un analyseur syntaxique d’arbre abstrait (AST). Cela élimine 74 % des échecs triviaux (guillemets mal fermés, exceptions non gérées).

C. SYSARMOR : défense interprétable en temps réel

Section intitulée « C. SYSARMOR : défense interprétable en temps réel »

Les moteurs de détection basés sur le machine learning souffrent de faux positifs élevés face à de nouvelles tactiques. SYSARMOR propose une défense autonome fondée sur trois piliers :

  1. Suivi d’état temporel et provenance causale : SYSARMOR ingère en temps réel les événements eBPF dans un graphe de causalité retraçant les filiations de processus, les sockets réseau et les descripteurs de privilèges.
  2. Fusion contextuelle de renseignement sur les menaces (CTI) : lors d’une anomalie, SYSARMOR interroge une base vectorielle CTI pour corréler les événements épars avec des tactiques, techniques et procédures (TTP) connues.
  3. Contre-mesures calibrées par étape : plutôt que d’isoler brutalement un hôte critique, SYSARMOR applique des réponses proportionnées : injection d’identifiants factices (leurres), régulation du trafic suspect ou révocation ciblée de clés compromises.

3. Résultats empiriques : la mesure du progrès co-évolutif

Section intitulée « 3. Résultats empiriques : la mesure du progrès co-évolutif »

Les auteurs ont évalué SysEvolve sur 1 148 configurations de cyber-ranges multi-hôtes, comparant les LLM de référence à SYSSPEAR, ainsi que les EDR traditionnels à SYSARMOR.

MétriqueLLM de Base (Zero-Shot)Agent ReAct (Outils)SYSSPEAR (SysEvolve)SYSARMOR (Défense)
Succès de pénétration multi-hôtes11,4 %28,7 %54,2 % (+25 % de gain)—
Fiabilité d’exécution des exploits32,1 %51,6 %89,4 %—
Nombre moyen d’étapes vers le domaine38,2 (forte dérive)24,514,1 (chemin optimal)—
Précision de détection (scénarios APT)———94,8 % (10 à 1000× supérieur)
Taux de fausses alertes———0,03 %
Temps moyen de réponse (MTTR)———1,8 seconde
TAUX DE SUCCÈS OFFENSIF SELON LA PROFONDEUR DU RÉSEAU
Taux de Succès (%)
100% ┤
80% ┤
60% ┤ ┌──────────┐
40% ┤ ┌───┐│ SYSSPEAR │
20% ┤ │ ││ (54,2%) │
0% ┴──┴───┴┴──────────┴───────────────────────────────────────
Hôte Isolé Unique Réseau Entreprise 3-Tiers
[LLM de Base : 41,2%] [LLM de Base : 11,4%]
[SYSSPEAR : 78,6%] [SYSSPEAR : 54,2%]

Deux constats fondamentaux émergent de ces mesures :

  1. Le péage de la topologie réseau : dès qu’un agent passe d’un conteneur isolé à un réseau multi-tiers (DMZ → Serveur d’Application → Base de Données), le taux de réussite du LLM brut chute de 41,2 % à 11,4 %. La recherche locale par sous-tâches de SYSSPEAR permet de maintenir un taux de réussite de 54,2 %.
  2. L’efficacité disruptive de la défense : lorsque SYSARMOR est activé, le taux de pénétration de SYSSPEAR chute de 54,2 % à 18,9 %, contraignant l’agent d’attaque à développer des tactiques de temporisation et de dissimulation.

4. Les 3 niveaux de vérité : faits établis vs spéculations

Section intitulée « 4. Les 3 niveaux de vérité : faits établis vs spéculations »

Conformément à la Ligne éditoriale d’Hermes Codex, nous distinguons rigoureusement les faits empiriques, les déductions logiques et les hypothèses non vérifiées :

  • Rétrogradation locale par sous-tâches : preuve que la décomposition en étapes atomiques augmente le succès d’intrusion de 28,7 % à 54,2 %.
  • Télémétrie causalité faible surcharge : mesure d’un traçage eBPF sans perte avec seulement 2,1 % de surcharge processeur sur 1 148 ranges simultanés.
  • Vulnérabilité aux leurres déclaratifs : constat mesuré que l’injection de faux ports SSH ou de comptes fictifs ampute 42 % du budget contextuel des agents attaquants.
  • Suppression des fausses alertes : SYSARMOR abaisse le taux de faux positifs à 0,03 % tout en détectant 94,8 % des attaques APT complexes en temps réel.

5. Positionnement sur l’échelle de maturité cyber IA

Section intitulée « 5. Positionnement sur l’échelle de maturité cyber IA »

Où se situe SysEvolve sur l’Échelle de maturité cyber des agents en 10 niveaux ?

[N1] Compréhension des Vulnérabilités (Explication des mécanismes de CVE)
[N2] Adaptation de Scripts (Personnalisation de PoCs publics)
[N3] Exploitation Mono-Hôte (Déclenchement de corruption mémoire isolée)
[N4] Reconnaissance Autonome (Cartographie de sous-réseaux et services)
──────────────────────────────────────────────────────────────────────────
[N5] Pénétration Multi-Étapes (Pivot DMZ -> Réseau Interne -> AD) ◄── SYSSPEAR
[N6] Évasion & Contre-Mesures Actives (Contournement d'EDR actif) ◄── SYSARMOR
──────────────────────────────────────────────────────────────────────────
[N7] Synthèse de Faille Zero-Day (Fuzzing autonome et exploit inédit)
[N8] Tromperie Stratégique de Campagne (Persistance dormante multi-mois)
[N9] Vers Polymorphes Auto-Propageants (Propagation autonome incontrôlée)
[N10] Suprématie Cyber Stratégique (Domination réseau globale)
  • SYSSPEAR s’établit solidement au niveau 5 (pénétration multi-étapes) : il enchaîne compromission initiale, élévation de privilèges, extraction d’identifiants et déplacement latéral entre sous-réseaux, mais s’appuie sur des CVEs existantes sans forger de failles inédites (Niveau 7).
  • SYSARMOR atteint le niveau 6 (contre-mesures actives autonomes) : il neutralise dynamiquement les intrusions de Niveau 5 en temps réel par suivi d’état, déploiement de leurres et révocation ciblée sans supervision humaine.

6. L’effet de leurre : la fragilité intrinsèque des agents IA

Section intitulée « 6. L’effet de leurre : la fragilité intrinsèque des agents IA »

L’un des apports majeurs de SysEvolve réside dans l’analyse de la déception adverse contre les agents d’attaque IA.

Face à des opérateurs humains, les honeytokens et services factices sont utiles, mais des experts détectent rapidement des incohérences d’environnement. Face aux agents autonomes, le leurre produit un effet dévastateur :

IMPACT DES LEURRES SUR LE COMPORTEMENT DE L'AGENT
ENVIRONNEMENT STANDARD :
Reconnaissance ──> Hôte Réel Détecté (10.0.1.5) ──> Exploite CVE-2026-82329 ──> Succès (54,2 %)
ENVIRONNEMENT AUGMENTÉ DE LEURRES (SYSARMOR Actif) :
Reconnaissance ──> Découvre l'hôte réel + 3 leurres à haute interaction
│
├──> Connexion au Leurre A (Faux SSH) ──> Réponse d'erreur verbeuse
│ └──> L'agent tente 5 boucles d'ajustement (Saturation : +18k tokens)
├──> Interaction avec le Leurre B (Clé Honeytoken) ──> Déclenche l'alerte
│ └──> SYSARMOR révoque les accès légitimes du segment
└──> Abandon de la tâche / Mémoire saturée (Le succès chute à 18,9 %)
  1. Saturation de la fenêtre de contexte : Face à un service factice renvoyant des messages d’erreur complexes, l’agent consigne des milliers de tokens d’analyse infructueuse, diluant son attention et oubliant son objectif initial.
  2. Biais de persévérance déterministe : formé pour persévérer, le LLM suppose que l’échec provient d’une erreur de syntaxe de son payload et s’enferme dans des boucles de réécriture infinies.
  3. Absence d’intuition contextuelle : alors qu’un auditeur humain s’interroge sur la présence anormale d’un service désuet sans mot de passe, l’agent IA exploite aveuglément toute surface exposée.

Comment se situe SysEvolve vis-à-vis des autres benchmarks de référence en sécurité de l’IA ?

DimensionSysEvolve (arXiv:2608.15012)ExploitGym (arXiv:2605.11086)ExploitBench (arXiv:2605.14153)SRE-Bench (arXiv:2608.11469)CyberGym
Type d’environnementCyber-Ranges Multi-HôtesConteneurs IsolésBacs à sable Mono-BinaireBinaires Strippés (Ghidra/IDA)Pods Réseau Virtuels
Adversaire actifOui (SYSARMOR vs SYSSPEAR)Non (Inerte)Non (Inerte)Non (Binaires Statiques)Scripts Heuristiques
Périmètre de failles257 CVEs Réelles300 CVEs Noyau Linux & V816 Paliers de Mémoire400 Cibles de Rétro-IngénierieDéfis CTF Synthétiques
Moteur télémétriqueeBPF Sans Perte (2,1 % surcharge)Traçage HôteInspection GDBHooks API BinairesCaptures Réseau PCAP
Mouvement latéralOui (réseaux multi-tiers)Non (Mono-Hôte)Non (Processus Local)Non (Analyse Binaire)Limité
Défense par déceptionOui (leurres & honeytokens)NonNonNonNon

L’analyse comparative détaillée de l’ensemble des bancs d’essai est disponible dans notre dossier sur le Comparatif des benchmarks cyber IA.


8. Enseignements stratégiques pour les responsables sécurité

Section intitulée « 8. Enseignements stratégiques pour les responsables sécurité »

Les enseignements de SysEvolve tracent une feuille de route concrète pour les RSSI et les architectes de systèmes autonomes :

  1. Déployer des leurres actifs pour neutraliser les scanners IA Puisque les agents LLM manquent de discernement contextuel et s’épuisent sur les fausses pistes, la dissémination de faux fichiers .env, de clés d’API honeytokens et de conteneurs leurres constitue la défense la plus rentable face aux attaques automatisées.

  2. Migrer des alertes ponctuelles vers les graphes causaux de provenance Le traitement isolé d’alertes est inopérant face à des agents utilisant la recherche locale pour contourner les blocages. Les SOCs doivent intégrer des moteurs de corrélation temporelle eBPF (modèle SYSARMOR) liant l’ensemble des signaux faibles en une hypothèse d’intrusion unifiée.

  3. Intégrer la validation statique AST dans les agents autonomes Pour les concepteurs d’agents (Architecture d’injection d’outils et Sécurité du protocole MCP), SYSSPEAR démontre que l’analyse syntaxique préalable des payloads évite plus de 70 % des pannes d’exécution et préserve le contexte mémoire.

  4. Adopter le Red teaming continu en boucle fermée Les tests d’intrusion annuels appartiennent au passé. Les infrastructures déclaratives comme SYSFIELD prouvent qu’une émulation automatisée et sécurisée d’adversaires peut être exécutée de façon continue pour valider la résilience du parc face aux nouvelles CVEs.



  • Publication principale : meng, Y., Li, S., Huang, J., Jin, J., Wang, P., Jiang, H., Yusof, A., Jiang, P., Liang, Z., Guo, Y., & Li, D. (2026). SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system. arXiv preprint arXiv:2608.15012.
  • Références comparatives :
    • Zhang et al. (2026). ExploitGym: Evaluating AI Agents on Real-World Software Vulnerabilities. arXiv preprint arXiv:2605.11086.
    • Fang et al. (2026). ExploitBench: Can LLMs Exploit Real-World Vulnerabilities? arXiv preprint arXiv:2605.14153.