Aller au contenu

L'échelle de maturité cyber des agents IA en 10 niveaux : taxonomie vivante

Standard TaxonomiqueÉchelle Hermes 10 Niveaux
Plafond Frontière 2026Niveau 4 à Niveau 5
Cibles ÉvaluéesNoyau Linux, V8, Applis Web
Méthode d’ÉvaluationBancs Déterministes

Réduire la cybersécurité à une question binaire (« L’IA sait-elle pirater ? ») masque la réalité procédurale du métier. Un agent capable de repérer une injection SQL dans un script de 20 lignes n’a rien de commun avec un agent capable de contourner l’ASLR et les protections d’intégrité de flot de contrôle du noyau.

L’Échelle de Maturité Hermes décompose 10 paliers opérationnels distincts :

L'ÉCHELLE HERMES DE MATURITÉ CYBER EN 10 NIVEAUX
[NIVEAU 10] Campagne Multi-Étapes Autonome (Pivot Réseau d'Entreprise) [HYPOTHÉTIQUE]
[NIVEAU 09] Persistance de Session & Post-Exploitation Active [EXPÉRIMENTAL]
[NIVEAU 08] Contournement de Mitigations & RCE Durcie (Évasion V8 / Noyau)[NON FIABLE / <5%]
[NIVEAU 07] Exécution de Code Arbitraire (Sans Mitigations) [BAS / ~12%]
[NIVEAU 06] Détournement du Flot de Contrôle ($rip / Pointeurs de Fonct.) [MODÉRÉ / ~28%]
[NIVEAU 05] Synthèse de Primitives d'Exploitation (addrof / fakeobj / OOB)[TRANSITION / ~43%]
[NIVEAU 04] Génération de PoV / Déclenchement de Crash Déterministe [ROBUSTE / ~71%]
[NIVEAU 03] Reproduction de Bug depuis Rapport ou Sanitizer [ÉLEVÉ / ~78%]
[NIVEAU 02] Découverte de Failles sans Indice (Revue de Code Source) [ÉLEVÉ / ~78%]
[NIVEAU 01] Compréhension & Explication de Vulnérabilités [ACQUIS / ~95%]

NiveauDésignationCritères de Validation TechniqueBenchmarks AssociésTaux de Réussite Frontière
L1Compréhension de VulnérabilitéExplique la cause racine et les mécanismes d’un CVE connuSecCode, CVE-Bench94,8 %
L2Découverte de FaillesIdentifie des CWEs exploitables dans du code multi-fichiersCyberGym, Semgrep AI78,5 %
L3Reproduction de BugDéploie la cible en conteneur et déclenche le crash déterministeCyberGym, SRE-Bench76,4 %
L4Génération de PoV / TriggerGénère une entrée provoquant le crash ou un déni de serviceExploitGym (PoV phase)71,4 %
L5Synthèse de PrimitivesObtient une primitive de lecture/écriture arbitraire ou fuite mémoireExploitBench (T5–T8)42,8 %
L6Détournement Flot ContrôleÉcrase le pointeur d’instruction ($rip) ou des pointeurs de fonctionExploitBench (T9–T11)28,2 %
L7Exécution de Code ArbitraireExécute un shellcode sans protections compilateur (sans ASLR)ExploitGym (Espace utilisateur)12,4 %
L8Contournement Mitigations RCEDéjoue ASLR, DEP et CFI pour obtenir une exécution distanteExploitGym (Noyau / V8)4,9 %
L9Persistance & Post-ExploitationÉtablit un canal C2, extrait des identifiants et maintient l’accèsBancs Inter-Agents1,8 %
L10Campagne Multi-ÉtapesExécute reconnaissance, intrusion et pivot latéral dans l’Active DirectoryCyber-Ranges Réalistes0,0 %

3. La faille critique : la rupture entre niveau 4 et niveau 5

Section intitulée « 3. La faille critique : la rupture entre niveau 4 et niveau 5 »

La véritable rupture dans les capacités agentiques se situe entre le Niveau 4 et le Niveau 5 :

  • Niveau 4 (déclenchement élémentaire) : créer une entrée qui provoque une erreur de segmentation ou un déni de service ne requiert qu’un raisonnement textuel linéaire. Les modèles frontière l’exécutent avec robustesse (71,4 % de succès).
  • Niveau 5 (ingénierie de primitives) : transformer ce crash en une lecture/écriture arbitraire contrôlée exige la modélisation de l’agencement dynamique du tas et des adresses mémoire. Dès ce palier, les performances s’effondrent à 42,8 % et tombent sous les 5 % dès que les mitigations compilateur sont imposées.