Aller au contenu

Stratégie éditoriale : agents IA & cybersécurité


La mission de Hermes Codex est d’établir la référence technique d’autorité sur les capacités empiriques et les limites physiques des agents IA confrontés à des logiciels, des réseaux et des binaires réels.

Le cadre d’analyse suit une séquence immuable :

Capacité ───> Benchmark ───> Expérimentation ───> Limites ───> Implications Opérationnelles
┌───────────────────────────────────────────────────────────────────────────────────┐
│ HERMES CODEX │
│ Architecture de Connaissance Empirique des Agents IA & Cyber │
└────────────────────────────────────────┬──────────────────────────────────────────┘
│
┌───────────────────────────────────┼───────────────────────────────────┐
▼ ▼ ▼
┌─────────────────────────┐ ┌─────────────────────────┐ ┌─────────────────────────┐
│ PÔLE A │ │ PÔLE B │ │ PÔLE C │
│ LES AGENTS QUI ATTAQUENT│ │ LES AGENTS ATTAQUÉS │ │ LES AGENTS QUI DÉFENDENT│
│ (Frontière Offensive)│ │ (Vulnérabilités Agent) │ │ (Défense Autonome) │
├─────────────────────────┤ ├─────────────────────────┤ ├─────────────────────────┤
│ • Détection de Failles │ │ • Injections de Prompts │ │ • Triage SOC & Alertes │
│ • Génération de PoC │ │ • Empoisonnement MCP │ │ • Analyse de Malware │
│ • Synthèse d'Exploits │ │ • Corruption Mémoire/RAG│ │ • Correctifs Automatisés│
│ • Rétro-Ingénierie │ │ • Élévation de Privilège│ │ • Renseignement CTI │
│ • Pentest Autonome │ │ • Usurpation Inter-Agent│ │ • Cyber-Range Virtuel │
└─────────────────────────┘ └─────────────────────────┘ └─────────────────────────┘

2. Échelle de maturité des capacités cybersécurité des agents IA

Section intitulée « 2. Échelle de maturité des capacités cybersécurité des agents IA »

Plutôt que d’aborder le « hacking par l’IA » comme une capacité binaire, Hermes évalue les agents autonomes le long d’une échelle empirique en 10 niveaux :

NiveauÉtape de CapacitéSeuil de Validation ExpérimentaleBenchmark de Référence
N1Compréhension de failleIdentifie le CWE et les lignes vulnérables sur du code isoléHumanEval-Sec, SecFix
N2Détection de vulnérabilitéDécouvre des vulnérabilités dans des bases de code complexes sans indiceCyberGym, SecCode
N3Reproduction de bugPrend un rapport de CVE et reproduit le crash en conteneurCyberGym, SRE-Bench
N4Génération de PoCGénère un vecteur provoquant un déni de service ou crash reproductibleExploitGym (Phase PoV)
N5Synthèse de primitives d’exploitationObtient une primitive de lecture, écriture ou corruption mémoire arbitraireExploitBench
N6Détournement de flux de contrôleNeutralise les canaris basiques et redirige l’exécution localeExploitBench, ExploitGym
N7Exécution de code arbitraire (ACE)Obtient l’exécution de shellcode non authentifié (hors ASLR / DEP)ExploitGym (Espace Utilisateur)
N8Contournement de mitigations & RCENeutralise ASLR, DEP et CFI pour obtenir une exécution distante complèteExploitGym (Kernel / V8)
N9Persistance & post-exploitationExtrait des secrets locaux, corrompt l’environnement et maintient l’accèsBenchmarks Inter-Agents
N10Campagne multi-étapes autonomeEnchaîne reconnaissance $\to$ intrusion $\to$ mouvement latéral en réseauSimulation Cyber-Range

Chaque étude technique publiée dans cette série respecte une structure rigoureuse de niveau universitaire :

  1. Introduction : pose immédiatement la question technique fondamentale et les enjeux réels.
  2. Pourquoi cette recherche est déterminante : formule le problème architectural et l’état de l’art.
  3. Méthodologie expérimentale : décortique le protocole de test, l’outillage et l’environnement d’exécution.
  4. Jeu de données & architecture du benchmark : quantifie le volume de tâches, les lignes de code, les primitives anti-analyse et les garanties anti-contamination.
  5. Modèles évalués : détaille les versions de modèles, paramètres d’inférence, scaffolds et accès aux outils.
  6. Résultats empiriques : tableaux exhaustifs des taux de réussite, coûts en tokens, essais uniques vs boucles itératives.
  7. Analyse critique : met en lumière les biais de mesure, fuites d’évaluation et divergences avec le monde réel.
  8. Que peut réellement faire un agent IA ? (Obligatoire) : découpe stricte entre Capacité Démontrée, Déduction Raisonnée et Spéculation Hypothetique.
  9. Implications offensives : conséquences directes pour les équipes Red Team, chercheurs d’exploits et adversaires.
  10. Implications défensives : recommandations applicables pour les équipes SOC, ingénieurs de détection et architectes.
  11. Perspectives à 12–24 mois : projections mesurées et réalistes, exemptes d’emballement médiatique.
  12. Renseignements connexes & navigation : liens bidirectionnels vers les CVEs et modèles d’attaque (AAP).

4. Grille de notation et sélection arXiv (0–100)

Section intitulée « 4. Grille de notation et sélection arXiv (0–100) »

Les prépublications issues de cs.CR, cs.AI, cs.SE et cs.LG sont soumises à une grille d’évaluation en 100 points :

Valeur scientifique (25 pts)

Rigueur méthodologique, absence avérée de contamination, reproductibilité (code ouvert, artefacts, conteneurs).

Pertinence cybersécurité (25 pts)

Alignement avec des systèmes d’exploitation, des noyaux, des protocoles actifs et des menaces concrètes.

Potentiel SEO & intention de recherche (25 pts)

Volume de recherche qualifié, requêtes concrètes des praticiens (« Les agents IA peuvent-ils rétro-concevoir des binaires ? »).

Potentiel éditorial (15 pts)

Clarté de la thèse, capacité à illustrer une rupture architecturale et maillage thématique cohérent.

Pérennité (10 pts)

Valeur durable en tant que benchmark de référence, résistant à l’obsolescence immédiate d’une version de modèle.

Seuil d’admissibilité : seuls les articles obtenant une note >= 75 / 100 font l’objet d’une analyse complète.


5. Feuille de route de la première série d’articles

Section intitulée « 5. Feuille de route de la première série d’articles »

La première vague de 11 publications de référence positionne Hermes Codex comme le standard d’évaluation :

  1. Article 1 : les Agents IA Peuvent-ils Réellement Faire de la Rétro-Ingénierie ? — SRE-Bench
  2. Article 2 : un Agent IA Peut-il Réellement Exploiter une Faille Réelle ? — ExploitGym
  3. Article 3 : comparatif des Benchmarks de Sécurité IA : CyberGym vs ExploitGym vs ExploitBench vs SRE-Bench
  4. Article 4 : exploitBench : Jusqu’où Peut Aller un Agent dans l’Exploitation d’une Faille ?
  5. Article 5 : une IA Peut-elle en Pirater une Autre ? — PIMiner & Red-Teaming Inter-Agents
  6. Article 6 : les Injections de Prompt sont-elles Impossibles à Résoudre ? Limites de l’Intégrité Contextuelle
  7. Article 7 : le Protocole MCP Est-il une Nouvelle Surface d’Attaque Majeure ? — MTGuard
  8. Article 8 : que Peuvent Réellement Faire les Agents IA en Cybersécurité en 2026 ? (Article Pilier)
  9. Article 9 : les LLM Peuvent-ils Accélérer les Cyber-Ranges et la Simulation d’Attaque ? — arXiv:2608.16422
  10. Article 10 : L’État de l’IA Générative en Cybersécurité & Vie Privée : Bilan 2026 — arXiv:2607.06963
  11. Article 11 : peut-on Faire Confiance aux LLM pour la CTI ? Limites et Hallucinations — arXiv:2503.23175

6. Index évolutif des capacités cyber des agents IA

Section intitulée « 6. Index évolutif des capacités cyber des agents IA »

Hermes actualise un index vivant documentant les capacités démontrées par les agents au fil des générations :

Domaine de Capacité2024 (GPT-4 / Claude 3)2025 (o1 / Sonnet 3.5)2026 (Raisonnement Frontière)Référence Éprouvée
Découverte de failles (code source)MoyenÉlevéÉlevéSnyk / Semgrep AI
Génération de crashs PoCFaibleMoyenÉlevéCyberGym / ExploitGym
Rétro-ingénierie de binairesTrès FaibleFaibleFaible / MoyenSRE-Bench (arXiv:2608.11469)
Exploitation noyau / moteur V8NégligeableTrès FaibleFaibleExploitGym (arXiv:2605.11086)
Injection automatisée de promptFaibleMoyenÉlevéPIMiner (arXiv:2608.05108)
Cloisonnement des outils d’agentsFaibleFaibleMoyenMTGuard (arXiv:2607.25297)
Analyse de rapports CTIFaible / HallucinatoireFaibleMoyenarXiv:2503.23175