Valeur scientifique (25 pts)
Rigueur méthodologique, absence avérée de contamination, reproductibilité (code ouvert, artefacts, conteneurs).
La mission de Hermes Codex est d’établir la référence technique d’autorité sur les capacités empiriques et les limites physiques des agents IA confrontés à des logiciels, des réseaux et des binaires réels.
Le cadre d’analyse suit une séquence immuable :
Capacité ───> Benchmark ───> Expérimentation ───> Limites ───> Implications Opérationnelles┌───────────────────────────────────────────────────────────────────────────────────┐│ HERMES CODEX ││ Architecture de Connaissance Empirique des Agents IA & Cyber │└────────────────────────────────────────┬──────────────────────────────────────────┘ │ ┌───────────────────────────────────┼───────────────────────────────────┐ ▼ ▼ ▼┌─────────────────────────┐ ┌─────────────────────────┐ ┌─────────────────────────┐│ PÔLE A │ │ PÔLE B │ │ PÔLE C ││ LES AGENTS QUI ATTAQUENT│ │ LES AGENTS ATTAQUÉS │ │ LES AGENTS QUI DÉFENDENT││ (Frontière Offensive)│ │ (Vulnérabilités Agent) │ │ (Défense Autonome) │├─────────────────────────┤ ├─────────────────────────┤ ├─────────────────────────┤│ • Détection de Failles │ │ • Injections de Prompts │ │ • Triage SOC & Alertes ││ • Génération de PoC │ │ • Empoisonnement MCP │ │ • Analyse de Malware ││ • Synthèse d'Exploits │ │ • Corruption Mémoire/RAG│ │ • Correctifs Automatisés││ • Rétro-Ingénierie │ │ • Élévation de Privilège│ │ • Renseignement CTI ││ • Pentest Autonome │ │ • Usurpation Inter-Agent│ │ • Cyber-Range Virtuel │└─────────────────────────┘ └─────────────────────────┘ └─────────────────────────┘Plutôt que d’aborder le « hacking par l’IA » comme une capacité binaire, Hermes évalue les agents autonomes le long d’une échelle empirique en 10 niveaux :
| Niveau | Étape de Capacité | Seuil de Validation Expérimentale | Benchmark de Référence |
|---|---|---|---|
| N1 | Compréhension de faille | Identifie le CWE et les lignes vulnérables sur du code isolé | HumanEval-Sec, SecFix |
| N2 | Détection de vulnérabilité | Découvre des vulnérabilités dans des bases de code complexes sans indice | CyberGym, SecCode |
| N3 | Reproduction de bug | Prend un rapport de CVE et reproduit le crash en conteneur | CyberGym, SRE-Bench |
| N4 | Génération de PoC | Génère un vecteur provoquant un déni de service ou crash reproductible | ExploitGym (Phase PoV) |
| N5 | Synthèse de primitives d’exploitation | Obtient une primitive de lecture, écriture ou corruption mémoire arbitraire | ExploitBench |
| N6 | Détournement de flux de contrôle | Neutralise les canaris basiques et redirige l’exécution locale | ExploitBench, ExploitGym |
| N7 | Exécution de code arbitraire (ACE) | Obtient l’exécution de shellcode non authentifié (hors ASLR / DEP) | ExploitGym (Espace Utilisateur) |
| N8 | Contournement de mitigations & RCE | Neutralise ASLR, DEP et CFI pour obtenir une exécution distante complète | ExploitGym (Kernel / V8) |
| N9 | Persistance & post-exploitation | Extrait des secrets locaux, corrompt l’environnement et maintient l’accès | Benchmarks Inter-Agents |
| N10 | Campagne multi-étapes autonome | Enchaîne reconnaissance $\to$ intrusion $\to$ mouvement latéral en réseau | Simulation Cyber-Range |
Chaque étude technique publiée dans cette série respecte une structure rigoureuse de niveau universitaire :
Les prépublications issues de cs.CR, cs.AI, cs.SE et cs.LG sont soumises à une grille d’évaluation en 100 points :
Valeur scientifique (25 pts)
Rigueur méthodologique, absence avérée de contamination, reproductibilité (code ouvert, artefacts, conteneurs).
Pertinence cybersécurité (25 pts)
Alignement avec des systèmes d’exploitation, des noyaux, des protocoles actifs et des menaces concrètes.
Potentiel SEO & intention de recherche (25 pts)
Volume de recherche qualifié, requêtes concrètes des praticiens (« Les agents IA peuvent-ils rétro-concevoir des binaires ? »).
Potentiel éditorial (15 pts)
Clarté de la thèse, capacité à illustrer une rupture architecturale et maillage thématique cohérent.
Pérennité (10 pts)
Valeur durable en tant que benchmark de référence, résistant à l’obsolescence immédiate d’une version de modèle.
Seuil d’admissibilité : seuls les articles obtenant une note >= 75 / 100 font l’objet d’une analyse complète.
La première vague de 11 publications de référence positionne Hermes Codex comme le standard d’évaluation :
Hermes actualise un index vivant documentant les capacités démontrées par les agents au fil des générations :
| Domaine de Capacité | 2024 (GPT-4 / Claude 3) | 2025 (o1 / Sonnet 3.5) | 2026 (Raisonnement Frontière) | Référence Éprouvée |
|---|---|---|---|---|
| Découverte de failles (code source) | Moyen | Élevé | Élevé | Snyk / Semgrep AI |
| Génération de crashs PoC | Faible | Moyen | Élevé | CyberGym / ExploitGym |
| Rétro-ingénierie de binaires | Très Faible | Faible | Faible / Moyen | SRE-Bench (arXiv:2608.11469) |
| Exploitation noyau / moteur V8 | Négligeable | Très Faible | Faible | ExploitGym (arXiv:2605.11086) |
| Injection automatisée de prompt | Faible | Moyen | Élevé | PIMiner (arXiv:2608.05108) |
| Cloisonnement des outils d’agents | Faible | Faible | Moyen | MTGuard (arXiv:2607.25297) |
| Analyse de rapports CTI | Faible / Hallucinatoire | Faible | Moyen | arXiv:2503.23175 |