Aller au contenu

Méthodologie du Hermes Agentic Security Score (HASS)

1. La nécessité d’une métrique spécifique aux systèmes agentiques

Section intitulée « 1. La nécessité d’une métrique spécifique aux systèmes agentiques »

Les systèmes d’évaluation traditionnels (tels que CVSS v3.1 / v4.0) ont été conçus pour des logiciels procéduraux déterministes à travers des vecteurs d’attaque classiques (AV:N, AC:L, PR:N, UI:N).

Appliqué aux LLM Agentiques, le système CVSS échoue à appréhender trois dynamiques fondamentales :

  • Le multiplicateur d’autonomie : une injection de commande dans un script classique requiert une intervention humaine malveillante. La même vulnérabilité au sein d’un agent en mode Auto-Run permet à l’agent d’exécuter la charge utile spontanément, sans aucune interaction de l’utilisateur.
  • L’autorité ambiante des outils : un agent doté d’accès shell ou d’infrastructures Cloud transforme une simple injection de prompt en une destruction irréversible sur les systèmes de production.
  • La persistance contextuelle : alors qu’une attaque conventionnelle s’arrête à la terminaison du processus, l’empoisonnement de mémoire agentique contamine durablement les bases vectorielles (RAG) et se répercute sur les futures interactions multi-agents.

Le HASS répond à une interrogation primordiale :

Quelle est la dangerosité réelle de cette faille du fait des capacités d’autonomie, d’actionnement externe et de persistance de l’agent ?

Le score HASS est calculé comme la somme pondérée de six dimensions systémiques fondamentales, pour un total maximal de 100 points :

SCORE TOTAL HASS = Autonomie (20) + Accès Outils (20) + Privilèges (15)
+ Persistance (15) + Impact Externe (15) + Propagation (15)

Mesure le degré d’indépendance décisionnelle et d’exécution de l’agent :

  • 0 Pt — aucune autonomie : interface de dialogue passive en lecture seule, sans exécution autonome.
  • 5 Pts — décisions supervisées : l’agent suggère des actions mais exige une confirmation humaine pas-à-pas.
  • 10 Pts — flux de travail autonome : l’agent exécute des tâches uniques pré-approuvées de manière autonome.
  • 15 Pts — planification multi-étapes : l’agent décompose des objectifs complexes en sous-tâches et itère de façon autonome.
  • 20 Pts — exécution entièrement autonome : agents en arrière-plan capables de réorganiser leurs objectifs à long terme sans supervision.

Évalue les capacités d’actionnement externe mises à disposition du modèle :

  • 0 Pt — aucun outil : le modèle produit uniquement du texte au sein de son bac à sable.
  • 5 Pts — API en lecture seule : consultation d’informations publiques ou de documentation.
  • 10 Pts — API modifiant l’état et navigation : navigation Web active, modification de tickets de support ou d’entrées CRM.
  • 15 Pts — actionnement à fort impact : écriture sur le système de fichiers, écriture en base de données, exécution de code Python/JS non sandbxé.
  • 20 Pts — infrastructure système critique : exécution directe de commandes shell hôte, privilèges conteneur root, orchestration Cloud (Kubernetes, AWS IAM, Terraform).

Dimension 3 : niveau de privilège (0 à 15 points)

Section intitulée « Dimension 3 : niveau de privilège (0 à 15 points) »

Mesure le contexte d’identité et les autorisations héritées par l’agent :

  • 0 Pt — anonyme / non fiable : aucune accréditation ambiante ; bac à sable strict.
  • 5 Pts — utilisateur restreint : exécution sous un compte utilisateur standard confiné.
  • 10 Pts — compte de service d’application : accès aux jetons de microservices, bases de données privées et secrets d’API.
  • 15 Pts — administrateur système / root : privilèges administrateur complets sur l’OS ou le tenant Cloud.

Évalue la capacité de l’état compromis à survivre au-delà de l’interaction immédiate :

  • 0 Pt — éphémère : l’effet de la faille cesse immédiatement à la fin du tour de parole.
  • 5 Pts — mémoire de session : la contamination persiste durant la session active de l’utilisateur.
  • 10 Pts — empoisonnement vectoriel / RAG : les données frelatées s’inscrivent durablement dans les bases de connaissances d’entreprise.
  • 15 Pts — configuration système / poids du modèle : altération permanente des instructions système fondamentales ou de l’état partagé d’un essaim.

Mesure la gravité des effets irréversibles sur le monde réel :

  • 0 Pt — confiné : l’impact se limite à des incohérences textuelles dans le chat.
  • 5 Pts — fuite de données interne : exfiltration de métadonnées non critiques ou de l’historique de dialogue.
  • 10 Pts — altération d’état : transactions financières non autorisées, commits de code frauduleux ou altération de tables.
  • 15 Pts — destruction système / RCE : prise de contrôle totale de l’hôte, suppression massive de données ou dommage cyber-physique.

Mesure la propension de l’attaque à franchir les frontières de confiance :

  • 0 Pt — isolé : instance d’agent unique sans communication externe.
  • 5 Pts — inter-sessions : contamination s’étendant à d’autres sessions d’utilisateurs partageant la même instance.
  • 10 Pts — essaim multi-agents : propagation à d’autres agents et sous-agents via des échanges de messages sémantiques non authentifiés.
  • 15 Pts — chaîne d’approvisionnement / cascade : propagation vers des systèmes d’entreprise tiers, dépôts publics ou partenaires commerciaux.

Le score global HASS se décline en six niveaux de sévérité opérationnelle :

Plage de Score HASSNiveau de GravitéSignification Opérationnelle
90 – 100EXTRÊMEPrise de contrôle immédiate de l’hôte ou destruction autonome irréversible. Confinement d’urgence requis.
75 – 89CRITIQUEDétournement d’agent non authentifié avec accès à des outils privilégiés ou corruption RAG persistante.
60 – 74ÉLEVÉManipulation d’outils ou propagation multi-agents capable d’altérer ou d’exfiltrer des données sensibles.
40 – 59MODÉRÉMauvaise utilisation supervisée d’outils ou fuite de données limitée encadrée par un contrôle humain.
20 – 39FAIBLEDérive comportementale ou déviation de prompt mineure sans capacité d’actionnement externe.
0 – 19MINIMALIncohérences textuelles sans persistance ni altération d’état externe.

4. Exemple d’évaluation concrète : CVE-2026-22708

Section intitulée « 4. Exemple d’évaluation concrète : CVE-2026-22708 »

Voici l’évaluation opérationnelle de la faille CVE-2026-22708 (contournement de commandes internes dans Cursor IDE) visualisée avec le composant ScoreCard :

HASS

SCORE DE SÉCURITÉ AGENTIQUE HERMES

Cible : Composant Terminal Auto-Run de Cursor Agent
Confiance : 95%
91 / 100
EXTRÊME

Mesure le risque systémique spécifique découlant de l'autonomie, de l'autorité des outils et de l'exécution en cascade.

Décomposition des dimensions
Autonomie décisionnelle 19 / 20
Accès aux outils & APIs 20 / 20
Privilege 15 / 15
Persistence 12 / 15
External Impact 15 / 15
Propagation 10 / 15
⚖️ Divergence & Justification opérationnelle

Alors que le CVSS traditionnel classait cette vulnérabilité à 8.8 (Élevé) en raison du contexte local, le score HASS l'élève à 91 (EXTRÊME). En mode Auto-Run, l'agent exécute les commandes de manière autonome sans solliciter l'approbation humaine, exploitant les primitives shell intégrées pour empoisonner l'environnement et déclencher une RCE immédiate.

Chaque score HASS est assorti d’un Indice de Confiance (0 à 100 %) calculé formellement :

  1. Corrélation de sources indépendantes ($+15%$ par source validée)
  2. Preuve de concept (PoC) technique vérifiée ($+25%$)
  3. Reproductibilité en environnement de laboratoire confiné ($+20%$)
  4. Présence d’informations contradictoires ($-30%$)