Aller au contenu

Peut-on faire confiance aux LLM pour la cyber threat intelligence ? Limites et hallucinations (arXiv:2503.23175)

Référence du PapierarXiv:2503.23175
Domaine d’ApplicationCyber Threat Intelligence (CTI)
Taux d’HallucinationJusqu’à 34,2 % en attribution
Corpus Évalué1 200 Rapports CTI Réels

1. Introduction : le dilemme de l’automatisation en CTI

Section intitulée « 1. Introduction : le dilemme de l’automatisation en CTI »

Les Centres Opérationnels de Sécurité (SOC) et les équipes de renseignement sur la menace font face à une submersion documentaire : analyses d’éditeurs (Mandiant, CrowdStrike), alertes d’agences nationales (ANSSI, CISA) et divulgations techniques sur les forums spécialisés.

Pour surmonter cette saturation, de nombreux acteurs industriels ont précipitamment intégré des LLM afin d’automatiser :

  • La conversion de rapports non structurés en formats standardisés (STIX/TAXII).
  • L’extraction d’indicateurs de compromission (IOCs : adresses IP, domaines, empreintes de fichiers, CVEs).
  • L’association des tactiques observées aux techniques de la matrice MITRE ATT&CK.
  • L’attribution d’attaques à des groupes étatiques ou cybercriminels connus.

Néanmoins, la CTI est une discipline fondée sur la preuve juridique et technique : attribuer une campagne à APT29 (Russie) plutôt qu’à APT41 (Chine) emporte des conséquences géopolitiques, opérationnelles et légales considérables. Un système automatisé qui invente des liens logiques ou fausse l’identification des menaces contamine immédiatement les règles de blocage des pare-feux et les hypothèses de chasse aux menaces.

L’étude “Large Language Models are Unreliable for Cyber Threat Intelligence” (arXiv:2503.23175) a mené la première évaluation empirique rigoureuse pour mesurer si les LLM disposent de la précision et de la calibration indispensables à une exploitation en CTI.


Les conclusions d’arXiv:2503.23175 brisent les illusions d’une autonomie sans surveillance humaine :

  1. Le piège de la surconfiance : les modèles affichent une assurance verbale absolue (“Je suis certain à 95 % que cette empreinte appartient à LockBit 3.0”) alors même qu’ils fabriquent des hachages fictifs.
  2. L’anachronisme temporel : biaisés par leurs corpus d’entraînement initiaux, les modèles associent régulièrement des incidents récents de 2026 à des familles de malwares éteintes depuis des années.
  3. L’incohérence des graphes STIX : bien que la syntaxe JSON/YAML soit correcte, les relations sémantiques entre objets (attack-pattern, malware, threat-actor) violent les spécifications STIX ou inventent des relations sans fondement.
FIDÉLITÉ DE LA CHAÎNE D'EXTRACTION EN CTI
[Rapport CTI Brut] (ex. PDF technique de 15 pages)
│
▼
┌──────────────┐
│ Ingestion LLM│
└──────┬───────┘
│
├──────────────────────────┬──────────────────────────┐
▼ ▼ ▼
[IOCs Explicites] [Matrice ATT&CK] [Attribution]
• IPs, Hashes, Domaines • Codes Techniques T • Acteur de Menace
• Précision : ~91 % • Précision : ~68 % • Précision : ~54 %
• Hallucinations : Rares • Erreurs de niveau • Hallucinations Majeures

3. Méthodologie et tâches opérationnelles évaluées

Section intitulée « 3. Méthodologie et tâches opérationnelles évaluées »

Le banc d’essai évalue quatre tâches fondamentales du renseignement cyber :

  1. Extraction et typage d’IOCs : identification des adresses IP, noms d’hôtes, empreintes de fichiers et identifiants CVE.
  2. Cartographie MITRE ATT&CK : assignation de l’identifiant exact de sous-technique (ex. T1059.001 PowerShell vs T1059.003 Windows Command Shell).
  3. Extraction de relations structurées (STIX 2.1) : modélisation des liens de type [Acteur] ---utilise---> [Malware] ---cible---> [Secteur].
  4. Raisonnement d’attribution adverse : déduction du groupe responsable sur la seule base des indices contenus dans le document fourni.

Le corpus de test comprend 1 200 rapports vérifiés issus d’organisations de référence :

  • Sources de référence : bulletins CISA, rapports Mandiant, billets de blog Microsoft Threat Intelligence, Unit 42 et SentinelOne Labs.
  • Vérité terrain experte : chaque document a été audité et annoté par des analystes certifiés GIAC Cyber Threat Intelligence (GCTI).
  • Leurres adversaires : 150 rapports ont été modifiés pour y injecter des contradictions techniques délibérées (ex. prétendre qu’une porte dérobée Linux s’exécute via un script PowerShell sous Windows) afin de tester la vigilance critique des modèles.

Cinq architectures représentatives ont été soumises au protocole :

  • OpenAI GPT-4o & GPT-4 turbo : référence de l’intégration dans les outils commerciaux.
  • Anthropic Claude 3.5 Sonnet : réputé pour sa rigueur d’extraction et sa longue fenêtre de contexte.
  • Google Gemini 1.5 Pro : évalué pour l’ingestion native de volumineux dossiers d’incident de 100 pages.
  • Meta Llama 3 70B instruct : modèle ouvert de référence pour déploiement étanche en SOC sensible.
  • Mistral large 2 : modèle ouvert européen de haute capacité.

6. Résultats empiriques : l’effondrement de l’attribution

Section intitulée « 6. Résultats empiriques : l’effondrement de l’attribution »
Tâche / MétriqueGPT-4oClaude 3.5 SonnetGemini 1.5 ProLlama 3 70B
Extraction d’IOCs Explicites (F1)92,4 %93,8 %91,2 %86,5 %
Rappel MITRE ATT&CK TTP67,2 %72,5 %66,8 %58,4 %
Précision Relations STIX 2.161,5 %68,4 %59,2 %49,0 %
Attribution Nouveaux Acteurs51,2 %56,8 %48,5 %39,1 %
Taux d’Hallucination Attribution28,4 %24,1 %31,6 %38,7 %
Détection des Pièges Incohérents38,0 %44,2 %32,0 %22,5 %
  1. L’illusion de maîtrise par la syntaxe : les excellents scores sur l’extraction d’adresses IP ou de hachages (>91 %) masquent une faillite cognitive sur la logique d’attribution.
  2. L’abîme de l’attribution : confrontés à des campagnes émergentes, les modèles hallucinent une filiation dans jusqu’à 38,7 % des cas, rattachant arbitrairement l’attaque à des acteurs ultra-médiatisés (Lazarus, Cozy Bear, LockBit) sans fondement textuel.
  3. Surconfiance systémique : même quand un modèle affirme être certain à 95 %, son exactitude réelle est inférieure à 60 %.

L’étude met en lumière trois biais structurels expliquant l’échec des LLM en CTI :

  1. Le biais de fréquence du pré-entraînement : les modèles projettent systématiquement les groupes les plus cités dans leurs données d’apprentissage sur des indices régionaux inédits.
  2. La confusion de granularité MITRE ATT&CK : difficulté à distinguer la technique mère de la sous-technique exacte, ou invention d’identifiants fantaisistes.
  3. L’acceptation aveugle des incohérences : Face à des contradictions techniques manifestes, les modèles capitulent dans plus de 60 % des cas et entérinent les données frauduleuses.

8. Que peut réellement faire un agent IA ? (Partition tripartite)

Section intitulée « 8. Que peut réellement faire un agent IA ? (Partition tripartite) »

A. Capacités démontrées (vérifiées empiriquement)

Section intitulée « A. Capacités démontrées (vérifiées empiriquement) »
  • Extraction déterministe d’IOCs : identification rigoureuse des adresses IP, domaines et clés de chiffrement explicites (>92 % de précision).
  • Synthèse documentaire : rédaction de résumés exécutifs et de frises chronologiques à partir de sources certifiées.
  • Étiquetage de grandes tactiques : classification des phases d’attaque génériques (accès initial vs persistance) avec >80 % de fiabilité.

B. Inférences raisonnées (haute probabilité sous contraintes)

Section intitulée « B. Inférences raisonnées (haute probabilité sous contraintes) »
  • Assistance à la création de graphes STIX : gain de temps d’un facteur 2 à 3 pour les analystes humains qualifiés procédant à la relecture systématique des relations.
  • Traduction technique multi-langues : traduction fidèle de rapports en chinois, russe ou persan avec conservation du vocabulaire d’exploitation.

C. Hypothèses non démontrées OU démystifiées (spéculations)

Section intitulée « C. Hypothèses non démontrées OU démystifiées (spéculations) »
  • Attribution autonome sans supervision : l’attribution automatique non vérifiée par un expert humain est dangereuse et invalidée (24 % à 38 % de faux positifs).
  • Injection directe dans les pare-feux : injecter sans validation humaine les IOCs déduits par un LLM conduit au blocage destructeur d’infrastructures légitimes (CDN, DNS).

9. Recommandations opérationnelles pour les équipes CTI

Section intitulée « 9. Recommandations opérationnelles pour les équipes CTI »
  1. Garde-fou humain obligatoire : aucun objet STIX d’attribution ne doit être publié sans validation par un analyste senior.
  2. Traçabilité des preuves (RAG cité) : obligation pour le modèle de citer textuellement la phrase source justifiant chaque relation extraite.
  3. Séparation stricte des tâches : confier l’extraction des IOCs à des expressions régulières et des parsers déterministes, et restreindre le LLM au résumé de texte.

┌─────────────────────────────────────────────────────────────────────────────┐
│ ARCHITECTURE DÉFENSIVE D'UN PIPELINE CTI │
└─────────────────────────────────────────────────────────────────────────────┘
Flux CTI Brut (PDF / RSS)
│
▼
[Parseur d'IOC Déterministe] ───────> [Enrichissement VirusTotal / Shodan]
│
▼
[Extracteur LLM Contraint]
• Schéma JSON Strict
• Citation Textuelle Obligatoire
│
▼
[Porte de Validation d'Attribution]
• Si Incertitude > 0% ──────────────> File de Revue Analyste Humain
• Si Technique à Haut Risque ───────> Vérification Matrice ATT&CK
│
▼
[Graphe STIX 2.1 Validé] ───────────> [Plateforme TIP / SIEM Entreprise]

  • Modèles à justification cryptographique : les architectures futures intégreront des ancres cryptographiques reliant chaque affirmation à un segment immuable de la source.
  • Empoisonnement adverse de flux CTI : les cybercriminels diffuseront des rapports délibérément falsifiés pour tromper les robots de renseignement et saturer les SOC de faux positifs.