Skip to content

Agentic Security Observatory: Autonomous AI Threat Radar & Posture Hub


Explore real-time posture assessments across 10 agentic ecosystems, investigate cognitive threat layers, analyze HASS vs CVSS divergence, or evaluate your own agent deployment in the triage sandbox:

42 Raw AI CVEs Tracked Models, runtimes & libraries
→
19 Active Agentic Sinks Tool actuation & loops
→
8 Weaponized In-The-Wild Functional zero-click RCE
→
84.6 Mean HASS Score CRITICAL Severity Tier

Posture Mapping Across 10 Agentic Ecosystems

Continuous posture evaluation based on native autonomy loops, default sandbox isolation, and ambient tool authority.

Developer Coding Agents

Cursor AI IDE

HASS 91.0
Autonomy: Autonomous Multi-Step Planning
Default Sandbox: Partial (Regex / AST Filter)
Ambient Tool Risk: CRITICAL
Verified Incidents & CVEs:
Autonomous CLI Coding Agents

Mistral Vibe Agent

HASS 92.5
Autonomy: Autonomous Multi-Step Planning
Default Sandbox: Partial (Regex / AST Filter)
Ambient Tool Risk: CRITICAL
Agentic Orchestration Frameworks

LangChain / LangGraph

HASS 88.0
Autonomy: Autonomous Workflow
Default Sandbox: None (Host Process)
Ambient Tool Risk: CRITICAL
Multi-Agent Conversation Frameworks

Microsoft AutoGen

HASS 85.0
Autonomy: Fully Autonomous Execution
Default Sandbox: Container (Docker)
Ambient Tool Risk: HIGH
Verified Incidents & CVEs:
Role-Playing Agent Swarms

CrewAI

HASS 86.5
Autonomy: Fully Autonomous Execution
Default Sandbox: Partial (Regex / AST Filter)
Ambient Tool Risk: HIGH
Verified Incidents & CVEs:
Autonomous Software Engineers

OpenDevin (All-Hands)

HASS 94.0
Autonomy: Fully Autonomous Execution
Default Sandbox: Container (Docker)
Ambient Tool Risk: CRITICAL
Verified Incidents & CVEs:
Agent Actuation & Tool Protocols

Model Context Protocol (MCP)

HASS 89.0
Autonomy: Supervised Decisions
Default Sandbox: None (Host Process)
Ambient Tool Risk: CRITICAL
Verified Incidents & CVEs:
Data & Context Frameworks

LlamaIndex Agentic RAG

HASS 82.0
Autonomy: Autonomous Workflow
Default Sandbox: None (Host Process)
Ambient Tool Risk: HIGH
Verified Incidents & CVEs:
Inference & Model Serving

vLLM / Ollama Runtime

HASS 78.0
Autonomy: Supervised Decisions
Default Sandbox: None (Host Process)
Ambient Tool Risk: MEDIUM
Verified Incidents & CVEs:
Frontier Foundation Models

DeepSeek / Janus Architecture

HASS 83.0
Autonomy: Supervised Decisions
Default Sandbox: None (Host Process)
Ambient Tool Risk: HIGH
Verified Incidents & CVEs:

4-Layer Cognitive Threat Taxonomy of Agent Systems

Agentic vulnerabilities do not target a static binary; they exploit vulnerabilities along the agent's cognitive lifecycle.

01

Perception Layer (Input Processing & Context)

Weaponization of untrusted inputs, indirect context injections via web scraping/documents, and tokenizer bypasses that override system instructions.

Primary Risk Driver: Unsanitized third-party text directly altering system instruction state in the model context window.
Recommended Guardrail: Dual-LLM architectural isolation (privileged planner vs untrusted parser) and structural XML delimiter validation.
Associated Attack Patterns (AAP):
02

Brain / Reasoning Layer (Planning & Routing)

Subversion of task decomposition, deceptive goal re-prioritization, semantic tool poisoning, and lateral impersonation between agent swarm nodes.

Primary Risk Driver: Natural-language tool description poisoning manipulating the LLM router's semantic similarity matching.
Recommended Guardrail: Cryptographically signed tool schemas, deterministic intent gating, and inter-agent mTLS authentication.
Associated Attack Patterns (AAP):
03

Action Layer (Tools, Actuation & Sinks)

Unauthorized invocation of state-modifying tools, parameter tampering, command injection via shell built-ins, and multi-turn autonomous retry loops.

Primary Risk Driver: Un-sandboxed execution of arbitrary OS binaries and AST parser discrepancies allowing subshell breakout.
Recommended Guardrail: MicroVM ephemeral isolation (Firecracker), non-bypassable JIT approval gates, and Linux capability stripping (CAP_SYS_ADMIN drops).
Associated Attack Patterns (AAP):
04

Memory & Persistence Layer (State & Vector DB)

Persistent poisoning of long-term vector embeddings, episodic state contamination, and cross-session sleeper vulnerabilities surviving restarts.

Primary Risk Driver: Corrupted semantic memories loaded into subsequent user sessions without authenticity verification.
Recommended Guardrail: Read-only signed embedding stores, semantic drift anomaly detection, and strict session-scoped episodic isolation.
Associated Attack Patterns (AAP):

The Autonomy Multiplier: Why CVSS Underestimates Agentic Risk

CVSS v3/v4 was designed for deterministic software. When an agent possesses autonomous loops and tool actuation, real-world severity surges.

CVE ID Framework & Vulnerability CVSS v3.1 Hermes HASS Multiplier & Delta Weaponization Status
CVE-2026-87986
Mistral Vibe Parser Error AST Discrepancy RCE
8.4 95.0 +11.0 pts Weaponized in Wild
CVE-2026-87985
Mistral Vibe ANSI-C String Escape RCE
8.4 94.0 +10.0 pts Weaponized in Wild
CVE-2026-87983
Mistral Vibe Quote Evasion Gate Bypass RCE
8.4 93.0 +9.0 pts Weaponized in Wild
CVE-2026-4372
Cursor AI IDE Auto-Run Terminal Command Injection
8.8 91.0 +3.0 pts Weaponized in Wild
CVE-2026-27966
Langflow CSV Agent Python REPL Arbitrary RCE
9.8 96.0 -2.0 pts Weaponized in Wild
CVE-2026-54236
OpenDevin Autonomous Agent Docker Socket Escape
8.9 97.0 +8.1 pts Public PoC Available
CVE-2026-11393
CrewAI Autonomous Tool Execution Sandbox Escape
8.1 88.0 +7.0 pts Public PoC Available
CVE-2026-48746
LangChain Remote Agent Deserialization / Tool Execution RCE
8.6 92.0 +6.0 pts Public PoC Available
CVE-2026-5027
AutoGen Multi-Agent Workflow Privilege Escalation
7.8 85.0 +7.2 pts Public PoC Available
CVE-2026-76460
DeepSeek Janus-Pro Tensor Buffer Overflow RCE
8.5 83.0 -2.0 pts Public PoC Available

Agent Posture Triage Sandbox (Privacy-First)

Evaluate the security posture of your custom agent. All calculations execute client-side with zero data transmission.

AGENTIC RISK EVALUATION
85 / 100
CRITICAL

High-risk exposure: system tool access combined with shared RAG allows persistent takeover via indirect prompt injection.

Immediate Defense Checklist:
  • Migrate tool actuation into ephemeral MicroVMs (Firecracker)
  • Enforce non-bypassable JIT human approval on shell actuation
  • Cryptographically sign all documents ingested into RAG vector stores

1. Why Traditional Vulnerability Scanners Fail on AI Agents

Section titled “1. Why Traditional Vulnerability Scanners Fail on AI Agents”

Enterprise security postures have historically relied on Common Vulnerabilities and Exposures (CVE) and CVSS v3.1 scoring. When applied to agentic AI, this paradigm suffers from three critical blind spots:

  1. The Autonomy Multiplier: A classic command injection flaw in a developer script requires active human invocation. The identical vulnerability in an autonomous agent running in background mode (auto-run) allows the model to execute the payload autonomously during its Thought-Action-Observation loop without human intervention.
  2. Ambient Tool Authority: Modern agent environments connect LLMs directly to high-privilege actuation tools via the Model Context Protocol (MCP), local bash shells, or cloud API credentials. An attacker who steers the context window automatically inherits all ambient tool capabilities.
  3. Persistent Cognitive Contamination: In deterministic software, killing a process terminates the exploit. In agentic workflows, adversarial payloads injected into vector embeddings (RAG) or episodic memory persist indefinitely, silently poisoning all subsequent user sessions.

The Hermes Agentic Security Score (HASS) corrects these blind spots by evaluating vulnerabilities along six systemic axes: Autonomy, Tool Access, Privilege Level, Persistence, External Impact, and Multi-Agent Propagation.


The Observatory organizes agentic vulnerabilities across the four structural tiers of autonomous intelligence:

graph TD
subgraph Perception ["1. Perception Layer"]
P1["Untrusted Ingestion (Web, PRs, Emails)"]
P2["Indirect Context Injection (AAP-002)"]
end
subgraph Brain ["2. Brain & Planning Layer"]
B1["Goal Decomposition & LLM Router"]
B2["Semantic Tool Poisoning (AAP-004)"]
B3["Inter-Agent Spoofing (AAP-006)"]
end
subgraph Action ["3. Action & Tool Layer"]
A1["Tool Actuation (MCP, Bash, REPL)"]
A2["Tool Parameter Tampering (AAP-003)"]
A3["Cascading Subshell RCE (AAP-007)"]
end
subgraph Memory ["4. Memory & State Layer"]
M1["Shared Vector Store (RAG)"]
M2["Persistent Memory Poisoning (AAP-005)"]
end
Perception --> Brain
Brain --> Action
Action --> Memory
Memory -.->|Contaminates Future Sessions| Brain

The Observatory continuously tracks 10 flagship agent ecosystems:

EcosystemPrimary DomainDefault IsolationAmbient RiskKey CVEs & Incidents
Cursor AI IDECoding & Software EngineeringPartial (Regex / AST)CRITICALCVE-2026-22708, CVE-2026-4372
Mistral VibeAutonomous CLI CodingPartial (AST Filter)CRITICALCVE-2026-87983 to 87987
OpenDevinAutonomous Software EngineerDocker ContainerCRITICALCVE-2026-54236 (Socket Escape)
LangChain / LangGraphAgentic OrchestrationNone (Host Process)CRITICALCVE-2026-48746, CVE-2026-27966
CrewAIRole-Playing Agent SwarmsPartial (Regex Filter)HIGHCVE-2026-11393 (Sandbox Escape)
Microsoft AutoGenMulti-Agent ConversationsDocker ContainerHIGHCVE-2026-5027 (Privilege Escalation)
Model Context ProtocolTool & Actuation IntegrationNone (Host Process)CRITICALAAP-003, AAP-004 (Tool Poisoning)
LlamaIndexContext & Agentic RAGNone (Host Process)HIGHCVE-2025-26319 (Retrieval SSRF)
DeepSeek / JanusMultimodal Foundation ModelsNone (Host Process)HIGHCVE-2026-76460 (Tensor Overflow)
vLLM / OllamaInference & Model ServingNone (Host Process)MEDIUMCVE-2025-54794, CVE-2025-54795

All threat telemetry, framework risk profiles, and incident feeds are published as static, zero-latency JSON endpoints:

Terminal window
# Query the live Agentic Threat Radar via CLI
curl -s https://hermes-codex.vercel.app/api/agentic-observatory/radar.json | jq .