LLM & Blueteaming
Comprehensive evaluations of LLM security, indirect prompt injection susceptibility, and adversarial testing datasets.
LLM Security
Qwen 3.7 Flash — Full Battery Adversarial Evaluation
30-config battery (610 records, 398 attack): 25 core IPI classes plus multimodal, agentic, RAG, output-plane, reasoning, and memory phases. 10.8% ASR with full core-25 resistance. Top findings in encoded numerical injection, RAG dormant triggers, output-injection payloads, and reasoning-sponge attacks. Manual spot-check of all 43 compromise verdicts. Structural disclosure with defensive mitigations.
10.8% ASR · 610 records · 18 compromised classes · core-25 fully resistant · κ 0.6933GPT-OSS-120B — Indirect Prompt Injection Assessment
Red team evaluation across 250 test cases (25 IPI classes × 10 variants). 8% overall susceptibility with critical findings in 4 specific classes (IPI-010, IPI-019, IPI-021, IPI-022). Variant analysis: direct 9%, obfuscated 9.3%, embedded 5.3%. Structural disclosure with architectural root cause analysis and defensive validation patterns.
8% susceptibility · 250 test cases · 25 IPI classes · 4 vulnerable classesGPT-5 Nano — Prompt Injection Susceptibility Assessment
IPI Taxonomy v0.13 evaluation across 210 test cases (21 classes × 10 variants; 9 inference failures excluded; 201 analyzed). 38.3% overall susceptibility rate. Critical findings in recursive instruction framing (100%) and MCP tool description poisoning (80%). Full OWASP LLM mapping with defensive mitigations and validation unit-tests. Structural disclosure — no payloads published.
38.3% susceptibility · IPI-010 100% rate · OWASP LLM Top 10 mapped · Structural disclosure