Zum Inhalt springen

Agentic Security - LLM Vulnerability Scanner Cheatsheet

Agentic Security - LLM Vulnerability Scanner Cheatsheet

Agentic Security ist ein Open-Source-Agentic-LLM-Vulnerability-Scanner und Red-Team-Toolkit. Anstatt eine feste Liste von Prompts zu verwenden, nutzt es eine agentic Loop zum Fuzzen eines Ziel-Modells oder einer API — generiert Probes, beobachtet Antworten und passt sich an — um Jailbreaks, Prompt Injections und unsicheres Verhalten zu decken. Es führt auch API Stress Testing durch, was wichtig ist, weil viele LLM-Deployments bei Ratelimits und Ressourcenerschöpfung fehlschlagen, bevor sie bei Content Safety fehlschlagen.

Scanne nur Systeme, denen du gehörst oder die du testen darfst.

Installation

MethodeBefehl
pippip install agentic_security
Vom Sourcegit clone https://github.com/msoedov/agentic_security && pip install -e .
Run die UIagentic_security (bedient eine lokale Web-UI)
Headlessagentic_security --headless
Verifikationagentic_security --help

Einen Scan ausführen

BefehlBeschreibung
agentic_securityStarte die lokale UI (Standard-Port 8718)
agentic_security --port 8718Wähle einen Port
agentic_security --headlessCI/Non-interactive-Modus
--llm-spec <file>Definiere das Ziel-Request-Format
--max-budget NBegrenze Token/Requests

Das Ziel definieren

Der Scanner muss wissen, wie er deinen LLM-Endpunkt aufruft. Du stellst eine HTTP-Spezifikation bereit:

POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json

{
  "model": "my-model",
  "messages": [{"role": "user", "content": "<<PROMPT>>"}]
}

<<PROMPT>> wird mit jeder generierten Adversarial-Probe ersetzt, daher kann jede OpenAI-kompatible oder benutzerdefinierte API als Ziel verwendet werden.

Was es prüft

KategorieSucht nach
JailbreaksUmgehung von Sicherheitsanweisungen
Prompt InjectionAnweisungsüberschreibung über Eingabe
Data LeakageSystem Prompt / Training Data Exposure
Harmful ContentUnsichere Einhaltung
FuzzingMalformed/Edge-Case-Eingaben
StressVerhalten unter Last/Ratelimits

Datensätze & Probes

QuelleStellt zur Verfügung
Built-in Probe SetsKuratierte Adversarial Prompts
HuggingFace DatensätzeCommunity Jailbreak Corpora
Custom CSVDeine eigenen Probes
Agentic GenerationModell-generierte adaptive Attacken

Ergebnisse lesen

OutputBedeutung
Failure RateAnteil der Probes, die unsichere Ausgabe produzierten
Pro-Modul-BreakdownWelche Attackklasse erfolgreich war
Sample TranscriptsDie exakten Prompt/Response-Paare
Throughput/LatencyAPI-Verhalten unter Stress

Konzentriere dich zuerst auf Module mit hoher Failure Rate — das ist, wo deine Guardrails am dünnsten sind.

CI Integration

# Headless Scan mit Spend Cap, Fail bei Threshold
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
PraxisWarum
Begrenze BudgetAgentic Fuzzing kann schnell Tokens ausgeben
Pin Probe SetsVergleichbare Ergebnisse run zu run
Run bei Prompt/Model-ÄnderungBeides ändert die Safety-Oberfläche
Pair mit GuardrailsRe-scan nach dem Hinzufügen von LLM Guard

Agentic Security vs verwandte Tools

AspektAgentic SecuritygarakDeepTeam
AnsatzAgentic Fuzzing + StressStatische Probe-BibliothekPythonic Test Suite
API Stress TestingJaNeinNein
UILokale Web-UICLICode
Am besten fürBlack-Box-Endpunkt-ScanningBreite Modell-ProbesApp-Level CI Red Teaming

Ressourcen