Agentic Security - LLM Vulnerability Scanner Cheatsheet
Agentic Security ist ein Open-Source-Agentic-LLM-Vulnerability-Scanner und Red-Team-Toolkit. Anstatt eine feste Liste von Prompts zu verwenden, nutzt es eine agentic Loop zum Fuzzen eines Ziel-Modells oder einer API — generiert Probes, beobachtet Antworten und passt sich an — um Jailbreaks, Prompt Injections und unsicheres Verhalten zu decken. Es führt auch API Stress Testing durch, was wichtig ist, weil viele LLM-Deployments bei Ratelimits und Ressourcenerschöpfung fehlschlagen, bevor sie bei Content Safety fehlschlagen.
Scanne nur Systeme, denen du gehörst oder die du testen darfst.
Installation
| Methode | Befehl |
|---|
| pip | pip install agentic_security |
| Vom Source | git clone https://github.com/msoedov/agentic_security && pip install -e . |
| Run die UI | agentic_security (bedient eine lokale Web-UI) |
| Headless | agentic_security --headless |
| Verifikation | agentic_security --help |
Einen Scan ausführen
| Befehl | Beschreibung |
|---|
agentic_security | Starte die lokale UI (Standard-Port 8718) |
agentic_security --port 8718 | Wähle einen Port |
agentic_security --headless | CI/Non-interactive-Modus |
--llm-spec <file> | Definiere das Ziel-Request-Format |
--max-budget N | Begrenze Token/Requests |
Das Ziel definieren
Der Scanner muss wissen, wie er deinen LLM-Endpunkt aufruft. Du stellst eine HTTP-Spezifikation bereit:
POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json
{
"model": "my-model",
"messages": [{"role": "user", "content": "<<PROMPT>>"}]
}
<<PROMPT>> wird mit jeder generierten Adversarial-Probe ersetzt, daher kann jede OpenAI-kompatible oder benutzerdefinierte API als Ziel verwendet werden.
Was es prüft
| Kategorie | Sucht nach |
|---|
| Jailbreaks | Umgehung von Sicherheitsanweisungen |
| Prompt Injection | Anweisungsüberschreibung über Eingabe |
| Data Leakage | System Prompt / Training Data Exposure |
| Harmful Content | Unsichere Einhaltung |
| Fuzzing | Malformed/Edge-Case-Eingaben |
| Stress | Verhalten unter Last/Ratelimits |
Datensätze & Probes
| Quelle | Stellt zur Verfügung |
|---|
| Built-in Probe Sets | Kuratierte Adversarial Prompts |
| HuggingFace Datensätze | Community Jailbreak Corpora |
| Custom CSV | Deine eigenen Probes |
| Agentic Generation | Modell-generierte adaptive Attacken |
Ergebnisse lesen
| Output | Bedeutung |
|---|
| Failure Rate | Anteil der Probes, die unsichere Ausgabe produzierten |
| Pro-Modul-Breakdown | Welche Attackklasse erfolgreich war |
| Sample Transcripts | Die exakten Prompt/Response-Paare |
| Throughput/Latency | API-Verhalten unter Stress |
Konzentriere dich zuerst auf Module mit hoher Failure Rate — das ist, wo deine Guardrails am dünnsten sind.
CI Integration
# Headless Scan mit Spend Cap, Fail bei Threshold
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
| Praxis | Warum |
|---|
| Begrenze Budget | Agentic Fuzzing kann schnell Tokens ausgeben |
| Pin Probe Sets | Vergleichbare Ergebnisse run zu run |
| Run bei Prompt/Model-Änderung | Beides ändert die Safety-Oberfläche |
| Pair mit Guardrails | Re-scan nach dem Hinzufügen von LLM Guard |
| Aspekt | Agentic Security | garak | DeepTeam |
|---|
| Ansatz | Agentic Fuzzing + Stress | Statische Probe-Bibliothek | Pythonic Test Suite |
| API Stress Testing | Ja | Nein | Nein |
| UI | Lokale Web-UI | CLI | Code |
| Am besten für | Black-Box-Endpunkt-Scanning | Breite Modell-Probes | App-Level CI Red Teaming |
Ressourcen