Agentic Security - Cheatsheet dello Scanner di Vulnerabilità LLM
Agentic Security è uno scanner open-source di vulnerabilità LLM agentico e un toolkit di red-team. Invece di sparare una lista fissa di prompt, usa un ciclo agentico per eseguire il fuzzing di un modello target o API — generando probe, osservando risposte e adattandosi — per scoprire jailbreak, prompt injection e comportamenti non sicuri. Inoltre esegue il test di stress delle API, che è importante perché molte distribuzioni LLM falliscono su limiti di rate e esaurimento di risorse prima di fallire su sicurezza dei contenuti.
Scansiona solo sistemi di cui sei proprietario o autorizzato a testare.
Installation
| Method | Command |
|---|
| pip | pip install agentic_security |
| From source | git clone https://github.com/msoedov/agentic_security && pip install -e . |
| Run the UI | agentic_security (serves a local web UI) |
| Headless | agentic_security --headless |
| Verify | agentic_security --help |
Running a Scan
| Command | Description |
|---|
agentic_security | Avvia l”UI locale (porta predefinita 8718) |
agentic_security --port 8718 | Scegli una porta |
agentic_security --headless | Modalità CI/non-interattiva |
--llm-spec <file> | Definisci il formato della richiesta target |
--max-budget N | Limitare i token/richieste spesi |
Defining the Target
Lo scanner ha bisogno di sapere come chiamare il tuo endpoint LLM. Fornisci una specifica HTTP:
POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json
{
"model": "my-model",
"messages": [{"role": "user", "content": "<<PROMPT>>"}]
}
<<PROMPT>> viene sostituito con ogni probe avversariale generata, quindi qualsiasi API compatibile con OpenAI o personalizzata può essere presa di mira.
What It Probes
| Category | Looks for |
|---|
| Jailbreaks | Bypass delle istruzioni di sicurezza |
| Prompt injection | Override di istruzioni tramite input |
| Data leakage | Esposizione di prompt di sistema / dati di training |
| Harmful content | Conformità non sicura |
| Fuzzing | Input malformati/edge-case |
| Stress | Comportamento sotto carico/limiti di rate |
Datasets & Probes
| Source | Provides |
|---|
| Built-in probe sets | Prompt avversariali curati |
| HuggingFace datasets | Corpora di jailbreak della comunità |
| Custom CSV | Le tue stesse probe |
| Agentic generation | Attacchi adattativi generati dal modello |
Reading Results
| Output | Meaning |
|---|
| Failure rate | Quota di probe che ha prodotto output non sicuri |
| Per-module breakdown | Quale classe di attacco ha avuto successo |
| Sample transcripts | Le coppie esatte prompt/risposta |
| Throughput/latency | Comportamento dell”API sotto stress |
Concentrati prima sui moduli con un alto tasso di fallimento — è dove le tue guardrail sono più deboli.
CI Integration
# Headless scan with a spend cap, fail on threshold
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
| Practice | Why |
|---|
| Cap budget | Il fuzzing agentico può spendere token velocemente |
| Pin probe sets | Risultati comparabili tra esecuzioni |
| Run on prompt/model change | Entrambi alterano la superficie di sicurezza |
| Pair with guardrails | Scansiona di nuovo dopo aver aggiunto LLM Guard |
| Aspect | Agentic Security | garak | DeepTeam |
|---|
| Approach | Fuzzing agentico + stress | Libreria di probe statica | Suite di test Pythonic |
| API stress testing | Yes | No | No |
| UI | UI web locale | CLI | Code |
| Best for | Scansione di endpoint black-box | Probe ampi del modello | Red teaming di CI a livello di app |
Resources