Salta ai contenuti

Agentic Security - Cheatsheet dello Scanner di Vulnerabilità LLM

Agentic Security - Cheatsheet dello Scanner di Vulnerabilità LLM

Agentic Security è uno scanner open-source di vulnerabilità LLM agentico e un toolkit di red-team. Invece di sparare una lista fissa di prompt, usa un ciclo agentico per eseguire il fuzzing di un modello target o API — generando probe, osservando risposte e adattandosi — per scoprire jailbreak, prompt injection e comportamenti non sicuri. Inoltre esegue il test di stress delle API, che è importante perché molte distribuzioni LLM falliscono su limiti di rate e esaurimento di risorse prima di fallire su sicurezza dei contenuti.

Scansiona solo sistemi di cui sei proprietario o autorizzato a testare.

Installation

MethodCommand
pippip install agentic_security
From sourcegit clone https://github.com/msoedov/agentic_security && pip install -e .
Run the UIagentic_security (serves a local web UI)
Headlessagentic_security --headless
Verifyagentic_security --help

Running a Scan

CommandDescription
agentic_securityAvvia l”UI locale (porta predefinita 8718)
agentic_security --port 8718Scegli una porta
agentic_security --headlessModalità CI/non-interattiva
--llm-spec <file>Definisci il formato della richiesta target
--max-budget NLimitare i token/richieste spesi

Defining the Target

Lo scanner ha bisogno di sapere come chiamare il tuo endpoint LLM. Fornisci una specifica HTTP:

POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json

{
  "model": "my-model",
  "messages": [{"role": "user", "content": "<<PROMPT>>"}]
}

<<PROMPT>> viene sostituito con ogni probe avversariale generata, quindi qualsiasi API compatibile con OpenAI o personalizzata può essere presa di mira.

What It Probes

CategoryLooks for
JailbreaksBypass delle istruzioni di sicurezza
Prompt injectionOverride di istruzioni tramite input
Data leakageEsposizione di prompt di sistema / dati di training
Harmful contentConformità non sicura
FuzzingInput malformati/edge-case
StressComportamento sotto carico/limiti di rate

Datasets & Probes

SourceProvides
Built-in probe setsPrompt avversariali curati
HuggingFace datasetsCorpora di jailbreak della comunità
Custom CSVLe tue stesse probe
Agentic generationAttacchi adattativi generati dal modello

Reading Results

OutputMeaning
Failure rateQuota di probe che ha prodotto output non sicuri
Per-module breakdownQuale classe di attacco ha avuto successo
Sample transcriptsLe coppie esatte prompt/risposta
Throughput/latencyComportamento dell”API sotto stress

Concentrati prima sui moduli con un alto tasso di fallimento — è dove le tue guardrail sono più deboli.

CI Integration

# Headless scan with a spend cap, fail on threshold
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
PracticeWhy
Cap budgetIl fuzzing agentico può spendere token velocemente
Pin probe setsRisultati comparabili tra esecuzioni
Run on prompt/model changeEntrambi alterano la superficie di sicurezza
Pair with guardrailsScansiona di nuovo dopo aver aggiunto LLM Guard
AspectAgentic SecuritygarakDeepTeam
ApproachFuzzing agentico + stressLibreria di probe staticaSuite di test Pythonic
API stress testingYesNoNo
UIUI web localeCLICode
Best forScansione di endpoint black-boxProbe ampi del modelloRed teaming di CI a livello di app

Resources