Agentic Security - Escáner de Vulnerabilidades LLM Hoja de Trucos
Agentic Security es un escáner de vulnerabilidades LLM agentico de código abierto y kit de red teaming. En lugar de ejecutar una lista fija de prompts, utiliza un bucle agentico para probar un modelo o API objetivo — generando sondas, observando respuestas y adaptándose — para descubrir jailbreaks, inyección de prompts y comportamientos inseguros. También realiza pruebas de estrés en API, que importa porque muchos despliegues LLM fallan en límites de velocidad y agotamiento de recursos antes de fallar en seguridad de contenidos.
Escanea solo sistemas que posees o estás autorizado a probar.
Instalación
| Método | Comando |
|---|
| pip | pip install agentic_security |
| Desde fuente | git clone https://github.com/msoedov/agentic_security && pip install -e . |
| Ejecutar la UI | agentic_security (sirve una UI web local) |
| Sin interfaz | agentic_security --headless |
| Verificar | agentic_security --help |
Ejecutar un Escaneo
| Comando | Descripción |
|---|
agentic_security | Iniciar la UI local (puerto 8718 por defecto) |
agentic_security --port 8718 | Elegir un puerto |
agentic_security --headless | Modo CI/no interactivo |
--llm-spec <file> | Define el formato de solicitud objetivo |
--max-budget N | Limita tokens/solicitudes gastados |
Definir el Objetivo
El escáner necesita saber cómo llamar tu endpoint LLM. Suministras una especificación HTTP:
POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json
{
"model": "my-model",
"messages": [{"role": "user", "content": "<<PROMPT>>"}]
}
<<PROMPT>> se sustituye con cada sonda adversarial generada, por lo que cualquier API compatible con OpenAI o API personalizada puede ser objetivo.
Lo Que Prueba
| Categoría | Busca |
|---|
| Jailbreaks | Eludir instrucciones de seguridad |
| Inyección de prompts | Override de instrucciones a través de entrada |
| Fuga de datos | Exposición de prompt de sistema / datos de entrenamiento |
| Contenido dañino | Cumplimiento inseguro |
| Fuzzing | Entradas malformadas/de casos límite |
| Estrés | Comportamiento bajo carga/límites de velocidad |
Conjuntos de Datos y Sondas
| Fuente | Proporciona |
|---|
| Conjuntos de sondas integrados | Prompts adversariales curados |
| Conjuntos de datos HuggingFace | Corpus comunitarios de jailbreaks |
| CSV personalizado | Tus propias sondas |
| Generación agentica | Ataques adaptativos generados por modelo |
Leer Resultados
| Salida | Significado |
|---|
| Tasa de falla | Porcentaje de sondas que produjeron salida insegura |
| Desglose por módulo | Qué clase de ataque tuvo éxito |
| Transcripciones de muestra | Pares exactos prompt/respuesta |
| Throughput/latencia | Comportamiento de API bajo estrés |
Enfócate primero en módulos con alta tasa de falla — ese es donde tus guardrails son más débiles.
Integración en CI
# Escaneo sin interfaz con límite de gasto, fallar en umbral
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
| Práctica | Por qué |
|---|
| Límite de presupuesto | El fuzzing agentico puede gastar tokens rápidamente |
| Fijar conjuntos de sondas | Resultados comparables de ejecución en ejecución |
| Ejecutar en cambio de prompt/modelo | Ambos alteran la superficie de seguridad |
| Emparejar con guardrails | Re-escanear después de añadir LLM Guard |
Agentic Security vs Herramientas Relacionadas
| Aspecto | Agentic Security | garak | DeepTeam |
|---|
| Enfoque | Fuzzing agentico + estrés | Biblioteca de sondas estática | Suite de pruebas Pythonica |
| Pruebas de estrés en API | Sí | No | No |
| UI | UI web local | CLI | Código |
| Mejor para | Escaneo de endpoint de caja negra | Sondas de modelo amplias | Red teaming de nivel de aplicación en CI |
Recursos