Ir al contenido

Agentic Security - Escáner de Vulnerabilidades LLM Hoja de Trucos

Agentic Security - Escáner de Vulnerabilidades LLM Hoja de Trucos

Agentic Security es un escáner de vulnerabilidades LLM agentico de código abierto y kit de red teaming. En lugar de ejecutar una lista fija de prompts, utiliza un bucle agentico para probar un modelo o API objetivo — generando sondas, observando respuestas y adaptándose — para descubrir jailbreaks, inyección de prompts y comportamientos inseguros. También realiza pruebas de estrés en API, que importa porque muchos despliegues LLM fallan en límites de velocidad y agotamiento de recursos antes de fallar en seguridad de contenidos.

Escanea solo sistemas que posees o estás autorizado a probar.

Instalación

MétodoComando
pippip install agentic_security
Desde fuentegit clone https://github.com/msoedov/agentic_security && pip install -e .
Ejecutar la UIagentic_security (sirve una UI web local)
Sin interfazagentic_security --headless
Verificaragentic_security --help

Ejecutar un Escaneo

ComandoDescripción
agentic_securityIniciar la UI local (puerto 8718 por defecto)
agentic_security --port 8718Elegir un puerto
agentic_security --headlessModo CI/no interactivo
--llm-spec <file>Define el formato de solicitud objetivo
--max-budget NLimita tokens/solicitudes gastados

Definir el Objetivo

El escáner necesita saber cómo llamar tu endpoint LLM. Suministras una especificación HTTP:

POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json

{
  "model": "my-model",
  "messages": [{"role": "user", "content": "<<PROMPT>>"}]
}

<<PROMPT>> se sustituye con cada sonda adversarial generada, por lo que cualquier API compatible con OpenAI o API personalizada puede ser objetivo.

Lo Que Prueba

CategoríaBusca
JailbreaksEludir instrucciones de seguridad
Inyección de promptsOverride de instrucciones a través de entrada
Fuga de datosExposición de prompt de sistema / datos de entrenamiento
Contenido dañinoCumplimiento inseguro
FuzzingEntradas malformadas/de casos límite
EstrésComportamiento bajo carga/límites de velocidad

Conjuntos de Datos y Sondas

FuenteProporciona
Conjuntos de sondas integradosPrompts adversariales curados
Conjuntos de datos HuggingFaceCorpus comunitarios de jailbreaks
CSV personalizadoTus propias sondas
Generación agenticaAtaques adaptativos generados por modelo

Leer Resultados

SalidaSignificado
Tasa de fallaPorcentaje de sondas que produjeron salida insegura
Desglose por móduloQué clase de ataque tuvo éxito
Transcripciones de muestraPares exactos prompt/respuesta
Throughput/latenciaComportamiento de API bajo estrés

Enfócate primero en módulos con alta tasa de falla — ese es donde tus guardrails son más débiles.

Integración en CI

# Escaneo sin interfaz con límite de gasto, fallar en umbral
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
PrácticaPor qué
Límite de presupuestoEl fuzzing agentico puede gastar tokens rápidamente
Fijar conjuntos de sondasResultados comparables de ejecución en ejecución
Ejecutar en cambio de prompt/modeloAmbos alteran la superficie de seguridad
Emparejar con guardrailsRe-escanear después de añadir LLM Guard

Agentic Security vs Herramientas Relacionadas

AspectoAgentic SecuritygarakDeepTeam
EnfoqueFuzzing agentico + estrésBiblioteca de sondas estáticaSuite de pruebas Pythonica
Pruebas de estrés en APINoNo
UIUI web localCLICódigo
Mejor paraEscaneo de endpoint de caja negraSondas de modelo ampliasRed teaming de nivel de aplicación en CI

Recursos