Agentic Security - LLM 脆弱性スキャナー チートシート
Agentic Security はオープンソースのエージェント型 LLM 脆弱性スキャナーおよびレッドティームツールキットです。固定されたプロンプトリストを発火する代わりに、エージェントループを使用してターゲットモデルまたは API をファジングします。プローブを生成し、応答を観察し、適応しながら、ジェイルブレイク、プロンプトインジェクション、不安全な動作を表面化させます。また、API ストレステストも実行します。これは、多くの LLM デプロイメントがコンテンツセーフティの前にレート制限とリソース枯渇で失敗するため重要です。
自分が所有または許可を得たシステムのみをスキャンしてください。
インストール
| 方法 | コマンド |
|---|
| pip | pip install agentic_security |
| ソースから | git clone https://github.com/msoedov/agentic_security && pip install -e . |
| UI を実行 | agentic_security (ローカルウェブ UI を提供) |
| ヘッドレス | agentic_security --headless |
| 確認 | agentic_security --help |
スキャン実行
| コマンド | 説明 |
|---|
agentic_security | ローカル UI を起動 (デフォルトポート 8718) |
agentic_security --port 8718 | ポートを選択 |
agentic_security --headless | CI/非対話型モード |
--llm-spec <file> | ターゲットリクエストフォーマットを定義 |
--max-budget N | トークン/リクエスト支出をキャップ |
ターゲットを定義
スキャナーは LLM エンドポイントの呼び出し方法を知る必要があります。HTTP スペックを提供します:
POST https://api.example.com/v1/chat/completions
Authorization: Bearer $TOKEN
Content-Type: application/json
{
"model": "my-model",
"messages": [{"role": "user", "content": "<<PROMPT>>"}]
}
<<PROMPT>> は各生成敵対プローブに置き換わるため、OpenAI 互換またはカスタム API をターゲットできます。
調査対象
| カテゴリ | 検索対象 |
|---|
| ジェイルブレイク | セーフティ命令のバイパス |
| プロンプトインジェクション | 入力による命令上書き |
| データ漏洩 | システムプロンプト/学習データ暴露 |
| 有害なコンテンツ | 安全でないコンプライアンス |
| ファジング | 不正形式/エッジケース入力 |
| ストレス | 負荷/レート制限下の動作 |
データセットとプローブ
| ソース | 提供 |
|---|
| 組み込みプローブセット | キュレートされた敵対的プロンプト |
| HuggingFace データセット | コミュニティジェイルブレイクコーパス |
| カスタム CSV | あなた独自のプローブ |
| エージェント生成 | モデル生成適応型攻撃 |
結果の読取
| 出力 | 意味 |
|---|
| 失敗率 | 危険な出力を生成したプローブの割合 |
| モジュール別詳細 | どの攻撃クラスが成功したか |
| サンプルトランスクリプト | 正確なプロンプト/応答ペア |
| スループット/レイテンシー | ストレス下の API 動作 |
失敗率が高いモジュールから始めてください。これがあなたのガードレールが最も薄い場所です。
CI 統合
# 支出キャップ付きのヘッドレススキャン、閾値でフェイル
agentic_security --headless --llm-spec ./target.spec --max-budget 50000
| 実践 | 理由 |
|---|
| 予算をキャップ | エージェント型ファジングはトークンを速く消費可能 |
| プローブセットをピン留め | 実行間で比較可能な結果 |
| プロンプト/モデル変更時に実行 | 両方が安全面を変える |
| ガードレールと組み合わせ | LLM Guard 追加後に再スキャン |
Agentic Security 対 関連ツール
| 側面 | Agentic Security | garak | DeepTeam |
|---|
| 手法 | エージェント型ファジング + ストレス | 静的プローブライブラリ | Pythonic テストスイート |
| API ストレステスト | はい | いいえ | いいえ |
| UI | ローカルウェブ UI | CLI | コード |
| 最適用途 | ブラックボックスエンドポイントスキャン | 広範なモデルプローブ | アプリレベル CI レッドティーミング |
リソース