LLM アプリケーションの出荷は、障害モードが例外やスタックトレースではなく出力であるシステムの出荷を意味します — システムプロンプトを漏洩させるチャットボット、呼び出すべきでないツールに議論で説得されるエージェント、自信を持って払い戻しポリシーを発明するサポート アシスタント。これらのどれもエラーをスロー しません。期待値を返すための関数をアサートする従来のテストは、そのほとんどを表現できません。その隙間を埋めるために生まれた学問はLLM レッドティーミングです: 誰かが別の人である前に、受け入れられない動作を生成する入力を見つけるため、あなた独自のモデルとアプリケーションを故意に攻撃。
2026 年までに、これは ad-hoc プロンプト実験から、異なるレイヤーを持つツール景観に成熟しました。このガイドはその景観をマップします — garak と PyRIT がモデル層、DeepTeam と promptfoo がアプリケーション層、Agentic Security がブラックボックスエンドポイント ファジング、Giskard と Inspect がスキャンと厳密な評価。一貫性があり、これらのツールは競合者ではありません: 異なるクラスの障害をキャッチし、1 つだけ実行すると予測可能なギャップが残ります。
実際にテストしている内容
ツール前に、障害クラスを命名する方法があります。異なるテストを要求するため。ジェイルブレイクとプロンプトインジェクションが見出しです: モデルが指示を無視させ、直接操作 (「前の指示を無視」) または間接的には、それが取得するコンテンツ — ポイズンド ドキュメント指示を運ぶモデルが次に従います。間接インジェクションは RAG とエージェント システム内では、攻撃者がプロンプトボックスに触れることがなくなるため、より深刻な変形。
データ漏洩はシステムプロンプトの抽出、モデルがコンテキストで見た PII、または学習データをカバー。過度な能力は、エージェントがツールを得るほどより危険に成長する障害クラスです: モデルが拒否すべきアクションを実行、または意図される権限を超えるツール方法チェーン。有害なコンテンツはアプリケーションが拒否すべき要求のストレート フォワード コンプライアンス。そして幻覚 — 自信を持った捏造 — しばしま最も低劇的でも高頻度のビジネスリスク。
それぞれは異なるレイヤーで生活します。ジェイルブレイク感受性は主にモデルの属性。過度な能力とプロンプト漏洩はアプリケーションの属性 — システムプロンプト、ツール、ガードレール。幻覚はパイプラインの属性、特に検索品質。このレイヤーはツールが分割する方法と正確にです。
モデル層スキャナー: garak と PyRIT
garak (NVIDIA から) は LLM 用 nmap に最も近いもの。モデルに対してプローブの大規模なライブラリを実行します — ジェイルブレイク家族、プロンプトインジェクション、毒性、データ漏洩、エンコーディング攻撃 — そしてどれが成功したかレポート。モデル (HuggingFace モデル、OpenAI エンドポイント、ローカルサーバー) にポイント、そのカタログで動作。その価値は幅と低摩擦です: 既知の攻撃家族にモデルが感受性があり、自分で設計することなく素早く学習。
PyRIT (Microsoft から) より難しい問題をターゲット: マルチターンと マルチモーダル攻撃。多くの実ジェイルブレイク単一メッセージでは機能しません; それらは複数ターン全体でコンテキストを確立し、段階的にエスカレートすることで機能します。PyRIT はそれへのオーケストレーション提供します — crescendo (遅い段階的) と TAP (枝をプルーン付き攻撃のツリー) の様な攻撃戦略は、モデルの応答に基づいて適応。それはスタート するためにより多くの仕事と研究への単一ショット プローブが見つけられない攻撃さらに強力な SDK より スキャナー。
共有的な制限はほぼ両方がテストするモデル、アプリケーションではない。モデルが分離でgarak のプローブに抵抗しは、アプリケーション内で依然として無自覚にコンプロマイズできます。システムプロンプト、検索、ツールがモデル層スキャンが見たことない攻撃面を作成するため。
アプリケーション層スイート: DeepTeam と promptfoo
ここで DeepTeam と promptfoo はまちがえます。両者テストデプロイ済みアプリケーション、あなたのアプリが実際にある — プロンプト、検索、ツール、ガードレール — そして全体アセンブリを攻撃。
DeepEval チームから DeepTeam は、Python としてレッドティーミングを表現: model_callback を提供する (アプリ呼び出す)、宣言する脆弱性をプローブ (PII 漏洩、過度な能力、バイアス、プロンプト漏洩) と攻撃使用、そして敵対ケースを生成・実行。その攻撃拡張が興味ぶかい部分 — 同じベース攻撃が base64 として、別の言語として、ロールプレイ、またはターン全体にエスカレート。実攻撃者が素朴なフィルターを回避する方法。コードなので、テストスイートに落ちて CI で実行。
promptfoo はそれを評価から来ます: LLM 出力テスト用のコンフィグ駆動 CLI は大規模なレッドティーミング能力へと成長、敵対プロンプトをダース攻撃プラグイン全体で自動生成・コンプライアンスフレームワークへ マップ。その強みは CI 統合と同じツールが品質評価とセキュリティ テスト両方をカバーしたため、1 つの手綱両方目的で機能。
最多のチーム出荷 LLM 産物このレイヤーは、モデル層より重要です。デプロイ済みの物をテストするため。キャッチは、「受け入れられない」を定義する必要があります — ツールは攻撃を生成しますが、あなたはどの出力が障害かについての判定を供給。
ブラックボックスとスキャン手法
別 2 つの形は知る価値があります。Agentic Security は、あなたのエンドポイントをブラックボックスとして扱い、エージェント型でファジング — プローブ生成、応答観察、適応 — API ストレステストの有用な追加付き。その最後の部分は過小評価: LLM デプロイメントの意味あり共有がコンテンツセーフティの前にレート制限、トークン枯渇、リソース悪用の失敗、そして大多数レッドティームツールはそれを完全に無視。
Giskard 通常的なワークフロー逆: 何を テストする指定する必要がある代わりに、スキャンモデル — あなたのアプリが何をするか説明を使用してドメイン関連プローブを生成 — と検出脆弱性のレポートを生成、それは次に再利用可能なテストスイートに変換できます。スキャン・テスト化パターンはちょうど価値があり、最も難しいレッド ティーミング部分は知る何を見つけるかです。Giskard は、テストを考え付かないを見つけ、回帰テストとしてロック.
最後に、Inspect 英国 AI セーフティ研究所から少し別に座ります: むしろ攻撃ツール、それは厳密な評価フレームワーク — その構造 (データセット、ソルバー、スコアラー) と卓越したトランスクリプト ビューアー、脆弱性リストではなく防衛可能で再現可能な測定が必要な場合のように、エージェント動作を含む。
レイヤード実践構築
実践的な結論はこれらのツールが構成される。合理的な 2026 年実践はこのようになります。
ベースモデル選択またはアップグレード時、モデル層スキャナー実行 — 幅用 garak、マルチターンロバストネスがリスク プロファイルで重要場合 PyRIT。これは、モデル選択を情報提供し、財団がそれ自体に抵抗するコンテンツ。
開発中、Giskard のようなスキャンスタイルツール実行、あなたのアプリケーション実際に反対スキャン、予期しない障害クラス発見、そしてその発見を テストに変換。
CI で、すべてのプロンプト、モデル、またはツール変更、アプリケーション層スイート実行 — DeepTeam または promptfoo — ゲートとして。これは最高値自動化、プロンプト変更が制御面でツール定義も変更し、LLM アプリ。無害に見えるプロンプト編集はジェイルブレイク防止文を削除できます。
リリース前、デプロイ済みエンドポイント反対ブラックボックス ファジング追加、ストレステスト含む、コード レベルテストが漏らす配置レベルの問題をキャッチ。
そして人間をそれに保つ。 すべての自動ツール既知攻撃家族をテスト。新規攻撃 — ドメイン、データ、ツール固有の — あなたのビジネスロジック思考敵対的に理解する人から来ます。自動化は床を上げます; 天井を置き換えません。
間接インジェクション: モデルを破るもの
攻撃クラス 1 つはほとんどのチームが開始する直感を破りのため別個の治療が必要。直接プロンプトインジェクション — ユーザーが「あなたの指示を無視」タイプする — 最初にすべてがテストし、より簡単な半。間接プロンプトインジェクションは、悪意命令がシステム検索コンテンツを通して到着: ドキュメント知識ベース、エージェント ブラウズウェブページ、アウト要約メール、読むコード コメント。攻撃者がアプリのプロンプトボックスと全く相互作用しません。
これは RAG システムとエージェントのためにメータボー。価値命題は外部コンテンツを消費。支援アシスタント質問ドキュメンテーション答えは誠実にそれが従うドキュメント埋め込まれた命令パブリック ウィキを得るだれかがいると、顧客提出チケット、またはスクレイプページ経由。エージェント GitHub 問題をもつ読むことができるその問題。信頼境界人間は想像 (「ユーザーは信頼されない、データは信頼される」) は一度保たない全体一部がコーパス影響可能。
これのテストは直接インジェクション テストより難しい。ポイズンドプロンプトではなく、ポイズンドコンテンツをシミュレートが必要 — 検索見つけた敵対テキストを配置・模デルはそれに動作しないを確認。アプリケーション層ツール検索パイプラインがテストの一部以後それら、しかししばしば意図的にシナリオを構築する必要。
軽減は、プロンプトベース代わりにアーキテクチャ。すべての取得されたコンテンツ信頼されないとして扱う。取得されたテキストが命令として解釈できる位置に到達をやめるあなたが構造的に回避できる。エージェント許可ツールを制約、潜在的なアクション確認を要求。そして系譜を保つ: どのドキュメント悪い答え生成したかを知ることは、インシデントを修正に変えます。
レッドティーミング修正されない何
明確に述べる価値のある警告: 脆弱性を見つけることは修正するのと同じではない、そして LLM 脆弱性はしばしば完全には修正できません。バッファ オーバーフローをパッチするようなモデルをパッチできません。現実的応答は軽減より排除: より厳しいシステムプロンプト、入力と出力ガードレール LLM Guard のような、制約ツール権限、重要アクション向け人間承認、異常動作の監視。
これが赤チーム報告に意味することを変えます。従来のセキュリティでは、発見は修正を意味します。LLM セキュリティで、発見しばしば意味リスク決定: 攻撃はいくらか成功率で、ここ軽減、ここ残りリスク、それはこのユースケース受け入れ可能ですか? 赤チーム レポート が清潔なヘルス請求書を生成望むチーム永遠に失望します。リスク意識的に受け入れるために使用する取得実際値のチーム。
コロラリーは、アーキテクチャはプロンプト・エンジニアリング最も重要な障害を打ちます。ツール移転への権限を構造的に欠ける理由でエージェント誘導トリックするのはより安全なモデルに拒否に頼ること。過度な能力が最高に対処されることより少ない能力与え。レッド ティーミングの最有用な出力しばしば実感は能力が一番初め決定するべきではない。
ボトムライン
LLM レッドティーミングが実学問なったなぜなら LLM 障害は例外ではなく出力、および通常のテストが表現できません。2026 年ツール層により分割される、そしてその分割がそれをよく使用するキーです: garak と PyRITモデルをプローブ、DeepTeam と promptfooアプリケーションデプロイ済み攻撃、Agentic Securityエンドポイントファジング、リソース制限を含める、そして Giskard 知らなかった問題を発見。複数実行、プロンプト最多変わる層でアプリケーション層 CI をゲート、ループで敵対的人間思考を保つ、そしてメッセージを修正待つバグではなくリスク決定として — 架空ではなくアーキテクチャで修正できるもの。
参照とリソース
ツール
背景と分析
- 2026 年最高 LLM 脆弱性スキャナー: Garak、PyRIT、Promptfoo
- LLM レッドティーミング ガイド 2026: ツール、攻撃 & 方法論 — AppSec Santa
- LLM レッド ティーミング ツール 比較 — QAwerk
- awesome-ai-security-tools
関連 1337skills チートシート