コンテンツにスキップ

DeepTeam - LLM レッドティーミングフレームワーク チートシート

DeepTeam - LLM レッドティーミングフレームワーク チートシート

DeepTeam は DeepEval チームが開発したオープンソースの LLM レッドティーミングフレームワーク です。LLM アプリケーションに対する敵対的攻撃をシミュレートします。プロンプトインジェクション、ジェイルブレイク、個人情報漏洩、過度な能力委譲、バイアスなど、脆弱性とそれを回避防御を重ねる攻撃拡張のライブラリを使用します。その基本的な思想は、レッドティーミングは繰り返し可能で自動化されたべきで、一度限りの手動演習ではなく、CI のテストスイートのように実行されるべきということです。

自分が所有または許可を得たシステムのみでレッドティームを実行してください。生成された攻撃は実在する敵対的入力です。

インストール

方法コマンド
pippip install deepteam
uvuv add deepteam
モデルキーexport OPENAI_API_KEY=... (シミュレーターと判定用)
確認python -c "import deepteam; print('ok')"

コア概念

用語意味
Vulnerability調査する弱点クラス (例: 個人情報漏洩)
Attackそれをトリガーするために使用される技術 (例: プロンプトインジェクション)
Enhancement攻撃をより検出しにくくする変換
Model callbackあなたのアプリで、DeepTeam が呼び出せる関数としてラップされたもの
Risk assessment何が成功したかのスコア付きレポート

最小限のレッドティーム実行

from deepteam import red_team
from deepteam.vulnerabilities import Bias, PIILeakage
from deepteam.attacks.single_turn import PromptInjection

async def model_callback(input: str) -> str:
    # あなたのアプリ/モデルをここで呼び出して出力を返す
    return await my_llm_app(input)

risk = red_team(
    model_callback=model_callback,
    vulnerabilities=[Bias(), PIILeakage()],
    attacks=[PromptInjection()],
)
print(risk)
引数目的
model_callbackテスト対象システムへのアダプタ
vulnerabilities調査する弱点
attacks使用する技術
attacks_per_vulnerability_typeテストケースのボリューム

脆弱性カテゴリ

カテゴリ調査対象
PIILeakage個人データの漏洩
Bias性別/人種/宗教/政治的バイアス
Toxicity有害または虐待的な出力
PromptLeakageシステムプロンプト開示
ExcessiveAgency無許可のアクション実行
Misinformation事実的/根拠のない主張
IllegalActivity安全でない命令コンプライアンス
Robustnessハイジャック/入力への過度な依存

攻撃と拡張

シングルターン攻撃技術
PromptInjection注入された命令
Roleplayペルソナベースのバイパス
Base64 / ROT13 / Leetspeakエンコーディング回避
Multilingual非英語バイパス
MathProblemフレーミングによる難読化
マルチターン攻撃技術
LinearJailbreakingターン数の段階的増加
TreeJailbreakingバイパスを探すブランチ検索
CrescendoJailbreaking段階的なエスカレーション

CI での実行

# red_team.py — 重度の問題が出現した場合、ビルドを失敗させる
risk = red_team(model_callback=cb, vulnerabilities=[...], attacks=[...])
assert risk.overall_score >= THRESHOLD, "Red team failures detected"
実践理由
シナリオセットをピン留め実行間で比較可能な結果
重大度でゲート高リスク回帰のみでブロック
レポートを保存時間経過に伴う態勢を追跡
プロンプト変更時に再実行プロンプトは制御面

DeepTeam 対 関連ツール

側面DeepTeamgarakPyRITpromptfoo
レイヤーアプリケーションモデルモデル + マルチターンアプリケーション
スタイルPythonic スイートCLI スキャナーオーケストレーション SDKConfig + CLI
マルチターンはい限定的強力はい
最適用途アプリレベルの自動レッドティーミング広範なモデルプローブ複雑な攻撃研究CI 評価 + レッドティーム

garak (モデル層プローブ) と promptfoo (評価 + CI) を補完します。複数実行してください。異なる障害をキャッチします。

リソース