Inspect AI - LLM 評価フレームワーク チートシート
Inspect は英国 AI セーフティ研究所により作成された大規模言語モデル評価用のオープンソースフレームワークです。評価に明確な構造を与えます — データセットのサンプル、答えを生成するソルバーパイプライン、それらを採点するスコアラー — さらにすべてのサンプルとモデル相互作用を正確に検査するための一流のビューアーを備えています。厳密で再現可能な評価のために設計されており、エージェントタスクとツール使用を含み、安全性と能力テストで広く使用されています。
インストール
| 方法 | コマンド |
|---|
| pip | pip install inspect-ai |
| uv | uv add inspect-ai |
| モデルキー | export OPENAI_API_KEY=... / ANTHROPIC_API_KEY=... |
| VS Code | Inspect エクステンションをインストールしてビューアーを使用 |
| 確認 | inspect --version |
3 つの構成要素
| コンポーネント | 役割 |
|---|
| Dataset | input と target を持つサンプル |
| Solver | 入力をモデル出力に変える処理ステップ |
| Scorer | 出力をターゲットに対して採点 |
最小限の評価
from inspect_ai import Task, task
from inspect_ai.dataset import example_dataset
from inspect_ai.scorer import model_graded_fact
from inspect_ai.solver import generate, system_message
@task
def security_qa():
return Task(
dataset=example_dataset("theory_of_mind"),
solver=[
system_message("You are a concise security expert."),
generate(),
],
scorer=model_graded_fact(),
)
inspect eval security_qa.py --model openai/gpt-4o
評価を実行
| コマンド | 説明 |
|---|
inspect eval task.py --model openai/gpt-4o | 評価を実行 |
inspect eval task.py --limit 20 | 最初の 20 サンプルのみ |
inspect eval task.py --model-base-url URL | カスタム/ローカルエンドポイント |
inspect eval task.py -T param=value | タスクパラメータを渡す |
inspect eval-retry <log> | 失敗したサンプルを再試行 |
inspect view | ログビューアーを開く |
ソルバー
| ソルバー | 実行内容 |
|---|
generate() | モデルを呼び出す |
system_message(...) | システムプロンプトを先頭に追加 |
chain_of_thought() | CoT プロンプティングを追加 |
self_critique() | モデルが自分の答えを審査 |
use_tools([...]) | ツール呼び出しを有効化 |
basic_agent() | ReAct スタイルのエージェントループ |
スコアラー
| スコアラー | 採点基準 |
|---|
match() | 完全一致/部分文字列一致 |
includes() | ターゲットが出力に出現 |
pattern(regex) | 正規表現抽出 |
model_graded_qa() | ルーブリックに対する LLM 判定 |
model_graded_fact() | 事実的等価性に対する LLM 判定 |
choice() | 複数選択答え |
エージェント評価とツール
from inspect_ai.tool import bash, python
from inspect_ai.solver import basic_agent
solver = basic_agent(tools=[bash(), python()], max_attempts=3)
| 能力 | 注釈 |
|---|
| ツール使用 | 組み込み bash、python、ウェブツール |
| サンドボックス化 | Docker でツールを実行して分離 |
| マルチターン | 試行制限付きエージェントループ |
| カスタムツール | Python 関数をツールとしてデコレート |
ビューアー
| 表示内容 | なぜ重要か |
|---|
| すべてのサンプル | 入力、ターゲット、出力、スコア |
| 完全なトランスクリプト | 各メッセージ、ツール呼び出し、結果 |
| スコアリング根拠 | 判定者がなぜこのように採点したか |
| メトリクス | 精度とカスタムメトリクス |
トランスクリプトを読む能力は、スコアを実行可能な発見に変えるもの。
Inspect 対 他の評価フレームワーク
| 側面 | Inspect | DeepEval | Ragas |
|---|
| 出所 | 英国 AI セーフティ研究所 | Confident AI | Exploding Gradients |
| フォーカス | 一般的 + エージェント評価 | ユニットテストスタイルアプリ評価 | RAG 固有メトリクス |
| ビューアー | 豊富で一流 | レポート/ダッシュボード | スコア |
| 最適用途 | 厳密な能力/セーフティ評価 | CI テストゲーティング | RAG パイプラインスコアリング |
DeepEval for CI スタイルテストと Ragas for RAG 固有メトリクスを補完します。
リソース