コンテンツにスキップ

Inspect AI - LLM 評価フレームワーク チートシート

Inspect AI - LLM 評価フレームワーク チートシート

Inspect は英国 AI セーフティ研究所により作成された大規模言語モデル評価用のオープンソースフレームワークです。評価に明確な構造を与えます — データセットのサンプル、答えを生成するソルバーパイプライン、それらを採点するスコアラー — さらにすべてのサンプルとモデル相互作用を正確に検査するための一流のビューアーを備えています。厳密で再現可能な評価のために設計されており、エージェントタスクとツール使用を含み、安全性と能力テストで広く使用されています。

インストール

方法コマンド
pippip install inspect-ai
uvuv add inspect-ai
モデルキーexport OPENAI_API_KEY=... / ANTHROPIC_API_KEY=...
VS CodeInspect エクステンションをインストールしてビューアーを使用
確認inspect --version

3 つの構成要素

コンポーネント役割
Datasetinputtarget を持つサンプル
Solver入力をモデル出力に変える処理ステップ
Scorer出力をターゲットに対して採点

最小限の評価

from inspect_ai import Task, task
from inspect_ai.dataset import example_dataset
from inspect_ai.scorer import model_graded_fact
from inspect_ai.solver import generate, system_message

@task
def security_qa():
    return Task(
        dataset=example_dataset("theory_of_mind"),
        solver=[
            system_message("You are a concise security expert."),
            generate(),
        ],
        scorer=model_graded_fact(),
    )
inspect eval security_qa.py --model openai/gpt-4o

評価を実行

コマンド説明
inspect eval task.py --model openai/gpt-4o評価を実行
inspect eval task.py --limit 20最初の 20 サンプルのみ
inspect eval task.py --model-base-url URLカスタム/ローカルエンドポイント
inspect eval task.py -T param=valueタスクパラメータを渡す
inspect eval-retry <log>失敗したサンプルを再試行
inspect viewログビューアーを開く

ソルバー

ソルバー実行内容
generate()モデルを呼び出す
system_message(...)システムプロンプトを先頭に追加
chain_of_thought()CoT プロンプティングを追加
self_critique()モデルが自分の答えを審査
use_tools([...])ツール呼び出しを有効化
basic_agent()ReAct スタイルのエージェントループ

スコアラー

スコアラー採点基準
match()完全一致/部分文字列一致
includes()ターゲットが出力に出現
pattern(regex)正規表現抽出
model_graded_qa()ルーブリックに対する LLM 判定
model_graded_fact()事実的等価性に対する LLM 判定
choice()複数選択答え

エージェント評価とツール

from inspect_ai.tool import bash, python
from inspect_ai.solver import basic_agent

solver = basic_agent(tools=[bash(), python()], max_attempts=3)
能力注釈
ツール使用組み込み bashpython、ウェブツール
サンドボックス化Docker でツールを実行して分離
マルチターン試行制限付きエージェントループ
カスタムツールPython 関数をツールとしてデコレート

ビューアー

表示内容なぜ重要か
すべてのサンプル入力、ターゲット、出力、スコア
完全なトランスクリプト各メッセージ、ツール呼び出し、結果
スコアリング根拠判定者がなぜこのように採点したか
メトリクス精度とカスタムメトリクス

トランスクリプトを読む能力は、スコアを実行可能な発見に変えるもの。

Inspect 対 他の評価フレームワーク

側面InspectDeepEvalRagas
出所英国 AI セーフティ研究所Confident AIExploding Gradients
フォーカス一般的 + エージェント評価ユニットテストスタイルアプリ評価RAG 固有メトリクス
ビューアー豊富で一流レポート/ダッシュボードスコア
最適用途厳密な能力/セーフティ評価CI テストゲーティングRAG パイプラインスコアリング

DeepEval for CI スタイルテストと Ragas for RAG 固有メトリクスを補完します。

リソース