Zum Inhalt springen

Inspect AI - LLM Evaluation Framework Cheatsheet

Inspect AI - LLM Evaluation Framework Cheatsheet

Inspect ist ein Open-Source-Framework für Large Language Model Evaluations, erstellt vom UK AI Safety Institute. Es gibt Evals eine klare Struktur — einen Datensatz von Samples, einen Solver-Pipeline, der Antworten erzeugt, und einen Scorer, der sie bewertet — plus einen erstklassigen Viewer, um genau zu sehen, was das Modell auf jeder Sample gesehen und getan hat. Es ist für strenge, reproduzierbare Evaluation konzipiert, einschließlich Agentic-Aufgaben und Tool-Use, und wird häufig für Sicherheits- und Fähigkeitsprüfungen verwendet.

Installation

MethodeBefehl
pippip install inspect-ai
uvuv add inspect-ai
Model-Schlüsselexport OPENAI_API_KEY=... / ANTHROPIC_API_KEY=...
VS CodeInstalliere die Inspect-Erweiterung für den Viewer
Verifikationinspect --version

Die drei Bausteine

KomponenteRolle
DatasetSamples mit input und target
SolverSchritte, die Input in Modell-Output verwandeln
ScorerBewertet Output gegen das Target

Ein minimales Eval

from inspect_ai import Task, task
from inspect_ai.dataset import example_dataset
from inspect_ai.scorer import model_graded_fact
from inspect_ai.solver import generate, system_message

@task
def security_qa():
    return Task(
        dataset=example_dataset("theory_of_mind"),
        solver=[
            system_message("You are a concise security expert."),
            generate(),
        ],
        scorer=model_graded_fact(),
    )
inspect eval security_qa.py --model openai/gpt-4o

Evals ausführen

BefehlBeschreibung
inspect eval task.py --model openai/gpt-4oFühre ein Eval aus
inspect eval task.py --limit 20Nur die ersten 20 Samples
inspect eval task.py --model-base-url URLBenutzerdefinierter/lokaler Endpunkt
inspect eval task.py -T param=valueÜbergebe Task-Parameter
inspect eval-retry <log>Wiederhole fehlgeschlagene Samples
inspect viewÖffne den Log Viewer

Solver

SolverTut
generate()Rufe das Modell auf
system_message(...)Prepend einen System Prompt
chain_of_thought()Füge CoT Prompting hinzu
self_critique()Modell überprüft seine eigene Antwort
use_tools([...])Aktiviere Tool Calling
basic_agent()Ein ReAct-Style Agent Loop

Scorer

ScorerBewertet nach
match()Exakt/Substring-Match
includes()Target erscheint in Output
pattern(regex)Regex-Extraktion
model_graded_qa()LLM-Judge gegen ein Rubric
model_graded_fact()LLM-Judge für faktische Äquivalenz
choice()Multiple-Choice-Antwort

Agentic Evals & Tools

from inspect_ai.tool import bash, python
from inspect_ai.solver import basic_agent

solver = basic_agent(tools=[bash(), python()], max_attempts=3)
FähigkeitNotiz
Tool UseBuilt-in bash, python, Web Tools
SandboxingFühre Tools in Docker aus für Isolation
Multi-TurnAgent Loops mit Attempt Limits
Custom ToolsDekoriere Python-Funktionen als Tools

Der Viewer

ZeigtWarum es wichtig ist
Jede SampleInput, Target, Output, Score
Full TranscriptJede Nachricht, Tool Call und Result
Scoring RationaleWarum der Judge so bewertet hat
MetricsAccuracy und Custom Metrics

In der Lage zu sein, das Transcript von Fehlern zu lesen, ist das, was einen Score in ein actionable Finding verwandelt.

Inspect vs Andere Eval Frameworks

AspektInspectDeepEvalRagas
UrsprungUK AI Safety InstituteConfident AIExploding Gradients
FokusAllgemeine + Agentic EvalsUnit-Test-Style App EvalsRAG-Spezifische Metriken
ViewerRich, erstklassigReports/DashboardScores
Am besten fürStrenge Capability/Safety EvalsCI Test GatingRAG Pipeline Scoring

Ergänzt DeepEval für CI-Style-Testing und Ragas für RAG-Spezifische-Metriken.

Ressourcen