Inspect AI - LLM 평가 프레임워크 치트시트
Inspect는 영국 AI 안전 연구소가 만든 대형 언어 모델 평가를 위한 오픈소스 프레임워크입니다. 평가에 명확한 구조를 제공합니다 — 샘플의 데이터세트, 답변을 생성하는 솔버 파이프라인, 그리고 그들을 채점하는 채점기 — 더불어 모든 샘플과 모델 상호작용을 검사하기 위한 최고급 뷰어를 제공합니다. 이는 에이전틱 작업 및 도구 사용을 포함한 엄격하고 재현 가능한 평가를 위해 설계되었으며, 안전 및 성능 테스트에 광범위하게 사용됩니다.
설치
| 방법 | 명령 |
|---|
| pip | pip install inspect-ai |
| uv | uv add inspect-ai |
| 모델 키 | export OPENAI_API_KEY=... / ANTHROPIC_API_KEY=... |
| VS Code | Inspect 확장 설치 |
| 확인 | inspect --version |
세 가지 구성 요소
| 컴포넌트 | 역할 |
|---|
| Dataset | input과 target을 가진 샘플 |
| Solver | 입력을 모델 출력으로 변환하는 단계 |
| Scorer | 대상과 비교하여 출력을 채점 |
최소 평가
from inspect_ai import Task, task
from inspect_ai.dataset import example_dataset
from inspect_ai.scorer import model_graded_fact
from inspect_ai.solver import generate, system_message
@task
def security_qa():
return Task(
dataset=example_dataset("theory_of_mind"),
solver=[
system_message("You are a concise security expert."),
generate(),
],
scorer=model_graded_fact(),
)
inspect eval security_qa.py --model openai/gpt-4o
평가 실행
| 명령 | 설명 |
|---|
inspect eval task.py --model openai/gpt-4o | 평가 실행 |
inspect eval task.py --limit 20 | 처음 20개 샘플만 |
inspect eval task.py --model-base-url URL | 맞춤형/로컬 엔드포인트 |
inspect eval task.py -T param=value | 작업 매개변수 전달 |
inspect eval-retry <log> | 실패한 샘플 재시도 |
inspect view | 로그 뷰어 열기 |
솔버
| 솔버 | 역할 |
|---|
generate() | 모델 호출 |
system_message(...) | 시스템 프롬프트 추가 |
chain_of_thought() | CoT 프롬팅 추가 |
self_critique() | 모델이 자신의 답변을 검토 |
use_tools([...]) | 도구 호출 활성화 |
basic_agent() | ReAct 스타일 에이전트 루프 |
채점기
| 채점기 | 채점 기준 |
|---|
match() | 정확/부분 일치 |
includes() | 대상이 출력에 나타남 |
pattern(regex) | 정규식 추출 |
model_graded_qa() | 루브릭에 대한 LLM 판사 |
model_graded_fact() | 사실적 동등성에 대한 LLM 판사 |
choice() | 객관식 답변 |
에이전틱 평가 및 도구
from inspect_ai.tool import bash, python
from inspect_ai.solver import basic_agent
solver = basic_agent(tools=[bash(), python()], max_attempts=3)
| 기능 | 참고 |
|---|
| 도구 사용 | 기본 제공 bash, python, 웹 도구 |
| 샌드박싱 | Docker에서 도구 실행 격리 |
| 다중 턴 | 시도 제한이 있는 에이전트 루프 |
| 맞춤형 도구 | Python 함수를 도구로 장식 |
뷰어
| 표시 | 중요한 이유 |
|---|
| 모든 샘플 | 입력, 대상, 출력, 점수 |
| 전체 대사록 | 각 메시지, 도구 호출, 결과 |
| 채점 근거 | 판사가 왜 그렇게 채점했는가 |
| 메트릭 | 정확도 및 맞춤형 메트릭 |
실패의 대사록을 읽을 수 있다는 것이 점수를 실행 가능한 발견으로 바꿉니다.
Inspect vs 다른 평가 프레임워크
| 측면 | Inspect | DeepEval | Ragas |
|---|
| 출처 | 영국 AI 안전 연구소 | Confident AI | Exploding Gradients |
| 초점 | 일반 + 에이전틱 평가 | 단위 테스트 스타일 앱 평가 | RAG 특정 메트릭 |
| 뷰어 | 풍부하고 최고급 | 보고서/대시보드 | 점수 |
| 최고의 용도 | 엄격한 능력/안전 평가 | CI 테스트 게이팅 | RAG 파이프라인 채점 |
DeepEval (CI 스타일 테스트)과 Ragas (RAG 특정 메트릭)을 보완합니다.
리소스