콘텐츠로 이동

Inspect AI - LLM 평가 프레임워크 치트시트

Inspect AI - LLM 평가 프레임워크 치트시트

Inspect는 영국 AI 안전 연구소가 만든 대형 언어 모델 평가를 위한 오픈소스 프레임워크입니다. 평가에 명확한 구조를 제공합니다 — 샘플의 데이터세트, 답변을 생성하는 솔버 파이프라인, 그리고 그들을 채점하는 채점기 — 더불어 모든 샘플과 모델 상호작용을 검사하기 위한 최고급 뷰어를 제공합니다. 이는 에이전틱 작업 및 도구 사용을 포함한 엄격하고 재현 가능한 평가를 위해 설계되었으며, 안전 및 성능 테스트에 광범위하게 사용됩니다.

설치

방법명령
pippip install inspect-ai
uvuv add inspect-ai
모델 키export OPENAI_API_KEY=... / ANTHROPIC_API_KEY=...
VS CodeInspect 확장 설치
확인inspect --version

세 가지 구성 요소

컴포넌트역할
Datasetinputtarget을 가진 샘플
Solver입력을 모델 출력으로 변환하는 단계
Scorer대상과 비교하여 출력을 채점

최소 평가

from inspect_ai import Task, task
from inspect_ai.dataset import example_dataset
from inspect_ai.scorer import model_graded_fact
from inspect_ai.solver import generate, system_message

@task
def security_qa():
    return Task(
        dataset=example_dataset("theory_of_mind"),
        solver=[
            system_message("You are a concise security expert."),
            generate(),
        ],
        scorer=model_graded_fact(),
    )
inspect eval security_qa.py --model openai/gpt-4o

평가 실행

명령설명
inspect eval task.py --model openai/gpt-4o평가 실행
inspect eval task.py --limit 20처음 20개 샘플만
inspect eval task.py --model-base-url URL맞춤형/로컬 엔드포인트
inspect eval task.py -T param=value작업 매개변수 전달
inspect eval-retry <log>실패한 샘플 재시도
inspect view로그 뷰어 열기

솔버

솔버역할
generate()모델 호출
system_message(...)시스템 프롬프트 추가
chain_of_thought()CoT 프롬팅 추가
self_critique()모델이 자신의 답변을 검토
use_tools([...])도구 호출 활성화
basic_agent()ReAct 스타일 에이전트 루프

채점기

채점기채점 기준
match()정확/부분 일치
includes()대상이 출력에 나타남
pattern(regex)정규식 추출
model_graded_qa()루브릭에 대한 LLM 판사
model_graded_fact()사실적 동등성에 대한 LLM 판사
choice()객관식 답변

에이전틱 평가 및 도구

from inspect_ai.tool import bash, python
from inspect_ai.solver import basic_agent

solver = basic_agent(tools=[bash(), python()], max_attempts=3)
기능참고
도구 사용기본 제공 bash, python, 웹 도구
샌드박싱Docker에서 도구 실행 격리
다중 턴시도 제한이 있는 에이전트 루프
맞춤형 도구Python 함수를 도구로 장식

뷰어

표시중요한 이유
모든 샘플입력, 대상, 출력, 점수
전체 대사록각 메시지, 도구 호출, 결과
채점 근거판사가 왜 그렇게 채점했는가
메트릭정확도 및 맞춤형 메트릭

실패의 대사록을 읽을 수 있다는 것이 점수를 실행 가능한 발견으로 바꿉니다.

Inspect vs 다른 평가 프레임워크

측면InspectDeepEvalRagas
출처영국 AI 안전 연구소Confident AIExploding Gradients
초점일반 + 에이전틱 평가단위 테스트 스타일 앱 평가RAG 특정 메트릭
뷰어풍부하고 최고급보고서/대시보드점수
최고의 용도엄격한 능력/안전 평가CI 테스트 게이팅RAG 파이프라인 채점

DeepEval (CI 스타일 테스트)과 Ragas (RAG 특정 메트릭)을 보완합니다.

리소스