تخطَّ إلى المحتوى

Inspect AI - إطار عمل تقييم النموذج اللغوي

Inspect AI - إطار عمل تقييم النموذج اللغوي

Inspect هو إطار عمل مفتوح المصدر لـ تقييمات النماذج اللغوية الكبيرة، تم إنشاؤه من قبل معهد الذكاء الاصطناعي بالمملكة المتحدة. يعطي التقييمات بنية واضحة — مجموعة بيانات من العينات، حلّال خط أنابيب ينتج إجابات، و مُصنف يصنفها — بالإضافة إلى عارض من الدرجة الأولى لفحص ما رآه النموذج بالضبط وما فعله على كل عينة. تم تصميمه لتقييم صارم وقابل للتكرار، بما في ذلك المهام الوكالية واستخدام الأدوات، ويُستخدم على نطاق واسع لاختبار السلامة والقدرة.

التثبيت

الطريقةالأمر
pippip install inspect-ai
uvuv add inspect-ai
مفتاح النموذجexport OPENAI_API_KEY=... / ANTHROPIC_API_KEY=...
VS Codeثبّت ملحق Inspect للعارض
التحققinspect --version

كتل البناء الثلاثة

المكونالدور
مجموعة البياناتعينات مع input و target
الحلّالخطوات تحول المدخلات إلى مخرجات النموذج
المُصنفيصنف المخرجات مقابل الهدف

تقييم الحد الأدنى

from inspect_ai import Task, task
from inspect_ai.dataset import example_dataset
from inspect_ai.scorer import model_graded_fact
from inspect_ai.solver import generate, system_message

@task
def security_qa():
    return Task(
        dataset=example_dataset("theory_of_mind"),
        solver=[
            system_message("You are a concise security expert."),
            generate(),
        ],
        scorer=model_graded_fact(),
    )
inspect eval security_qa.py --model openai/gpt-4o

تشغيل التقييمات

الأمرالوصف
inspect eval task.py --model openai/gpt-4oتشغيل تقييم
inspect eval task.py --limit 20فقط أول 20 عينة
inspect eval task.py --model-base-url URLنقطة نهاية مخصصة/محلية
inspect eval task.py -T param=valueمرر معاملات المهمة
inspect eval-retry <log>أعد محاولة العينات الفاشلة
inspect viewافتح عارض السجل

الحلّالات

الحلّالماذا يفعل
generate()استدعِ النموذج
system_message(...)أضف موجه النظام
chain_of_thought()أضف موجهة CoT
self_critique()يراجع النموذج إجابته الخاصة
use_tools([...])فعّل استدعاء الأداة
basic_agent()حلقة وكيل بأسلوب ReAct

المُصنفات

المُصنفيصنف بـ
match()تطابق دقيق/فرعي
includes()يظهر الهدف في المخرجات
pattern(regex)استخراج Regex
model_graded_qa()حكم النموذج ضد مقياس
model_graded_fact()حكم النموذج للتكافؤ الحقائقي
choice()إجابة متعددة الخيارات

تقييمات الأدوات والوكالة

from inspect_ai.tool import bash, python
from inspect_ai.solver import basic_agent

solver = basic_agent(tools=[bash(), python()], max_attempts=3)
القدرةملاحظة
استخدام الأداةأدوات مدمجة bash, python, ويب
الحَجْرشغّل الأدوات في Docker للعزل
متعدد الأدوارحلقات الوكيل مع حدود المحاولة
أدوات مخصصةزيّن دوال Python كأدوات

العارض

يعرضلماذا مهم
كل عينةالمدخلات، الهدف، المخرجات، النقاط
النسخة الكاملةكل رسالة، استدعاء أداة، والنتيجة
منطق التصنيفلماذا صنّف الحكم كما فعل
المقاييسالدقة والمقاييس المخصصة

القدرة على قراءة النسخة من الفشل هي ما يحوّل درجة إلى نتيجة قابلة للتنفيذ.

Inspect مقابل أطر عمل تقييم أخرى

الجانبInspectDeepEvalRagas
الأصلمعهد الذكاء الاصطناعي بالمملكة المتحدةConfident AIانفجار التدرجات
التركيزتقييمات عامة + وكاليةتقييمات تطبيق بأسلوب اختبار الوحدةمقاييس خاصة بـ RAG
العارضغني وفئة أولىالتقارير/لوحة المعلوماتالنقاط
الأفضل لـتقييمات صارمة للقدرة/السلامةبوابة مقياس CIنقاط خط أنابيب RAG

يكمل DeepEval لاختبار نمط CI و Ragas لمقاييس RAG الخاصة.

الموارد