تخطَّ إلى المحتوى

DeepTeam - إطار عمل اختبار اللون الأحمر للنماذج اللغوية

DeepTeam - إطار عمل اختبار اللون الأحمر للنماذج اللغوية

DeepTeam هو إطار عمل مفتوح المصدر لاختبار اللون الأحمر للنماذج اللغوية من فريق DeepEval. يحاكي الهجمات العكسية ضد تطبيق النموذج اللغوي — حقن الأوامر، كسر الأقفال، تسرب البيانات الشخصية، الوكالة المفرطة، الانحياز — باستخدام مكتبة من نقاط الضعف و تحسينات الهجوم التي تعيد كتابة الهجوم الأساسي لتجنب الدفاعات. الفكرة الموجهة هي أن اختبار اللون الأحمر يجب أن يكون متكررًا وآليًا، وليس تمرينًا يدويًا لمرة واحدة، لذا فهو يعمل مثل مجموعة اختبار في CI.

اختبر اللون الأحمر فقط للأنظمة التي تملكها أو يُرخص لك باختبارها. الهجمات المُنتجة هي مدخلات معادية حقيقية.

التثبيت

الطريقةالأمر
pippip install deepteam
uvuv add deepteam
مفتاح النموذجexport OPENAI_API_KEY=... (محاكي + حكم)
التحققpython -c "import deepteam; print('ok')"

المفاهيم الأساسية

المصطلحالمعنى
نقطة ضعففئة ضعف يجب فحصها (مثل تسرب البيانات الشخصية)
هجومتقنية تستخدم لتفعيلها (مثل حقن الأوامر)
تحسينتحويل يجعل الهجوم أصعب في الكشف
رد اتصال النموذجتطبيقك، مُغلّف كدالة يمكن لـ DeepTeam استدعاؤها
تقييم المخاطرتقرير مسجل بما نجح

تشغيل اختبار اللون الأحمر الحد الأدنى

from deepteam import red_team
from deepteam.vulnerabilities import Bias, PIILeakage
from deepteam.attacks.single_turn import PromptInjection

async def model_callback(input: str) -> str:
    # call YOUR app/model here and return its output
    return await my_llm_app(input)

risk = red_team(
    model_callback=model_callback,
    vulnerabilities=[Bias(), PIILeakage()],
    attacks=[PromptInjection()],
)
print(risk)
الحجةالغرض
model_callbackمحول إلى نظامك قيد الاختبار
vulnerabilitiesما هي نقاط الضعف التي يجب فحصها
attacksأي تقنيات يجب استخدامها
attacks_per_vulnerability_typeحجم حالات الاختبار

فئات نقاط الضعف

الفئةالفحص
PIILeakageتسرب البيانات الشخصية
Biasانحياز الجنس/العرق/الدين/السياسة
Toxicityمخرجات ضارة أو مسيئة
PromptLeakageكشف موجه النظام
ExcessiveAgencyاتخاذ إجراءات غير مصرح بها
Misinformationادعاءات غير حقيقية/غير مدعومة
IllegalActivityامتثال للتعليمات غير الآمنة
Robustnessاختطاف / الاعتماد الزائد على المدخلات

الهجمات والتحسينات

هجوم بدورة واحدةالتقنية
PromptInjectionتعليمات مُحقونة
Roleplayتجاوز قائم على الشخصية
Base64 / ROT13 / Leetspeakتجنب الترميز
Multilingualتجاوز غير إنجليزي
MathProblemإخفاء من خلال الصياغة
هجوم متعدد الأدوارالتقنية
LinearJailbreakingتصعيد الأدوار
TreeJailbreakingبحث متفرع عن تجاوز
CrescendoJailbreakingتصعيد تدريجي

التشغيل في CI

# red_team.py — fail the build if high-severity issues appear
risk = red_team(model_callback=cb, vulnerabilities=[...], attacks=[...])
assert risk.overall_score >= THRESHOLD, "Red team failures detected"
الممارسةالسبب
تثبيت مجموعة سيناريونتائج قابلة للمقارنة عبر التشغيلات
البوابة على الخطورةحظر فقط الانحدار عالي المخاطر
تخزين التقاريرتتبع الموقف بمرور الوقت
إعادة التشغيل على تغيير المحفزالمحفزات هي السطح التحكمي

DeepTeam مقابل الأدوات ذات الصلة

الجانبDeepTeamgarakPyRITpromptfoo
الطبقةالتطبيقالنموذجالنموذج + متعدد الأدوارالتطبيق
الأسلوبمجموعة Pythonicماسح CLISDK التنسيقConfig + CLI
متعدد الأدوارنعممحدودقوينعم
الأفضل لـاختبار اللون الأحمر الآلي على مستوى التطبيقفحوصات النموذج الواسعةأبحاث الهجوم المعقدةتقييم CI + اختبار اللون الأحمر

يكمل garak (فحوصات طبقة النموذج) و promptfoo (تقييم + CI)؛ تشغيل أكثر من واحد — يلتقطون فشل مختلف.

الموارد