تخطَّ إلى المحتوى

SkyPilot - تشغيل أحمال عمل الذكاء الاصطناعي على أي سحابة

SkyPilot - تشغيل أحمال عمل الذكاء الاصطناعي على أي سحابة

SkyPilot يشغل أحمال عمل AI و batch على أي سحابة أو Kubernetes cluster من تعريف YAML واحد. القيمة الأساسية للعمل LLM اقتصادية: توفر GPU و تسعير تختلف بشكل كبير عبر providers و المناطق و SkyPilot تلقائياً تجد أرخص سعة متاحة تلبي متطلباتك و توفر و تزامن الكود و تشغل الوظيفة و تفكك كل شيء. كما تتعامل مع spot-instance preemption مع auto-recovery الذي يجعل GPUs interruptible رخيصة عملية للتشغيلات الدريبية الطويلة.

التثبيت

الطريقةالأمر
pippip install "skypilot[all]"
سحابات محددةpip install "skypilot[aws,gcp,kubernetes]"
تحقق المعاييرsky check
التحققsky --version

sky check تقرير السحابات التي لديك أوراق اعتماد عاملة — SkyPilot فقط تعتبر تلك.

تحديد مهمة

# train.yaml
resources:
  accelerators: A100:8
  use_spot: true
  any_of:
    - cloud: aws
    - cloud: gcp
    - cloud: kubernetes

num_nodes: 1

workdir: .

setup: |
  pip install -r requirements.txt

run: |
  torchrun --nproc_per_node=8 train.py --config configs/7b.yaml
الحقلالغرض
resources.acceleratorsنوع GPU و العدد (A100:8 و H100:4)
use_spotاستخدم الحالات interruptible
any_of / orderedسحابات/مناطق مرشح
workdirدليل محلي متزامن مع الكتلة
setupتشغيل مرة واحدة لكل كتلة
runالوظيفة الفعلية
num_nodesتدريب متعدد العقد

الأوامر الأساسية

الأمرالوصف
sky launch -c mycluster train.yamlتوفير وتشغيل
sky exec mycluster train.yamlتشغيل مرة أخرى على كتلة موجودة
sky statusقائمة الكتل و التكاليف
sky logs myclusterStream job logs
sky queue myclusterعرض job queue
sky down myclusterإنهاء (توقف الدفع)
sky stop myclusterإيقاف لكن الاحتفاظ بالقرص

Managed Jobs (Spot مع Recovery)

# تشغيل التدريب الطويل على spot instances و auto-recovered عند preemption
sky jobs launch -n llama-sft train.yaml
الأمرالغرض
sky jobs launchأرسل managed job
sky jobs queueقائمة managed jobs
sky jobs logs -n NAMETail logs
sky jobs cancel -n NAMEإلغاء

Managed jobs هي الميزة التي تجعل spot GPUs قابلة للاستخدام للتدريب: عند preemption SkyPilot إعادة التوفير في مكان آخر و استئناف من checkpoint الخاص بك حتى تشغيل متعدد الأيام ينجو من المقاطعات.

تحسين التكلفة

الآليةالتأثير
بحث Cross-cloudيختار أرخص خيار مطابق
use_spot: trueفي كثير من الأحيان 60–90٪ أرخص
sky show-gpusأسعار/توفر حالية بـ سحابة
Autostopsky autostop -i 10 mycluster ينهي كتل خامدة
sky downالعادة الأكثر أهمية — GPUs الخامدة هي الهدر الرئيسي
# ما سعة A100 موجودة و في أي سعر؟
sky show-gpus A100

خدمة النماذج

# serve.yaml
service:
  readiness_probe: /v1/models
  replicas: 2

resources:
  accelerators: A100:1
  ports: 8000

run: |
  vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000
sky serve up -n llm-api serve.yaml
sky serve status

SkyServe تضيف replicas و health checks و autoscaling عبر السحابات — مفيدة لخدمة مع vLLM على أرخص GPUs متاحة.

Kubernetes Backend

القدرةملاحظة
كتل موجودةcloud: kubernetes يستهدف K8s الخاص بك
مختلطجمع on-prem K8s مع سحابة burst
GPU schedulingاستخدم موارد GPU K8s القياسية
لا يلزم أوراق اعتماد السحابةللاستخدام on-prem النقي

SkyPilot مقابل البدائل

الجانبSkyPilotRayCloud-native (SageMaker/Vertex)
متعدد السحابةميزة أساسيةممكن و يدويبائع واحد
Spot recoveryمدمجيدوييختلف
الحبسلا شيء (YAML عادي)Frameworkعالي
الأفضل للـأرخص GPUs أي مكانتطبيقات Python الموزعةIntegration عميق single-cloud

أزواج مع stacks التدريب مثل Axolotl و TorchTitan و serving عبر vLLM.

الموارد