コンテンツにスキップ

SkyPilot - 任意のクラウド上でAIワークロードを実行 チートシート

SkyPilot - 任意のクラウド上でAIワークロードを実行 チートシート

SkyPilot任意のクラウドまたはKubernetesクラスターから1つのYAML定義でAIおよびバッチ ワークロード実行。LLM作業のコア価値は経済的:GPU利用可能性および価格プロバイダーおよび地域でワイルド変動、SkyPilotは自動的に検索最安い利用可能容量要件を満たす、プロビジョン、コード同期、ジョブを実行し、すべてを引き下ろします。また処理スポット インスタンス プリエンプション自動リカバリーで、長いトレーニング実行のための安い中断可能GPU実際的にします。

インストール

MethodCommand
pippip install "skypilot[all]"
Specific cloudspip install "skypilot[aws,gcp,kubernetes]"
Check credentialssky check
Verifysky --version

sky checkはどれだけのクラウド作業クレデンシャル報告—SkyPilotのは、それらのみを考慮します。

タスク定義

# train.yaml
resources:
  accelerators: A100:8
  use_spot: true
  any_of:
    - cloud: aws
    - cloud: gcp
    - cloud: kubernetes

num_nodes: 1

workdir: .

setup: |
  pip install -r requirements.txt

run: |
  torchrun --nproc_per_node=8 train.py --config configs/7b.yaml
FieldPurpose
resources.acceleratorsGPU タイプおよびカウント(A100:8H100:4
use_spot中断可能インスタンス使用
any_of / ordered候補クラウド/地域
workdirクラスター同期ローカル dir
setupクラスターごと1度実行
run実際のジョブ
num_nodesマルチノード トレーニング

コア コマンド

CommandDescription
sky launch -c mycluster train.yamlプロビジョンおよび実行
sky exec mycluster train.yaml既存クラスターで再度実行
sky statusクラスター リストおよびコスト
sky logs myclusterストリーム ジョブ ログ
sky queue myclusterジョブ キュー表示
sky down mycluster終了(支払い停止)
sky stop mycluster停止ただしディスク保つ

管理ジョブ(リカバリーでスポット)

# スポット インスタンスで長いトレーニング 実行、プリエンプション時自動復元
sky jobs launch -n llama-sft train.yaml
CommandPurpose
sky jobs launch管理ジョブ送信
sky jobs queue管理ジョブのリスト
sky jobs logs -n NAMEログのテール
sky jobs cancel -n NAMEキャンセル

管理ジョブはトレーニング用スポットGPUを使用可能機能:プリエンプション時SkyPilot他の場所を再プロビジョンおよびチェックポイントから再開するため、マルチ日実行中断生き残ります。

コスト 最適化

MechanismEffect
Cross-cloud search最安い マッチング オプションを選ぶ
use_spot: trueしばしば 60–90%より安い
sky show-gpus現在の価格/利用可能 クラウド
Autostopsky autostop -i 10 myclusterアイドル クラスター終了
sky down最も重要な習慣—アイドルGPUはメイン無駄
# A100容量はどれだけ存在しおよび何価格?
sky show-gpus A100

モデルの提供

# serve.yaml
service:
  readiness_probe: /v1/models
  replicas: 2

resources:
  accelerators: A100:1
  ports: 8000

run: |
  vllm serve meta-llama/Llama-3.1-8B-Instruct --port 8000
sky serve up -n llm-api serve.yaml
sky serve status

SkyServeはレプリカ、ヘルス チェック、クラウド自動スケーリング追加—vLLM最安いGPUで提供有用。

Kubernetesバックエンド

CapabilityNote
Existing clusterscloud: kubernetesクラスター ターゲット
MixedオンプレmK8s+クラウド バースト結合
GPU scheduling標準K8s GPU リソース使用
No cloud credentials needed純粋 オンプレ使用

SkyPilot対代替

AspectSkyPilotRayCloud-native (SageMaker/Vertex)
Multi-cloudコア機能可能、手動単一ベンダー
Spot recoveryビルトイン手動変動
Lock-inなし(プレーンYAML)フレームワーク高い
Best for最安いGPU どこでも分散Pythonアプリディープ 単一クラウド 統合

AxolotlTorchTitanvLLM経由提供トレーニング スタックペア。

リソース