ワークロードガイド
vLLMでLLMを提供する
メモリと並行性を計画し、vLLMエンドポイントを設定して、代表的な推論ワークロードを検証します。
9 分で読了 · 更新サービング契約を定義する
モデル識別子とリビジョン、重み形式、量子化、最大コンテキスト長、プロンプト長の分布、並行性、レイテンシ目標を記録してください。これらの設定はワークロードの一部であり、任意のベンチマークメモではありません。
重みは KV キャッシュおよび一時ワークスペースと GPU メモリを共有します。1つの短いプロンプトで正常に読み込まれたモデルでも、意図したトラフィックではメモリ不足になる可能性があります。運用上の余裕を確保し、許可される最長のリクエストをテストしてください。
適合する場合は1つのGPUから始める
単一GPUはGPU間通信を回避し、最初のデプロイメントの診断を容易にします。モデルと必要なランタイム状態が1つのアクセラレータに収まらない場合、または代表的な測定が分割を正当化する場合は、テンソル並列を検討してください。
独立したレプリカは別々のリクエストを処理し、テンソル並列はモデル計算を分割します。これらは異なる問題を解決します。複数のカードを備えたカタログノードは、それ自体では特定のインターコネクトを証明するものではありません。
H100 SXMとH100 PCIeを比較完全な環境を検証する
AnchorGPU vllmイメージは、カタログでNVIDIAおよびAMD向けに利用可能です。実際の実行前に、実際のドライバー、CUDAまたはROCmランタイム、PyTorch、Python、vLLMのバージョンを特定してください。モデルアーキテクチャ、量子化サポート、コンパイル済みアテンションカーネルを併せて確認してください。
このローカルサイトは設定を保存しますが、リモートモデルサーバーは実行しません。以下のコマンドは、必要なソフトウェアとモデルアクセスを備えた実際のプロビジョニング済みLinuxノードで実行するものです。
プライベートエンドポイントを起動する
サーバーを起動するシェルでモデルとプライベートAPIキーを設定します。両方のプレースホルダーを置き換えてください。このキーはvLLMサービング資格情報であり、AnchorGPUアカウントのAPIキーではありません。検証中はループバックにバインドし、リモートアクセスには認証済みのTLSまたはプライベートネットワーク経路が必要です。
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000同じノード上の4つの可視GPUに意図的に分割されたモデルの場合、--tensor-parallel-size 4を追加してください。変更を行う前に、ハードウェアレイアウトとソフトウェアサポートを確認してください。
負荷テストの前にAPIを確認する
別のシェルで同じVLLM_API_KEYを設定し、モデルリストを照会してください。チャット補完リクエストには適切なチャットテンプレートを持つモデルも必要です。サーバーの起動が成功しても、すべてのAPIタスクがサポートされるとは限りません。
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"クライアントリクエストでは、サーバーから報告されたモデル識別子を使用してください。テスト中は認証を有効にしておいてください。
持続可能な容量を測定する
意図したプロンプト長、出力制限、並行性でサニタイズ済みリクエストを再生してください。最初のトークンまでの時間、エンドツーエンドレイテンシ、スループット、エラー率、GPUメモリ使用量、サーバーが報告するKVキャッシュ容量を記録してください。
コールドモデルの読み込みは、定常状態のサービングとは別に測定してください。同時実行数を徐々に増やしてください。メモリが制限要因になる場合は、より多くのコンピュートが役立つと決めつける前に、より低いコンテキスト/concurrency、適切な量子化形式、またはより多くのメモリを評価してください。
完了した作業を固定予約価格を使用してコストに変換します。見出しのトークン毎秒の数値は容量の約束ではなく、このガイドではAnchorGPUのベンチマーク結果を主張しません。
一般的な障害モードを解決する
チャットリクエストが失敗する場合: モデルのチャットテンプレートとサポートされている API タスクを確認してください。読み込み後にメモリ障害が増加する場合: KV キャッシュの圧力、コンテキスト、同時実行数を確認してください。マルチ GPU 初期化がハングする場合: 可視デバイス、集団通信ライブラリ、テンソル並列分割の有効性を確認してください。
モデルのリビジョン、コンテナダイジェスト、起動設定、検証結果、クライアントAPI契約を保存してください。ノードを解放する前に、運用成果物をノードからコピーしてください。
インスタンスライフサイクルガイドを読む