AGAnchorGPU
← すべてのエンジニアリングガイド

GPUワークロードガイド

本番環境でのLLM推論に適したGPUの選択

モデルサイズ、量子化、コンテキスト、バッチ処理、レイテンシ目標が最適なGPUをどのように変えるか、そしてリクエストあたりの実際のコスト。

AnchorGPU 作成 · 更新 · 7分で読了

サービング契約を指定する

対話型の推論提供とオフラインのバッチ処理を分離してください。最大プロンプト長、標準および最大出力長、目標同時実行数、最初のトークンまでの時間、トークン間レイテンシ、許容エラー率を定義してください。単一の短いリクエストは容量テストにはなりません。

ハードウェアを比較する際は、モデルとトークナイザのリビジョン、量子化形式、チャットテンプレート、デコード設定を固定してください。そうしないと、高速な結果がGPUではなく、異なるワークロードや品質のトレードオフに起因する可能性があります。

モデルの重み以上の予算を確保する

推論にはモデルの重み、ランタイムバッファ、アクティベーション、通常はアクティブなシーケンス用のKVキャッシュが必要です。同時シーケンス数が増え、コンテキストが長くなると、必要なメモリが変化します。量子化のサポートと出力品質への影響は、選択したランタイムで検証する必要があります。

24 GBまたは48 GBのカードは、適合するモデルの候補であり、パラメータサイズクラスのすべてのモデルが実行できるという約束ではありません。実際のモデルとコンテキスト制限をテストしてください。大容量メモリのアクセラレータは、パーティショニングを減らしたり、測定された並行性の余裕を提供したりする場合に有用です。

レプリカと分散モデルのどちらですか?

モデルが1つのGPUに収まる場合、独立したレプリカはより多くのリクエストを処理するための簡単な方法かもしれません。テンソル並列はモデルの一部を分散し、アクセラレータ間の通信を発生させます。パイプライン並列には異なる配置と利用率のトレードオフがあります。

カード数を選択する前に、現在のvLLMガイダンスと提供されるマシントポロジーを確認してください。SXM、PCIe、4枚のカード、または合計VRAM数が特定の接続ファブリックを意味するとは想定しないでください。

計測の前にソフトウェアスタックを検証

ドライバー、CUDAまたはROCmビルド、GPUアーキテクチャのサポート、モデルが必要とするオペレーターの可用性を確認してください。コンテナタグは固定し、新しい環境でも同じサービング結果を再現できる必要があります。

最初のテストはループバックにバインドし、APIキーを使用して、認証されていないモデルエンドポイントを公開しないでください。リモートアクセス、TLS、イングレス制御、サービス監視には明示的なデプロイ設定が必要であり、カタログイメージを選択するだけでは作成されません。

現実的なトラフィックを測定する

サーバーをウォームアップし、モデル読み込み時間を定常状態の結果から分離します。プロンプト長、出力長、同時リクエストの代表的な組み合わせを再現します。受け入れられたリクエストのスループット、p95レイテンシ、エラー、メモリ使用量をまとめて報告します。

レイテンシまたは信頼性の目標を満たせなくなるまでトラフィックを増やし、その後は容量に余裕を残してください。コールドスタートと復旧テストは分けて実施してください。運用準備には、プロセスまたはノード障害後のサービス復旧も含まれます。

有用な出力のコストを比較する

測定された間隔について、その間隔に帰属する完全な割り当てコストを正常に配信された出力で割ります。100万トークンあたりのコストを報告する場合は、入力トークンと出力トークンが含まれるかどうかを明記し、すべての候補に同じ規則を使用してください。

固定7日または30日のレンタルは、アイドル時間を含む全期間分が支払われます。構成を比較する前に、利用率を明示的に見積もり、オプションを含めてください。AnchorGPUのカタログ価格はモデル化された入力であり、ここではライブのサービングベンチマークや本番可用性は主張されていません。

情報源と編集方針

公式ドキュメントが技術的な説明を裏付けています。ハードウェアの推奨事項は、当社のワークロード依存の解釈であり、測定された性能保証ではありません。

vLLM — クイックスタートとサービングvLLM — 分散サービングと並列処理vLLM — GPUインストール要件