GPUワークロードガイド
実際に必要なGPU VRAMはどれくらいですか?
推論、ファインチューニング、画像生成、動画ワークロード向けの実用的なメモリ予算—24 GBから192 GBまで。
AnchorGPU 作成 · 更新 · 読了目安6分VRAM は予算であり、モデルラベルではありません
GPUメモリは、モデルの重み、推論KVキャッシュ、一時的なアクティベーション、フレームワークのワークスペース、アロケータキャッシュ、そしてトレーニング中は勾配とオプティマイザの状態という、独立した複数のカテゴリによって消費されます。ある構成でモデルが収まるからといって、より長いコンテキスト、より大きなバッチ、異なる精度、またはより多くの同時リクエストでも収まるとは限りません。
正確なモデルリビジョンとランタイム構成から計画してください。7B、13B、70Bなどのラベルはパラメータ規模を示すものであり、総運用メモリを示すものではないため、GPUに普遍的にマッピングすべきではありません。
まず生の重みを推定する
明示的に仮定の例として、モデルが正確に13億のパラメータを持ち、すべてのパラメータを16ビット形式で保存するとします。生の重みストレージは13,000,000,000 × 2バイト = 26,000,000,000バイト、つまり約24.2GiBです。この数値は他のすべての割り当てを除外しているため、GPU推奨ではなく下限です。
量子化は重みのストレージを削減できますが、実際のフットプリントにはスケール、メタデータ、逆量子化バッファ、重複テンソル、ランタイムワークスペースも含まれます。パラメータ数を名目上のビット幅で割って結果を最終的なものとして扱うのではなく、実際のローダーが生成する形式を使用してください。
推論ではKVキャッシュと作業メモリが追加されます
自己回帰型サービングは、アクティブなシーケンスのキーおよびバリューテンソルを保持します。KVキャッシュの需要は、モデルアーキテクチャ、キャッシュ精度、同時シーケンス数、およびそれらのシーケンス全体のライブトークン数に依存します。最大コンテキストまたは同時実行数を引き上げると、重みの読み込みが成功した場合でもメモリを使い果たす可能性があります。
一時的なアクティベーション、アテンションワークスペース、コンパイル済みカーネル、通信バッファ、フレームワークアロケータが追加のメモリを消費します。vLLM は利用可能な GPU KV キャッシュ容量と、設定されたシーケンス長に対する推定同時実行数を報告します。これらの起動時の数値は計画の参考として扱い、本番ワークロードをコミットする前に代表的なプロンプトを再生してください。
トレーニングは異なるメモリ形状を持つ
ファインチューニングでは、勾配、オプティマイザの状態、保存されたアクティベーション、場合によっては追加の全精度コピーが加わります。その正確なサイズは、オプティマイザ、精度ポリシー、学習可能なパラメータセット、シャーディング戦略によって異なるため、単一の推論倍率は誤解を招きます。
DistributedDataParallelは各ワーカーが必要とする学習状態を複製するものであり、複数のGPUを1つの連続したメモリプールに変えるものではありません。Fully Sharded Data Parallelはパラメータ、勾配、オプティマイザ状態をワーカー間でシャーディングでき、アクティベーションチェックポインティングは逆伝播時に選択した処理を再計算することで保存アクティベーションのメモリを削減します。どちらの手法も、シンプルさまたは計算量をメモリと引き換えにします。
実行する構成を測定する
正確なフレームワーク、精度、コンテキスト、バッチ、並列化設定で、モデルの読み込みと、オプティマイザ更新を含む完全な代表的な推論リクエストまたはトレーニングステップをテストします。ピーク時の割り当て済みおよび予約済みメモリを記録し、現実的な同時実行数または勾配累積で繰り返します。最後の利用可能なバイトを狙うのではなく、運用上の余裕を残してください。
測定されたピークを安全に削減できない場合は、より大きなメモリのGPUを選択してください。GPUを追加するのは、ソフトウェアがモデルまたはワークロードを明示的にシャーディングし、提供されるインターコネクトが判明している場合のみにしてください。モデル、ランタイム、量子化、コンテキスト、バッチを変更した後は、必ず測定を再実行してください。
情報源と編集方針
公式ドキュメントが技術的な説明を裏付けています。ハードウェアの推奨事項は、当社のワークロード依存の解釈であり、測定された性能保証ではありません。
vLLM — 並列処理とスケーリング ↗PyTorch — FullyShardedDataParallel ↗PyTorch — アクティベーションチェックポインティング ↗