AGAnchorGPU
← すべてのエンジニアリングガイド

GPUワークロードガイド

ファインチューニングに最適なGPU:A100、H100、H200、またはMI300X?

メモリ負荷、ソフトウェアスタック、インターコネクトの必要性、そして早期完了の価値に基づいて選択してください。単なる公称スループットだけではありません。

AnchorGPU 作成 · 更新 · 7分で読了

カードの前に実行内容を定義する

万能な最適のファインチューニング用GPUはありません。モデルのリビジョン、学習可能パラメータ数、オプティマイザ、精度、最大シーケンス長、マイクロバッチサイズ、検証スケジュールを記録してください。同じモデルでも、LoRAアダプタの実行と全パラメータの実行ではメモリ要件が異なります。

有用な余裕を持って完全なトレーニングステップを完了できる、テスト済みの最小構成を選択してください。パラメータ数に重み精度を掛けた値は下限にすぎません。勾配、オプティマイザ状態、アクティベーション、一時バッファ、フレームワークもメモリを消費します。

代表的なシングルGPUパイロットから始める

実際の最長バッチでウォームアップ反復を実行し、その後に順伝播、逆伝播、オプティマイザのステップを実行してください。ピーク時の割り当て済みテンソルメモリを記録し、デバイス全体の使用量を確認してください。PyTorchのアロケータ統計には、他のライブラリによるすべての割り当てが含まれるわけではありません。

ステップ時間の変動、データ読み込みの停止、検証時間、チェックポイント書き込みを測定してください。フレームワーク、ドライバー、モデル、データのリビジョンをこれらの結果とともに保存してください。1回の順伝播が成功しただけでは、トレーニング構成を検証したことにはなりません。

A100、H100、H200、それともMI300X?

カタログのA100 SXMとH100 SXMは、いずれもアクセラレータあたり80GBを搭載しています。A100はカタログコストの低いCUDAベースラインです。H100は、実際のカーネルと数値形式がその能力を活用できる場合にテストする価値があります。アーキテクチャだけでは速度は保証されません。

H200はアクセラレータあたり141 GBを提供し、MI300Xは192 GBを提供します。これらの大容量はメモリ制約のあるワークロードを簡素化できますが、AMDの選択には、検証済みのROCmビルド、サポートされているオペレータ、互換性のある依存関係も必要です。製品名だけでなく、正確にインストールされているアクセラレータとスタックを確認してください。

適切な並列学習の形式を選ぶ

DistributedDataParallelはモデルをプロセス間で複製し、勾配を同期します。4枚のカードを1つの大きなメモリプールに変えるものではありません。Fully Sharded Data Parallelはトレーニング状態を分割し、通信を発生させます。適切な選択は、スループット、より多くのメモリ、またはその両方が必要かどうかによって異なります。

スケーリング前に、GPUトポロジ、プロセスバインディング、集団通信ライブラリを確認してください。同等の実効バッチサイズと品質設定で、有用なスループットを単一GPUベースラインと比較してください。4つのアクセラレータが自動的に4倍高速になるわけではありません。

チェックポイント復旧はベンチマークの一部です

保存が成功したからといって、復元可能な実行が保証されるわけではありません。新しいプロセスに復元し、実験に必要なモデル、オプティマイザ、スケジュール、乱数状態、データ位置を確認してください。

読み込み、検証、チェックポイントのアップロードとエクスポートをレンタル期間内に含めてください。ローカルNVMeは作業用ディスクであり、独立したバックアップではありません。割り当てが終了する前に、必要な成果物をマシンから移動してください。

固定期間の決定を行う

選択したカード数と期間についてライブカタログ表を使用し、必要なオプションを追加してください。完全なテストコストを理論上のピークスループット数値ではなく、成功したトレーニング出力で割ってください。

推奨するのは段階的なパイロットです。実用的なメモリ予算を確立し、スケーリングを1段階テストし、復元を実証してから期間を予約してください。AnchorGPUは現在、割り当てと請求をローカルでモデル化しており、物理インフラの性能測定は主張していません。

情報源と編集方針

公式ドキュメントが技術的な説明を裏付けています。ハードウェアの推奨事項は、当社のワークロード依存の解釈であり、測定された性能保証ではありません。

PyTorch — 分散トレーニング概要PyTorch — ピークテンソルメモリAMD — ROCm上のPyTorchNVIDIA — H200メモリ仕様