VRAM
アクセラレータにローカルなメモリ。ワークロード容量にはモデルの重み以外にも、アクティベーション、バッファ、キャッシュされた状態、フレームワークの割り当てなどが含まれ、これらもメモリを消費する可能性があります。
KVキャッシュ
自己回帰サービングがライブシーケンスのために保持するキーテンソルとバリューテンソル。モデルアーキテクチャ、キャッシュ精度、トークン数、並行性が必要容量に影響します。
量子化
一部のモデル値を低い数値精度で表現すること。実際のメモリ使用量にはフォーマットメタデータとランタイムワークスペースが含まれ、サポートされているカーネルと出力品質を確認する必要があります。
テンソル並列
モデルのテンソル演算の一部を複数のアクセラレータに分散すること。モデルを複数のカードに分散できますが、通信が発生し、明示的にサポートされたサービングまたはトレーニング戦略が必要です。
DistributedDataParallel (DDP)
プロセス間でモデルレプリカを実行し、勾配を同期するPyTorchトレーニング手法。レプリケーションはデバイスメモリを1つの連続したプールに結合するものではありません。
完全シャーディングデータ並列(FSDP)
モデルパラメータ、勾配、オプティマイザ状態をシャーディングする分散トレーニング。メモリ削減には通信、調整、チェックポイントの要件が伴います。
CUDA
NVIDIAの並列コンピューティングプラットフォームおよびプログラミングモデル。CUDA依存のワークロードには、互換性のあるハードウェア、ドライバー、ランタイム、ライブラリが引き続き必要です。
ROCm
GPUコンピューティング向けのAMDのソフトウェアスタック。正確なGPU、オペレーティングシステム、フレームワークビルド、ワークロードの依存関係についてサポートを確認する必要があります。
トレーニングチェックポイント
トレーニングを再開または再現するために使用される保存状態。実行内容に応じて、モデル、オプティマイザ、スケジュール、乱数状態、データの進行状況が含まれます。書き込みだけでなく、復元を検証してください。
変分オートエンコーダ(VAE)
拡散パイプラインにおいて、潜在表現と表示可能な出力との間をマッピングするコンポーネント。デコードはノイズ除去とは別のメモリピークを持つ場合があり、サポートされているチャンキングまたはタイリングには品質チェックが必要です。
固定レンタル期間
このカタログでは、1週間は正確に 7 日、1か月は正確に 30 日です。モデル化された割り当てを停止しても、支払い済み期間は一時停止されません。GPU価格と選択したオプションが完全な見積もりを構成します。
冪等性キー
サポートされている操作が繰り返しのリクエストを認識し、同じアクションが2回適用されないようにするための識別子です。別の購入や設定ではなく、同じ操作の再試行に再利用してください。
定義は概念を説明するものであり、特定のワークロード、ライブラリバージョン、またはトポロジがAnchorGPU割り当てでサポートされることを保証するものではありません。