VRAM
加速器本地内存。工作负载容量不仅包括模型权重:激活、缓冲区、缓存状态和框架分配也可能消耗内存。
KV 缓存
自回归推理为活跃序列保留的键和值张量。模型架构、缓存精度、令牌数量和并发度都会影响所需容量。
量化
以降低的数值精度表示某些模型值。实际内存使用包括格式元数据和运行时工作区;受支持的内核和输出质量必须进行检查。
张量并行
将模型张量运算的部分分配到多个加速器上。它可以将模型分布到多张显卡上,但会引入通信开销,并且需要明确支持的推理或训练策略。
分布式数据并行(DDP)
一种 PyTorch 训练方法,跨进程运行模型副本并同步梯度。复制不会将设备内存合并为一个连续池。
全分片数据并行(FSDP)
将模型参数、梯度和优化器状态分片的分布式训练。节省内存的同时会带来通信、协调和检查点方面的要求。
CUDA
NVIDIA 的并行计算平台和编程模型。依赖 CUDA 的工作负载仍需要兼容的硬件、驱动程序、运行时和库。
ROCm
AMD 的 GPU 计算软件栈。必须针对确切的 GPU、操作系统、框架构建和工作负载依赖项检查支持情况。
训练检查点
用于恢复或复现训练的已保存状态。根据运行情况,这包括模型、优化器、调度器、随机状态和数据进度。请验证恢复,而不仅仅是写入。
变分自编码器(VAE)
在扩散流程中,负责在潜在表示与可视输出之间进行映射的组件。解码的内存峰值可能与去噪不同;支持的分块或平铺需要质量检查。
固定租期
在本目录中,一周恰好为 7 天,一个月恰好为 30 天。停止已建模的分配不会暂停付费周期。GPU 价格和所选选项构成完整报价。
幂等键
一种标识符,可让受支持的操作识别重复请求,从而避免同一操作被执行两次。请将其用于同一操作的重试,而不是用于不同的购买或配置。
定义用于解释概念;它们不保证特定工作负载、库版本或拓扑受 AnchorGPU 分配支持。