AGAnchorGPU

GPU 工作负载术语表

配置背后的条款。

GPU 内存、KV 缓存、量化、CUDA、ROCm、张量并行、训练和固定期限计费的通俗定义。

#

VRAM

加速器本地内存。工作负载容量不仅包括模型权重:激活、缓冲区、缓存状态和框架分配也可能消耗内存。

实用指南 →官方文档 ↗
#

KV 缓存

自回归推理为活跃序列保留的键和值张量。模型架构、缓存精度、令牌数量和并发度都会影响所需容量。

实用指南 →官方文档 ↗
#

量化

以降低的数值精度表示某些模型值。实际内存使用包括格式元数据和运行时工作区;受支持的内核和输出质量必须进行检查。

实用指南 →官方文档 ↗
#

张量并行

将模型张量运算的部分分配到多个加速器上。它可以将模型分布到多张显卡上,但会引入通信开销,并且需要明确支持的推理或训练策略。

实用指南 →官方文档 ↗
#

分布式数据并行(DDP)

一种 PyTorch 训练方法,跨进程运行模型副本并同步梯度。复制不会将设备内存合并为一个连续池。

实用指南 →官方文档 ↗
#

全分片数据并行(FSDP)

将模型参数、梯度和优化器状态分片的分布式训练。节省内存的同时会带来通信、协调和检查点方面的要求。

实用指南 →官方文档 ↗
#

CUDA

NVIDIA 的并行计算平台和编程模型。依赖 CUDA 的工作负载仍需要兼容的硬件、驱动程序、运行时和库。

实用指南 →官方文档 ↗
#

ROCm

AMD 的 GPU 计算软件栈。必须针对确切的 GPU、操作系统、框架构建和工作负载依赖项检查支持情况。

实用指南 →官方文档 ↗
#

训练检查点

用于恢复或复现训练的已保存状态。根据运行情况,这包括模型、优化器、调度器、随机状态和数据进度。请验证恢复,而不仅仅是写入。

实用指南 →官方文档 ↗
#

变分自编码器(VAE)

在扩散流程中,负责在潜在表示与可视输出之间进行映射的组件。解码的内存峰值可能与去噪不同;支持的分块或平铺需要质量检查。

实用指南 →官方文档 ↗
#

固定租期

在本目录中,一周恰好为 7 天,一个月恰好为 30 天。停止已建模的分配不会暂停付费周期。GPU 价格和所选选项构成完整报价。

实用指南 →产品参考 ↗
#

幂等键

一种标识符,可让受支持的操作识别重复请求,从而避免同一操作被执行两次。请将其用于同一操作的重试,而不是用于不同的购买或配置。

实用指南 →产品参考 ↗

定义用于解释概念;它们不保证特定工作负载、库版本或拓扑受 AnchorGPU 分配支持。