VRAM
Memória local de um acelerador. A capacidade de carga de trabalho inclui mais do que os pesos do modelo: ativações, buffers, estado em cache e alocações de framework também podem consumi-la.
cache KV
Tensores de chave e valor retidos pela inferência autorregressiva para sequências ativas. A arquitetura do modelo, a precisão do cache, a contagem de tokens e a concorrência afetam a capacidade necessária.
Quantização
Representar alguns valores do modelo com precisão numérica reduzida. O uso real de memória inclui metadados de formato e espaços de trabalho do tempo de execução; kernels suportados e qualidade da saída devem ser verificados.
Paralelismo de tensores
Distribuir partes das operações de tensor do modelo entre aceleradores. Pode espalhar um modelo entre placas, mas introduz comunicação e exige uma estratégia de serviço ou treinamento explicitamente suportada.
DistributedDataParallel (DDP)
Uma abordagem de treinamento PyTorch que executa réplicas do modelo em vários processos e sincroniza gradientes. A replicação não combina as memórias dos dispositivos em um único pool contíguo.
Fully Sharded Data Parallel (FSDP)
Treino distribuído que fragmenta parâmetros do modelo, gradientes e estado do otimizador. A poupança de memória vem com requisitos de comunicação, coordenação e pontos de verificação.
CUDA
A plataforma de computação paralela e o modelo de programação da NVIDIA. Uma carga de trabalho dependente de CUDA ainda requer hardware, driver, runtime e bibliotecas compatíveis.
ROCm
A pilha de software da AMD para computação em GPU. O suporte deve ser verificado para a GPU exata, sistema operacional, compilação do framework e dependências da carga de trabalho.
Checkpoint de treinamento
Estado salvo usado para retomar ou reproduzir o treinamento. Dependendo da execução, isso inclui o modelo, o otimizador, o agendamento, o estado aleatório e o progresso pelos dados. Verifique a restauração, não apenas a gravação.
Autoencoder variacional (VAE)
Em um pipeline de difusão, um componente que mapeia entre representações latentes e saídas visualizáveis. A decodificação pode ter um pico de memória separado da remoção de ruído; o particionamento ou mosaico suportado exige verificações de qualidade.
Prazo fixo de locação
Neste catálogo, uma semana tem exatamente 7 dias e um mês exatamente 30 dias. Parar uma alocação modelada não pausa o período pago. Os preços de GPU e as opções selecionadas formam o orçamento completo.
Chave de idempotência
Um identificador que permite que uma operação suportada reconheça uma solicitação repetida, para que a mesma ação não seja aplicada duas vezes. Reutilize-o para uma nova tentativa da mesma operação, não para uma compra ou configuração diferente.
As definições explicam o conceito; elas não garantem que uma carga de trabalho, versão de biblioteca ou topologia específica seja suportada por uma alocação da AnchorGPU.