AGAnchorGPU

Glossário de cargas de trabalho de GPU

Os termos por trás da configuração.

Definições em linguagem simples de memória de GPU, cache KV, quantização, CUDA, ROCm, paralelismo de tensores, treinamento e cobrança por período fixo.

#

VRAM

Memória local de um acelerador. A capacidade de carga de trabalho inclui mais do que os pesos do modelo: ativações, buffers, estado em cache e alocações de framework também podem consumi-la.

Guia prático →Documentação oficial ↗
#

cache KV

Tensores de chave e valor retidos pela inferência autorregressiva para sequências ativas. A arquitetura do modelo, a precisão do cache, a contagem de tokens e a concorrência afetam a capacidade necessária.

Guia prático →Documentação oficial ↗
#

Quantização

Representar alguns valores do modelo com precisão numérica reduzida. O uso real de memória inclui metadados de formato e espaços de trabalho do tempo de execução; kernels suportados e qualidade da saída devem ser verificados.

Guia prático →Documentação oficial ↗
#

Paralelismo de tensores

Distribuir partes das operações de tensor do modelo entre aceleradores. Pode espalhar um modelo entre placas, mas introduz comunicação e exige uma estratégia de serviço ou treinamento explicitamente suportada.

Guia prático →Documentação oficial ↗
#

DistributedDataParallel (DDP)

Uma abordagem de treinamento PyTorch que executa réplicas do modelo em vários processos e sincroniza gradientes. A replicação não combina as memórias dos dispositivos em um único pool contíguo.

Guia prático →Documentação oficial ↗
#

Fully Sharded Data Parallel (FSDP)

Treino distribuído que fragmenta parâmetros do modelo, gradientes e estado do otimizador. A poupança de memória vem com requisitos de comunicação, coordenação e pontos de verificação.

Guia prático →Documentação oficial ↗
#

CUDA

A plataforma de computação paralela e o modelo de programação da NVIDIA. Uma carga de trabalho dependente de CUDA ainda requer hardware, driver, runtime e bibliotecas compatíveis.

Guia prático →Documentação oficial ↗
#

ROCm

A pilha de software da AMD para computação em GPU. O suporte deve ser verificado para a GPU exata, sistema operacional, compilação do framework e dependências da carga de trabalho.

Guia prático →Documentação oficial ↗
#

Checkpoint de treinamento

Estado salvo usado para retomar ou reproduzir o treinamento. Dependendo da execução, isso inclui o modelo, o otimizador, o agendamento, o estado aleatório e o progresso pelos dados. Verifique a restauração, não apenas a gravação.

Guia prático →Documentação oficial ↗
#

Autoencoder variacional (VAE)

Em um pipeline de difusão, um componente que mapeia entre representações latentes e saídas visualizáveis. A decodificação pode ter um pico de memória separado da remoção de ruído; o particionamento ou mosaico suportado exige verificações de qualidade.

Guia prático →Documentação oficial ↗
#

Prazo fixo de locação

Neste catálogo, uma semana tem exatamente 7 dias e um mês exatamente 30 dias. Parar uma alocação modelada não pausa o período pago. Os preços de GPU e as opções selecionadas formam o orçamento completo.

Guia prático →Referência do produto ↗
#

Chave de idempotência

Um identificador que permite que uma operação suportada reconheça uma solicitação repetida, para que a mesma ação não seja aplicada duas vezes. Reutilize-o para uma nova tentativa da mesma operação, não para uma compra ou configuração diferente.

Guia prático →Referência do produto ↗

As definições explicam o conceito; elas não garantem que uma carga de trabalho, versão de biblioteca ou topologia específica seja suportada por uma alocação da AnchorGPU.