VRAM
Memoria locale di un acceleratore. La capacità di carico include più dei soli pesi del modello: anche attivazioni, buffer, stato in cache e allocazioni del framework possono consumarla.
cache KV
Tensori chiave e valore mantenuti dal serving autoregressivo per le sequenze attive. Architettura del modello, precisione della cache, numero di token e concorrenza influenzano la capacità richiesta.
Quantizzazione
Rappresentazione di alcuni valori del modello con precisione numerica ridotta. L'uso reale della memoria include metadati di formato e spazi di lavoro del runtime; i kernel supportati e la qualità dell'output devono essere verificati.
Parallelismo tensoriale
Distribuzione di parti delle operazioni tensoriali del modello tra più acceleratori. Può distribuire un modello su più schede ma introduce comunicazione e richiede una strategia di serving o addestramento esplicitamente supportata.
DistributedDataParallel (DDP)
Un approccio di addestramento PyTorch che esegue repliche del modello su più processi e sincronizza i gradienti. La replica non combina le memorie dei dispositivi in un unico pool contiguo.
Fully Sharded Data Parallel (FSDP)
Addestramento distribuito che suddivide parametri del modello, gradienti e stato dell'ottimizzatore. Il risparmio di memoria comporta requisiti di comunicazione, coordinamento e checkpoint.
CUDA
La piattaforma di calcolo parallelo e il modello di programmazione di NVIDIA. Un carico di lavoro dipendente da CUDA richiede comunque hardware, driver, runtime e librerie compatibili.
ROCm
Lo stack software di AMD per il calcolo su GPU. Il supporto deve essere verificato per la GPU esatta, il sistema operativo, la build del framework e le dipendenze del carico di lavoro.
Checkpoint di addestramento
Stato salvato utilizzato per riprendere o riprodurre l'addestramento. A seconda dell'esecuzione, include il modello, l'ottimizzatore, la pianificazione, lo stato casuale e l'avanzamento nei dati. Verifica il ripristino, non solo la scrittura.
Autoencoder variazionale (VAE)
In una pipeline di diffusione, un componente che mappa tra rappresentazioni latenti e output visualizzabili. La decodifica può avere un picco di memoria separato dal denoising; il chunking o il tiling supportati richiedono controlli di qualità.
Periodo di noleggio fisso
In questo catalogo, una settimana corrisponde esattamente a 7 giorni e un mese esattamente a 30 giorni. L'arresto di un'allocazione modellata non sospende il periodo pagato. I prezzi delle GPU e le opzioni selezionate formano il preventivo completo.
Chiave di idempotenza
Un identificatore che consente a un'operazione supportata di riconoscere una richiesta ripetuta, in modo che la stessa azione non venga applicata due volte. Riutilizzalo per un nuovo tentativo della stessa operazione, non per un acquisto o una configurazione diversa.
Le definizioni spiegano il concetto; non garantiscono che un carico di lavoro, una versione di libreria o una topologia specifica sia supportata da un'allocazione AnchorGPU.