AGAnchorGPU

Glossario dei carichi di lavoro GPU

I termini alla base della configurazione.

Definizioni in linguaggio semplice di memoria GPU, cache KV, quantizzazione, CUDA, ROCm, parallelismo tensoriale, addestramento e fatturazione a periodo fisso.

#

VRAM

Memoria locale di un acceleratore. La capacità di carico include più dei soli pesi del modello: anche attivazioni, buffer, stato in cache e allocazioni del framework possono consumarla.

Guida pratica →Documentazione ufficiale ↗
#

cache KV

Tensori chiave e valore mantenuti dal serving autoregressivo per le sequenze attive. Architettura del modello, precisione della cache, numero di token e concorrenza influenzano la capacità richiesta.

Guida pratica →Documentazione ufficiale ↗
#

Quantizzazione

Rappresentazione di alcuni valori del modello con precisione numerica ridotta. L'uso reale della memoria include metadati di formato e spazi di lavoro del runtime; i kernel supportati e la qualità dell'output devono essere verificati.

Guida pratica →Documentazione ufficiale ↗
#

Parallelismo tensoriale

Distribuzione di parti delle operazioni tensoriali del modello tra più acceleratori. Può distribuire un modello su più schede ma introduce comunicazione e richiede una strategia di serving o addestramento esplicitamente supportata.

Guida pratica →Documentazione ufficiale ↗
#

DistributedDataParallel (DDP)

Un approccio di addestramento PyTorch che esegue repliche del modello su più processi e sincronizza i gradienti. La replica non combina le memorie dei dispositivi in un unico pool contiguo.

Guida pratica →Documentazione ufficiale ↗
#

Fully Sharded Data Parallel (FSDP)

Addestramento distribuito che suddivide parametri del modello, gradienti e stato dell'ottimizzatore. Il risparmio di memoria comporta requisiti di comunicazione, coordinamento e checkpoint.

Guida pratica →Documentazione ufficiale ↗
#

CUDA

La piattaforma di calcolo parallelo e il modello di programmazione di NVIDIA. Un carico di lavoro dipendente da CUDA richiede comunque hardware, driver, runtime e librerie compatibili.

Guida pratica →Documentazione ufficiale ↗
#

ROCm

Lo stack software di AMD per il calcolo su GPU. Il supporto deve essere verificato per la GPU esatta, il sistema operativo, la build del framework e le dipendenze del carico di lavoro.

Guida pratica →Documentazione ufficiale ↗
#

Checkpoint di addestramento

Stato salvato utilizzato per riprendere o riprodurre l'addestramento. A seconda dell'esecuzione, include il modello, l'ottimizzatore, la pianificazione, lo stato casuale e l'avanzamento nei dati. Verifica il ripristino, non solo la scrittura.

Guida pratica →Documentazione ufficiale ↗
#

Autoencoder variazionale (VAE)

In una pipeline di diffusione, un componente che mappa tra rappresentazioni latenti e output visualizzabili. La decodifica può avere un picco di memoria separato dal denoising; il chunking o il tiling supportati richiedono controlli di qualità.

Guida pratica →Documentazione ufficiale ↗
#

Periodo di noleggio fisso

In questo catalogo, una settimana corrisponde esattamente a 7 giorni e un mese esattamente a 30 giorni. L'arresto di un'allocazione modellata non sospende il periodo pagato. I prezzi delle GPU e le opzioni selezionate formano il preventivo completo.

Guida pratica →Riferimento prodotto ↗
#

Chiave di idempotenza

Un identificatore che consente a un'operazione supportata di riconoscere una richiesta ripetuta, in modo che la stessa azione non venga applicata due volte. Riutilizzalo per un nuovo tentativo della stessa operazione, non per un acquisto o una configurazione diversa.

Guida pratica →Riferimento prodotto ↗

Le definizioni spiegano il concetto; non garantiscono che un carico di lavoro, una versione di libreria o una topologia specifica sia supportata da un'allocazione AnchorGPU.