AGAnchorGPU

Glossaire des charges de travail GPU

Les conditions derrière la configuration.

Définitions en langage clair de la mémoire GPU, du cache KV, de la quantification, de CUDA, de ROCm, du parallélisme de tenseurs, de l'entraînement et de la facturation à période fixe.

#

VRAM

Mémoire locale à un accélérateur. La capacité de charge de travail comprend plus que les poids du modèle : les activations, les tampons, l'état en cache et les allocations du framework peuvent également la consommer.

Guide pratique →Documentation officielle ↗
#

cache KV

Tenseurs de clé et de valeur conservés par l'inférence autorégressive pour les séquences actives. L'architecture du modèle, la précision du cache, le nombre de jetons et la concurrence affectent la capacité requise.

Guide pratique →Documentation officielle ↗
#

Quantification

Représentation de certaines valeurs du modèle avec une précision numérique réduite. L'utilisation réelle de la mémoire inclut les métadonnées de format et les espaces de travail du runtime ; les noyaux pris en charge et la qualité de sortie doivent être vérifiés.

Guide pratique →Documentation officielle ↗
#

Parallélisme de tenseurs

Répartition de parties des opérations tensorielles du modèle entre les accélérateurs. Cela peut répartir un modèle entre les cartes, mais introduit de la communication et nécessite une stratégie de service ou d'entraînement explicitement prise en charge.

Guide pratique →Documentation officielle ↗
#

DistributedDataParallel (DDP)

Une approche d'entraînement PyTorch qui exécute des répliques du modèle sur plusieurs processus et synchronise les gradients. La réplication ne combine pas les mémoires des appareils en un seul pool contigu.

Guide pratique →Documentation officielle ↗
#

Fully Sharded Data Parallel (FSDP)

Entraînement distribué qui fragmente les paramètres du modèle, les gradients et l'état de l'optimiseur. Les économies de mémoire s'accompagnent d'exigences de communication, de coordination et de points de contrôle.

Guide pratique →Documentation officielle ↗
#

CUDA

La plateforme de calcul parallèle et le modèle de programmation de NVIDIA. Une charge de travail dépendante de CUDA nécessite toujours un matériel, un pilote, un runtime et des bibliothèques compatibles.

Guide pratique →Documentation officielle ↗
#

ROCm

La pile logicielle de AMD pour le calcul GPU. L'assistance doit être vérifiée pour le GPU exact, le système d'exploitation, la version du framework et les dépendances de la charge de travail.

Guide pratique →Documentation officielle ↗
#

Point de contrôle d'entraînement

État enregistré utilisé pour reprendre ou reproduire l'entraînement. Selon l'exécution, cela inclut le modèle, l'optimiseur, le planificateur, l'état aléatoire et la progression dans les données. Vérifiez la restauration, pas seulement l'écriture.

Guide pratique →Documentation officielle ↗
#

Autoencodeur variationnel (VAE)

Dans un pipeline de diffusion, un composant qui fait le lien entre les représentations latentes et les sorties visualisables. Le décodage peut avoir un pic mémoire distinct du débruitage ; le découpage ou le pavage pris en charge nécessite des contrôles de qualité.

Guide pratique →Documentation officielle ↗
#

Durée de location fixe

Dans ce catalogue, une semaine correspond exactement à 7 jours et un mois à 30 jours. L'arrêt d'une allocation modélisée ne suspend pas la période payée. Les prix des GPU et les options sélectionnées constituent le devis complet.

Guide pratique →Référence produit ↗
#

Clé d'idempotence

Un identifiant qui permet à une opération prise en charge de reconnaître une requête répétée, afin que la même action ne soit pas appliquée deux fois. Réutilisez-le pour une nouvelle tentative de la même opération, pas pour un achat ou une configuration différente.

Guide pratique →Référence produit ↗

Les définitions expliquent le concept ; elles ne garantissent pas qu'une charge de travail, une version de bibliothèque ou une topologie spécifique soit prise en charge par une allocation AnchorGPU.