VRAM
Mémoire locale à un accélérateur. La capacité de charge de travail comprend plus que les poids du modèle : les activations, les tampons, l'état en cache et les allocations du framework peuvent également la consommer.
cache KV
Tenseurs de clé et de valeur conservés par l'inférence autorégressive pour les séquences actives. L'architecture du modèle, la précision du cache, le nombre de jetons et la concurrence affectent la capacité requise.
Quantification
Représentation de certaines valeurs du modèle avec une précision numérique réduite. L'utilisation réelle de la mémoire inclut les métadonnées de format et les espaces de travail du runtime ; les noyaux pris en charge et la qualité de sortie doivent être vérifiés.
Parallélisme de tenseurs
Répartition de parties des opérations tensorielles du modèle entre les accélérateurs. Cela peut répartir un modèle entre les cartes, mais introduit de la communication et nécessite une stratégie de service ou d'entraînement explicitement prise en charge.
DistributedDataParallel (DDP)
Une approche d'entraînement PyTorch qui exécute des répliques du modèle sur plusieurs processus et synchronise les gradients. La réplication ne combine pas les mémoires des appareils en un seul pool contigu.
Fully Sharded Data Parallel (FSDP)
Entraînement distribué qui fragmente les paramètres du modèle, les gradients et l'état de l'optimiseur. Les économies de mémoire s'accompagnent d'exigences de communication, de coordination et de points de contrôle.
CUDA
La plateforme de calcul parallèle et le modèle de programmation de NVIDIA. Une charge de travail dépendante de CUDA nécessite toujours un matériel, un pilote, un runtime et des bibliothèques compatibles.
ROCm
La pile logicielle de AMD pour le calcul GPU. L'assistance doit être vérifiée pour le GPU exact, le système d'exploitation, la version du framework et les dépendances de la charge de travail.
Point de contrôle d'entraînement
État enregistré utilisé pour reprendre ou reproduire l'entraînement. Selon l'exécution, cela inclut le modèle, l'optimiseur, le planificateur, l'état aléatoire et la progression dans les données. Vérifiez la restauration, pas seulement l'écriture.
Autoencodeur variationnel (VAE)
Dans un pipeline de diffusion, un composant qui fait le lien entre les représentations latentes et les sorties visualisables. Le décodage peut avoir un pic mémoire distinct du débruitage ; le découpage ou le pavage pris en charge nécessite des contrôles de qualité.
Durée de location fixe
Dans ce catalogue, une semaine correspond exactement à 7 jours et un mois à 30 jours. L'arrêt d'une allocation modélisée ne suspend pas la période payée. Les prix des GPU et les options sélectionnées constituent le devis complet.
Clé d'idempotence
Un identifiant qui permet à une opération prise en charge de reconnaître une requête répétée, afin que la même action ne soit pas appliquée deux fois. Réutilisez-le pour une nouvelle tentative de la même opération, pas pour un achat ou une configuration différente.
Les définitions expliquent le concept ; elles ne garantissent pas qu'une charge de travail, une version de bibliothèque ou une topologie spécifique soit prise en charge par une allocation AnchorGPU.