VRAM
Geheugen dat lokaal is voor een accelerator. Werkbelastingcapaciteit omvat meer dan modelgewichten: activaties, buffers, cache-status en frameworktoewijzingen kunnen dit ook verbruiken.
KV-cache
Sleutel- en waardetensoren die door autoregressieve serving worden vastgehouden voor live sequenties. Modelarchitectuur, cacheprecisie, tokenaantal en gelijktijdigheid beïnvloeden de benodigde capaciteit.
Kwantificering
Het weergeven van sommige modelwaarden met verminderde numerieke precisie. Werkelijk geheugengebruik omvat formaatmetadata en runtimewerkruimten; ondersteunde kernels en uitvoerkwaliteit moeten worden gecontroleerd.
Tensorparallellisme
Het verdelen van delen van modeltensorbewerkingen over accelerators. Het kan een model over kaarten verspreiden, maar introduceert communicatie en vereist een expliciet ondersteunde serving- of trainingsstrategie.
DistributedDataParallel (DDP)
Een PyTorch-trainingsaanpak die modelreplica's over processen uitvoert en gradiënten synchroniseert. Replicatie combineert apparaatgeheugens niet tot één aaneengesloten pool.
Fully Sharded Data Parallel (FSDP)
Gedistribueerde training die modelparameters, gradiënten en optimizerstatus opsplitst. Geheugenbesparing gaat gepaard met communicatie-, coördinatie- en checkpointvereisten.
CUDA
NVIDIA's platform voor parallel rekenen en programmeermodel. Een van CUDA afhankelijke workload vereist nog steeds compatibele hardware, driver, runtime en bibliotheken.
ROCm
De softwarestack van AMD voor GPU-computing. Ondersteuning moet worden gecontroleerd voor de exacte GPU, het besturingssysteem, de framework-build en de workloadafhankelijkheden.
Trainingscheckpoint
Opgeslagen status die wordt gebruikt om training te hervatten of te reproduceren. Afhankelijk van de run omvat dit het model, de optimizer, het schema, de willekeurige status en de voortgang door de data. Controleer het herstel, niet alleen het schrijven.
Variationele auto-encoder (VAE)
In een diffusiepijplijn een component die tussen latente representaties en zichtbare uitvoer mapt. Decodering kan een aparte geheugenpiek hebben ten opzichte van denoising; ondersteunde chunking of tiling vereist kwaliteitscontroles.
Vaste huurtermijn
In deze catalogus is een week precies 7 dagen en een maand precies 30 dagen. Het stoppen van een gemodelleerde toewijzing pauzeert de betaalde periode niet. GPU-prijzen en geselecteerde opties vormen de volledige offerte.
Idempotentiesleutel
Een identificator waarmee een ondersteunde bewerking een herhaald verzoek kan herkennen, zodat dezelfde actie niet twee keer wordt toegepast. Hergebruik deze voor een nieuwe poging van dezelfde bewerking, niet voor een andere aankoop of configuratie.
Definities leggen het concept uit; ze garanderen niet dat een specifieke workload, bibliotheekversie of topologie wordt ondersteund door een AnchorGPU-toewijzing.