VRAM
Pamięć lokalna akceleratora. Pojemność robocza obejmuje więcej niż wagi modelu: aktywacje, bufory, stan buforowany i alokacje frameworka również mogą ją zużywać.
Pamięć podręczna KV
Tensory kluczy i wartości przechowywane przez serwowanie autoregresyjne dla aktywnych sekwencji. Architektura modelu, precyzja pamięci podręcznej, liczba tokenów i współbieżność wpływają na wymaganą pojemność.
Kwantyzacja
Reprezentowanie niektórych wartości modelu ze zmniejszoną precyzją numeryczną. Rzeczywiste zużycie pamięci obejmuje metadane formatu i przestrzenie robocze środowiska uruchomieniowego; obsługiwane jądra i jakość wyników muszą zostać sprawdzone.
Paralelizm tensorowy
Rozdzielanie części operacji tensorowych modelu między akceleratory. Może rozłożyć model na karty, ale wprowadza komunikację i wymaga jawnie obsługiwanej strategii serwowania lub trenowania.
DistributedDataParallel (DDP)
Podejście treningowe PyTorch, które uruchamia repliki modelu w wielu procesach i synchronizuje gradienty. Replikacja nie łączy pamięci urządzeń w jedną ciągłą pulę.
W pełni współdzielony równoległy przetwarzanie danych (FSDP)
Trening rozproszony, który dzieli parametry modelu, gradienty i stan optymalizatora. Oszczędności pamięci wiążą się z wymaganiami dotyczącymi komunikacji, koordynacji i punktów kontrolnych.
CUDA
Platforma obliczeń równoległych i model programowania firmy NVIDIA. Obciążenie zależne od CUDA nadal wymaga zgodnego sprzętu, sterownika, środowiska uruchomieniowego i bibliotek.
ROCm
Stos oprogramowania AMD do obliczeń GPU. Wsparcie należy sprawdzić dla dokładnego GPU, systemu operacyjnego, kompilacji frameworka i zależności obciążenia.
Punkt kontrolny treningu
Zapisany stan używany do wznawiania lub odtwarzania treningu. W zależności od przebiegu obejmuje model, optymalizator, harmonogram, stan losowy i postęp w danych. Zweryfikuj przywracanie, a nie tylko zapis.
Wariacyjny autoenkoder (VAE)
W potoku dyfuzyjnym komponent mapujący między reprezentacjami latentnymi a widocznymi wynikami. Dekodowanie może mieć osobny szczyt pamięci niż odszumianie; obsługiwane dzielenie na fragmenty lub kafelki wymaga kontroli jakości.
Stały okres wynajmu
W tym katalogu tydzień to dokładnie 7 dni, a miesiąc dokładnie 30 dni. Zatrzymanie zamodelowanej alokacji nie wstrzymuje opłaconego okresu. Ceny GPU i wybrane opcje tworzą kompletną wycenę.
Klucz idempotentności
Identyfikator umożliwiający obsługiwanej operacji rozpoznanie powtórzonego żądania, dzięki czemu ta sama akcja nie zostanie zastosowana dwukrotnie. Użyj go ponownie przy ponowieniu tej samej operacji, a nie przy innym zakupie lub konfiguracji.
Definicje wyjaśniają pojęcie; nie gwarantują, że określone obciążenie, wersja biblioteki lub topologia są obsługiwane przez alokację AnchorGPU.