AGAnchorGPU

Słownik obciążeń GPU

Warunki stojące za konfiguracją.

Przystępne definicje pamięci GPU, pamięci podręcznej KV, kwantyzacji, CUDA, ROCm, paralelizmu tensorowego, trenowania i rozliczeń za okres stały.

#

VRAM

Pamięć lokalna akceleratora. Pojemność robocza obejmuje więcej niż wagi modelu: aktywacje, bufory, stan buforowany i alokacje frameworka również mogą ją zużywać.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

Pamięć podręczna KV

Tensory kluczy i wartości przechowywane przez serwowanie autoregresyjne dla aktywnych sekwencji. Architektura modelu, precyzja pamięci podręcznej, liczba tokenów i współbieżność wpływają na wymaganą pojemność.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

Kwantyzacja

Reprezentowanie niektórych wartości modelu ze zmniejszoną precyzją numeryczną. Rzeczywiste zużycie pamięci obejmuje metadane formatu i przestrzenie robocze środowiska uruchomieniowego; obsługiwane jądra i jakość wyników muszą zostać sprawdzone.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

Paralelizm tensorowy

Rozdzielanie części operacji tensorowych modelu między akceleratory. Może rozłożyć model na karty, ale wprowadza komunikację i wymaga jawnie obsługiwanej strategii serwowania lub trenowania.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

DistributedDataParallel (DDP)

Podejście treningowe PyTorch, które uruchamia repliki modelu w wielu procesach i synchronizuje gradienty. Replikacja nie łączy pamięci urządzeń w jedną ciągłą pulę.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

W pełni współdzielony równoległy przetwarzanie danych (FSDP)

Trening rozproszony, który dzieli parametry modelu, gradienty i stan optymalizatora. Oszczędności pamięci wiążą się z wymaganiami dotyczącymi komunikacji, koordynacji i punktów kontrolnych.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

CUDA

Platforma obliczeń równoległych i model programowania firmy NVIDIA. Obciążenie zależne od CUDA nadal wymaga zgodnego sprzętu, sterownika, środowiska uruchomieniowego i bibliotek.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

ROCm

Stos oprogramowania AMD do obliczeń GPU. Wsparcie należy sprawdzić dla dokładnego GPU, systemu operacyjnego, kompilacji frameworka i zależności obciążenia.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

Punkt kontrolny treningu

Zapisany stan używany do wznawiania lub odtwarzania treningu. W zależności od przebiegu obejmuje model, optymalizator, harmonogram, stan losowy i postęp w danych. Zweryfikuj przywracanie, a nie tylko zapis.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

Wariacyjny autoenkoder (VAE)

W potoku dyfuzyjnym komponent mapujący między reprezentacjami latentnymi a widocznymi wynikami. Dekodowanie może mieć osobny szczyt pamięci niż odszumianie; obsługiwane dzielenie na fragmenty lub kafelki wymaga kontroli jakości.

Praktyczny przewodnik →Oficjalna dokumentacja ↗
#

Stały okres wynajmu

W tym katalogu tydzień to dokładnie 7 dni, a miesiąc dokładnie 30 dni. Zatrzymanie zamodelowanej alokacji nie wstrzymuje opłaconego okresu. Ceny GPU i wybrane opcje tworzą kompletną wycenę.

Praktyczny przewodnik →Odniesienie do produktu ↗
#

Klucz idempotentności

Identyfikator umożliwiający obsługiwanej operacji rozpoznanie powtórzonego żądania, dzięki czemu ta sama akcja nie zostanie zastosowana dwukrotnie. Użyj go ponownie przy ponowieniu tej samej operacji, a nie przy innym zakupie lub konfiguracji.

Praktyczny przewodnik →Odniesienie do produktu ↗

Definicje wyjaśniają pojęcie; nie gwarantują, że określone obciążenie, wersja biblioteki lub topologia są obsługiwane przez alokację AnchorGPU.