VRAM
Пам'ять, локальна для прискорювача. Робоче навантаження включає не лише ваги моделі: активації, буфери, кешований стан і виділення фреймворків також можуть її споживати.
Кеш KV
Тензори ключів і значень, які утримуються авторегресивним обслуговуванням для активних послідовностей. Архітектура моделі, точність кешу, кількість токенів і паралельність впливають на необхідну ємність.
Квантування
Представлення деяких значень моделі зі зниженою числовою точністю. Реальне використання пам'яті включає метадані формату та робочі простори середовища виконання; підтримувані ядра та якість виводу потрібно перевіряти.
Тензорний паралелізм
Розподіл частин тензорних операцій моделі між прискорювачами. Це може розподілити модель між картами, але вводить комунікацію та потребує явно підтримуваної стратегії обслуговування або навчання.
DistributedDataParallel (DDP)
Підхід до навчання PyTorch, який запускає репліки моделі між процесами та синхронізує градієнти. Реплікація не об'єднує пам'ять пристроїв в один безперервний пул.
Повністю шардований паралелізм даних (FSDP)
Розподілене навчання, яке розбиває параметри моделі, градієнти та стан оптимізатора. Економія пам'яті супроводжується вимогами до комунікації, координації та контрольних точок.
CUDA
Платформа паралельних обчислень і модель програмування NVIDIA. Робоче навантаження, залежне від CUDA, все одно потребує сумісного обладнання, драйвера, середовища виконання та бібліотек.
ROCm
Програмний стек AMD для обчислень на GPU. Підтримку необхідно перевіряти для конкретного GPU, операційної системи, збірки фреймворку та залежностей робочого навантаження.
Контрольна точка навчання
Збережений стан, який використовується для відновлення або відтворення навчання. Залежно від запуску, він включає модель, оптимізатор, розклад, випадковий стан і прогрес у даних. Перевіряйте відновлення, а не лише запис.
Варіаційний автокодувальник (VAE)
У дифузійному конвеєрі — компонент, який відображає між латентними представленнями та видимими результатами. Декодування може мати окремий пік пам'яті від денойзингу; підтримуване розбиття на частини або тайлінг вимагає перевірки якості.
Фіксований термін оренди
У цьому каталозі тиждень становить рівно 7 днів, а місяць — рівно 30 днів. Зупинка змодельованого розподілу не призупиняє оплачений період. Ціни на GPU та вибрані параметри формують повну пропозицію.
Ключ ідемпотентності
Ідентифікатор, який дозволяє підтримуваній операції розпізнати повторний запит, щоб та сама дія не була застосована двічі. Використовуйте його повторно для повторної спроби тієї самої операції, а не для іншої покупки чи конфігурації.
Визначення пояснюють концепцію; вони не гарантують, що конкретне робоче навантаження, версія бібліотеки чи топологія підтримуються розподілом AnchorGPU.