AGAnchorGPU

Глоссарий рабочих нагрузок GPU

Условия, лежащие в основе конфигурации.

Простые определения памяти GPU, кэша KV, квантизации, CUDA, ROCm, тензорного параллелизма, обучения и биллинга с фиксированным сроком.

#

VRAM

Память, локальная для ускорителя. Рабочая ёмкость включает не только веса модели: активации, буферы, кэшированное состояние и выделения фреймворка также могут её потреблять.

Практическое руководство →Официальная документация ↗
#

KV-кэш

Тензоры ключей и значений, удерживаемые при авторегрессионном обслуживании для активных последовательностей. Архитектура модели, точность кэша, количество токенов и параллелизм влияют на требуемую ёмкость.

Практическое руководство →Официальная документация ↗
#

Квантование

Представление некоторых значений модели с пониженной числовой точностью. Реальное использование памяти включает метаданные формата и рабочие области среды выполнения; поддерживаемые ядра и качество вывода необходимо проверить.

Практическое руководство →Официальная документация ↗
#

Тензорный параллелизм

Распределение частей тензорных операций модели по ускорителям. Это может распределить модель по картам, но вводит коммуникацию и требует явно поддерживаемой стратегии обслуживания или обучения.

Практическое руководство →Официальная документация ↗
#

DistributedDataParallel (DDP)

Подход к обучению PyTorch, который запускает реплики модели в нескольких процессах и синхронизирует градиенты. Репликация не объединяет память устройств в один непрерывный пул.

Практическое руководство →Официальная документация ↗
#

Полностью сегментированный параллелизм данных (FSDP)

Распределённое обучение, при котором параметры модели, градиенты и состояние оптимизатора разделяются на части. Экономия памяти сопровождается требованиями к коммуникации, координации и контрольным точкам.

Практическое руководство →Официальная документация ↗
#

CUDA

Платформа параллельных вычислений и модель программирования NVIDIA. Рабочая нагрузка, зависящая от CUDA, по-прежнему требует совместимого оборудования, драйвера, среды выполнения и библиотек.

Практическое руководство →Официальная документация ↗
#

ROCm

Программный стек AMD для вычислений на GPU. Поддержку необходимо проверять для конкретного GPU, операционной системы, сборки фреймворка и зависимостей рабочей нагрузки.

Практическое руководство →Официальная документация ↗
#

Контрольная точка обучения

Сохранённое состояние, используемое для возобновления или воспроизведения обучения. В зависимости от запуска оно включает модель, оптимизатор, расписание, случайное состояние и прогресс по данным. Проверяйте восстановление, а не только запись.

Практическое руководство →Официальная документация ↗
#

Вариационный автоэнкодер (VAE)

В конвейере диффузии — компонент, который преобразует скрытые представления в видимые выходные данные. Декодирование может иметь отдельный пик потребления памяти по сравнению с шумоподавлением; поддерживаемое разбиение на фрагменты или тайлинг требует проверки качества.

Практическое руководство →Официальная документация ↗
#

Фиксированный срок аренды

В этом каталоге неделя составляет ровно 7 дней, а месяц — ровно 30 дней. Остановка смоделированного размещения не приостанавливает оплаченный период. Цены на GPU и выбранные параметры формируют полную смету.

Практическое руководство →Справочник по продукту ↗
#

Ключ идемпотентности

Идентификатор, позволяющий поддерживаемой операции распознать повторный запрос, чтобы одно и то же действие не было применено дважды. Используйте его повторно для повтора той же операции, а не для другой покупки или конфигурации.

Практическое руководство →Справочник по продукту ↗

Определения объясняют концепцию; они не гарантируют, что конкретная рабочая нагрузка, версия библиотеки или топология поддерживаются выделением AnchorGPU.