VRAM
Память, локальная для ускорителя. Рабочая ёмкость включает не только веса модели: активации, буферы, кэшированное состояние и выделения фреймворка также могут её потреблять.
KV-кэш
Тензоры ключей и значений, удерживаемые при авторегрессионном обслуживании для активных последовательностей. Архитектура модели, точность кэша, количество токенов и параллелизм влияют на требуемую ёмкость.
Квантование
Представление некоторых значений модели с пониженной числовой точностью. Реальное использование памяти включает метаданные формата и рабочие области среды выполнения; поддерживаемые ядра и качество вывода необходимо проверить.
Тензорный параллелизм
Распределение частей тензорных операций модели по ускорителям. Это может распределить модель по картам, но вводит коммуникацию и требует явно поддерживаемой стратегии обслуживания или обучения.
DistributedDataParallel (DDP)
Подход к обучению PyTorch, который запускает реплики модели в нескольких процессах и синхронизирует градиенты. Репликация не объединяет память устройств в один непрерывный пул.
Полностью сегментированный параллелизм данных (FSDP)
Распределённое обучение, при котором параметры модели, градиенты и состояние оптимизатора разделяются на части. Экономия памяти сопровождается требованиями к коммуникации, координации и контрольным точкам.
CUDA
Платформа параллельных вычислений и модель программирования NVIDIA. Рабочая нагрузка, зависящая от CUDA, по-прежнему требует совместимого оборудования, драйвера, среды выполнения и библиотек.
ROCm
Программный стек AMD для вычислений на GPU. Поддержку необходимо проверять для конкретного GPU, операционной системы, сборки фреймворка и зависимостей рабочей нагрузки.
Контрольная точка обучения
Сохранённое состояние, используемое для возобновления или воспроизведения обучения. В зависимости от запуска оно включает модель, оптимизатор, расписание, случайное состояние и прогресс по данным. Проверяйте восстановление, а не только запись.
Вариационный автоэнкодер (VAE)
В конвейере диффузии — компонент, который преобразует скрытые представления в видимые выходные данные. Декодирование может иметь отдельный пик потребления памяти по сравнению с шумоподавлением; поддерживаемое разбиение на фрагменты или тайлинг требует проверки качества.
Фиксированный срок аренды
В этом каталоге неделя составляет ровно 7 дней, а месяц — ровно 30 дней. Остановка смоделированного размещения не приостанавливает оплаченный период. Цены на GPU и выбранные параметры формируют полную смету.
Ключ идемпотентности
Идентификатор, позволяющий поддерживаемой операции распознать повторный запрос, чтобы одно и то же действие не было применено дважды. Используйте его повторно для повтора той же операции, а не для другой покупки или конфигурации.
Определения объясняют концепцию; они не гарантируют, что конкретная рабочая нагрузка, версия библиотеки или топология поддерживаются выделением AnchorGPU.