Руководство по рабочим нагрузкам GPU
Выбор GPU для инференса LLM в продакшене
Как размер модели, квантование, контекст, пакетная обработка и целевые показатели задержки меняют лучший GPU — и реальную стоимость одного запроса.
Автор: AnchorGPU · Обновлено · 7 мин чтенияОпределите контракт обслуживания
Отделите интерактивное обслуживание от офлайн-пакетной работы. Определите максимальную длину запроса, типичную и максимальную длину ответа, целевую конкурентность, время до первого токена, задержку между токенами и допустимую погрешность. Один короткий запрос не является тестом пропускной способности.
При сравнении оборудования сохраняйте неизменными версии модели и токенизатора, формат квантования, шаблон чата и настройки декодирования. В противном случае более быстрый результат может быть следствием другой рабочей нагрузки или компромисса по качеству, а не GPU.
Закладывайте бюджет больше, чем веса модели
Для инференса требуются веса модели, буферы среды выполнения, активации и обычно кэш KV для активных последовательностей. Большее число одновременных последовательностей и более длинные контексты изменяют требуемый объем памяти. Поддержку квантизации и ее влияние на качество вывода необходимо проверить на выбранной среде выполнения.
Карта 24 GB или 48 GB — это кандидат для модели, которая помещается в память, а не обещание, что любая модель из класса с таким числом параметров будет работать. Проверьте фактическую модель и лимит контекста. Ускорители с большим объёмом памяти полезны, когда они уменьшают необходимость разбиения или обеспечивают измеренный запас по параллельной работе.
Реплики или распределенная модель?
Если модель помещается на одном GPU, независимые реплики могут быть простым способом обслуживать больше запросов. Тензорный параллелизм распределяет части модели и добавляет коммуникацию между ускорителями. Конвейерный параллелизм имеет другие компромиссы по размещению и использованию.
Проверьте текущие рекомендации vLLM и предоставленную топологию машины, прежде чем выбирать количество карт. Не предполагайте, что SXM, PCIe, четыре карты или совокупный показатель VRAM подразумевают конкретную подключенную фабрику.
Проверьте программный стек перед измерением времени
Подтвердите драйвер, сборку CUDA или ROCm, поддержку архитектуры GPU и доступность операторов, необходимых вашей модели. Теги контейнеров должны быть закреплены, а свежая среда должна воспроизводить тот же результат обслуживания.
Привяжите первый тест к loopback, используйте ключ API и не открывайте конечную точку модели без аутентификации. Удалённый доступ, TLS, контроль входящего трафика и мониторинг служб требуют явной конфигурации развёртывания; они не создаются при выборе образа из каталога.
Измеряйте реалистичный трафик
Прогрейте сервер и отделите время загрузки модели от результатов в установившемся режиме. Воспроизведите репрезентативную смесь длин запросов, длин ответов и одновременных запросов. Сообщайте вместе принятую пропускную способность запросов, задержку p95, ошибки и использование памяти.
Увеличивайте трафик до тех пор, пока целевые показатели задержки или надежности не перестанут выполняться, затем оставьте запас мощности. Проводите тесты холодного старта и восстановления отдельно: операционная готовность включает восстановление обслуживания после сбоя процесса или узла.
Сравните стоимость полезного результата
Для измеряемого интервала разделите полную стоимость выделения, относящуюся к этому интервалу, на успешно предоставленный результат. Если вы сообщаете стоимость за миллион токенов, укажите, включены ли входные и выходные токены, и используйте одно и то же соглашение для каждого кандидата.
Фиксированная аренда на 7 или 30 дней оплачивается за весь срок, включая время простоя. Явно планируйте загрузку и учитывайте опции перед сравнением конфигураций. Цены каталога AnchorGPU являются смоделированными данными; здесь не утверждается наличие живого сервисного бенчмарка или производственной доступности.
Источники и редакционный метод
Официальная документация подтверждает технические пояснения. Рекомендации по оборудованию — это наша интерпретация, зависящая от рабочей нагрузки, а не измеренная гарантия производительности.
vLLM — быстрый старт и обслуживание ↗vLLM — распределенное обслуживание и параллелизм ↗vLLM — требования к установке GPU ↗