Руководства по рабочим нагрузкам
Обслуживание LLM с помощью vLLM
Спланируйте память и параллелизм, настройте конечную точку vLLM и проверьте репрезентативную рабочую нагрузку инференса.
9 мин чтения · ОбновленоОпределите контракт обслуживания
Зафиксируйте идентификатор и ревизию модели, формат весов, квантизацию, максимальную длину контекста, распределение длины промптов, конкурентность и целевую задержку. Эти параметры — часть рабочей нагрузки, а не необязательные примечания к бенчмарку.
Веса разделяют память GPU с кэшем KV и временными рабочими областями. Модель, успешно загружающаяся с одним коротким запросом, всё равно может исчерпать память при ожидаемом трафике. Оставляйте операционный запас и тестируйте самые длинные допустимые запросы.
Начните с одного GPU, когда это подходит
Один GPU исключает меж-GPU-коммуникацию и упрощает диагностику первого развёртывания. Рассмотрите тензорный параллелизм, когда модель и необходимое состояние выполнения не помещаются на одном ускорителе или когда репрезентативное измерение оправдывает такое разделение.
Независимые реплики обслуживают отдельные запросы; тензорный параллелизм разделяет вычисления модели. Они решают разные задачи. Узел каталога с несколькими картами сам по себе не доказывает наличие конкретного интерконнекта.
Сравнить H100 SXM с H100 PCIeПроверьте полное окружение
Образ vllm AnchorGPU доступен для NVIDIA и AMD в каталоге. Перед реальным выполнением определите фактический драйвер, среду выполнения CUDA или ROCm, версии PyTorch, Python и vLLM. Проверьте вместе архитектуру модели, поддержку квантования и все скомпилированные ядра внимания.
Этот локальный сайт сохраняет конфигурации, но не запускает удаленный сервер моделей. Следующие команды предназначены для реального подготовленного узла Linux с необходимым программным обеспечением и доступом к модели.
Запустить частную конечную точку
Задайте модель и приватный ключ API в оболочке, используемой для запуска сервера. Замените оба заполнителя. Ключ является учетными данными обслуживания vLLM, а не ключом AnchorGPU API вашей учетной записи. При проверке привязывайтесь к loopback; для удаленного доступа требуется аутентифицированный путь TLS или частная сеть.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000Для модели, намеренно разделённой между четырьмя видимыми GPU на одном узле, добавьте --tensor-parallel-size 4. Подтвердите конфигурацию оборудования и поддержку программного обеспечения перед внесением этого изменения.
Проверьте API перед нагрузочным тестированием
В другой оболочке задайте тот же ключ VLLM_API_KEY и запросите список моделей. Запрос chat-completions также требует модель с подходящим шаблоном чата; успешный запуск сервера не гарантирует поддержку каждой задачи API.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"Используйте идентификатор модели, сообщаемый сервером, в клиентских запросах. Держите аутентификацию включенной во время тестирования.
Измерьте устойчивую ёмкость
Воспроизведите очищенные запросы с предполагаемой длиной подсказок, лимитами вывода и параллелизмом. Записывайте время до первого токена, сквозную задержку, пропускную способность, частоту ошибок, использование памяти GPU и ёмкость кэша KV, сообщаемую сервером.
Измеряйте холодную загрузку модели отдельно от обслуживания в установившемся режиме. Увеличивайте параллелизм постепенно. Если ограничением становится память, оцените меньший контекст/concurrency, подходящий формат квантования или больший объем памяти, прежде чем предполагать, что поможет больше вычислительных ресурсов.
Преобразуйте выполненную работу в стоимость, используя фиксированную цену резервирования. Показатель количества токенов в секунду не является обещанием ёмкости, и в этом руководстве мы не заявляем о результатах тестов AnchorGPU.
Устраните распространённые режимы сбоев
Сбой чат-запроса: проверьте шаблон чата модели и поддерживаемую задачу API. Сбой памяти после увеличения нагрузки: проверьте давление на кэш KV, контекст и конкурентность. Зависание инициализации на нескольких GPU: подтвердите видимые устройства, коллективные библиотеки и корректность тензорно-параллельного разделения.
Сохраните ревизию модели, дайджест контейнера, конфигурацию запуска, результаты проверки и клиентский контракт API. Скопируйте операционные артефакты с узла до его освобождения.
Прочитайте руководство по жизненному циклу инстанса