AGAnchorGPU

Руководства по рабочим нагрузкам

Обслуживание LLM с помощью vLLM

Спланируйте память и параллелизм, настройте конечную точку vLLM и проверьте репрезентативную рабочую нагрузку инференса.

9 мин чтения · Обновлено

Определите контракт обслуживания

Зафиксируйте идентификатор и ревизию модели, формат весов, квантизацию, максимальную длину контекста, распределение длины промптов, конкурентность и целевую задержку. Эти параметры — часть рабочей нагрузки, а не необязательные примечания к бенчмарку.

Веса разделяют память GPU с кэшем KV и временными рабочими областями. Модель, успешно загружающаяся с одним коротким запросом, всё равно может исчерпать память при ожидаемом трафике. Оставляйте операционный запас и тестируйте самые длинные допустимые запросы.

Начните с одного GPU, когда это подходит

Один GPU исключает меж-GPU-коммуникацию и упрощает диагностику первого развёртывания. Рассмотрите тензорный параллелизм, когда модель и необходимое состояние выполнения не помещаются на одном ускорителе или когда репрезентативное измерение оправдывает такое разделение.

Независимые реплики обслуживают отдельные запросы; тензорный параллелизм разделяет вычисления модели. Они решают разные задачи. Узел каталога с несколькими картами сам по себе не доказывает наличие конкретного интерконнекта.

Сравнить H100 SXM с H100 PCIe

Проверьте полное окружение

Образ vllm AnchorGPU доступен для NVIDIA и AMD в каталоге. Перед реальным выполнением определите фактический драйвер, среду выполнения CUDA или ROCm, версии PyTorch, Python и vLLM. Проверьте вместе архитектуру модели, поддержку квантования и все скомпилированные ядра внимания.

Этот локальный сайт сохраняет конфигурации, но не запускает удаленный сервер моделей. Следующие команды предназначены для реального подготовленного узла Linux с необходимым программным обеспечением и доступом к модели.

Запустить частную конечную точку

Задайте модель и приватный ключ API в оболочке, используемой для запуска сервера. Замените оба заполнителя. Ключ является учетными данными обслуживания vLLM, а не ключом AnchorGPU API вашей учетной записи. При проверке привязывайтесь к loopback; для удаленного доступа требуется аутентифицированный путь TLS или частная сеть.

export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000

Для модели, намеренно разделённой между четырьмя видимыми GPU на одном узле, добавьте --tensor-parallel-size 4. Подтвердите конфигурацию оборудования и поддержку программного обеспечения перед внесением этого изменения.

Проверьте API перед нагрузочным тестированием

В другой оболочке задайте тот же ключ VLLM_API_KEY и запросите список моделей. Запрос chat-completions также требует модель с подходящим шаблоном чата; успешный запуск сервера не гарантирует поддержку каждой задачи API.

curl http://127.0.0.1:8000/v1/models \
  -H "Authorization: Bearer $VLLM_API_KEY"

Используйте идентификатор модели, сообщаемый сервером, в клиентских запросах. Держите аутентификацию включенной во время тестирования.

Измерьте устойчивую ёмкость

Воспроизведите очищенные запросы с предполагаемой длиной подсказок, лимитами вывода и параллелизмом. Записывайте время до первого токена, сквозную задержку, пропускную способность, частоту ошибок, использование памяти GPU и ёмкость кэша KV, сообщаемую сервером.

Измеряйте холодную загрузку модели отдельно от обслуживания в установившемся режиме. Увеличивайте параллелизм постепенно. Если ограничением становится память, оцените меньший контекст/concurrency, подходящий формат квантования или больший объем памяти, прежде чем предполагать, что поможет больше вычислительных ресурсов.

Преобразуйте выполненную работу в стоимость, используя фиксированную цену резервирования. Показатель количества токенов в секунду не является обещанием ёмкости, и в этом руководстве мы не заявляем о результатах тестов AnchorGPU.

Устраните распространённые режимы сбоев

Сбой чат-запроса: проверьте шаблон чата модели и поддерживаемую задачу API. Сбой памяти после увеличения нагрузки: проверьте давление на кэш KV, контекст и конкурентность. Зависание инициализации на нескольких GPU: подтвердите видимые устройства, коллективные библиотеки и корректность тензорно-параллельного разделения.

Сохраните ревизию модели, дайджест контейнера, конфигурацию запуска, результаты проверки и клиентский контракт API. Скопируйте операционные артефакты с узла до его освобождения.

Прочитайте руководство по жизненному циклу инстанса

Источники и дополнительная литература

Установка GPU vLLMПараллелизм и масштабирование vLLMБыстрый старт и аутентификация vLLMОнлайн-обслуживание vLLM
Настроить узел инференса