Посібники з робочих навантажень
Обслуговування LLM за допомогою vLLM
Сплануйте пам'ять і паралелізм, налаштуйте кінцеву точку vLLM та перевірте репрезентативне робоче навантаження інференсу.
9 хв читання · ОновленоВизначте контракт обслуговування
Зафіксуйте ідентифікатор моделі та ревізію, формат ваг, квантизацію, максимальну довжину контексту, розподіл довжини запитів, паралелізм і цільову затримку. Ці налаштування є частиною робочого навантаження, а не необов'язковими нотатками до бенчмарку.
Ваги моделі ділять пам'ять GPU з кешем KV і тимчасовими робочими просторами. Модель, яка успішно завантажується з одним коротким запитом, може все одно вичерпати пам'ять за очікуваного трафіку. Залишайте операційний запас і тестуйте найдовші дозволені запити.
Почніть з одного GPU, коли це підходить
Один GPU уникає між-GPU комунікації та полегшує діагностику першого розгортання. Розглядайте тензорний паралелізм, коли модель і необхідний стан виконання не вміщуються на одному прискорювачі або коли репрезентативне вимірювання виправдовує його розділення.
Незалежні репліки обслуговують окремі запити; тензорний паралелізм розділяє обчислення моделі. Вони вирішують різні завдання. Вузол каталогу з кількома картами сам по собі не доводить наявність певного з'єднання.
Порівняти H100 SXM з H100 PCIeКваліфікуйте повне середовище
Образ vllm AnchorGPU доступний для NVIDIA та AMD у каталозі. Перед реальним виконанням визначте фактичний драйвер, середовище виконання CUDA або ROCm, версії PyTorch, Python та vLLM. Перевірте архітектуру моделі, підтримку квантування та будь-які скомпільовані ядра уваги разом.
Цей локальний сайт зберігає конфігурації, але не запускає віддалений сервер моделей. Наведені нижче команди слід виконувати на реальному, підготовленому вузлі Linux із необхідним програмним забезпеченням і доступом до моделі.
Запустити приватну кінцеву точку
Встановіть модель і приватний ключ API в оболонці, яка використовується для запуску сервера. Замініть обидва заповнювачі. Ключ є обліковими даними обслуговування vLLM, а не ключем AnchorGPU API вашого облікового запису. Під час перевірки прив'язуйтеся до loopback; віддалений доступ потребує автентифікованого TLS або шляху через приватну мережу.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000Для моделі, навмисно розділеної на чотири видимі GPU на тому самому вузлі, додайте --tensor-parallel-size 4. Підтвердьте апаратну конфігурацію та підтримку програмного забезпечення перед внесенням цієї зміни.
Перевірте API перед навантажувальним тестуванням
В іншій оболонці встановіть той самий ключ VLLM_API_KEY і запитайте список моделей. Запит chat-completions також потребує моделі з відповідним шаблоном чату; успішний запуск сервера не гарантує підтримку кожного завдання API.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"Використовуйте ідентифікатор моделі, повідомлений сервером, у клієнтських запитах. Тримайте автентифікацію ввімкненою під час тестування.
Виміряйте стійку ємність
Відтворюйте санітизовані запити з передбачуваною довжиною підказок, лімітами виводу та паралельністю. Записуйте час до першого токена, наскрізну затримку, пропускну здатність, частоту помилок, використання пам'яті GPU та ємність кешу KV, повідомлену сервером.
Вимірюйте холодне завантаження моделі окремо від стаціонарного обслуговування. Збільшуйте паралельність поступово. Якщо обмеженням стає пам'ять, оцініть менший контекст/concurrency, відповідний формат квантування або більше пам'яті, перш ніж припускати, що допоможе більше обчислювальної потужності.
Перетворіть завершену роботу на вартість за фіксованою ціною резервування. Показник токенів за секунду в заголовку не є обіцянкою потужності, і ми не заявляємо результатів бенчмарків AnchorGPU у цьому посібнику.
Усуньте поширені режими відмов
Помилка чат-запиту: перевірте шаблон чату моделі та підтримуване завдання API. Помилка пам'яті після збільшення завантаження: перевірте тиск кешу KV, контекст і паралельність. Ініціалізація кількох GPU зависає: підтвердьте видимі пристрої, колективні бібліотеки та коректність тензорно-паралельного розподілу.
Збережіть ревізію моделі, дайджест контейнера, конфігурацію запуску, результати валідації та контракт клієнтського API. Скопіюйте операційні артефакти з вузла перед його звільненням.
Прочитайте посібник з життєвого циклу інстансу