AGAnchorGPU
← Усі інженерні посібники

Посібник із робочих навантажень GPU

Вибір GPU для інференсу LLM у виробничому середовищі

Як розмір моделі, квантування, контекст, пакетування та цільові показники затримки змінюють найкращий GPU — і реальну вартість одного запиту.

Автор: AnchorGPU · Оновлено · 7 хв читання

Визначте контракт обслуговування

Відокремте інтерактивне обслуговування від офлайн-пакетної роботи. Визначте максимальну довжину запиту, типову та максимальну довжину відповіді, цільову паралельність, час до першого токена, затримку між токенами та допустиму похибку. Один короткий запит не є тестом пропускної здатності.

Зберігайте незмінними версії моделі та токенізатора, формат квантування, шаблон чату та параметри декодування під час порівняння обладнання. Інакше швидший результат може походити від іншого робочого навантаження або компромісу щодо якості, а не від GPU.

Бюджетуйте більше, ніж ваги моделі

Для інференсу потрібні ваги моделі, буфери середовища виконання, активації та зазвичай кеш KV для активних послідовностей. Більша кількість одночасних послідовностей і довші контексти змінюють необхідний обсяг пам'яті. Підтримку квантування та його вплив на якість виводу потрібно перевірити на обраному середовищі виконання.

Карта 24 GB або 48 GB є кандидатом для моделі, яка вміщується, а не обіцянкою, що кожна модель у класі розміру параметрів працюватиме. Перевірте фактичну модель та ліміт контексту. Прискорювачі з більшою пам'яттю корисні, коли вони зменшують розбиття або забезпечують виміряний запас паралелізму.

Репліки чи розподілена модель?

Якщо модель поміщається на одному GPU, незалежні репліки можуть бути простим способом обслуговувати більше запитів. Тензорний паралелізм розподіляє частини моделі та вводить комунікацію між прискорювачами. Конвеєрний паралелізм має інші компроміси щодо розміщення та використання.

Перевірте поточні рекомендації vLLM та надану топологію машини, перш ніж обирати кількість карт. Не припускайте, що SXM, PCIe, чотири карти чи сукупний показник VRAM означають певну з'єднану фабрику.

Перевірте програмний стек перед вимірюванням часу

Підтвердьте драйвер, збірку CUDA або ROCm, підтримку архітектури GPU та доступність операторів, потрібних вашій моделі. Теги контейнерів слід закріплювати, а свіже середовище має відтворювати той самий результат обслуговування.

Прив'яжіть перший тест до loopback, використовуйте ключ API і не відкривайте неавтентифіковану кінцеву точку моделі. Віддалений доступ, TLS, контроль вхідного трафіку та моніторинг сервісу потребують явної конфігурації розгортання; вони не створюються автоматично під час вибору образу з каталогу.

Вимірюйте реалістичний трафік

Прогрійте сервер і відокремте час завантаження моделі від результатів у сталому режимі. Відтворіть репрезентативну суміш довжин запитів, довжин виведення та одночасних запитів. Повідомте разом прийняту пропускну здатність запитів, затримку p95, помилки та використання пам'яті.

Збільшуйте трафік, доки не перестануть виконуватися цільові показники затримки або надійності, потім залиште запас потужності. Тримайте тести холодного старту та відновлення окремо: операційна готовність включає відновлення сервісу після збою процесу або вузла.

Порівняйте вартість корисного результату

Для виміряного інтервалу розділіть повну вартість виділення, що припадає на цей інтервал, на успішно наданий результат. Якщо звітуєте про вартість за мільйон токенів, зазначте, чи включено вхідні та вихідні токени, і використовуйте ту саму конвенцію для кожного кандидата.

Фіксована оренда на 7 або 30 днів оплачується за весь термін, включно з часом простою. Явно плануйте використання та враховуйте опції перед порівнянням конфігурацій. Ціни каталогу AnchorGPU є змодельованими вхідними даними; тут не стверджується жодного живого сервісного бенчмарку чи виробничої доступності.

Джерела та редакційний метод

Офіційна документація підтверджує технічні пояснення. Рекомендації щодо обладнання є нашою інтерпретацією, залежною від робочого навантаження, а не виміряною гарантією продуктивності.

vLLM — швидкий старт і обслуговуванняvLLM — розподілене обслуговування та паралелізмvLLM — вимоги до встановлення GPU