AGAnchorGPU
← Усі інженерні посібники

Посібник із робочих навантажень GPU

Скільки GPU VRAM вам насправді потрібно?

Практичний бюджет пам'яті для інференсу, тонкого налаштування, генерації зображень і відео-робочих навантажень — від 24 GB до 192 GB.

Автор: AnchorGPU · Оновлено · 6 хв читання

VRAM — це бюджет, а не позначка моделі

Пам'ять GPU споживається кількома незалежними категоріями: ваги моделі, кеш KV для висновування, тимчасові активації, робочі простори фреймворку, кеш розподільника та — під час навчання — градієнти й стан оптимізатора. Те, що модель вміщується в одній конфігурації, не доводить, що вона вміститься з довшим контекстом, більшим пакетом, іншою точністю або більшою кількістю одночасних запитів.

Плануйте на основі точної ревізії моделі та конфігурації середовища виконання. Позначення на кшталт 7B, 13B або 70B описують масштаб параметрів, а не загальну оперативну пам'ять, тому їх ніколи не слід універсально зіставляти з GPU.

Спочатку оцініть необроблені ваги

Як явно гіпотетичний приклад, припустімо, що модель має рівно 13 мільярдів параметрів і зберігає кожен параметр у 16-бітному форматі. Сире зберігання ваг становить 13,000,000,000 × 2 байтів = 26,000,000,000 байтів, або приблизно 24.2 GiB. Це число виключає всі інші виділення, тому воно є нижньою межею, а не рекомендацією щодо GPU.

Квантизація може зменшити зберігання ваг, але реальні обсяги також включають масштаби, метадані, буфери деквантизації, дубльовані тензори та робочі простори виконання. Використовуйте формат, створений фактичним завантажувачем, а не діліть кількість параметрів на номінальну бітову ширину та не сприймайте результат як остаточний.

Інференс додає кеш KV і робочу пам'ять

Авторегресивне обслуговування зберігає тензори ключів і значень для активних послідовностей. Потреба в KV-кеші залежить від архітектури моделі, точності кешу, кількості одночасних послідовностей та кількості активних токенів у цих послідовностях. Збільшення максимального контексту або паралелізму може вичерпати пам'ять, навіть якщо ваги завантажилися успішно.

Тимчасові активації, робочі простори уваги, скомпільовані ядра, буфери зв'язку та розподільник фреймворку споживають додаткову пам'ять. vLLM повідомляє про доступну ємність KV-кешу GPU та орієнтовну паралельність для налаштованої довжини послідовності; розглядайте ці стартові показники як докази для планування, а потім відтворіть репрезентативні запити перед запуском виробничого навантаження.

Навчання має іншу структуру пам'яті

Тонке налаштування додає градієнти, стан оптимізатора, збережені активації, а іноді й додаткові копії з повною точністю. Їхній точний розмір залежить від оптимізатора, політики точності, набору навчальних параметрів і стратегії шардування, тому єдиний множник для інференсу вводить в оману.

DistributedDataParallel реплікує стан навчання, потрібний кожному воркеру; він не перетворює кілька GPU на один безперервний пул пам'яті. Fully Sharded Data Parallel може розподіляти параметри, градієнти та стани оптимізатора між воркерами, тоді як контрольні точки активацій зменшують пам'ять збережених активацій шляхом повторного обчислення вибраної роботи під час зворотного проходу. Обидві техніки обмінюють простоту або обчислення на пам'ять.

Вимірюйте конфігурацію, яку збираєтеся запускати

Перевірте завантаження моделі та повний репрезентативний запит на інференс або крок навчання, включно з оновленням оптимізатора, з точними налаштуваннями фреймворку, точності, контексту, пакета та паралелізму. Запишіть пікову виділену та зарезервовану пам'ять, а потім повторіть із реалістичною конкурентністю або накопиченням градієнта. Залишайте операційний запас, а не намагайтеся використати останній доступний байт.

Обирайте GPU з більшим обсягом пам'яті, коли виміряний пік неможливо безпечно зменшити. Додавайте GPU лише тоді, коли програмне забезпечення явно розподіляє модель або робоче навантаження, а надане з'єднання відоме. Повторюйте вимірювання після будь-якої зміни моделі, середовища виконання, квантизації, контексту або розміру пакета.

Джерела та редакційний метод

Офіційна документація підтверджує технічні пояснення. Рекомендації щодо обладнання є нашою інтерпретацією, залежною від робочого навантаження, а не виміряною гарантією продуктивності.

vLLM — паралелізм і масштабуванняPyTorch — FullyShardedDataParallelPyTorch — контрольні точки активації