Guide des charges de travail GPU
Choisir un GPU pour l'inférence LLM en production
Comment la taille du modèle, la quantification, le contexte, le traitement par lots et les objectifs de latence modifient le meilleur GPU — et le coût réel par requête.
Par AnchorGPU · Mis à jour · 7 min de lecturePrécisez le contrat de service
Séparez le service interactif du traitement par lots hors ligne. Définissez la longueur maximale de l'invite, la longueur de sortie typique et maximale, la concurrence cible, le délai jusqu'au premier jeton, la latence inter-jetons et la tolérance aux erreurs. Une seule requête courte ne constitue pas un test de capacité.
Conservez les révisions du modèle et du tokenizer, le format de quantification, le modèle de chat et les paramètres de décodage fixes lors de la comparaison du matériel. Sinon, un résultat plus rapide peut provenir d'une charge de travail différente ou d'un compromis de qualité plutôt que du GPU.
Budgétez plus que les poids du modèle
L'inférence nécessite les poids du modèle, les tampons d'exécution, les activations et généralement un cache KV pour les séquences actives. Davantage de séquences simultanées et des contextes plus longs modifient la mémoire requise. La prise en charge de la quantification et son effet sur la qualité de sortie doivent être validés sur le runtime choisi.
Une carte 24 GB ou 48 GB est une candidate pour un modèle qui tient, pas une promesse que chaque modèle d'une classe de taille de paramètres fonctionnera. Testez le modèle réel et la limite de contexte. Les accélérateurs à plus grande mémoire sont utiles lorsqu'ils réduisent le partitionnement ou offrent une marge de concurrence mesurée.
Réplicas ou modèle distribué ?
Si le modèle tient sur un seul GPU, des réplicas indépendants peuvent être un moyen simple de servir plus de requêtes. Le parallélisme de tenseurs distribue des parties du modèle et introduit de la communication entre accélérateurs. Le parallélisme de pipeline présente des compromis différents en matière de placement et d'utilisation.
Consultez les recommandations actuelles de vLLM et la topologie de la machine livrée avant de choisir un nombre de cartes. Ne partez pas du principe que SXM, PCIe, quatre cartes ou un total agrégé de VRAM impliquent un tissu connecté particulier.
Qualifier la pile logicielle avant de chronométrer
Confirmez le pilote, la version CUDA ou ROCm, la prise en charge de l'architecture GPU et la disponibilité des opérateurs dont votre modèle a besoin. Les étiquettes de conteneur doivent être épinglées et un environnement neuf doit reproduire le même résultat de service.
Liez un premier test à loopback, utilisez une clé API et n'exposez pas de point de terminaison de modèle non authentifié. L'accès distant, TLS, les contrôles d'entrée et la surveillance des services nécessitent une configuration de déploiement explicite ; ils ne sont pas créés par la sélection d'une image du catalogue.
Mesurez un trafic réaliste
Préchauffez le serveur et séparez le temps de chargement du modèle des résultats en régime permanent. Rejouez un mélange représentatif de longueurs de requêtes, de longueurs de sortie et de requêtes simultanées. Présentez ensemble le débit de requêtes acceptées, la latence p95, les erreurs et l'utilisation de la mémoire.
Augmentez le trafic jusqu'à ce que l'objectif de latence ou de fiabilité ne soit plus atteint, puis laissez une marge de capacité. Gardez les tests de démarrage à froid et de récupération séparés : la préparation opérationnelle inclut la restauration du service après une défaillance de processus ou de nœud.
Comparez le coût de la sortie utile
Pour un intervalle mesuré, divisez le coût d'allocation complet attribuable à cet intervalle par la production livrée avec succès. Si vous indiquez le coût par million de jetons, précisez si les jetons d'entrée et de sortie sont inclus et utilisez la même convention pour chaque candidat.
Une location fixe de 7 ou 30 jours est payée pour toute la durée, y compris les temps d'inactivité. Projetez explicitement l'utilisation et incluez les options avant de comparer les configurations. Les prix du catalogue AnchorGPU sont des entrées modélisées ; aucun benchmark de service en direct ni disponibilité de production n'est affirmé ici.
Sources et méthode éditoriale
La documentation officielle étaye les explications techniques. Les recommandations matérielles sont notre interprétation dépendante de la charge de travail, et non une garantie de performance mesurée.
vLLM — démarrage rapide et inférence ↗vLLM — inférence distribuée et parallélisme ↗vLLM — exigences d'installation du GPU ↗