Guides de charge de travail
Servir un LLM avec vLLM
Planifiez la mémoire et la concurrence, configurez un point de terminaison vLLM et validez une charge de travail d'inférence représentative.
9 min de lecture · Mis à jour leDéfinissez le contrat de service
Consignez l'identifiant et la révision du modèle, le format des poids, la quantification, la longueur de contexte maximale, la distribution des longueurs d'invite, la concurrence et l'objectif de latence. Ces paramètres font partie de la charge de travail, ce ne sont pas des notes d'évaluation facultatives.
Les poids partagent la mémoire GPU avec le cache KV et les espaces de travail temporaires. Un modèle qui se charge correctement avec une invite courte peut encore manquer de mémoire sous le trafic prévu. Conservez une marge de fonctionnement et testez les requêtes les plus longues autorisées.
Commencez avec un seul GPU lorsque cela suffit
Un seul GPU évite la communication inter-GPU et facilite le diagnostic d'un premier déploiement. Envisagez le parallélisme de tenseurs lorsque le modèle et l'état d'exécution requis ne tiennent pas sur un seul accélérateur, ou lorsqu'une mesure représentative justifie de le diviser.
Des réplicas indépendants servent des requêtes distinctes ; le parallélisme de tenseurs divise le calcul du modèle. Ils résolvent des problèmes différents. Un nœud du catalogue doté de plusieurs cartes ne prouve pas, à lui seul, une interconnexion particulière.
Comparer H100 SXM avec H100 PCIeQualifier l'environnement complet
L'image vllm d'AnchorGPU est disponible pour NVIDIA et AMD dans le catalogue. Avant toute exécution réelle, identifiez le pilote réel, le runtime CUDA ou ROCm, les versions de PyTorch, Python et vLLM. Vérifiez ensemble l'architecture du modèle, la prise en charge de la quantification et les éventuels noyaux d'attention compilés.
Ce site local enregistre les configurations mais n'exécute pas de serveur de modèle distant. Les commandes suivantes appartiennent à un véritable nœud Linux provisionné avec les logiciels requis et l'accès au modèle.
Lancer un point de terminaison privé
Définissez le modèle et une clé d'API privée dans le shell utilisé pour lancer le serveur. Remplacez les deux espaces réservés. La clé est un identifiant de service vLLM, pas votre clé d'API du compte AnchorGPU. Liez à la boucle locale pendant la validation ; l'accès à distance nécessite un chemin TLS authentifié ou un réseau privé.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000Pour un modèle intentionnellement réparti sur quatre GPU visibles du même nœud, ajoutez --tensor-parallel-size 4. Confirmez la disposition matérielle et la prise en charge logicielle avant d'effectuer cette modification.
Vérifiez l'API avant les tests de charge
Dans un autre shell, définissez la même clé VLLM_API_KEY et interrogez la liste des modèles. Une requête de complétion de chat nécessite également un modèle avec un modèle de chat approprié ; un lancement réussi du serveur ne garantit pas que chaque tâche API soit prise en charge.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"Utilisez l'identifiant de modèle signalé par le serveur dans les requêtes client. Gardez l'authentification activée pendant les tests.
Mesurez la capacité soutenue
Rejouez des requêtes assainies avec les longueurs d'invite, les limites de sortie et la concurrence prévues. Enregistrez le délai jusqu'au premier jeton, la latence de bout en bout, le débit, le taux d'erreur, l'utilisation de la mémoire GPU et la capacité du cache KV signalée par le serveur.
Mesurez le chargement à froid du modèle séparément du service en régime permanent. Augmentez la concurrence progressivement. Si la mémoire devient la limite, évaluez un contexte/concurrency plus faible, un format de quantification adapté ou davantage de mémoire avant de supposer que plus de calcul aidera.
Convertissez le travail effectué en coût en utilisant le prix de réservation fixe. Un chiffre de jetons par seconde en vedette n'est pas une promesse de capacité, et nous ne revendiquons pas de résultats de référence AnchorGPU dans ce guide.
Résoudre les modes de défaillance courants
Échec de la requête de chat : vérifiez le modèle de chat du modèle et la tâche API prise en charge. Échec de mémoire après augmentation de la charge : vérifiez la pression du cache KV, le contexte et la concurrence. Blocage de l'initialisation multi-GPU : confirmez les périphériques visibles, les bibliothèques collectives et la validité de la division en parallélisme de tenseurs.
Enregistrez la révision du modèle, le condensat du conteneur, la configuration de lancement, les résultats de validation et le contrat client API. Copiez les artefacts opérationnels hors du nœud avant de le libérer.
Lire le guide du cycle de vie des instances