İş yükü kılavuzları
vLLM ile bir LLM sunun
Bellek ve eşzamanlılığı planlayın, bir vLLM uç noktası yapılandırın ve temsili bir çıkarım iş yükünü doğrulayın.
9 dk okuma · GüncellendiSunum sözleşmesini tanımlayın
Model tanımlayıcısını ve revizyonunu, ağırlık biçimini, nicemlemeyi, maksimum bağlam uzunluğunu, istem uzunluğu dağılımını, eşzamanlılığı ve gecikme hedefini kaydedin. Bu ayarlar iş yükünün bir parçasıdır, isteğe bağlı kıyaslama notları değildir.
Ağırlıklar, GPU belleğini KV önbelleği ve geçici çalışma alanlarıyla paylaşır. Kısa bir istemle başarıyla yüklenen bir model, amaçlanan trafik altında yine de bellek yetersizliği yaşayabilir. İşletim payı bırakın ve izin verilen en uzun istekleri test edin.
Uygun olduğunda tek bir GPU ile başlayın
Tek bir GPU, GPU'lar arası iletişimi önler ve ilk dağıtımın tanılanmasını kolaylaştırır. Model ve gerekli çalışma zamanı durumu tek bir hızlandırıcıya sığmadığında veya temsili bir ölçüm bölmeyi haklı çıkardığında tensör paralelliğini değerlendirin.
Bağımsız çoğaltmalar ayrı istekleri karşılar; tensör paralelliği model hesaplamasını böler. Farklı sorunları çözerler. Birkaç kartlı bir katalog düğümü, tek başına belirli bir ara bağlantıyı kanıtlamaz.
H100 SXM ile H100 PCIe karşılaştırınTüm ortamı doğrulayın
AnchorGPU vllm görüntüsü, katalogda NVIDIA ve AMD için kullanılabilir. Gerçek yürütmeden önce, gerçek sürücüyü, CUDA veya ROCm çalışma zamanını, PyTorch, Python ve vLLM sürümlerini belirleyin. Model mimarisini, nicemleme desteğini ve derlenmiş dikkat çekirdeklerini birlikte kontrol edin.
Bu yerel site yapılandırmaları kaydeder ancak uzak bir model sunucusu çalıştırmaz. Aşağıdaki komutlar, gerekli yazılım ve model erişimine sahip gerçek, sağlanmış bir Linux düğümünde kullanılmalıdır.
Özel bir uç nokta başlatın
Sunucuyu başlatmak için kullanılan kabukta modeli ve özel bir API anahtarını ayarlayın. Her iki yer tutucuyu da değiştirin. Anahtar bir vLLM sunum kimlik bilgisidir; AnchorGPU hesabı API anahtarınız değildir. Doğrulama sırasında geri döngüye bağlayın; uzaktan erişim için kimliği doğrulanmış bir TLS veya özel ağ yolu gerekir.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000Aynı düğümde dört görünür GPU'ya bilinçli olarak bölünmüş bir model için --tensor-parallel-size 4 ekleyin. Bu değişikliği yapmadan önce donanım düzenini ve yazılım desteğini doğrulayın.
Yük testinden önce API'yi kontrol edin
Başka bir kabukta aynı VLLM_API_KEY değerini ayarlayın ve model listesini sorgulayın. Sohbet tamamlama isteği ayrıca uygun bir sohbet şablonuna sahip bir model gerektirir; başarılı bir sunucu başlatma, her API görevinin desteklendiğini garanti etmez.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"İstemci isteklerinde sunucu tarafından bildirilen model tanımlayıcısını kullanın. Test sırasında kimlik doğrulamayı etkin tutun.
Sürdürülebilir kapasiteyi ölçün
Amaçlanan istem uzunlukları, çıktı sınırları ve eşzamanlılıkla temizlenmiş istekleri yeniden oynatın. İlk belirtece kadar geçen süreyi, uçtan uca gecikmeyi, verimi, hata oranını, GPU bellek kullanımını ve sunucu tarafından bildirilen KV önbellek kapasitesini kaydedin.
Soğuk model yüklemeyi kararlı durum sunumundan ayrı ölçün. Eşzamanlılığı kademeli olarak artırın. Bellek sınırlayıcı hale gelirse, daha fazla hesaplamanın yardımcı olacağını varsaymadan önce daha düşük bağlam/concurrency, uygun bir nicemleme biçimi veya daha fazla bellek değerlendirin.
Tamamlanan işi sabit rezervasyon fiyatını kullanarak maliyete dönüştürün. Saniye başına jeton sayısı başlığı bir kapasite vaadi değildir ve bu kılavuzda AnchorGPU kıyaslama sonuçları iddia etmiyoruz.
Yaygın hata modlarını çözün
Sohbet isteği başarısız oluyor: modelin sohbet şablonunu ve desteklenen API görevini kontrol edin. Yükleme sonrası bellek hatası artıyor: KV önbellek baskısını, bağlamı ve eşzamanlılığı kontrol edin. Çoklu GPU başlatma takılıyor: görünür aygıtları, toplu iletişim kitaplıklarını ve tensör-paralel bölmenin geçerliliğini doğrulayın.
Model revizyonunu, kapsayıcı özetini, başlatma yapılandırmasını, doğrulama sonuçlarını ve istemci API sözleşmesini kaydedin. Düğümü serbest bırakmadan önce operasyonel yapıtları düğümden kopyalayın.
Örnek yaşam döngüsü kılavuzunu okuyun