AGAnchorGPU

İş yükü kılavuzları

vLLM ile bir LLM sunun

Bellek ve eşzamanlılığı planlayın, bir vLLM uç noktası yapılandırın ve temsili bir çıkarım iş yükünü doğrulayın.

9 dk okuma · Güncellendi

Sunum sözleşmesini tanımlayın

Model tanımlayıcısını ve revizyonunu, ağırlık biçimini, nicemlemeyi, maksimum bağlam uzunluğunu, istem uzunluğu dağılımını, eşzamanlılığı ve gecikme hedefini kaydedin. Bu ayarlar iş yükünün bir parçasıdır, isteğe bağlı kıyaslama notları değildir.

Ağırlıklar, GPU belleğini KV önbelleği ve geçici çalışma alanlarıyla paylaşır. Kısa bir istemle başarıyla yüklenen bir model, amaçlanan trafik altında yine de bellek yetersizliği yaşayabilir. İşletim payı bırakın ve izin verilen en uzun istekleri test edin.

Uygun olduğunda tek bir GPU ile başlayın

Tek bir GPU, GPU'lar arası iletişimi önler ve ilk dağıtımın tanılanmasını kolaylaştırır. Model ve gerekli çalışma zamanı durumu tek bir hızlandırıcıya sığmadığında veya temsili bir ölçüm bölmeyi haklı çıkardığında tensör paralelliğini değerlendirin.

Bağımsız çoğaltmalar ayrı istekleri karşılar; tensör paralelliği model hesaplamasını böler. Farklı sorunları çözerler. Birkaç kartlı bir katalog düğümü, tek başına belirli bir ara bağlantıyı kanıtlamaz.

H100 SXM ile H100 PCIe karşılaştırın

Tüm ortamı doğrulayın

AnchorGPU vllm görüntüsü, katalogda NVIDIA ve AMD için kullanılabilir. Gerçek yürütmeden önce, gerçek sürücüyü, CUDA veya ROCm çalışma zamanını, PyTorch, Python ve vLLM sürümlerini belirleyin. Model mimarisini, nicemleme desteğini ve derlenmiş dikkat çekirdeklerini birlikte kontrol edin.

Bu yerel site yapılandırmaları kaydeder ancak uzak bir model sunucusu çalıştırmaz. Aşağıdaki komutlar, gerekli yazılım ve model erişimine sahip gerçek, sağlanmış bir Linux düğümünde kullanılmalıdır.

Özel bir uç nokta başlatın

Sunucuyu başlatmak için kullanılan kabukta modeli ve özel bir API anahtarını ayarlayın. Her iki yer tutucuyu da değiştirin. Anahtar bir vLLM sunum kimlik bilgisidir; AnchorGPU hesabı API anahtarınız değildir. Doğrulama sırasında geri döngüye bağlayın; uzaktan erişim için kimliği doğrulanmış bir TLS veya özel ağ yolu gerekir.

export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000

Aynı düğümde dört görünür GPU'ya bilinçli olarak bölünmüş bir model için --tensor-parallel-size 4 ekleyin. Bu değişikliği yapmadan önce donanım düzenini ve yazılım desteğini doğrulayın.

Yük testinden önce API'yi kontrol edin

Başka bir kabukta aynı VLLM_API_KEY değerini ayarlayın ve model listesini sorgulayın. Sohbet tamamlama isteği ayrıca uygun bir sohbet şablonuna sahip bir model gerektirir; başarılı bir sunucu başlatma, her API görevinin desteklendiğini garanti etmez.

curl http://127.0.0.1:8000/v1/models \
  -H "Authorization: Bearer $VLLM_API_KEY"

İstemci isteklerinde sunucu tarafından bildirilen model tanımlayıcısını kullanın. Test sırasında kimlik doğrulamayı etkin tutun.

Sürdürülebilir kapasiteyi ölçün

Amaçlanan istem uzunlukları, çıktı sınırları ve eşzamanlılıkla temizlenmiş istekleri yeniden oynatın. İlk belirtece kadar geçen süreyi, uçtan uca gecikmeyi, verimi, hata oranını, GPU bellek kullanımını ve sunucu tarafından bildirilen KV önbellek kapasitesini kaydedin.

Soğuk model yüklemeyi kararlı durum sunumundan ayrı ölçün. Eşzamanlılığı kademeli olarak artırın. Bellek sınırlayıcı hale gelirse, daha fazla hesaplamanın yardımcı olacağını varsaymadan önce daha düşük bağlam/concurrency, uygun bir nicemleme biçimi veya daha fazla bellek değerlendirin.

Tamamlanan işi sabit rezervasyon fiyatını kullanarak maliyete dönüştürün. Saniye başına jeton sayısı başlığı bir kapasite vaadi değildir ve bu kılavuzda AnchorGPU kıyaslama sonuçları iddia etmiyoruz.

Yaygın hata modlarını çözün

Sohbet isteği başarısız oluyor: modelin sohbet şablonunu ve desteklenen API görevini kontrol edin. Yükleme sonrası bellek hatası artıyor: KV önbellek baskısını, bağlamı ve eşzamanlılığı kontrol edin. Çoklu GPU başlatma takılıyor: görünür aygıtları, toplu iletişim kitaplıklarını ve tensör-paralel bölmenin geçerliliğini doğrulayın.

Model revizyonunu, kapsayıcı özetini, başlatma yapılandırmasını, doğrulama sonuçlarını ve istemci API sözleşmesini kaydedin. Düğümü serbest bırakmadan önce operasyonel yapıtları düğümden kopyalayın.

Örnek yaşam döngüsü kılavuzunu okuyun

Kaynaklar ve ek okumalar

vLLM GPU kurulumuvLLM paralellik ve ölçeklemevLLM hızlı başlangıç ve kimlik doğrulamavLLM çevrimiçi sunum
Bir çıkarım düğümü yapılandırın