GPU iş yükü kılavuzu
Üretimde LLM çıkarımı için GPU seçimi
Model boyutu, nicemleme, bağlam, toplu işleme ve gecikme hedeflerinin en iyi GPU'yu ve istek başına gerçek maliyeti nasıl değiştirdiği.
AnchorGPU tarafından · Güncellendi · 7 dk okumaSunum sözleşmesini belirtin
Etkileşimli sunumu çevrimdışı toplu işten ayırın. Maksimum istem uzunluğunu, tipik ve maksimum çıktı uzunluğunu, hedef eşzamanlılığı, ilk belirtece kadar geçen süreyi, belirteçler arası gecikmeyi ve hata toleransını tanımlayın. Tek bir kısa istek kapasite testi değildir.
Donanım karşılaştırırken model ve tokenizer revizyonlarını, nicemleme biçimini, sohbet şablonunu ve kod çözme ayarlarını sabit tutun. Aksi takdirde daha hızlı bir sonuç, GPU'dan değil farklı bir iş yükünden veya kalite ödününden kaynaklanabilir.
Model ağırlıklarından daha fazlasını bütçeleyin
Çıkarım; model ağırlıkları, çalışma zamanı tamponları, aktivasyonlar ve genellikle aktif diziler için bir KV önbelleği gerektirir. Daha fazla eşzamanlı dizi ve daha uzun bağlamlar gerekli belleği değiştirir. Niceleme desteği ve çıktı kalitesi üzerindeki etkisi, seçilen çalışma zamanında doğrulanmalıdır.
24 GB veya 48 GB kart, sığan bir model için adaydır; parametre boyutu sınıfındaki her modelin çalışacağına dair bir söz değildir. Gerçek modeli ve bağlam sınırını test edin. Daha büyük bellekli hızlandırıcılar, bölümlemeyi azalttıklarında veya ölçülen eşzamanlılık payı sağladıklarında yararlıdır.
Çoğaltmalar mı yoksa dağıtılmış bir model mi?
Model tek bir GPU'ya sığıyorsa, bağımsız çoğaltmalar daha fazla isteği karşılamanın basit bir yolu olabilir. Tensör paralelliği modelin parçalarını dağıtır ve hızlandırıcılar arasında iletişim getirir. Boru hattı paralelliğinin farklı yerleşim ve kullanım ödünleşimleri vardır.
Kart sayısını seçmeden önce güncel vLLM yönergelerini ve teslim edilen makine topolojisini kontrol edin. SXM, PCIe, dört kart veya toplam VRAM sayısının belirli bir bağlı dokuyu ima ettiğini varsaymayın.
Zamanlamadan önce yazılım yığınını doğrulayın
Sürücüyü, CUDA veya ROCm derlemesini, GPU mimarisi desteğini ve modelinizin gereksinim duyduğu operatörlerin kullanılabilirliğini doğrulayın. Kapsayıcı etiketleri sabitlenmeli ve yeni bir ortam aynı sunum sonucunu yeniden üretmelidir.
İlk testi geri döngüye bağlayın, bir API anahtarı kullanın ve kimliği doğrulanmamış bir model uç noktası açığa çıkarmayın. Uzaktan erişim, TLS, giriş denetimleri ve hizmet izleme açık bir dağıtım yapılandırması gerektirir; bir katalog görüntüsü seçilerek oluşturulmazlar.
Gerçekçi trafiği ölçün
Sunucuyu ısıtın ve model yükleme süresini kararlı durum sonuçlarından ayırın. İstem uzunlukları, çıktı uzunlukları ve eşzamanlı isteklerden oluşan temsilî bir karışımı yeniden oynatın. Kabul edilen istek verimini, p95 gecikmesini, hataları ve bellek kullanımını birlikte raporlayın.
Gecikme veya güvenilirlik hedefi karşılanmayana kadar trafiği artırın, ardından kapasite payı bırakın. Soğuk başlatma ve kurtarma testlerini ayrı tutun: operasyonel hazırlık, bir süreç veya düğüm arızasından sonra hizmeti geri yüklemeyi de içerir.
Yararlı çıktının maliyetini karşılaştırın
Ölçülen bir aralık için, o aralığa atfedilebilen toplam tahsis maliyetini başarıyla teslim edilen çıktıya bölün. Milyon token başına maliyet bildiriyorsanız, girdi ve çıktı tokenlarının dahil olup olmadığını belirtin ve her aday için aynı kuralı kullanın.
Sabit 7 veya 30 günlük bir kiralama, boşta geçen süre dahil tüm dönem için ödenir. Yapılandırmaları karşılaştırmadan önce kullanımı açıkça projelendirin ve seçenekleri dahil edin. AnchorGPU katalog fiyatları modellenmiş girdilerdir; burada canlı hizmet kıyaslaması veya üretim kullanılabilirliği iddia edilmez.
Kaynaklar ve editoryal yöntem
Resmi belgeler teknik açıklamaları destekler. Donanım önerileri, ölçülmüş bir performans garantisi değil, iş yüküne bağlı yorumumuzdur.
vLLM — hızlı başlangıç ve sunum ↗vLLM — dağıtık sunum ve paralellik ↗vLLM — GPU kurulum gereksinimleri ↗