دليل أعباء عمل وحدات معالجة الرسومات
اختيار وحدة معالجة رسوميات لاستدلال نماذج اللغة الكبيرة في الإنتاج
كيف يغير حجم النموذج والتكميم والسياق والتجميع وأهداف زمن الاستجابة أفضل وحدة معالجة رسومات — والتكلفة الحقيقية لكل طلب.
بقلم AnchorGPU · حُدّث في · 7 دقائق قراءةحدد عقد التقديم
افصل بين التقديم التفاعلي وأعمال الدُفعات غير المتصلة. حدد الحد الأقصى لطول الموجه، وطول الإخراج النموذجي والأقصى، والتزامن المستهدف، والوقت حتى أول رمز، وزمن الانتقال بين الرموز، وتحمل الأخطاء. الطلب القصير الواحد ليس اختبارًا للسعة.
حافظ على ثبات مراجعات النموذج والمحلل اللغوي، وتنسيق التكميم، وقالب المحادثة، وإعدادات فك الترميز عند مقارنة الأجهزة. وإلا فقد تأتي النتيجة الأسرع من عبء عمل مختلف أو مقايضة في الجودة بدلاً من وحدة معالجة الرسومات.
خصص ميزانية أكبر من أوزان النموذج
يحتاج الاستدلال إلى أوزان النموذج ومخازن وقت التشغيل والتفعيلات وعادةً ذاكرة تخزين مؤقت KV للتسلسلات النشطة. يؤدي زيادة التسلسلات المتزامنة والسياقات الأطول إلى تغيير الذاكرة المطلوبة. يحتاج دعم التكميم وتأثيره على جودة المخرجات إلى التحقق على وقت التشغيل المختار.
بطاقة 24 GB أو 48 GB مرشحة لنموذج يناسبها، وليست وعدًا بأن كل نموذج في فئة حجم معلمات سيعمل. اختبر النموذج الفعلي وحد السياق. تكون المسرعات ذات الذاكرة الأكبر مفيدة عندما تقلل التقسيم أو توفر هامش تزامن مقيس.
نسخ متماثلة أم نموذج موزع؟
إذا كان النموذج يتسع على وحدة معالجة رسوميات واحدة، فقد تكون النسخ المتماثلة المستقلة طريقة مباشرة لخدمة المزيد من الطلبات. يوزع التوازي الموتر أجزاءً من النموذج ويُدخل اتصالًا بين المسرعات. للتوازي الأنبوبي مقايضات مختلفة في التموضع والاستخدام.
راجع إرشادات vLLM الحالية وطوبولوجيا الجهاز المسلَّم قبل اختيار عدد البطاقات. لا تفترض أن SXM أو PCIe أو أربع بطاقات أو رقم VRAM إجمالي يعني نسيجًا متصلًا معينًا.
تأهيل حزمة البرامج قبل قياس الوقت
تأكد من التعريف، وبناء CUDA أو ROCm، ودعم معمارية وحدة معالجة الرسومات، وتوفر العوامل التي يحتاجها نموذجك. يجب تثبيت وسوم الحاويات، ويجب أن تعيد البيئة الجديدة إنتاج نتيجة التقديم نفسها.
اربط الاختبار الأول بواجهة الاسترجاع الحلقي، واستخدم مفتاح API ولا تعرض نقطة نهاية نموذج غير مصادق عليها. يتطلب الوصول عن بُعد وTLS وضوابط الدخول ومراقبة الخدمة إعداد نشر صريح؛ ولا تُنشأ تلقائيًا بمجرد اختيار صورة كتالوج.
قس حركة مرور واقعية
قم بتسخين الخادم وافصل زمن تحميل النموذج عن نتائج الحالة المستقرة. أعد تشغيل مزيج تمثيلي من أطوال المطالبات وأطوال المخرجات والطلبات المتزامنة. أبلغ عن إنتاجية الطلبات المقبولة وزمن الاستجابة p95 والأخطاء واستخدام الذاكرة معًا.
زد حركة المرور حتى يتوقف تحقيق هدف زمن الاستجابة أو الموثوقية، ثم اترك هامش سعة. أبقِ اختبارات البدء البارد والاسترداد منفصلة: تشمل الجاهزية التشغيلية استعادة الخدمة بعد فشل عملية أو عقدة.
قارن تكلفة المخرجات المفيدة
بالنسبة لفاصل زمني مُقاس، اقسم تكلفة التخصيص الكاملة المنسوبة إلى ذلك الفاصل على الناتج المُسلَّم بنجاح. إذا كنت تبلغ عن التكلفة لكل مليون رمز، فاذكر ما إذا كانت رموز الإدخال والإخراج مشمولة واستخدم الاصطلاح نفسه لكل مرشح.
يُدفع الإيجار الثابت لمدة 7 أو 30 يومًا عن المدة كاملة، بما في ذلك وقت الخمول. قدّر الاستخدام بوضوح وأدرج الخيارات قبل مقارنة التكوينات. أسعار كتالوج AnchorGPU هي مدخلات نموذجية؛ ولا يُزعم هنا وجود أي اختبار أداء مباشر أو توفر إنتاجي.
المصادر والمنهج التحريري
تدعم الوثائق الرسمية الشروحات التقنية. توصيات الأجهزة هي تفسيرنا المعتمد على عبء العمل، وليست ضمانًا للأداء المقاس.
vLLM — البدء السريع والتقديم ↗vLLM — التقديم الموزع والتوازي ↗vLLM — متطلبات تثبيت وحدة معالجة الرسومات ↗