أدلة أعباء العمل
تقديم نموذج لغة كبير باستخدام vLLM
خطط للذاكرة والتزامن، واضبط نقطة نهاية vLLM وتحقق من عبء عمل استدلال تمثيلي.
9 دقيقة قراءة · تم التحديثحدد عقد التقديم
سجّل معرّف النموذج ومراجعته، وصيغة الأوزان، والتكميم، والحد الأقصى لطول السياق، وتوزيع طول الموجهات، والتزامن، وهدف زمن الاستجابة. هذه الإعدادات جزء من عبء العمل، وليست ملاحظات قياس أداء اختيارية.
تشارك الأوزان ذاكرة وحدة معالجة الرسومات مع ذاكرة التخزين المؤقت KV ومساحات العمل المؤقتة. قد ينفد النموذج الذي يُحمَّل بنجاح بموجه قصير واحد من الذاكرة تحت حركة المرور المقصودة. احتفظ بهامش تشغيل واختبر أطول الطلبات المسموح بها.
ابدأ بوحدة معالجة رسومات واحدة عندما يكون ذلك مناسبًا
تتجنب وحدة GPU واحدة الاتصال بين وحدات GPU وتجعل النشر الأول أسهل في التشخيص. فكّر في التوازي الموتر عندما لا يتسع النموذج وحالة التشغيل المطلوبة في مسرّع واحد، أو عندما يبرر قياس تمثيلي تقسيمه.
تخدم النسخ المتماثلة المستقلة طلبات منفصلة؛ بينما يقسم التوازي الموتر حساب النموذج. إنهما يحلان مشكلتين مختلفتين. عقدة الكتالوج التي تحتوي على عدة بطاقات لا تثبت بحد ذاتها وجود ترابط معين.
قارن H100 SXM مع H100 PCIeتأهيل البيئة الكاملة
صورة vllm من AnchorGPU متاحة لـ NVIDIA وAMD في الكتالوج. قبل التنفيذ الفعلي، حدد التعريف الفعلي، وبيئة تشغيل CUDA أو ROCm، وإصدارات PyTorch وPython وvLLM. تحقق من معمارية النموذج ودعم التكميم وأي نوى انتباه مجمعة معًا.
يحفظ هذا الموقع المحلي الإعدادات لكنه لا يشغّل خادم نماذج عن بُعد. تنتمي الأوامر التالية إلى عقدة Linux حقيقية مُجهزة بالبرمجيات المطلوبة وإمكانية الوصول إلى النموذج.
إطلاق نقطة نهاية خاصة
عيّن النموذج ومفتاح API خاص في الصدفة المستخدمة لتشغيل الخادم. استبدل كلا العنصرين النائبين. المفتاح هو اعتماد تقديم vLLM، وليس مفتاح AnchorGPU API الخاص بحسابك. اربط بواجهة الاسترجاع أثناء التحقق؛ يحتاج الوصول عن بُعد إلى مسار TLS موثق أو شبكة خاصة.
export MODEL_ID="your-organization/your-model"
export VLLM_API_KEY="replace-with-a-private-serving-key"
vllm serve "$MODEL_ID" --host 127.0.0.1 --port 8000لتقسيم نموذج عمدًا عبر أربع وحدات معالجة رسومات مرئية على العقدة نفسها، أضف --tensor-parallel-size 4. تأكد من تخطيط العتاد ودعم البرمجيات قبل إجراء هذا التغيير.
تحقق من API قبل اختبار الحمل
في طرفية أخرى، عيّن مفتاح VLLM_API_KEY نفسه واستعلم عن قائمة النماذج. يتطلب طلب إكمال المحادثة أيضًا نموذجًا بقالب محادثة مناسب؛ ولا يضمن نجاح إطلاق الخادم دعم كل مهمة من مهام API.
curl http://127.0.0.1:8000/v1/models \
-H "Authorization: Bearer $VLLM_API_KEY"استخدم معرّف النموذج الذي أبلغ عنه الخادم في طلبات العميل. حافظ على تمكين المصادقة أثناء الاختبار.
قياس السعة المستدامة
أعد تشغيل الطلبات المعقمة بأطوال المطالبات وحدود الإخراج والتزامن المقصودة. سجّل الوقت حتى أول رمز، وزمن الانتقال الكلي، والإنتاجية، ومعدل الخطأ، واستخدام ذاكرة GPU، وسعة ذاكرة KV المؤقتة التي يبلغ عنها الخادم.
قس تحميل النموذج البارد بشكل منفصل عن الخدمة في الحالة المستقرة. زد التزامن تدريجيًا. إذا أصبحت الذاكرة هي العائق، فقيّم سياقًا أقل/concurrency أو صيغة تكميم مناسبة أو ذاكرة أكبر قبل افتراض أن المزيد من الحوسبة سيساعد.
حوّل العمل المكتمل إلى تكلفة باستخدام سعر الحجز الثابت. رقم الرموز في الثانية الرئيسي ليس وعدًا بالسعة، ولا ندعي نتائج معايير AnchorGPU في هذا الدليل.
عالج أنماط الفشل الشائعة
فشل طلب الدردشة: تحقق من قالب الدردشة الخاص بالنموذج ومهمة API المدعومة. فشل الذاكرة بعد زيادة التحميل: تحقق من ضغط ذاكرة التخزين المؤقت KV والسياق والتزامن. توقف تهيئة وحدات معالجة الرسومات المتعددة: تأكد من الأجهزة المرئية ومكتبات الاتصال الجماعي وصحة تقسيم التوتر المتوازي.
احفظ مراجعة النموذج، وبصمة الحاوية، وإعدادات الإطلاق، ونتائج التحقق، وعقد API الخاص بالعميل. انسخ القطع التشغيلية بعيدًا عن العقدة قبل تحريرها.
اقرأ دليل دورة حياة المثيل