AGAnchorGPU
← جميع الأدلة الهندسية

دليل أعباء عمل وحدات معالجة الرسومات

ما مقدار VRAM لوحدة معالجة الرسومات الذي تحتاجه فعليًا؟

ميزانية ذاكرة عملية للاستدلال والضبط الدقيق وتوليد الصور وأعباء عمل الفيديو — من 24 GB إلى 192 GB.

بقلم AnchorGPU · حُدّث في · 6 دقائق قراءة

VRAM ميزانية، وليست تسمية طراز

تستهلك ذاكرة وحدة معالجة الرسومات عدة فئات مستقلة: أوزان النموذج، وذاكرة التخزين المؤقت KV للاستدلال، والتفعيلات المؤقتة، ومساحات عمل الإطار، وذاكرة المخصص المؤقتة، وأثناء التدريب أيضًا التدرجات وحالة المُحسِّن. لا يثبت ملاءمة نموذج في إعداد واحد أنه سيلائم سياقًا أطول أو دفعة أكبر أو دقة مختلفة أو طلبات متزامنة أكثر.

خطط انطلاقًا من مراجعة النموذج الدقيقة وإعدادات وقت التشغيل. تصف التسميات مثل 7B أو 13B أو 70B مقياس المعلمات، وليس إجمالي ذاكرة التشغيل، لذا يجب ألا تُربط بوحدة معالجة رسومات بشكل عام أبدًا.

قدّر الأوزان الأولية أولاً

كمثال افتراضي صريح، افترض أن نموذجًا يحتوي على 13 مليار معلمة بالضبط ويخزن كل معلمة بتنسيق 16 بت. تخزين الأوزان الخام هو 13,000,000,000 × 2 بايت = 26,000,000,000 بايت، أو حوالي 24.2 GiB. يستبعد هذا الرقم كل تخصيص آخر، لذا فهو حد أدنى وليس توصية بوحدة معالجة رسوميات.

يمكن أن يقلل التكميم من تخزين الأوزان، لكن البصمات الحقيقية تشمل أيضًا المقاييس والبيانات الوصفية ومخازن إلغاء التكميم والموترات المكررة ومساحات العمل في وقت التشغيل. استخدم التنسيق الذي ينتجه المحمّل الفعلي بدلًا من قسمة عدد المعلمات على عرض بت اسمي ومعاملة النتيجة كنهائية.

يضيف الاستدلال ذاكرة تخزين مؤقت KV وذاكرة عمل

يحتفظ التقديم التلقائي الانحداري بموترات المفاتيح والقيم للتسلسلات النشطة. يعتمد الطلب على ذاكرة KV المؤقتة على بنية النموذج، ودقة الذاكرة المؤقتة، والتسلسلات المتزامنة، وعدد الرموز الحية عبر تلك التسلسلات. قد تؤدي زيادة الحد الأقصى للسياق أو التزامن إلى استنفاد الذاكرة حتى عند تحميل الأوزان بنجاح.

تستهلك التفعيلات المؤقتة ومساحات عمل الانتباه والنوى المترجمة ومخازن الاتصال ومخصص الإطار ذاكرة إضافية. يعرض vLLM سعة ذاكرة التخزين المؤقت KV المتاحة لوحدة معالجة الرسومات وتزامنًا تقديريًا لطول التسلسل المحدد؛ تعامل مع هذه الأرقام الأولية كدليل تخطيط، ثم أعد تشغيل مطالبات تمثيلية قبل الالتزام بعبء عمل إنتاجي.

للتدريب شكل ذاكرة مختلف

يضيف الضبط الدقيق تدرجات وحالة المُحسِّن وتنشيطات محفوظة وأحيانًا نسخًا إضافية بدقة كاملة. يعتمد حجمها الدقيق على المُحسِّن وسياسة الدقة ومجموعة المعلمات القابلة للتدريب واستراتيجية التجزئة، لذا فإن مضاعف الاستدلال الواحد مضلل.

يقوم DistributedDataParallel بتكرار حالة التدريب التي يحتاجها كل عامل؛ ولا يحوّل عدة وحدات GPU إلى تجمع ذاكرة متصل واحد. يمكن لـ Fully Sharded Data Parallel تجزئة المعاملات والتدرجات وحالات المُحسِّن عبر العمال، بينما يقلل checkpointing التنشيطي من ذاكرة التنشيطات المحفوظة عن طريق إعادة حساب أعمال محددة أثناء المرور الخلفي. وتستبدل كلتا التقنيتين البساطة أو الحوسبة بالذاكرة.

قِس الإعداد الذي ستشغّله

اختبر تحميل النموذج وطلب استدلال تمثيلي كامل أو خطوة تدريب، بما في ذلك تحديث المُحسِّن، باستخدام الإطار والدقة والسياق والدفعة وإعدادات التوازي المحددة. سجّل الذاكرة المخصصة والمحجوزة القصوى، ثم كرر ذلك مع تزامن واقعي أو تراكم التدرجات. اترك هامش تشغيل بدلاً من استهداف آخر بايت متاح.

اختر GPU بذاكرة أكبر عندما لا يمكن تقليل الذروة المقاسة بأمان. أضف وحدات GPU فقط عندما تقوم البرمجيات صراحةً بتجزئة النموذج أو عبء العمل ويكون الربط الداخلي المقدم معروفًا. أعد إجراء القياس بعد أي تغيير في النموذج أو بيئة التشغيل أو التكميم أو السياق أو حجم الدفعة.

المصادر والمنهج التحريري

تدعم الوثائق الرسمية الشروحات التقنية. توصيات الأجهزة هي تفسيرنا المعتمد على عبء العمل، وليست ضمانًا للأداء المقاس.

vLLM — التوازي والتوسعPyTorch — FullyShardedDataParallelPyTorch — نقاط فحص التنشيط