منصة Vera Rubin تمثل انتقال NVIDIA من بيع «GPU أسرع» إلى تصميم منظومة مركز بيانات متكاملة تشمل الحوسبة، الشبكات، المعالجات والبرمجيات. أما NVL72 فيشير إلى بنية رف عالية الكثافة تربط عددًا كبيرًا من المسرّعات للعمل كنظام واحد.
المكوّنات الرئيسية
| المكوّن | الدور |
|---|---|
| Rubin GPU | تدريب واستدلال نماذج الذكاء الاصطناعي |
| Vera CPU | إدارة الأحمال وتغذية المسرّعات بالبيانات |
| NVLink / NVLink Switch | اتصال عالي السرعة داخل المنظومة |
| شبكات Spectrum-X أو InfiniBand | ربط الرفوف والعناقيد |
| برمجيات NVIDIA AI | تحسين التدريب والاستدلال والإدارة |
لماذا tokens per watt مهمة؟
في الاستدلال واسع النطاق، تكلفة النموذج ليست سعر المسرّع فقط. الطاقة والتبريد والشبكة ومعدل الاستفادة تحدد تكلفة الرمز الفعلية. تحسن الأداء لكل واط يمكن أن يخفض تكلفة الخدمة حتى لو كان سعر المنصة مرتفعًا.
أين تأتي NVL72؟
الهدف هو تقليل عنق الزجاجة عند تقسيم نموذج ضخم بين مسرّعات متعددة. كلما زادت سرعة الاتصال وذاكرته الفعالة، أمكن التعامل مع نماذج وسياقات أكبر بزمن استجابة أفضل.
هل تناسب كل جهة؟
لا. الجهات التي تدرب نماذج عملاقة أو تخدم أحمال استدلال ضخمة قد تستفيد، بينما مشاريع RAG الداخلية الصغيرة قد تكون أكثر كفاءة على عدد محدود من الخوادم أو مسرّعات أقل تكلفة. القرار الصحيح يبدأ بقياس عدد الطلبات، طول السياق، SLA، والطاقة المتاحة.
قائمة قرار الشراء
- هل الحمل تدريب أم استدلال؟
- ما حجم النموذج والدقة المطلوبة؟
- ما سعة الطاقة والتبريد؟
- هل الشبكة والتخزين يواكبان المسرّعات؟
- ما تكلفة ثلاث إلى خمس سنوات لا سعر الشراء فقط؟
اترك تعليقاً