NVIDIA Vera Rubin NVL72: كيف تغيّر تكلفة تشغيل الذكاء الاصطناعي؟

خوادم مركز بيانات
صورة توضيحية: Unsplash

منصة Vera Rubin تمثل انتقال NVIDIA من بيع «GPU أسرع» إلى تصميم منظومة مركز بيانات متكاملة تشمل الحوسبة، الشبكات، المعالجات والبرمجيات. أما NVL72 فيشير إلى بنية رف عالية الكثافة تربط عددًا كبيرًا من المسرّعات للعمل كنظام واحد.

المكوّنات الرئيسية

المكوّن الدور
Rubin GPU تدريب واستدلال نماذج الذكاء الاصطناعي
Vera CPU إدارة الأحمال وتغذية المسرّعات بالبيانات
NVLink / NVLink Switch اتصال عالي السرعة داخل المنظومة
شبكات Spectrum-X أو InfiniBand ربط الرفوف والعناقيد
برمجيات NVIDIA AI تحسين التدريب والاستدلال والإدارة

لماذا tokens per watt مهمة؟

في الاستدلال واسع النطاق، تكلفة النموذج ليست سعر المسرّع فقط. الطاقة والتبريد والشبكة ومعدل الاستفادة تحدد تكلفة الرمز الفعلية. تحسن الأداء لكل واط يمكن أن يخفض تكلفة الخدمة حتى لو كان سعر المنصة مرتفعًا.

أين تأتي NVL72؟

الهدف هو تقليل عنق الزجاجة عند تقسيم نموذج ضخم بين مسرّعات متعددة. كلما زادت سرعة الاتصال وذاكرته الفعالة، أمكن التعامل مع نماذج وسياقات أكبر بزمن استجابة أفضل.

هل تناسب كل جهة؟

لا. الجهات التي تدرب نماذج عملاقة أو تخدم أحمال استدلال ضخمة قد تستفيد، بينما مشاريع RAG الداخلية الصغيرة قد تكون أكثر كفاءة على عدد محدود من الخوادم أو مسرّعات أقل تكلفة. القرار الصحيح يبدأ بقياس عدد الطلبات، طول السياق، SLA، والطاقة المتاحة.

قائمة قرار الشراء

  • هل الحمل تدريب أم استدلال؟
  • ما حجم النموذج والدقة المطلوبة؟
  • ما سعة الطاقة والتبريد؟
  • هل الشبكة والتخزين يواكبان المسرّعات؟
  • ما تكلفة ثلاث إلى خمس سنوات لا سعر الشراء فقط؟

المصادر

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *