Dezkubeدزکوب

فناوری · GPU و هوش مصنوعی

NVIDIA GPU Operator در دزکوب

مدیریت درایور و زمان اجرای GPU

نسخهٔ پین‌شده
⟦V_NVIDIA_GPU_OPERATOR⟧
لایسنس
Apache 2.0
گروه در استک
GPU و هوش مصنوعی

NVIDIA GPU Operator چیست

اپراتوری که چرخهٔ کامل GPU روی نودهای Kubernetes را مدیریت می‌کند: درایور، زمان اجرای container، افزونهٔ دستگاه، و متریک سلامت.

چرا این را انتخاب کردیم

گزینه‌هایی که بررسی و رد شدند، و دلیل رد هر کدام
گزینه‌ای که رد شدچرا نه
نصب دستی درایور روی هر نودبا ناوگان ناهمگون، کابوس نگهداری است
بدون اپراتورارتقای درایور، یک عملیات دستی و پرریسک

ما دقیقاً چطور استفاده‌اش می‌کنیم

  • کشف خودکار کارت‌ها، مدل، حافظه و قابلیت‌ها روی هر نود.
  • برنامهٔ درایور به‌ازای مدل کارت — چون در ناوگان ناهمگون، یک برنامهٔ واحد بعضی نودها را خراب می‌کند.
  • بررسی پیش‌نیاز نود پیش از نصب، با گزارش جداگانه به‌ازای هر نود.
  • برش MIG برای تقسیم سخت‌افزاری کارت.
  • اشتراک زمانی برای وقتی که فقط می‌خواهید کارت بیکار نماند.
  • متریک DCGM برای دما، مصرف، استفاده و خطا — با cordon خودکار در صورت خرابی.
  • نصب از منبع تأییدشده در فهرست مجاز.

برای شما چه چیزی عوض می‌شود

  • درایور دستی روی هر نودمدیریت‌شده
  • ناوگان ناهمگون = دردسربرنامهٔ درایور به‌ازای مدل
  • کارت خراب، بی‌صدا خطا می‌دهدcordon خودکار با متریک

مرزها و محدودیت‌ها

این سکشن در هر صفحهٔ فناوری اجباری است. هر ابزاری مرزی دارد؛ صفحه‌ای که مرزش را نگوید، بقیه‌اش هم قابل اتکا نیست.

  • MIG فقط روی کارت‌هایی که پشتیبانی می‌کنند در دسترس است. برای بقیه، اشتراک زمانی تنها گزینه است.
  • ارتقای درایور نیاز به راه‌اندازی مجدد بار کاری GPU دارد. باید در پنجرهٔ نگهداری برنامه‌ریزی شود.
  • این اپراتور مخصوص یک تولیدکنندهٔ کارت است. پشتیبانی از سایر شتاب‌دهنده‌ها در دامنهٔ فعلی نیست — صادقانه می‌گوییم.

این را روی زیرساخت خودتان ببینید.

همین مؤلفه را در کلاستر شما پیکربندی می‌کنیم و نشان می‌دهیم.