راهنمای کارتهای گرافیک انویدیا در سرور HPE DL380؛ استقرار GPU برای هوش مصنوعی (نسل ۱۰ و ۱۱)

این مطلب را خلاصه کن با:
کارت گرافیکهای سازگار با سرورهای HPE ProLiant DL380 شامل مدلهای دیتاسنتری با خنککننده Passive (بدون فن) مانند سری A100، L40S و A30 هستند؛ در حالی که کارتهای گرافیک دسکتاپ و گیمینگ (Active) به دلیل جریان هوای متمرکز و عدم تطابق با مسیر هوایی شاسی ۲ یونیت، برای استفاده در دیتاسنتر و سرورهای سازمانی مناسب نمیباشند.
در این میان، سرورهای رکمونت 2U دو سوکته، بهویژه ابرخانواده HPE ProLiant DL380، نقشی حیاتی در دیتاسنترها و اتاقهای سرور سازمانی در ایران ایفا میکنند. شاسی ۲ یونیت DL380 به سبب توازن هندسی، ماژولاریتی در رایزرها و سیستم بهینه مدیریت جریان هوا، پایدارترین پلتفرم سازمانی برای میزبانی از شتابدهندههای دیتاسنتری انویدیا است. با این حال، استقرار کارتهای گرافیک روی سرورهای DL380 Gen10 و DL380 Gen11 چالشهای مهندسی فراوانی نظیر بودجهبندی جریان برق پیوسته و پیکهای لحظهای (Transient Power Spikes)، نوع کیت خنککننده، مدیریت همبستگی گرههای NUMA و سازگاری میانافزار (Firmware/UEFI) را به همراه دارد.
اگر پیشتر راهنمای انتخاب سرور مناسب هوش مصنوعی را در ولکان سرور مطالعه کرده باشید، میدانید که انتخاب شتابدهنده گرافیکی تنها نیمی از مسیر است؛ نیمه مهمتر، اطمینان از سازگاری فیزیکی، تأمین توان الکتریکی پایدار و مهندسی حرارتی کارت روی سرور است. در این مرجع دایرهالمعارفی از ولکان سرور، لیست کامل کارتهای گرافیک انویدیا سازگار با سرورهای HPE DL380 Gen10 و Gen11 را به همراه پیشنیازهای سختافزاری، جداول مقایسه فنی و متدولوژی علمی نصب و کانفیگ GPU کالبدشکافی خواهیم کرد.
۱. مبانی معماری شاسی HPE DL380: چرا این پلتفرم استاندارد بیرقیب GPU Computing است؟
سرورهای فرمفاکتور 2U به دلیل عمق و حجم داخلی، مناسبترین فرم فاکتور رکمونت برای استقرار کارتهای گرافیک توان بالا هستند. سرورهای 1U (نظیر HPE DL360) به علت ارتفاع ۱.۷۵ اینچی، توان تخلیه حرارتی (CFM) کافی برای کارتهای پسیو پرمصرف ۳۰۰ تا ۳۵۰ واتی را ندارند و بهجز کارتهای باریک و کممصرف (Half-Height Single-Width)، توانایی میزبانی شتابدهندههای سنگین را دارا نیستند. برعکس، شاسی DL380 سه قابلیت محوری را در اختیار مهندسین زیرساخت میگذارد:
- ظرفیت فیزیکی رایزرها (PCIe Riser Architecture): شاسی DL380 از ۳ محفظه رایزر اصلی پشتیبانی میکند: رایزر اولیه (Primary Riser)، رایزر ثانویه (Secondary Riser) و رایزر سوم (Tertiary Riser). این ساختار امکان چینش منعطف تا حداکثر ۳ عدد کارت گرافیک با پهنای دوبل (Double-Width) نظیر A100 و L40S یا حداکثر ۶ تا ۸ کارت گرافیک تکاسلات (Single-Width) نظیر T4 و L4 را فراهم میسازد.
- داکت مهندسیشده خنککاری (Engineered Air Baffle): کارتهای سروری انویدیا فاقد پروانه خنککننده (Passive Heatsink) هستند. شاسی DL380 مجهز به ساختار تفکیک هوای بسته است که جریان هوای پرفشار کشیده شده توسط فنهای جلوی شاسی را بدون فرار از کنارهها، مستقیماً از میان فینهای هیتسینک مسی کارت عبور میدهد.
- ارتباط مستقیم خطوط با ریشههای سوکت پردازنده (Direct Root Complex Lanes): هیچ کارت گرافیکی روی چیپست مادربورد (PCH) سوار نمیشود. کلیه خطوط اسلاتهای رایزر از طریق کانکتورهای پرسرعت مادربورد مستقیماً به Laneهای کنترلر ورودی/خروجی درون تراشه پردازندههای Xeon متصل هستند، که زمان تأخیر انتقال داده را در محدوده نانوثانیه نگاه میدارد.
۲. مقایسه بنیادین گذرگاه PCIe 3.0 در Gen10 در برابر PCIe 5.0 در Gen11؛ گلوگاهها و پهنای باند
تفاوت نسل میان سرورهای HPE DL380 Gen10 و HPE DL380 Gen11 صرفاً به سال ساخت یا قدرت پردازشی خام هستههای CPU محدود نمیشود؛ تفاوت اصلی و تعیینکننده برای پردازشهای گرافیکی، در نسل گذرگاه ارتباطی PCIe و پهنای باند تبادل مستقیم داده نهفته است.
وضعیت گذرگاه در HPE ProLiant DL380 Gen10:
سرور نسل ۱۰ بر پایه پردازندههای نسل اول و دوم اینتل زئون مقیاسپذیر (Skylake-SP و Cascade Lake-SP) طراحی شده و بر استاندارد PCIe 3.0 متکی است:
- نرخ انتقال سیگنال خام: معادل 8.0 GT/s8.0\text{ GT/s}8.0 GT/s به ازای هر مسیر ارتباطی (Lane).
- بازدهی با احتساب کدگذاری 128b/130b: تقریباً معادل ۹۸۵ مگابایت بر ثانیه به ازای هر خط در یک جهت.
- پهنای باند نهایی اسلات PCIe 3.0 x16: حداکثر معادل ۱۵.۷۵ گیگابایت بر ثانیه (یکطرفه) و حدود ۳۱.۵ گیگابایت بر ثانیه (دوطرفه / Full-Duplex).
وضعیت گذرگاه در HPE ProLiant DL380 Gen11:
سرور نسل ۱۱ با بهرهگیری از پردازندههای نسل چهارم و پنجم اینتل زئون مقیاسپذیر (Sapphire Rapids و Emerald Rapids)، مجهز به استاندارد فوقسریع PCIe 5.0 است:
- نرخ انتقال سیگنال خام: معادل 32.0 GT/s32.0\text{ GT/s}32.0 GT/s به ازای هر Lane.
- پهنای باند به ازای هر خط: معادل ۳.۹۴ گیگابایت بر ثانیه در یک جهت.
- پهنای باند نهایی اسلات PCIe 5.0 x16: معادل ۶۳ گیگابایت بر ثانیه (یکطرفه) و ۱۲۶ گیگابایت بر ثانیه (دوطرفه)؛ یعنی دقیقاً ۴ برابر پهنای باند بیشتر نسبت به Gen10 (و ۲ برابر نسبت به سرورهای میانی Gen10 Plus با PCIe 4.0).
تأثیر این اختلاف پهنای باند بر بارهای کاری هوش مصنوعی و یادگیری عمیق
-
فاز استنتاج مدلهای زبانی (LLM Inference):
زمانی که وزنهای مدل (Weights) به صورت کامل درون حافظه VRAM کارت گرافیک بارگذاری شده باشند، عمده بار پردازشی درون هستههای Tensor کارت انجام میشود و تبادل داده میان پردازنده و کارت بیشتر محدود به ارسال پرامپت متنی و دریافت توکنهای خروجی است. در این سناریو، تفاوت میان PCIe 3.0 و PCIe 5.0 افت محسوسی در سرعت تولید توکن ایجاد نمیکند.
-
فاز آموزش توزیعشده (Distributed Training) و مدلهای چندکارت:
در سناریوهای آموزش مدل یا تنظیم دقیق (Fine-Tuning) که تبادل مداوم گرادیانها بین چندین کارت گرافیک الزامی است (بهویژه در کارتهایی نظیر NVIDIA L40S یا A30 که فاقد پل فیزیکی NVLink هستند و از بستر PCIe P2P استفاده میکنند)، گذرگاه PCIe 3.0 سرور Gen10 تبدیل به یک گلوگاه حرکتی (Bottleneck) جدی میشود، در حالی که گذرگاه PCIe 5.0 در Gen11 پایداری و سرعت تبادل بینظیری ارائه میدهد.
-
تخلیه حافظه (CPU Offloading) و بارگذاری سریع وزنها:
در بارهایی که حافظه کارت پر شده و لایههایی از مدل باید موقتاً میان رم سرور (System RAM) و کارت گرافیک جابهجا شوند (Offloading در ابزارهایی مانند DeepSpeed و vLLM) یا هنگام راهاندازی اولیه و بارگذاری یک مدل حجیم ۷۰ میلیارد پارامتری (70B) از دیسک NVMe به حافظه کارت، گذرگاه ۱۲۶ گیگابایت بر ثانیهای Gen11 زمان انتظار و تاخیر لود را تا ۷۵٪ نسبت به Gen10 کاهش میدهد.
۳. بررسی تخصصی کارتهای گرافیک انویدیا سازگار با HPE DL380 Gen10
سرور DL380 Gen10 همچنان یکی از محبوبترین، دردسترسترین و باصرفهترین گزینههای بازار دیتاسنتر ایران برای استقرار پروژههای هوش مصنوعی، بینایی ماشین و مجازیسازی است. جدول زیر و توضیحات تکمیلی، تصویر فنی دقیقی از کارتهای سازگار با این نسل ارائه میدهند:
| مدل پردازنده گرافیکی | معماری تراشه | میزان و نوع حافظه (VRAM) | پهنای باند حافظه | توان مصرفی (TDP) | فرم فاکتور اسلات | حداکثر تعداد در DL380 G10 | کابل و توان مورد نیاز |
|---|---|---|---|---|---|---|---|
| NVIDIA T4 | Turing | 16GB GDDR6 | 320 GB/s | 70W | Single-Width, Low Profile | تا ۸ کارت (با رایزرهای کامل) | بدون نیاز به کابل برق (تغذیه از اسلات) |
| NVIDIA A2 | Ampere | 16GB GDDR6 | 200 GB/s | 40W – 60W | Single-Width, Low Profile | تا ۸ کارت | بدون نیاز به کابل برق (اسلات PCIe) |
| NVIDIA V100 (PCIe) | Volta | 16GB / 32GB HBM2 | 900 GB/s | 250W | Double-Width, Full Height | تا ۳ کارت | کابل برق ۸ پین، پاورهای حداقل ۱۶۰۰W |
| NVIDIA A100 (PCIe) | Ampere | 40GB / 80GB HBM2e | 1,555 تا 2,039 GB/s | 250W – 300W | Double-Width, Full Height | تا ۳ کارت | کابل برق مخصوص HPE، کیت فن عملکرد بالا |
| NVIDIA RTX A4000 | Ampere | 16GB GDDR6 (ECC) | 448 GB/s | 140W | Single-Width, Full Height | تا ۴ کارت | کابل برق ۶ پین یا ۸ پین |
| NVIDIA RTX A5000 | Ampere | 24GB GDDR6 (ECC) | 768 GB/s | 230W | Double-Width, Full Height | تا ۳ کارت | کابل برق ۸ پین سازمانی |
| NVIDIA RTX A6000 | Ampere | 48GB GDDR6 (ECC) | 768 GB/s | 300W | Double-Width, Full Height | تا ۳ کارت (محدودیت حرارتی) | کیت فن با دور حداکثری و کابل EPS |
۱. NVIDIA T4؛ شاهکار بهینگی و چگالی در استنتاج هوش مصنوعی
کارت انویدیا T4 مجهز به هستههای اختصاصی Tensor نسل دوم و توان مصرفی فوقالعاده پایین ۷۰ وات است. از آنجا که هر اسلات استاندارد PCIe قادر است تا سقف ۷۵ وات توان الکتریکی را بدون نیاز به کابل مجزا تأمین کند، T4 هیچگونه بار اضافی روی کانکتورهای کمکی پاور سرور وارد نمیکند. این کارت انتخاب اول برای پردازش آنلاین صدها جریان ویدئویی دوربینهای مداربسته (Surveillance Object Detection) و سیستمهای تبدیل گفتار به متن (STT) به حساب میآید.
۲. NVIDIA A100 (نسخه ۸۰ گیگابایت PCIe)؛ ماشین آموزش مدل و هوش مصنوعی سنگین
کارت A100 با معماری Ampere و مجهز به حافظه انقلابی HBM2e با پهنای باند بیش از ۲ ترابایت بر ثانیه، قویترین کارتی است که میتوانید روی سرور Gen10 مستقر کنید. پشتیبانی از فرمتهای محاسباتی TF32 و FP64 به همراه ویژگی Multi-Instance GPU (MIG) که به شما اجازه میدهد کارت را به ۷ نمونه سختافزاری مجزا تفکیک کنید، آن را به گزینهای بیرقیب برای پروژههای یادگیری ماشین چندکاربره در دانشگاهها و سازمانهای بزرگ تبدیل کرده است. در سرور DL380 Gen10 میتوانید تا ۳ عدد کارت A100 نصب کنید؛ به شرط آنکه شاسی به کیت فن Red-Stripe و پاورهای دوبل ۱۶۰۰ وات مجهز شده باشد.
۴. بررسی تخصصی کارتهای گرافیک نسل مدرن سازگار با HPE DL380 Gen11
سرور HPE ProLiant DL380 Gen11 نقطه اوج هماهنگی با کارتهای گرافیک مبتنی بر معماری Ada Lovelace و Hopper است. این سرور قادر است سنگینترین مدلهای هوش مصنوعی زاینده (Generative AI) را با پایداری کامل خنک کند.
| مدل پردازنده گرافیکی | معماری تراشه | میزان و نوع حافظه (VRAM) | پهنای باند حافظه | توان مصرفی (TDP) | قابلیت Multi-Instance (MIG) | حداکثر تعداد در DL380 G11 | بستر کاربردی هدف |
|---|---|---|---|---|---|---|---|
| NVIDIA L4 | Ada Lovelace | 24GB GDDR6 | 300 GB/s | 72W | خیر | تا ۸ کارت | استنتاج هوش مصنوعی، ترنسکد ویدیو 4K، پردازش صوتی |
| NVIDIA L40S | Ada Lovelace | 48GB GDDR6 (ECC) | 864 GB/s | 350W | خیر | تا ۳ کارت | Fine-Tuning مدلهای LLM، پردازش سهبعدی Omniverse، گرافیک ابری |
| NVIDIA H100 (PCIe) | Hopper | 80GB HBM3 | 3,350 GB/s | 350W | بله (تا ۷ نمونه مجزا) | تا ۳ کارت | آموزش مدلهای فوقسنگین، موتور ترنسفورمر، رایانش علمی HPC |
| NVIDIA H200 (PCIe) | Hopper | 141GB HBM3e | 4,800 GB/s | 350W – 400W | بله | بر اساس پشتیبانی حرارتی شاسی | پیشرفتهترین مدلهای هوش مصنوعی زاینده چندوجهی |
۱. NVIDIA L4؛ جانشین مدرن و مقتدر کارت T4
کارت L4 با تکیه بر نسل چهارم هستههای Tensor و نسل سوم هستههای RT و ۲۴ گیگابایت حافظه پرسرعت، توانی تا ۴ برابر بیشتر از T4 در بارهای کاری یادگیری عمیق ارائه میدهد در حالی که مصرف انرژی آن کماکان زیر ۷۵ وات (۷۲ وات) باقی مانده است. این کارت به عنوان یک سرمایهگذاری عالی برای شرکتهای هاستینگ جهت فروش سرویسهای شتابیافته ابری شناخته میشود.
۲. NVIDIA L40S؛ پرچمدار همهمنظوره هوش مصنوعی و گرافیک سازمانی
کارت L40S یکی از جذابترین پیشنهادها برای سرورهای DL380 Gen11 است. این کارت با داشتن ۴۸ گیگابایت حافظه و توان محاسباتی خیرهکننده FP8 و FP16 بدون نیاز به پیچیدگیهای ساختار خوشهای ابررایانهها، بهترین بستر برای فرآیند Fine-Tuning و سرو مدلهای ۷۰ میلیارد پارامتری به شمار میرود. توان مصرفی ۳۵۰ واتی این کارت نیازمند طراحی ویژه سیستم برق و فن است که در ادامه به تشریح الزامات آن پرداخته شده است.
۵. الزامات سختافزاری ۴ گانه برای آمادهسازی شاسی DL380 جهت نصب GPU (Hardware Enablement)
قرار دادن کارت گرافیک روی سرور اچ پی یک فرآیند Plug and Play ساده مانند رایانههای رومیزی نیست. افزودن کارتهای گرافیکی توانبالا رفتار حرارتی و الکتریکی شاسی سرور را دگرگون میسازد. برای آمادهسازی سرور باید چهار مرحله حیاتی به دقت اجرا شود:
گام اول: کیتهای رایزر ثانویه و ثالثیه (PCIe Riser Enablement)
به طور پیشفرض، اکثر سرورهای DL380 به همراه یک رایزر اولیه Primary عرضه میشوند که اغلب پورتهای فیزیکی آن برای کارتهای شبکه یا کنترلرهای رید اختصاص یافتهاند.
- برای نصب کارتهای Double-Width، باید از کیت رایزر اولیه ۲ اسلاته عریض (2-Slot x16 PCIe Riser Kit) استفاده شود.
- در صورت نیاز به کارت دوم، باید کیت رایزر ثانویه (Secondary Riser) سازگار با سوکت CPU 2 نصب شود. توجه داشته باشید که خطوط PCIe رایزر دوم مستقیماً به پردازنده دوم وابستهاند و تا زمانی که پردازنده فیزیکی دوم روی مادربورد نصب نباشد، رایزر ثانویه برق و دیتا دریافت نخواهد کرد.
- برای کارت سوم در DL380 Gen10 یا Gen11، نیاز به تهیه کیت رایزر ثالثیه (Tertiary Riser) وجود دارد که در انتهای سمت چپ شاسی نصب میگردد.
گام دوم: کابلهای توانرسانی اورجینال HPE (GPU Power Enablement Cables)
کارتهای گرافیک دیتاسنتری پسیو و کارتهای پرمصرف، نیازمند کابلهای تغذیه ۱۲ ولت کمکی هستند.
- هشدار ایمنی: هرگز نباید از کابلهای تبدیل استاندارد پاور کامپیوترهای خانگی استفاده شود. پیناوت بردهای سرور HPE استاندارد متفاوتی با مادربردهای مصرفی دارد. اتصال کابل غیراستاندارد منجر به سوختگی مسیرهای مسی مادربورد سرور در لحظه راهاندازی خواهد شد.
- کابلهای اورجینال HPE (مانند کابلهای اتصال ۱۰ پین مادربورد به ۸ پین PCIe گرافیک) از سیمهای با استاندارد AWG مناسب بهره میبرند تا بتوانند جریان لحظهای بیش از ۳۰ آمپر را بدون افت ولتاژ یا ذوبشدگی عایق عبور دهند.
گام سوم: ارتقای منبع تغذیه و فرمول محاسبه بودجه توان (Power Budget Calculation)
یکی از متداولترین دلایل کرش کردن، خاموشی یا ریستارتهای ناگهانی سرور زیر بار سنگین پردازشهای هوش مصنوعی، پدیدهای به نام Transient Power Spikes (جهشهای لحظهای میکروثانیهای مصرف برق) در پردازندههای گرافیکی است. کارتی با توان طراحی حرارتی (TDP) اسمی ۳۰۰ وات، میتواند در لحظات جابهجایی تنسورها در کسری از ثانیه (میلیثانیه) تا بیش از ۴۵۰ وات توان مصرفی لحظهای طلب کند.
فرمول استاندارد محاسبه بودجه توان سرور:
برای محاسبه توان کلی مورد نیاز شاسی جهت جلوگیری از افت ولتاژ، از فرمول زیر استفاده میشود:
Total Power=(TDPCPU 1+TDPCPU 2)+∑TDPGPUs+PowerRAM+PowerDrives & Fans+Safety Margin (20%)
مثال عملی و شبیهسازی بار (روی DL380 Gen10):
فرض کنید سروری با مشخصات زیر پیکربندی شده است:
- پردازندهها: ۲ عدد Intel Xeon Gold 6248R (هر پردازنده ۲۰۵ وات = مجموعاً ۴۱۰ وات)
- کارتهای گرافیک: ۲ عدد شتابدهنده NVIDIA A100 PCIe (هر کارت ۳۰۰ وات = مجموعاً ۶۰۰ وات)
- حافظه رم: ۱۲۸ گیگابایت حافظه DDR4 Smart Memory (حدود ۴۰ وات)
- فنهای High-Performance و درایوهای NVMe/SAS: حدود ۱۰۰ وات
۱. محاسبه توان پایه (Baseline):
Baseline=410+600+40+100=1150 Watts
۲. محاسبه توان نهایی با احتساب حاشیه اطمینان ۲۰٪ (برای پوشش نوسانات لحظهای و جهشهای بار):
Total Required Power=1150×1.20=1380 Watts
چالش ماژولهای پاور در حالت افزونگی (Redundancy N+1):
در استانداردهای اتاق سرور سازمانی، پاورها باید در حالت افزونه (1+1 Redundant) کار کنند؛ به این معنی که اگر یکی از پاورها یا خط تغذیه برق ورودی آن قطع شود، یک پاور منفرد باید بتواند به تنهایی کل بار مصرفی سرور (1380W) را پشتیبانی کند.
- ❌ اشتباه رایج: استفاده از دو عدد پاور ۸۰۰ وات (مجموعاً ۱۶۰۰ وات در حالت تقسیم بار) در این سرور ناکافی است؛ چرا که با سوختن یا خارج شدن یک پاور از مدار، پاور دوم زیر بار 1380W سریعاً خاموش شده و سرور Crash میکند.
- ✅ راهکار استاندارد مهندسی: استفاده از دو عدد پاور HPE 1600W Flex Slot Platinum یا پاورهای 1800W–2200W Titanium، پایداری ۱۰۰ درصدی شاسی را حتی در فاز لود کامل و اورکلاک هستههای تنسور تضمین مینماید.
گام چهارم: فنهای کارایی بالا (High-Performance Fan Kit)
فنهای استاندارد سرور DL380 توانایی تأمین فشار هوای استاتیک لازم (Static Pressure) برای مکش هوا از لابهلای شبکههای فشرده کارتهای پسیو را ندارند.
- پس از شناسایی کارت گرافیک توسط سنسورهای iLO، در صورتی که فنهای High-Performance نصب نباشند، سرور پیام هشدار سلامت داده و سرعت پردازنده یا گرافیک را برای حفظ ایمنی به شدت کاهش میدهد (Thermal Throttling).
- فنهای پرسرعت سازمانی HPE با لیبل نوار قرمز رنگ متمایز میشوند و دور موتوری بیش از ۱۵,۰۰۰ دور در دقیقه (RPM) تولید میکنند تا فشار جریان هوا برای دفع حرارت ۳۰۰ واتی هر کارت فراهم آید.
۶. بررسی چالشهای استفاده از کارتهای گرافیک گیمینگ (GeForce RTX 4090/3090) در سرور
به دلیل تفاوت قیمت فاحش میان کارتهای دیتاسنتری با کارتهای گیمینگ، همواره این وسوسه در میان کارشناسان وجود دارد که از کارتهایی نظیر NVIDIA GeForce RTX 4090 در سرور DL380 استفاده کنند. اگرچه نصب فیزیکی ممکن است با ترفندهایی میسر شود، اما در محیطهای سازمانی و دیتاسنتری مخاطرات زیر را در پی دارد:
۱. اختلال جریان هوا (Blower vs. Axial Flow Mismatch)
کارتهای گیمینگ مجهز به فنهای محوری (Axial Fans) هستند که هوا را از روبهرو کشیده و از لبههای جانبی کارت به درون فضای داخلی شاسی سرور پراکنده میکنند. در یک سرور 2U بسته، این تلاطم هوایی ایجاد گردابههای حرارتی (Hotspots) کرده و حرارت را مستقیماً بر روی چیپست، حافظههای RAM و اسلاتهای مجاور تخلیه میکند. برعکس، طراحی سرور نیازمند جریان هوای تونلی خطی از جلو به عقب است.
۲. ضخامت بیش از حد فیزیکی (3.5-Slot Form Factor)
کارتهای گرافیک پرچمدار گیمینگ اغلب دارای ضخامتی معادل ۳ یا ۳.۵ اسلات هستند. این مسئله مانع از بسته شدن درب بالایی کیس سرور میشود یا اسلاتهای PCIe مجاور را مسدود میسازد. همچنین به دلیل عدم وجود براکتهای مهارکننده سازمانی در بخش پشتی کارت، لرزشهای درون رک میتواند به ترکخوردگی شکاف PCIe روی رایزر منجر گردد.
۳. محدودیتهای گواهینامه و درایور (EULA & Driver Limitations)
مجوز استفاده از درایورهای GeForce (EULA) از نظر حقوقی مانع استفاده از آنها در دیتاسنترها میشود؛ اما مهمتر از آن، درایورهای گیمینگ فاقد پشتیبانی از فناوریهای مجازیسازی سازمانی نظیر NVIDIA vGPU (Virtual PC / Virtual Compute Server) هستند. در محیطهای هایپروایزر VMware ESXi و Proxmox، اختصاص مستقیم (Passthrough) کارتهای سری 4090 با خطاهای متعدد ریستارت و تخصیص کد خطای ۴۳ همراه خواهد شد، در حالی که کارتهای تجاری سری دیتا سنتر و ورکاستیشن (RTX A-Series و L-Series) دارای درایورهای پایدار برای روشن بودن مداوم در تمام طول سال هستند.
۷. مهندسی همبستگی حافظه و پردازنده (NUMA Architecture)؛ رمز دستیابی به بالاترین کارایی
در سرورهای دو سوکته نظیر DL380، یکی از بزرگترین علل افت کارایی کارتهای گرافیک در مدلهای یادگیری عمیق، نادیده گرفتن ساختار دسترسی ناهمگون به حافظه یا Non-Uniform Memory Access (NUMA) است.
یک سرور دو سوکته به دو گره NUMA مجزا تقسیم میشود:
- پردازنده اول (Socket 1) به بانکهای حافظه سمت راست و رایزر اولیه متصل است (Node 0).
- پردازنده دوم (Socket 2) به بانکهای حافظه سمت چپ و رایزرهای ثانویه و ثالثیه متصل است (Node 1).
ارتباط بین این دو پردازنده از طریق اتصالات پرسرعت اینتل بنام Ultra Path Interconnect (UPI) برقرار میشود. اگر پردازش هوش مصنوعی شما، دادههای آموزشی یا وزنهای مدل را در حافظه RAM متصل به Socket 1 بارگذاری کرده باشد، اما کارت گرافیک مربوطه در رایزر ثانویه (متصل به Socket 2) نصب شده باشد، به ازای هر بار تبادل داده، اطلاعات باید از پل ارتباطی UPI گذر کند. این رفت و برگشت سبب افت محسوس پهنای باند و افزایش چشمگیر تأخیر انتقال داده (Latency Penalty) خواهد شد.
قواعد استقرار سختافزاری برای حل چالش NUMA:
- تناظر محلی پردازش: همواره دادههای مربوط به مدل باید روی رمهای متعلق به همان سوکتی تخصیص یابد که کارت گرافیک به اسلات PCIe آن متصل است (numactl –cpunodebind=X –membind=X).
- پیکربندی توازن اسلاتها: اگر قصد نصب ۲ کارت گرافیک در سرور را دارید، برای حفظ تعادل حرارتی و ترافیک پردازشی، یک کارت را روی رایزر اولیه (متصل به سوکت ۱) و کارت دوم را روی رایزر ثانویه (متصل به سوکت ۲) نصب کنید تا بار پردازشی به مساوات روی هر دو گره تقسیم شود.
۸. چکلیست پیکربندی میانافزار (HPE UEFI/BIOS Tuning)
پیش از بوت کردن سرور به سمت سیستمعامل، برای شناسایی و تخصیص بهینه منابع کارتهای گرافیک انویدیا با حافظههای بالا، اعمال تغییرات زیر در محیط HPE System Utilities (RBSU) الزامی است:
- فعالسازی Above 4G Decoding (BAR Support): این قابلیت باید در مسیر PCIe Device Configuration روی حالت Enabled قرار گیرد. بدون این گزینه، سیستمعامل قادر نخواهد بود کل فضای آدرسدهی حافظه کارتهای با VRAM بزرگ (۱۶، ۲۴ یا ۸۰ گیگابایت) را آدرسدهی کند و سیستم با خطای عدم تخصیص منبع مواجه میشود.
- فعالسازی Resizable BAR Support: امکان دسترسی یکپارچه CPU به تمام فضای VRAM را فراهم کرده و نرخ انتقال دادههای حجیم را بهینهتر میسازد.
- تنظیم پروفایل مصرف انرژی روی Workload Profile: Low Latency / Maximum Performance: فعال کردن این پروفایل، فرکانس خطوط PCIe و کلاک پردازندهها را در حالت حداکثری قفل کرده و از رفتن اسلاتها به وضعیت کاهش مصرف (C-States / L1 Active State Power Management) جلوگیری مینماید تا کارت در بارهای کاری منقطع با افت فریم مواجه نشود.
- تنظیم فن در حالت افزایش جریان هوا (Increased Cooling / Maximum Cooling): در صورتی که کارتهای گرافیک توانبالا نصب کردهاید، از مسیر Thermal Configuration پروفایل خنککنندگی سرور را روی Increased Cooling تنظیم کنید تا فنها در صورت آغاز پردازشهای سنگین، پیش از رسیدن حرارت به نقاط بحرانی شتاب بگیرند.
۹. راهنمای کاربردی: کدام کانفیگ سرور DL380 متناسب با پروژه شماست؟
برای آنکه مهندسان زیرساخت، استارتاپهای هوش مصنوعی و شرکتهای هاستینگ بتوانند بر اساس بودجه ریالی و اولویت کاری خود تصمیمگیری کنند، ۴ سناریوی عملیاتی را پیشنهاد میدهیم:
سناریو الف: هاستینگ ماشینهای مجازی گرافیکی و دسکتاپ ابری (VDI)
- پلتفرم پیشنهادی: سرور HPE ProLiant DL380 Gen10
- پردازنده: دو عدد Intel Xeon Gold 6248R (مجموعاً ۴۸ هسته فیزیکی)
- رم: ۲۵۶ گیگابایت DDR4 2933MHz
- گرافیک: ۴ تا ۶ عدد کارت NVIDIA T4 یا RTX A4000
- هدف: تخصیص منابع کارت گرافیک به ماشینهای مجازی مهندسی (AutoCAD، نرمافزارهای رندرینگ و شبیهسازی) از طریق لایسنسینگ vGPU با مصرف برق بسیار اقتصادی.
سناریو ب: استنتاج بلادرنگ مدلهای زبانی متوسط (LLM Serving: LLaMA-3-8B / Mistral-7B)
- پلتفرم پیشنهادی: سرور HPE ProLiant DL380 Gen10 استوک یا Gen11
- پردازنده: دو عدد Intel Xeon Gold 6240 یا Xeon Silver 4410Y
- رم: ۱۲۸ تا ۲۵۶ گیگابایت
- گرافیک: ۲ عدد NVIDIA L4 (24GB) یا ۲ عدد RTX A5000 (24GB)
- هدف: راهاندازی سامانههای گفتگوی هوشمند سازمانی، سیستمهای پشتیبانی اتوماتیک متنی و خلاصهسازی پروندهها با توان مصرفی بهینه.
سناریو ج: Fine-Tuning و سرو مدلهای زبانی بزرگ سازمانی (LLM Fine-Tuning: 70B Models)
- پلتفرم پیشنهادی: سرور HPE ProLiant DL380 Gen11
- پردازنده: دو عدد Intel Xeon Gold 6430 یا 6530
- رم: ۵۱۲ گیگابایت DDR5
- گرافیک: ۲ تا ۳ عدد NVIDIA L40S (48GB)
- هدف: تنظیم اختصاصی مدلهای زبانی حجیم با دادههای بومی، ایجاد بسترهای RAG (Retrieval-Augmented Generation) در کلاس بانکی و پلتفرمهای کلانداده.
سناریو د: آزمایشگاه ملی یادگیری عمیق، آموزش مدل و پردازش ابررایانشی (HPC / Pre-training)
- پلتفرم پیشنهادی: سرور HPE ProLiant DL380 Gen11
- پردازنده: دو عدد Intel Xeon Platinum 8480+
- رم: ۱ ترابایت DDR5
- گرافیک: ۲ عدد NVIDIA H100 80GB (PCIe 5.0)
- هدف: اجرای پایدار الگوریتمهای یادگیری تقویتی، پردازش تصاویر پزشکی ژنتیکی و آموزش شبکههای عصبی بسیار عمیق بدون افت سرعت گذرگاه داده.
پرسشهای متداول (FAQ)
1. آیا سرور DL380 Gen10 میتواند از کارتهای نسل جدید نظیر NVIDIA L4 پشتیبانی کند؟
بله، با توجه به اینکه استاندارد PCIe دارای سازگاری رو به عقب (Backward Compatibility) است، کارت NVIDIA L4 روی اسلات PCIe 3.0 سرور Gen10 شناسایی میشود و کار میکند. با این حال، به دلیل سقف پهنای باند PCIe 3.0، حداکثر نرخ انتقال داده به حدود ۱۵.۷۵ گیگابایت بر ثانیه محدود خواهد بود که برای بارهای کاری استنتاج تأثیر منفی چشمگیری ندارد، اما برای فرآیندهای پرحجم بهتر است از سرور نسل Gen11 استفاده شود.
2. آیا برای نصب کارت گرافیک حتماً نیاز به نصب هر دو پردازنده روی مادربورد وجود دارد؟
اگر صرفاً قصد دارید از یک کارت گرافیک روی رایزر اولیه (Primary Riser) استفاده کنید، نصب یک پردازنده فیزیکی کفایت میکند. اما اگر بخواهید کارت گرافیک دوم یا سوم را روی رایزرهای ثانویه یا ثالثیه مستقر نمایید، نصب پردازنده دوم الزامی است؛ زیرا کنترلر و خطوط ارتباطی اسلاتهای رایزر دوم و سوم مستقیماً از سوکت پردازنده دوم منشعب میشوند.
3. تفاوت کارتهای گرافیک دارای پسوند Active و Passive چیست؟
کارتهای Active مجهز به فن خنککننده روی بدنه خود هستند و برای ایستگاههای کاری (Workstation) طراحی شدهاند. کارتهای Passive فاقد هرگونه فن متحرک بوده و تنها دارای هیتسینک مشبک هستند. این کارتها مخصوص استقرار در رکهای سرور طراحی شدهاند و دفع حرارت آنها منحصراً به فنهای قدرتمند شاسی سرور و داکت هدایت هوای آن وابسته است. استفاده از کارتهای اکتیو با فنهای متفرقه در سرور معمولاً به دلیل ابعاد غیراستاندارد و عدم همخوانی با جهت جریان هوا توصیه نمیشود.
تأمین، ارتقا و مشاوره فنی زیرساخت در ولکان سرور
راهاندازی، تأمین و پیکربندی سرورهای هوش مصنوعی مجهز به کارتهای گرافیک صنعتی، نیازمند محاسبات دقیق مهندسی برق، چینش خنککاری و اشراف به معماری سختافزار است. خطای محاسباتی در انتخاب کابل برق یا عدم توازن گرههای NUMA میتواند سرمایهگذاری سنگین سازمانی را با شکست مواجه کند.
مجموعه ولکان سرور ایرانیان به عنوان تأمینکننده تخصصی سرور HPE و قطعات شبکه در کشور، خدمات فنی زیر را ارائه میدهد:
- تأمین سرورهای اورجینال HPE ProLiant DL380 Gen10 و Gen11: ارائه انواع شاسیهای استوک گرید A++ و آکبند با کانفیگ سفارشی متناسب با بودجه شما.
- عرضه مستقیم پردازندههای گرافیکی تجاری NVIDIA: موجودی و تأمین کارتهای دیتاسنتری شامل T4, A100, L4, L40S و H100 همراه با ضمانت اصالت و سلامت تستهای زیر بار (Stress Test).
- پکیجهای کامل Enablement سختافزاری: شامل کیتهای رایزر اورجینال، کابلهای استاندارد برق GPU، فنهای High-Performance و پاورهای ۱۶۰۰ وات پلاتینیوم و تیتانیوم.
برای دریافت مشاوره فنی رایگان، استعلام قیمت بهروز و انتخاب بهترین کانفیگ سرورهای مجهز به GPU، با کارشناسان ولکان سرور تماس حاصل فرمایید یا برای مشاهده موجودی تجهیزات، به دستهبندی خرید سرور استوک و قطعات سرور مراجعه فرمایید.
اشتراکگذاری
با استفاده از روشهای زیر میتوانید این صفحه رو به اشتراک بگذارید.


