از دیتاسنتر تا آزمایشگاه یادگیری ماشین؛ چگونه سرورهای HPE ProLiant را برای هوش مصنوعی بهینه کنیم؟
رشد مدلهای Machine Learning، Deep Learning و Generative AI باعث شده طراحی سرور برای هوش مصنوعی دیگر فقط به انتخاب یک CPU قدرتمند و مقدار زیادی RAM محدود نباشد. در یک AI Server، عملکرد نهایی به هماهنگی میان GPU و VRAM، پردازنده، Memory Bandwidth، PCIe، NVMe Storage، Network و زیرساخت Power/Cooling وابسته است. حتی یک GPU قدرتمند نیز زمانی که Dataset با سرعت کافی از Storage به حافظه منتقل نشود یا CPU و PCIe نتوانند Data Pipeline را تغذیه کنند، ممکن است بخشی از توان محاسباتی خود را بلا استفاده بگذارد. به همین دلیل هنگام خرید سرور hpe برای AI باید کل معماری سیستم براساس Workload طراحی شود، نه اینکه صرفاً قدرتمندترین قطعات در یک شاسی قرار بگیرند.
اما یک HPE ProLiant مناسب برای Inference باید همان مشخصاتی را داشته باشد که برای Training مدل نیاز داریم؟ برای Fine-Tuning یک مدل بزرگ چه مقدار VRAM و RAM لازم است؟ چه زمانی هارد NVMe سرور روی سرعت Training تأثیر محسوسی میگذارد و در چه شرایطی Network یا PCIe به Bottleneck تبدیل میشود؟ در ادامه، مسیر بهینه سازی سرورهای HPE ProLiant را از انتخاب CPU و GPU تا طراحی Storage، Network، Power و Cooling بررسی میکنیم تا مشخص شود برای هر AI Workload چه کانفیگی منطقیتر است.
هوش مصنوعی چه منابعی از سرور HPE نیاز دارد؟
نیاز سخت افزاری یک سرور هوش مصنوعی کاملاً به نوع AI Workload بستگی دارد. Machine Learning کلاسیک ممکن است بیشتر به CPU و RAM وابسته باشد، در حالی که در Deep Learning و Generative AI معمولاً GPU، ظرفیت VRAM و پهنای باند حافظه GPU نقش پر رنگتری دارند.
علاوه بر این، Storage و Network باید بتوانند داده را با سرعت کافی در اختیار پردازندهها قرار دهند؛ در غیر این صورت حتی GPU قدرتمند نیز ممکن است به دلیل انتظار برای Data، به حداکثر Utilization نرسد.
به طور کلی منابع اصلی یک AI Server شامل موارد زیر هستند:
- GPU و VRAM: برای محاسبات موازی، آموزش شبکههای عصبی و اجرای مدلهای بزرگ
- CPU: برای Data Preprocessing، مدیریت I/O و اجرای بخشهای CPU-based Pipeline
- RAM: برای Dataset، Cache و پردازشهای قبل از انتقال داده به GPU
- SSD/NVMe: برای دسترسی سریع به Dataset، Checkpoint و فایلهای مدل
- PCIe: برای تأمین پهنای باند ارتباطی میان CPU، GPU و NVMe
- Network: برای Shared Storage، انتقال Dataset و Distributed Training
- Power و Cooling: برای تأمین توان و دفع حرارت GPU و CPU تحت Load مداوم
تفاوت Training و Inference در انتخاب سخت افزار
در Training مدل، حجم زیادی از عملیات محاسباتی و انتقال داده به صورت تکرار شونده انجام میشود. در نتیجه GPU Compute، ظرفیت و Bandwidth حافظه GPU، سرعت Storage و در سیستمهای Multi-GPU پهنای باند ارتباطی اهمیت زیادی دارند. Training مدلهای بزرگ همچنین میتواند به چند GPU و RAM سیستم بیشتری نیاز داشته باشد.
در Inference مدل از قبل آموزش دیده برای تولید خروجی استفاده میشود. اینجا علاوه بر توان پردازشی، معیارهایی مانند Latency، Throughput، تعداد Request هم زمان و مقدار حافظه لازم برای نگهداری مدل اهمیت دارند. بنابراین سروری که برای Training مناسب است الزاماً اقتصادیترین کانفیگ برای Inference نیست.
چرا AI Workload باید قبل از انتخاب سرور مشخص شود؟
عبارت «سرور هوش مصنوعی» به تنهایی برای تعیین Configuration کافی نیست. اجرای یک مدل Machine Learning کوچک، Fine-Tuning یک LLM، Computer Vision و Training چند GPU نیازهای سخت افزاری کاملاً متفاوتی دارند.
قبل از خرید سرور hpe بهتر است حداقل نوع مدل، Training یا Inference بودن Workload، حجم Dataset، VRAM مورد نیاز، تعداد GPU و میزان توسعه آینده مشخص شود. سپس میتوان CPU، RAM، Storage و Network را متناسب با GPU و Data Pipeline انتخاب کرد و از ایجاد Bottleneck جلوگیری کرد.
انتخاب سرور HPE ProLiant مناسب برای هوش مصنوعی
پس از مشخص شدن Workload، باید پلتفرمی انتخاب شود که از نظر GPU Support، PCIe Expansion، Power Budget، Cooling، Memory Capacity و Storage توان میزبانی Configuration مورد نظر را داشته باشد. صرف وجود PCIe Slot به این معنی نیست که هر GPU را میتوان روی هر ProLiant نصب کرد؛ ابعاد و توان کارت، نوع Riser، کابلهای Power، PSU، Thermal Configuration و فهرست GPUهای پشتیبانی شده همان مدل سرور نیز باید بررسی شوند.
Rack Server یا Tower Server؛ کدام برای AI مناسبتر است؟
سرورهای Rack خانواده ProLiant DL برای دیتاسنتر طراحی شدهاند و در Configurationهای مناسب میتوانند PCIe Expansion، ظرفیت RAM، Storage و Network مورد نیاز محیطهای AI را فراهم کنند. مزیت Rack Server زمانی بیشتر مشخص میشود که چند سرور قرار است در یک Rack، Cluster یا زیرساخت متمرکز استفاده شوند.
در مقابل، سرور HP ML با فرم Tower برای شرکتها، آزمایشگاهها یا محیطهایی که Rack اختصاصی ندارند قابل بررسی است. Tower Server میتواند برای Machine Learning سبک، Development و بعضی Inference Workloadها مناسب باشد؛ اما در پروژههای GPU-heavy باید حتماً تعداد و نوع GPUهای پشتیبانی شده، فضای داخلی شاسی و ظرفیت Power/Cooling همان مدل بررسی شود.
چه زمانی سرورهای GPU-Optimized انتخاب بهتری هستند؟
وقتی Workload به چند GPU پرمصرف، VRAM زیاد یا Training مداوم نیاز دارد، انتخاب پلتفرمی که مشخصاً برای GPU Compute طراحی شده معمولاً منطقیتر از اضافه کردن GPU به یک سرور General-purpose است.
در این سرورها معماری شاسی، Airflow، Power Delivery و مسیرهای PCIe برای تراکم بالاتر Acceleratorها طراحی میشود. این موضوع به ویژه در Multi-GPU Training، Generative AI و مدلهای بزرگ Deep Learning اهمیت پیدا میکند؛ زیرا در چنین محیطی محدودیت اصلی ممکن است دیگر CPU نباشد و به PCIe Bandwidth، ارتباط GPU-to-GPU، توان یا Cooling منتقل شود.
در نتیجه، انتخاب HPE ProLiant برای AI باید از Workload → GPU → Platform انجام شود، نه برعکس؛ ابتدا نیاز محاسباتی مشخص شود، سپس GPU و در نهایت سروری انتخاب شود که بتواند آن Configuration را بدون محدودیت جدی در I/O، Power یا Cooling پشتیبانی کند.
برای سرور هوش مصنوعی به چه مقدار RAM نیاز داریم؟
در سرورهای هوش مصنوعی، تمرکز معمولاً روی تعداد و قدرت GPUهاست، اما RAM سیستم نقش مهمی در آماده سازی و انتقال داده به GPU دارد. Dataset معمولاً ابتدا از Storage خوانده میشود، بخشی از آن در RAM قرار میگیرد و پس از انجام پردازشهایی مانند Decode، Augmentation، Tokenization یا ساخت Batch، داده برای پردازش به VRAM کارت گرافیک منتقل میشود.
بنابراین RAM و VRAM دو حافظه مستقل با وظایف متفاوت هستند؛ VRAM حافظه مستقیم GPU برای اجرای مدل و نگهداری Tensorهاست، در حالی که RAM حافظه اصلی سرور برای سیستم عامل، Dataset، Data Loaderها و پردازشهای CPU است.
مقدار RAM مورد نیاز عدد ثابتی ندارد و به حجم Dataset، تعداد GPUها، تعداد Workerهای Data Loader و نوع Workload بستگی دارد. برای مثال، یک سرور Inference با Dataset محدود ممکن است با 64 یا 128 گیگابایت RAM عملکرد مناسبی داشته باشد، اما در یک سرور Training چند-GPU که چندین پردازش به صورت هم زمان داده را آماده میکنند، نیاز به 256، 512 گیگابایت یا حتی چند ترابایت RAM دور از انتظار نیست. نکته مهم این است که ظرفیت RAM باید متناسب با کل Data Pipeline انتخاب شود، نه صرفاً براساس ظرفیت VRAM کارتهای گرافیک.
چرا کمبود RAM میتواند GPU قدرتمند را معطل نگه دارد؟
GPU زمانی بیشترین کارایی را دارد که Batch بعدی داده به موقع در اختیار آن قرار گیرد. اگر RAM کافی نباشد، سیستم مجبور میشود دادهها را مرتباً از Storage بخواند یا در شرایط شدیدتر از Swap روی دیسک استفاده کند. از آنجا که حتی NVMe SSD نیز نسبت به RAM تأخیر بسیار بیشتری دارد، GPU ممکن است بخشی از زمان خود را بهجای انجام محاسبات در انتظار داده بگذراند. در نتیجه GPU Utilization کاهش پیدا میکند و زمان Training افزایش مییابد؛ حتی اگر خود GPU بسیار قدرتمند باشد.
به همین دلیل در انتخاب و خرید رم سرور HP برای کاربردهای AI باید علاوه بر ظرفیت، تعداد کانالهای حافظه، نحوه DIMM Population، سرعت حافظه و سازگاری RAM با پردازنده و نسل سرور نیز بررسی شود. پر کردن صحیح کانالهای حافظه اهمیت زیادی دارد، زیرا پهنای باند RAM نیز میتواند روی سرعت آماده سازی و انتقال حجم بالای داده اثر بگذارد.
ECC Memory در AI Server چه اهمیتی دارد؟
در سرورهای Enterprise معمولاً از حافظه ECC استفاده میشود. ECC میتواند خطاهای تک بیتی حافظه را تشخیص داده و اصلاح کند و احتمال باقی ماندن خطاهای خاموش در دادههای در حال پردازش را کاهش دهد. این موضوع در Workloadهای طولانی AI اهمیت بیشتری پیدا میکند؛ زیرا یک فرآیند Training ممکن است ساعتها یا حتی روزها ادامه داشته باشد و سرور در تمام این مدت تحت بار سنگین قرار گیرد.
ECC به معنی مصونیت کامل سیستم در برابر همه خطاهای حافظه نیست، اما برای سروری که قرار است به صورت 24/7 و با Datasetهای حجیم کار کند، Reliability و Data Integrity بالاتری فراهم میکند. به همین دلیل در طراحی AI Server سازمانی، فقط ظرفیت RAM مطرح نیست و نوع حافظه، ECC، پهنای باند و Memory Population باید در کنار یکدیگر بررسی شوند.
طراحی Storage برای AI؛ چرا HDD به تنهایی کافی نیست؟
Storage در سرور هوش مصنوعی فقط محلی برای ذخیره Dataset نیست؛ بلکه یکی از اجزای اصلی Data Pipeline است. GPU ممکن است توان انجام حجم بسیار بالایی از محاسبات را داشته باشد، اما اگر Storage نتواند دادهها را با سرعت کافی به CPU و RAM تحویل دهد، GPU مجبور به انتظار میشود. به همین دلیل دو شاخص Throughput و IOPS در طراحی Storage سرور AI اهمیت زیادی دارند.
Throughput مشخص میکند در هر ثانیه چه حجم دادهای قابل خواندن یا نوشتن است و برای Datasetهای بزرگ و فایلهای حجیم اهمیت دارد. IOPS نیز تعداد عملیات ورودی/خروجی قابل انجام در هر ثانیه را نشان میدهد و در Datasetهایی شامل تعداد بسیار زیادی فایل کوچک اهمیت بیشتری پیدا میکند. برای مثال، خواندن هزاران یا میلیونها تصویر کوچک در Computer Vision میتواند فشار I/O متفاوتی نسبت به خواندن چند فایل بسیار بزرگ ایجاد کند.
NVMe برای Dataset و Training Data
برای Dataset فعال و Training Data، NVMe معمولاً گزینه بسیار مناسبی است؛ زیرا برخلاف HDD و بسیاری از SSDهای SATA، مستقیماً از رابط PCIe استفاده میکند و میتواند پهنای باند و IOPS بسیار بالاتری ارائه دهد. استفاده از هارد NVMe سرور باعث میشود Data Loader سریعتر به فایلهای Dataset دسترسی پیدا کند و احتمال ایجاد Storage Bottleneck در زمان Training کاهش یابد.
اهمیت NVMe در سیستمهای چند-GPU بیشتر میشود. وقتی چند GPU به صورت هم زمان Batchهای جدید درخواست میکنند، Storage باید توان پاسخ گویی به جریان داده بیشتری را داشته باشد. بنابراین نصب چند GPU قدرتمند در کنار Storage کند، لزوماً باعث افزایش متناسب سرعت Training نمیشود.
SSD برای سیستم عامل، Container و Checkpoint
در معماری Storage سرور AI لازم نیست تمام اطلاعات روی سریعترین NVMeها قرار گیرند. هارد SSD سرور میتواند برای سیستم عامل، Docker Containerها، کتابخانهها، محیطهای نرم افزاری، فایلهای پروژه و برخی Checkpointها استفاده شود.
Checkpoint اهمیت خاصی دارد؛ زیرا در Trainingهای طولانی، وضعیت مدل در فواصل مشخص ذخیره میشود تا در صورت توقف Job یا بروز مشکل، فرآیند از نقطه قبلی ادامه پیدا کند. بنابراین Storage مربوط به Checkpoint علاوه بر سرعت مناسب باید از نظر پایداری و ظرفیت نیز متناسب با تعداد و حجم مدلها طراحی شود.
HDD هنوز کجا کاربرد دارد؟
HDD در AI Server بی استفاده نیست؛ مشکل زمانی ایجاد میشود که بخواهیم تمام Data Pipeline را فقط روی HDD اجرا کنیم. هارد دیسکهای Enterprise به دلیل ظرفیت بالا و هزینه کمتر بهازای هر ترابایت، همچنان برای آرشیو Datasetهای قدیمی، Backup، نسخههای خام داده و اطلاعاتی که دائماً در Training استفاده نمیشوند مناسب هستند.
به همین دلیل میتوان Storage را به صورت Tiered طراحی کرد:
NVMe → دادههای فعال و Training Dataset
SSD → سیستم عامل، Container، نرم افزار و Checkpoint
HDD → Archive، Backup و Cold Data
در چنین معماریای، دادهای که قرار است وارد Training شود از لایه آرشیوی به Storage سریع منتقل شده و سپس در اختیار Data Pipeline قرار میگیرد. این روش اجازه میدهد بدون پرداخت هزینه NVMe برای کل ظرفیت ذخیره سازی، بخش فعال Workload از سرعت بالای NVMe بهره ببرد.
در نهایت، عملکرد سرور AI حاصل قدرت یک قطعه به تنهایی نیست. مسیر Storage → RAM → CPU/Data Loader → VRAM → GPU باید به صورت متوازن طراحی شود. اگر Storage نتواند داده را سریع بخواند یا RAM ظرفیت و پهنای باند کافی نداشته باشد، حتی GPU بسیار قدرتمند نیز نمیتواند دائماً با حداکثر توان خود کار کند. بنابراین هنگام کانفیگ سرور هوش مصنوعی، ظرفیت Storage به اندازه نوع درایو، IOPS، Throughput و نحوه تفکیک دادههای فعال و آرشیوی اهمیت دارد.
جلوگیری از I/O Bottleneck در سرورهای هوش مصنوعی
در سرور AI، قدرت GPU زمانی به طور کامل استفاده میشود که داده با سرعت کافی به آن برسد. Dataset معمولاً مسیر Storage → RAM → CPU/Data Loader → VRAM → GPU را طی میکند. اگر هر بخش از این مسیر سرعت کافی نداشته باشد، I/O Bottleneck ایجاد میشود و GPU بخشی از زمان خود را در انتظار Batch بعدی میگذراند. در چنین شرایطی حتی ارتقای GPU نیز الزاماً باعث افزایش سرعت Training نمیشود.
Local NVMe یا استوریج شبکهای؟
Local NVMe به دلیل اتصال مستقیم از طریق PCIe، تأخیر پایین و Throughput و IOPS بالا، برای Datasetهای فعال و Training سنگین گزینه مناسبی است. در مقابل، Network Storage زمانی اهمیت بیشتری پیدا میکند که Dataset باید بین چند سرور AI مشترک باشد یا ظرفیت، مدیریت متمرکز و توسعه پذیری Storage اهمیت داشته باشد.
البته در Storage شبکهای، سرعت فقط به خود درایوها وابسته نیست؛ پهنای باند شبکه و پروتکل دسترسی نیز اهمیت دارد. اگر چند GPU یا چند سرور به طور هم زمان Dataset بزرگی را بخوانند، شبکه یا Storage Backend میتواند به گلوگاه تبدیل شود.
چه زمانی استفاده از استوریج HPE منطقی است؟
استفاده از Storage مجزا در محیطهایی منطقیتر است که چند AI Server باید به Dataset مشترک دسترسی داشته باشند، حجم داده بسیار زیاد باشد یا امکاناتی مانند مدیریت متمرکز، افزونگی، Snapshot و توسعه ظرفیت مورد نیاز باشد. در مقابل، برای یک سرور مستقل با Dataset فعال محدود، استفاده از NVMe محلی میتواند معماری سادهتر و سریعتری ایجاد کند.
بنابراین در طراحی AI Server نباید فقط GPU را بررسی کرد؛ توان Storage، RAM و مسیر انتقال داده باید متناسب با توان پردازشی GPU باشد.
PCIe Architecture و پهنای باند؛ عامل پنهان در Performance سرور AI
GPU و NVMe هر دو برای ارتباط پرسرعت با سیستم به PCIe وابستهاند. به همین دلیل هنگام کانفیگ یک سرور Multi-GPU، فقط تعداد اسلاتهای PCIe مهم نیست؛ نسل PCIe، تعداد Laneها و نحوه اتصال هر اسلات به CPU نیز باید بررسی شود.
PCIe Generation و Lane Count چه تأثیری دارند؟
هر چه نسل PCIe جدیدتر باشد، پهنای باند هر Lane افزایش پیدا میکند. همچنین اتصال x16 پهنای باند بیشتری نسبت به x8 یا x4 در اختیار دستگاه قرار میدهد. یک GPU ممکن است از نظر فیزیکی در اسلات x16 نصب شود، اما معماری سرور تعیین میکند که واقعاً چند Lane در اختیار آن قرار بگیرد.
این موضوع در کانفیگهای چند-GPU و هنگام استفاده هم زمان از چند NVMe اهمیت بیشتری پیدا میکند.
چرا محل نصب GPU و NVMe مهم است؟
Laneهای PCIe در سرور محدود هستند و بین GPU، NVMe، کارت شبکه و سایر تجهیزات توزیع میشوند. بنابراین نصب تجهیزات در اسلات نامناسب میتواند باعث کاهش پهنای باند یا ایجاد مسیر طولانیتر برای انتقال داده شود. به همین دلیل در AI Serverهای حرفهای باید PCIe Slot Mapping و دستورالعمل سازنده سرور قبل از نصب GPU و NVMe بررسی شود.
NUMA چیست و چرا در Multi-GPU اهمیت دارد؟
در سرورهای دو پردازندهای، هر CPU معمولاً به بخشی از RAM و PCIe Deviceها دسترسی مستقیمتری دارد. این معماری NUMA یا Non-Uniform Memory Access نام دارد. اگر یک GPU متصل به CPU اول مجبور باشد دائماً به حافظه یا تجهیزات متصل به CPU دوم دسترسی پیدا کند، داده باید مسیر بیشتری را طی کند و تأخیر و ترافیک بین پردازندهها افزایش مییابد.
به همین دلیل در کانفیگ Multi-GPU، هماهنگی بین CPU، RAM، GPU و NVMe از نظر NUMA Topology اهمیت دارد. یک طراحی متوازن میتواند Data Locality را بهتر حفظ کند و اجازه دهد GPUها بدون ایجاد گلوگاه غیر ضروری به داده مورد نیاز خود دسترسی پیدا کنند.
شبکه مناسب برای AI Cluster؛ از 10GbE تا شبکههای پرسرعت
در یک AI Server مستقل که Dataset روی NVMe داخلی قرار دارد، شبکه ممکن است تأثیر مستقیمی روی سرعت Training نداشته باشد. اما وقتی چند Compute Node در قالب یک AI Cluster فعالیت میکنند یا Dataset از Shared Storage خوانده میشود، شبکه به بخشی از مسیر پردازش تبدیل میشود و پهنای باند و Latency آن میتواند مستقیماً روی Performance تأثیر بگذارد.
چه زمانی 10، 25 یا 100GbE لازم میشود؟
انتخاب سرعت شبکه باید براساس حجم Dataset، تعداد Nodeها، سرعت Storage و نوع Workload انجام شود. برای مثال، 10GbE میتواند برای محیطهای کوچک، Inference یا انتقال داده با حجم متوسط کافی باشد. با افزایش تعداد GPUها و حجم داده، 25GbE فضای بیشتری برای انتقال Dataset و دسترسی به Shared Storage فراهم میکند. در Clusterهای بزرگتر، به خصوص زمانی که چند Node به صورت هم زمان حجم زیادی از داده را جابهجا میکنند، ممکن است 100GbE یا شبکههای سریعتر مورد نیاز باشد.
بنابراین نمیتوان یک سرعت مانند 100GbE را برای تمام AI Serverها ضروری دانست. اگر Storage یا Workload توان تولید چنین حجم ترافیکی را نداشته باشد، افزایش پهنای باند شبکه به تنهایی Performance را افزایش نمیدهد.
Network Bottleneck در Distributed Training
اهمیت شبکه در Distributed Training بیشتر میشود. در این معماری، Training یک مدل میان چند GPU یا چند Compute Node تقسیم میشود و Nodeها علاوه بر دریافت Dataset، باید اطلاعات مربوط به محاسبات مدل مانند Gradientها را نیز با یکدیگر مبادله و همگام سازی کنند.
اگر این ارتباط کند باشد، GPUها پس از انجام بخشی از محاسبات مجبور میشوند برای Synchronization منتظر سایر Nodeها بمانند. در نتیجه با وجود GPUهای قدرتمند، GPU Utilization کاهش پیدا میکند و اضافه کردن Node جدید الزاماً افزایش خطی Performance ایجاد نخواهد کرد. در چنین Workloadهایی علاوه بر Bandwidth، Latency شبکه نیز اهمیت پیدا میکند.
ارتباط Compute Node با Shared Storage
در معماریهایی که چند Compute Node از Shared Storage استفاده میکنند، شبکه باید مجموع ترافیک هم زمان Nodeها را تحمل کند. برای مثال اگر چند سرور در حال خواندن Dataset، نوشتن Checkpoint و اجرای Training باشند، یک لینک شبکه محدود میتواند بین تمام این عملیات به گلوگاه مشترک تبدیل شود.
بنابراین طراحی شبکه AI Cluster باید در کنار Compute، Storage و تعداد GPUها انجام شود. هدف صرفاً انتخاب سریعترین کارت شبکه نیست؛ بلکه باید پهنای باند مسیر Compute Node تا Storage و ارتباط میان Nodeها متناسب با Data Pipeline واقعی سیستم باشد.
Power و Cooling؛ محدودیت مهم نصب GPU روی HPE ProLiant
انتخاب GPU برای سرور HPE ProLiant فقط براساس قدرت پردازشی یا مقدار VRAM انجام نمیشود. GPUهای دیتاسنتری میتوانند توان مصرفی و حرارت قابل توجهی ایجاد کنند و به همین دلیل مدل سرور باید از نظر Power، Cooling، PCIe Riser، فضای فیزیکی و پشتیبانی رسمی GPU برای کارت مورد نظر آماده باشد.
محاسبه Power Budget قبل از نصب GPU
قبل از نصب GPU باید Power Budget کل سرور بررسی شود. مصرف برق فقط مربوط به GPU نیست؛ CPUها، RAM، درایوهای NVMe و HDD، کارتهای شبکه، فنها و سایر PCIe Deviceها نیز از PSU استفاده میکنند.
برای مثال، وجود دو PSU با توان بالا لزوماً به این معنی نیست که تمام مجموع توان نامی آنها برای GPUها قابل استفاده است. نحوه پیکربندی Power Supply، افزونگی PSU و محدودیتهای طراحی خود سرور نیز باید در نظر گرفته شوند. به همین دلیل تعداد و مدل GPUهای پشتیبانی شده باید براساس مستندات همان مدل و نسل ProLiant بررسی شود.
تأثیر GPU روی PSU و Thermal Design
GPU علاوه بر افزایش مصرف برق، بار حرارتی سرور را نیز افزایش میدهد. در نتیجه ممکن است یک کانفیگ GPU به فنهای High Performance، Heatsink یا Airflow Configuration مشخص نیاز داشته باشد. اگر سیستم Cooling برای این بار حرارتی طراحی نشده باشد، افزایش دما میتواند باعث افزایش سرعت فنها و در شرایط خاص محدود شدن Performance قطعات برای کنترل حرارت شود.
به همین دلیل Cooling در AI Server موضوعی جدا از انتخاب PSU نیست؛ Power و Thermal Design باید هم زمان بررسی شوند.
چرا هر GPU را نمیتوان روی هر ProLiant نصب کرد؟
وجود یک اسلات PCIe سازگار به تنهایی برای نصب GPU کافی نیست. کارت مورد نظر باید از نظر ابعاد و فضای اشغال شده، توان قابل تأمین از اسلات و کابلهای Auxiliary Power، نوع و ظرفیت PCIe Riser، مسیر Airflow و Firmware با سرور سازگار باشد.
همچنین پشتیبانی رسمی GPU میتواند با توجه به مدل و Generation سرور HPE ProLiant متفاوت باشد. حتی دو سرور از یک نسل ممکن است به دلیل تفاوت شاسی، Riser و طراحی Cooling از GPUهای متفاوتی پشتیبانی کنند.
بنابراین قبل از خرید GPU برای سرور HPE باید توان PSU، نوع Riser، کابل برق GPU، فضای فیزیکی، Cooling Configuration، نسخه Firmware و فهرست GPUهای رسماً پشتیبانی شده توسط همان مدل سرور بررسی شود. این کار از انتخاب کارتی جلوگیری میکند که از نظر رابط PCIe قابل نصب به نظر میرسد، اما در عمل با محدودیت برق، حرارت یا ساختار داخلی سرور مواجه میشود.
بهینه سازی نرم افزاری HPE ProLiant برای Machine Learning
بعد از انتخاب CPU، GPU، RAM و Storage مناسب، تنظیمات نرم افزاری سرور نیز روی Performance واقعی Machine Learning تأثیر دارد. حتی یک کانفیگ سخت افزاری قدرتمند در صورت تنظیم نادرست BIOS، NUMA یا درایور GPU ممکن است نتواند از تمام منابع خود استفاده کند.
1_ BIOS و Power Profile مناسب Workload
در HPE ProLiant، تنظیمات BIOS و Power Profile مشخص میکنند سرور چگونه میان Performance و مصرف انرژی تعادل ایجاد کند. برای Workloadهای سنگین AI، تنظیماتی که بیش از حد بر کاهش مصرف انرژی تمرکز دارند ممکن است باعث تغییر فرکانس CPU یا افزایش Latency شوند.
بنابراین به جای تغییر تصادفی گزینههای BIOS، باید Workload Profile و Power/Performance Settings متناسب با مدل سرور و نوع بار کاری انتخاب شوند. Firmware و System ROM نیز بهتر است قبل از راه اندازی محیط AI به نسخه سازگار و توصیه شده ارتقا داده شوند.
2_ NUMA و CPU Affinity
در سرورهای چند پردازندهای، هر CPU به بخشی از RAM و PCIe Deviceها دسترسی مستقیمتری دارد. NUMA Awareness کمک میکند پردازشهای CPU، حافظه و GPU تا حد امکان در یک مسیر محلی قرار بگیرند.
CPU Affinity نیز امکان اختصاص پردازش یا Thread به Coreهای مشخص را فراهم میکند. این موضوع برای Data Loaderهای سنگین و سیستمهای Multi-GPU اهمیت بیشتری دارد؛ زیرا توزیع نامناسب پردازشها میتواند ترافیک بین NUMA Nodeها را افزایش دهد و بخشی از مزیت سخت افزار سریع را از بین ببرد.
3_ NVIDIA Driver، CUDA و Container Runtime
وجود GPU NVIDIA به تنهایی برای اجرای Frameworkهای هوش مصنوعی کافی نیست. نسخه NVIDIA Driver، CUDA Toolkit، کتابخانههای مورد نیاز Framework و Container Runtime باید با یکدیگر سازگار باشند.
در محیطهای Containerized نیز باید دسترسی Container به GPU به درستی پیکربندی شود. این موضوع مخصوصاً زمانی اهمیت دارد که چند پروژه با نسخههای متفاوت PyTorch، TensorFlow یا سایر کتابخانهها روی یک سرور اجرا میشوند؛ Containerها میتوانند وابستگیهای نرم افزاری هر محیط را از دیگری جدا کنند.
4_ مانیتورینگ منابع سرور
Optimization بدون مانیتورینگ کامل نیست. هنگام Training باید GPU Utilization و VRAM، مصرف CPU، ظرفیت و پهنای باند RAM، I/O Storage و دمای قطعات بررسی شوند.
برای مثال، GPU Utilization پایین همیشه به معنی ضعیف بودن GPU نیست؛ ممکن است CPU در آماده سازی Batchها کند باشد، Storage داده را دیر تحویل دهد یا RAM کافی وجود نداشته باشد. در سرورهای HPE نیز iLO میتواند برای بررسی وضعیت سخت افزار، دما، فنها، Power و رخدادهای سیستم استفاده شود. بنابراین مانیتورینگ کمک میکند Bottleneck واقعی قبل از ارتقای بی دلیل سخت افزار شناسایی شود.
آیا سرور استوک HPE برای هوش مصنوعی مناسب است؟
سرور استوک HPE میتواند برای برخی پروژههای AI انتخاب مناسبی باشد، اما تصمیم گیری صرفاً براساس قیمت پایینتر اشتباه است. در خرید سرور استوک HP باید مشخص شود پلتفرم قدیمیتر تا چه اندازه با GPU و Workload موردنظر سازگار است و آیا محدودیتهای آن در آینده هزینه بیشتری ایجاد میکنند یا خیر.
یکی از مهمترین موارد، نسل PCIe است. GPU و NVMe جدید ممکن است روی PCIe نسل قدیمی قابل استفاده باشند، اما پهنای باند در سطح نسل قدیمی محدود خواهد شد. این محدودیت به خصوص در سیستمهای Multi-GPU یا Workloadهایی که حجم زیادی از داده میان CPU، GPU و Storage جابهجا میکنند اهمیت پیدا میکند.
پردازنده و RAM نیز باید بررسی شوند. سرور قدیمی ممکن است Core کافی داشته باشد، اما از نظر Memory Bandwidth، تعداد کانالهای حافظه، ظرفیت DIMM و نسل CPU نسبت به پلتفرم جدید محدودتر باشد. همچنین Power Efficiency نسلهای قدیمی معمولاً پایینتر است؛ بنابراین قیمت خرید کمتر ممکن است در استفاده طولانی مدت با مصرف برق و Cooling بیشتر همراه شود.
مهمتر از همه، GPU Compatibility است. باید مشخص شود شاسی، PCIe Riser، PSU، کابل برق، Cooling و Firmware سرور از GPU مورد نظر پشتیبانی میکنند یا خیر. بنابراین سرور استوک برای Lab، توسعه، Inference یا Training با بودجه محدود میتواند منطقی باشد؛ اما برای GPUهای جدید و Training سنگین، ابتدا باید محدودیتهای پلتفرم دقیق بررسی شوند.
چه زمانی HPE ProLiant Gen11 برای AI ارزش انتخاب دارد؟
در خرید سرور HP G11 برای هوش مصنوعی، مزیت اصلی را نباید صرفاً «جدیدتر بودن» در نظر گرفت. معیار مهمتر، Platform Capability یا توانایی پلتفرم برای پشتیبانی از CPU، حافظه، PCIe، Storage و Acceleratorهای مورد نیاز Workload است.
یکی از مزیتهای مهم نسل Gen11، استفاده از پلتفرمهای جدیدتر پردازنده و حافظه DDR5 در مدلهای مربوطه است. همچنین پشتیبانی از PCIe 5.0 در این نسل میتواند پهنای باند بیشتری برای GPU، NVMe و کارتهای شبکه پرسرعت فراهم کند. این ویژگیها در سرورهای Multi-GPU، Datasetهای حجیم و معماریهایی که انتقال داده زیادی دارند ارزش بیشتری پیدا میکنند.
Gen11 زمانی انتخاب منطقیتری است که پروژه به GPUهای سازگار جدیدتر، پهنای باند بالاتر PCIe، Memory Bandwidth بیشتر، NVMe سریع یا شبکه پرسرعت نیاز داشته باشد یا قرار باشد سرور چند سال توسعه پیدا کند.
اما برای هر پروژه AI الزاماً به Gen11 نیاز نیست. اگر Workload سبکتر باشد، GPU مورد نظر روی نسل قبلی به طور کامل پشتیبانی شود و محدودیت PCIe، RAM یا CPU ایجاد نشود، یک ProLiant قدیمیتر میتواند همچنان نیاز پروژه را برطرف کند. بنابراین انتخاب Gen11 باید بر اساس نیاز واقعی Workload و مسیر ارتقای آینده انجام شود، نه صرفاً شماره نسل سرور.
اشتباهات رایج در کانفیگ سرور HPE برای AI
یکی از اشتباهات رایج در کانفیگ سرور HPE برای هوش مصنوعی، انتخاب قطعات به صورت جداگانه و بدون توجه به ارتباط آنها با یکدیگر است. برای مثال، خرید GPU قدرتمند بدون بررسی GPU Compatibility سرور میتواند با محدودیت PCIe Riser، فضای فیزیکی، توان PSU یا سیستم Cooling مواجه شود. از طرف دیگر، کمبود VRAM میتواند اجرای مدلهای بزرگ یا Batch Size مورد نیاز را محدود کند؛ در حالی که RAM ناکافی یا Storage کند باعث میشود Data Pipeline نتواند داده را با سرعت مناسب در اختیار GPU قرار دهد.
اشتباه مهم دیگر، نادیده گرفتن PCIe Architecture است. نصب چند GPU، NVMe و کارت شبکه روی سرور به این معنی نیست که همه آنها الزاماً حداکثر پهنای باند خود را دریافت میکنند. نسل PCIe، تعداد Laneها، Riser Configuration و در سرورهای چند پردازندهای NUMA Topology باید بررسی شوند تا انتقال داده میان CPU، RAM، Storage و GPU به گلوگاه تبدیل نشود.
Power و Cooling نیز باید قبل از خرید GPU محاسبه شوند. توان نامناسب PSU، نبود کابل برق مورد نیاز GPU، Riser ناسازگار یا Cooling ناکافی میتواند امکان نصب کارت را محدود کند. صرف وجود اسلات PCIe روی سرور، تضمین کننده پشتیبانی از یک GPU خاص نیست و باید Compatibility رسمی همان مدل و نسل HPE ProLiant بررسی شود. در AI Clusterها نیز استفاده از شبکه ضعیف یکی از خطاهای مهم طراحی است. اگر چند Compute Node به Shared Storage دسترسی داشته باشند یا Distributed Training اجرا شود، محدودیت Bandwidth و Latency شبکه میتواند باعث انتظار GPUها برای دریافت داده یا Synchronization شود. بنابراین کانفیگ صحیح AI Server باید به صورت یک سیستم کامل شامل GPU، CPU، RAM، Storage، PCIe، Network، Power و Cooling بررسی شود.
جمع بندی
انتخاب سرور HPE برای هوش مصنوعی فقط به خرید قویترین GPU یا جدیدترین نسل سرور محدود نمیشود. عملکرد واقعی زمانی به دست میآید که قدرت GPU با ظرفیت VRAM و RAM، سرعت Storage، پهنای باند PCIe و شبکه و همچنین توان Power و Cooling متعادل باشد. نوع Workload، حجم Dataset، تعداد GPUها و امکان توسعه آینده نیز باید قبل از انتخاب کانفیگ مشخص شوند.
برای انتخاب قطعات سازگار و طراحی کانفیگ متناسب با Machine Learning، Deep Learning و سایر پردازشهای AI، میتوانید از مشاوره تخصصی ولکان سرور ایرانیان برای بررسی و انتخاب سرور HPE متناسب با نیاز پروژه استفاده کنید.
سؤال متداول
1. برای هوش مصنوعی GPU مهمتر است یا CPU سرور؟
در بسیاری از Deep Learning Workloadها بخش اصلی محاسبات روی GPU انجام میشود، اما CPU همچنان در Data Preprocessing، I/O و آماده سازی داده نقش دارد. بنابراین نسبت CPU به GPU باید بر اساس Pipeline انتخاب شود.
2. برای Training مدلهای AI چه مقدار VRAM لازم است؟
عدد ثابتی وجود ندارد. Model Size، Batch Size، Precision، Optimizer State، Activationها و نوع Training یا Fine-Tuning روی VRAM مورد نیاز تأثیر میگذارند.
3. آیا میتوان هر GPU دیتاسنتری را روی HPE ProLiant نصب کرد؟
خیر. علاوه بر PCIe Slot باید GPU Support مدل سرور، ابعاد کارت، Riser، توان PSU، کابل برق، Cooling و Firmware بررسی شوند.
4. NVMe چه تأثیری روی سرعت Machine Learning دارد؟
NVMe میتواند زمان بارگذاری Dataset، Checkpoint و عملیات I/O را کاهش دهد، اما افزایش سرعت Training زمانی محسوس است که Storage واقعاً Bottleneck باشد؛ اگر محدودیت اصلی GPU Compute یا Network باشد، صرفاً نصب NVMe مشکل را برطرف نمیکند.


