از پردازنده تا GPU — راهنمای کامل پیکربندی سرور برای آموزش و سرویسدهی مدلهای هوش مصنوعی
در دنیای سرورهای هوش مصنوعی، پردازنده نقش مدیر ارکستر را دارد. GPU ها ستارههای اصلی اجرا هستند، اما این CPU است که دادهها را آماده میکند، حافظه را مدیریت میکند، و GPU ها را هماهنگ مینماید. انتخاب پردازنده مناسب به معنای انتخاب بین Intel Xeon و AMD EPYC است — نه پردازندههای خانگی Core یا Ryzen.
چرا Xeon و نه Core؟ پردازندههای سرور (Xeon Scalable یا EPYC) از حافظه ECC پشتیبانی میکنند که خطاهای حافظه را تصحیح میکند — چیزی که در آموزش چند هفتهای مدلهای AI حیاتی است. آنها همچنین از چند پردازنده همزمان (معمولاً ۲ عدد) پشتیبانی میکنند و تعداد هستههای بیشتری دارند. یک Xeon Platinum میتواند تا ۶۴ هسته و ۱۲۸ ترد داشته باشد — چهار برابر قویترین Core i9.
| پردازنده | هسته | ترد | حافظه ECC | مناسب برای |
|---|---|---|---|---|
| Intel Core i9 | ۲۴ | ۳۲ | ❌ ندارد | خانگی |
| Xeon Silver 4410Y | ۱۲ | ۲۴ | ✅ دارد | شروع |
| Xeon Gold 5512U | ۲۸ | ۵۶ | ✅ دارد | پیشنهادی |
| Xeon Platinum 8592+ | ۶۴ | ۱۲۸ | ✅ دارد | حرفهای |
| AMD EPYC 9654 | ۹۶ | ۱۹۲ | ✅ دارد | قدرتمند |
در هوش مصنوعی، GPU همه چیز است. آموزش مدلهای بزرگ — از LLaMA 7B تا GPT-4 — نیاز به هزاران میلیارد عملیات ماتریسی دارد که فقط GPU ها میتوانند آنها را بهصورت موازی انجام دهند. یک GPU خوب میتواند آموزش را ۱۰۰ برابر سریعتر از CPU کند.
GPU های مخصوص هوش مصنوعی از معماری Tensor Core استفاده میکنند — هستههایی که برای عملیات ماتریسی بهینه شدهاند. سه گزینه اصلی برای سرورهای AI وجود دارد:
| GPU | حافظه | توان مصرفی | مناسب برای | وضعیت در ایران |
|---|---|---|---|---|
| NVIDIA L40S | ۴۸ گیگابایت | ۳۵۰ وات | آموزش و استنتاج | موجود |
| NVIDIA A100 | ۸۰ گیگابایت | ۴۰۰ وات | آموزش سنگین | محدود |
| NVIDIA H100 | ۸۰ گیگابایت | ۷۰۰ وات | بهترین | تحریم |
برای آموزش مدلهای مختلف، حافظه GPU تعیینکننده است:
| مدل | پارامتر | حافظه GPU لازم | L40S لازم |
|---|---|---|---|
| LLaMA 7B | ۷ میلیارد | ۱۴-۲۸ گیگابایت | ۱ عدد |
| LLaMA 13B | ۱۳ میلیارد | ۲۶-۵۲ گیگابایت | ۱-۲ عدد |
| LLaMA 70B | ۷۰ میلیارد | ۱۴۰-۲۸۰ گیگابایت | ۳-۶ عدد |
| GPT-3 | ۱۷۵ میلیارد | ۳۵۰-۷۰۰ گیگابایت | ۸-۱۵ عدد |
در آموزش مدلهای هوش مصنوعی، فقط GPU مهم نیست — حافظه RAM و ذخیرهسازی نیز نقش حیاتی دارند. اگر GPU سریع باشد اما دادهها به کندی به آن برسند، تمام قدرت GPU هدر میرود.
برای آموزش مدلهای بزرگ، قانون ساده است: RAM باید حداقل ۲ برابر حافظه GPU باشد. اگر ۴ عدد L40S با ۱۹۲ گیگابایت حافظه GPU دارید، حداقل ۳۸۴ گیگابایت RAM نیاز دارید. برای کار حرفهای، ۵۱۲ گیگابایت تا ۱ ترابایت پیشنهاد میشود.
| پیکربندی GPU | حافظه GPU | RAM پیشنهادی |
|---|---|---|
| ۱ عدد L40S | ۴۸ گیگابایت | ۱۲۸ گیگابایت |
| ۲ عدد L40S | ۹۶ گیگابایت | ۲۵۶ گیگابایت |
| ۴ عدد L40S | ۱۹۲ گیگابایت | ۵۱۲ گیگابایت |
برای آموزش AI، NVMe SSD انتخاب اصلی است. سرعت خواندن و نوشتن NVMe تا ۷ گیگابایت بر ثانیه میرسد — ۱۰ برابر سریعتر از SSD معمولی SATA. این سرعت برای بارگذاری دیتاستهای بزرگ و ذخیره چکپوینتهای مدل حیاتی است.
| نوع ذخیرهسازی | سرعت خواندن | مناسب برای |
|---|---|---|
| HDD | ۲۵۰ مگابایت/ثانیه | بکاپ فقط |
| SATA SSD | ۵۵۰ مگابایت/ثانیه | عمومی |
| NVMe SSD | ۷۰۰۰ مگابایت/ثانیه | AI و دیتابیس |
حالا که تمام اجزا را شناختیم، میتوانیم یک پیکربندی کامل و حرفهای برای سرور AI ارائه دهیم. این پیکربندی بر اساس HPE ProLiant DL380 Gen12 — یکی از بهترین سرورهای رکمونت 2U موجود در بازار — طراحی شده است.
| قطعه | مشخصات پیشنهادی | تعداد |
|---|---|---|
| سرور | HPE ProLiant DL380 Gen12 | ۱ |
| پردازنده | Intel Xeon Gold 5512U (28 هسته) | ۲ |
| RAM | DDR5 ECC 64GB | ۸ (مجموع ۵۱۲ گیگابایت) |
| GPU | NVIDIA L40S 48GB | ۴ (مجموع ۱۹۲ گیگابایت) |
| ذخیرهسازی | NVMe SSD 3.84TB | ۸ (RAID 10) |
| RAID Controller | HPE Smart Array P408i-a | ۱ |
| شبکه | 25GbE SFP28 | ۲ پورت |
| پاور | 1600W Platinum | ۲ (Redundant) |
اصل انتخاب سرور AI: همیشه GPU را اول انتخاب کنید — بقیه قطعات را بر اساس آن بچینید. پردازنده باید توانایی تغذیه GPU ها را داشته باشد، RAM باید دو برابر حافظه GPU باشد، و ذخیرهسازی باید به اندازه کافی سریع باشد که GPU ها منتظر داده نمانند. اگر GPU درست انتخاب شود، بقیه قطعات خودشان سر جایشان قرار میگیرند.
در این مقاله، تمام اجزای یک سرور هوش مصنوعی را بررسی کردیم: پردازنده Xeon با حافظه ECC، کارت گرافیک L40S با ۴۸ گیگابایت حافظه، حافظه RAM با ظرفیت دو برابر GPU، و ذخیرهسازی NVMe با سرعت ۷ گیگابایت بر ثانیه. با ۴ سرور مجهز به این مشخصات، شما آمادهاید که وارد مرحله بعدی شوید: آموزش مدلهای هوش مصنوعی.
در مقاله بعدی، به سراغ مفاهیم بنیادی هوش مصنوعی میرویم: مدلهای زبانی بزرگ (LLM) چگونه کار میکنند؟ تفاوت بین Sparse و Dense چیست؟ معماری MoE (Mixture of Experts) چگونه به GPT-4 کمک میکند؟ و چرا ۱۰۰ مدل 7B میتوانند از یک مدل 700B بهتر باشند؟
سرورها آمادهاند. GPU ها منتظرند. حالا وقت آن است که وارد دنیای مدلهای زبانی بزرگ شویم — جایی که مفاهیمی مثل Dense، Sparse، MoE و Multimodal معنا پیدا میکنند.