← بازگشت به فرادیدپست
✍️ سید ابوالفضل موسوی 📅 ۳۱ مرداد ۱۴۰۵ ساعت ۰۴:۰۹ 👁️ 3 بازدید
فرادید پست

انتخاب سرورهای AI

از پردازنده تا GPU — راهنمای کامل پیکربندی سرور برای آموزش و سرویس‌دهی مدل‌های هوش مصنوعی

بخش اول

پردازنده (CPU)

قلب محاسباتی سرور — چرا Xeon و نه Core

در دنیای سرورهای هوش مصنوعی، پردازنده نقش مدیر ارکستر را دارد. GPU ها ستاره‌های اصلی اجرا هستند، اما این CPU است که داده‌ها را آماده می‌کند، حافظه را مدیریت می‌کند، و GPU ها را هماهنگ می‌نماید. انتخاب پردازنده مناسب به معنای انتخاب بین Intel Xeon و AMD EPYC است — نه پردازنده‌های خانگی Core یا Ryzen.

چرا Xeon و نه Core؟ پردازنده‌های سرور (Xeon Scalable یا EPYC) از حافظه ECC پشتیبانی می‌کنند که خطاهای حافظه را تصحیح می‌کند — چیزی که در آموزش چند هفته‌ای مدل‌های AI حیاتی است. آن‌ها همچنین از چند پردازنده همزمان (معمولاً ۲ عدد) پشتیبانی می‌کنند و تعداد هسته‌های بیشتری دارند. یک Xeon Platinum می‌تواند تا ۶۴ هسته و ۱۲۸ ترد داشته باشد — چهار برابر قوی‌ترین Core i9.

پردازنده هسته ترد حافظه ECC مناسب برای
Intel Core i9 ۲۴ ۳۲ ❌ ندارد خانگی
Xeon Silver 4410Y ۱۲ ۲۴ ✅ دارد شروع
Xeon Gold 5512U ۲۸ ۵۶ ✅ دارد پیشنهادی
Xeon Platinum 8592+ ۶۴ ۱۲۸ ✅ دارد حرفه‌ای
AMD EPYC 9654 ۹۶ ۱۹۲ ✅ دارد قدرتمند
پیشنهاد ما: برای سرورهای AI، دو عدد Intel Xeon Gold 5512U (هر کدام ۲۸ هسته، مجموعاً ۵۶ هسته و ۱۱۲ ترد) تعادل مناسبی بین قیمت و قدرت پردازشی ایجاد می‌کند. اگر بودجه بالاتری دارید، Xeon Platinum 8592+ با ۶۴ هسته انتخاب بهتری است.

بخش دوم

واحد پردازش گرافیکی (GPU)

موتور اصلی آموزش AI — انتخاب بین L40S، H100 و A100

در هوش مصنوعی، GPU همه چیز است. آموزش مدل‌های بزرگ — از LLaMA 7B تا GPT-4 — نیاز به هزاران میلیارد عملیات ماتریسی دارد که فقط GPU ها می‌توانند آن‌ها را به‌صورت موازی انجام دهند. یک GPU خوب می‌تواند آموزش را ۱۰۰ برابر سریع‌تر از CPU کند.

معماری GPU برای AI

GPU های مخصوص هوش مصنوعی از معماری Tensor Core استفاده می‌کنند — هسته‌هایی که برای عملیات ماتریسی بهینه شده‌اند. سه گزینه اصلی برای سرورهای AI وجود دارد:

GPU حافظه توان مصرفی مناسب برای وضعیت در ایران
NVIDIA L40S ۴۸ گیگابایت ۳۵۰ وات آموزش و استنتاج موجود
NVIDIA A100 ۸۰ گیگابایت ۴۰۰ وات آموزش سنگین محدود
NVIDIA H100 ۸۰ گیگابایت ۷۰۰ وات بهترین تحریم
⚠️ واقعیت بازار ایران: H100 به دلیل تحریم‌ها در ایران موجود نیست. A100 به‌سختی پیدا می‌شود و قیمت بسیار بالایی دارد. L40S بهترین گزینه واقع‌بینانه است — با ۴۸ گیگابایت حافظه، می‌تواند مدل‌های تا ۷۰ میلیارد پارامتری را با روش‌های بهینه‌سازی (LoRA/QLoRA) آموزش دهد.

چه تعداد GPU لازم داریم؟

برای آموزش مدل‌های مختلف، حافظه GPU تعیین‌کننده است:

مدل پارامتر حافظه GPU لازم L40S لازم
LLaMA 7B ۷ میلیارد ۱۴-۲۸ گیگابایت ۱ عدد
LLaMA 13B ۱۳ میلیارد ۲۶-۵۲ گیگابایت ۱-۲ عدد
LLaMA 70B ۷۰ میلیارد ۱۴۰-۲۸۰ گیگابایت ۳-۶ عدد
GPT-3 ۱۷۵ میلیارد ۳۵۰-۷۰۰ گیگابایت ۸-۱۵ عدد
💡 پیکربندی پیشنهادی: هر سرور DL380 Gen12 می‌تواند تا ۴ عدد L40S (مجموعاً ۱۹۲ گیگابایت حافظه GPU) داشته باشد. این یعنی یک سرور می‌تواند مدل‌های 7B تا 13B را به‌راحتی آموزش دهد. برای مدل‌های 70B، به ۲-۴ سرور نیاز دارید.

بخش سوم

حافظه RAM و ذخیره‌سازی

سرعت دسترسی به داده — گلوگاه پنهان آموزش AI

در آموزش مدل‌های هوش مصنوعی، فقط GPU مهم نیست — حافظه RAM و ذخیره‌سازی نیز نقش حیاتی دارند. اگر GPU سریع باشد اما داده‌ها به کندی به آن برسند، تمام قدرت GPU هدر می‌رود.

حافظه RAM

برای آموزش مدل‌های بزرگ، قانون ساده است: RAM باید حداقل ۲ برابر حافظه GPU باشد. اگر ۴ عدد L40S با ۱۹۲ گیگابایت حافظه GPU دارید، حداقل ۳۸۴ گیگابایت RAM نیاز دارید. برای کار حرفه‌ای، ۵۱۲ گیگابایت تا ۱ ترابایت پیشنهاد می‌شود.

پیکربندی GPU حافظه GPU RAM پیشنهادی
۱ عدد L40S ۴۸ گیگابایت ۱۲۸ گیگابایت
۲ عدد L40S ۹۶ گیگابایت ۲۵۶ گیگابایت
۴ عدد L40S ۱۹۲ گیگابایت ۵۱۲ گیگابایت

ذخیره‌سازی NVMe

برای آموزش AI، NVMe SSD انتخاب اصلی است. سرعت خواندن و نوشتن NVMe تا ۷ گیگابایت بر ثانیه می‌رسد — ۱۰ برابر سریع‌تر از SSD معمولی SATA. این سرعت برای بارگذاری دیتاست‌های بزرگ و ذخیره چک‌پوینت‌های مدل حیاتی است.

نوع ذخیره‌سازی سرعت خواندن مناسب برای
HDD ۲۵۰ مگابایت/ثانیه بکاپ فقط
SATA SSD ۵۵۰ مگابایت/ثانیه عمومی
NVMe SSD ۷۰۰۰ مگابایت/ثانیه AI و دیتابیس
💾 پیکربندی پیشنهادی: برای هر سرور AI، ۸ عدد NVMe SSD 3.84TB با RAID 10 (ظرفیت مفید ۱۵.۳ ترابایت) بهترین انتخاب است. این پیکربندی هم سرعت فوق‌العاده دارد و هم امنیت داده با تحمل خرابی ۲ دیسک.

بخش چهارم

پیکربندی کامل سرور

یک سرور AI همه‌چیز تمام — قطعه به قطعه

حالا که تمام اجزا را شناختیم، می‌توانیم یک پیکربندی کامل و حرفه‌ای برای سرور AI ارائه دهیم. این پیکربندی بر اساس HPE ProLiant DL380 Gen12 — یکی از بهترین سرورهای رک‌مونت 2U موجود در بازار — طراحی شده است.

قطعه مشخصات پیشنهادی تعداد
سرور HPE ProLiant DL380 Gen12 ۱
پردازنده Intel Xeon Gold 5512U (28 هسته) ۲
RAM DDR5 ECC 64GB ۸ (مجموع ۵۱۲ گیگابایت)
GPU NVIDIA L40S 48GB ۴ (مجموع ۱۹۲ گیگابایت)
ذخیره‌سازی NVMe SSD 3.84TB ۸ (RAID 10)
RAID Controller HPE Smart Array P408i-a ۱
شبکه 25GbE SFP28 ۲ پورت
پاور 1600W Platinum ۲ (Redundant)
💰 هزینه تقریبی هر سرور: این پیکربندی کامل حدود ۲ تا ۳ میلیارد تومان هزینه دارد. برای ۴ سرور، بودجه‌ای معادل ۸ تا ۱۲ میلیارد تومان لازم است. این سرمایه‌گذاری اولیه برای زیرساختی است که می‌تواند ۵ تا ۷ سال سرویس‌دهی کند.
اصل انتخاب سرور AI: همیشه GPU را اول انتخاب کنید — بقیه قطعات را بر اساس آن بچینید. پردازنده باید توانایی تغذیه GPU ها را داشته باشد، RAM باید دو برابر حافظه GPU باشد، و ذخیره‌سازی باید به اندازه کافی سریع باشد که GPU ها منتظر داده نمانند. اگر GPU درست انتخاب شود، بقیه قطعات خودشان سر جایشان قرار می‌گیرند.

بخش پنجم

جمع‌بندی

سرور AI آماده — گام بعدی: آموزش مدل‌های 7B

در این مقاله، تمام اجزای یک سرور هوش مصنوعی را بررسی کردیم: پردازنده Xeon با حافظه ECC، کارت گرافیک L40S با ۴۸ گیگابایت حافظه، حافظه RAM با ظرفیت دو برابر GPU، و ذخیره‌سازی NVMe با سرعت ۷ گیگابایت بر ثانیه. با ۴ سرور مجهز به این مشخصات، شما آماده‌اید که وارد مرحله بعدی شوید: آموزش مدل‌های هوش مصنوعی.

در مقاله بعدی، به سراغ مفاهیم بنیادی هوش مصنوعی می‌رویم: مدل‌های زبانی بزرگ (LLM) چگونه کار می‌کنند؟ تفاوت بین Sparse و Dense چیست؟ معماری MoE (Mixture of Experts) چگونه به GPT-4 کمک می‌کند؟ و چرا ۱۰۰ مدل 7B می‌توانند از یک مدل 700B بهتر باشند؟

🚀

از سخت‌افزار به نرم‌افزار

سرورها آماده‌اند. GPU ها منتظرند. حالا وقت آن است که وارد دنیای مدل‌های زبانی بزرگ شویم — جایی که مفاهیمی مثل Dense، Sparse، MoE و Multimodal معنا پیدا می‌کنند.