← بازگشت به فرادیدپست
✍️ سید ابوالفضل موسوی 📅 ۳۱ مرداد ۱۴۰۵ ساعت ۰۴:۱۷ 👁️ 4 بازدید
فرادید پست

مفاهیم بنیادی هوش مصنوعی

از Dense تا MoE — آشنایی عمیق با معماری مدل‌های زبانی بزرگ و تفاوت‌های بنیادین آن‌ها

بخش اول

مدل زبانی بزرگ چیست؟

درک پایه‌ای از LLM — مغز متفکر هوش مصنوعی مدرن

یک مدل زبانی بزرگ (Large Language Model — LLM) یک شبکه عصبی عظیم است که با میلیاردها پارامتر (وزن‌های قابل تنظیم) آموزش دیده تا متن را بفهمد و تولید کند. وقتی شما از ChatGPT سؤال می‌پرسید، در واقع میلیاردها عملیات ریاضی روی میلیاردها عدد انجام می‌شود تا پاسخ مناسب تولید شود. این اعداد — که پارامتر نامیده می‌شوند — دانش مدل را در خود ذخیره کرده‌اند.

پارامترها مثل اتصالات مغز هستند. یک مدل ۷ میلیارد پارامتری (7B) یعنی ۷ میلیارد عدد قابل تنظیم. مدل GPT-4 تخمین زده می‌شود که بیش از ۱ تریلیون پارامتر داشته باشد. هر چه پارامتر بیشتر، مدل باهوش‌تر — اما سنگین‌تر و گران‌تر. نکته کلیدی این است: فقط پارامتر بیشتر مهم نیست، نحوه استفاده از آن‌ها مهم‌تر است.

مدل پارامتر حافظه لازم مناسب برای
GPT-2 ۱.۵ میلیارد ۳ گیگابایت تحقیقات
LLaMA 7B ۷ میلیارد ۱۴ گیگابایت سرور معمولی
LLaMA 70B ۷۰ میلیارد ۱۴۰ گیگابایت کلاستر
GPT-3 ۱۷۵ میلیارد ۳۵۰ گیگابایت دیتاسنتر
GPT-4 ۱+ تریلیون ۲+ ترابایت ابررایانه

بخش دوم

معماری Dense

وقتی همه نورون‌ها همیشه فعال هستند

در یک مدل Dense (چگال)، همه پارامترها برای هر ورودی فعال می‌شوند. یعنی وقتی شما یک سؤال از مدل Dense می‌پرسید، تمام ۷ میلیارد یا ۷۰ میلیارد پارامتر مدل درگیر محاسبه می‌شوند — حتی اگر سؤال فقط درباره «آب و هوا» باشد و نیمی از پارامترها درباره «برنامه‌نویسی» آموزش دیده باشند.

این معماری ساده و قابل فهم است، اما یک مشکل اساسی دارد: اتلاف منابع. تصور کنید برای هر سؤال، تمام کارکنان یک شرکت — از حسابدار تا آشپز — باید نظر بدهند، حتی اگر سؤال فقط مربوط به بخش فروش باشد. این دقیقاً کاری است که مدل Dense انجام می‌دهد.

⚠️ مشکل Dense: آموزش یک مدل Dense 700 میلیارد پارامتری نیاز به ۱۸ تا ۷۳ سرور مجهز دارد و هزینه‌اش ۵۴ تا ۲۱۹ میلیارد تومان است. در استنتاج هم هر بار تمام ۷۰۰ میلیارد پارامتر باید محاسبه شوند — یعنی کندی و هزینه بالا برای هر پاسخ.

🧠 مدل Dense — همه چیز همیشه فعال

📥
ورودی

سؤال کاربر وارد مدل می‌شود

تمام ۷۰۰ میلیارد پارامتر

همه لایه‌ها و همه نورون‌ها فعال می‌شوند — بدون استثنا

📤
خروجی

پاسخ تولید می‌شود


بخش سوم

معماری Sparse و MoE

هوشمندانه‌تر: فقط بخشی از مدل برای هر سؤال فعال شود

Sparse (تنک) یعنی همه چیز همیشه فعال نیست. و MoE (Mixture of Experts) یعنی ترکیب چند متخصص. در این معماری، مدل از چندین Expert (متخصص) تشکیل شده — هر کدام در یک زمینه خاص آموزش دیده‌اند. یک Router (مسیریاب) کوچک تصمیم می‌گیرد هر سؤال به کدام Expert ها برود.

این معماری دقیقاً مثل یک بیمارستان است. وقتی شما با مشکل قلبی مراجعه می‌کنید، به جای اینکه همه پزشکان بیمارستان (از متخصص پوست تا دندانپزشک) شما را ویزیت کنند، فقط متخصص قلب معاینه می‌کند. نتیجه: کارایی بالاتر، سرعت بیشتر، و هزینه کمتر.

🏥 مدل MoE — فقط متخصصان مرتبط فعال می‌شوند

📥
ورودی

سؤال «قلب چگونه کار می‌کند؟» وارد مدل می‌شود

🧭
Router (مسیریاب)

تشخیص می‌دهد: این سؤال پزشکی است → Expert قلب و Expert عمومی

👨‍⚕️
فقط ۲-۴ Expert فعال

از بین ۱۰۰ Expert، فقط ۲-۴ متخصص مرتبط فعال می‌شوند — بقیه خاموش می‌مانند

📤
خروجی

پاسخ از ترکیب خروجی Expert های فعال تولید می‌شود

مزیت MoE: مدل Mixtral 8x7B — با ۸ Expert که هر کدام ۷ میلیارد پارامتر دارند — مجموعاً ۵۶ میلیارد پارامتر دارد، اما در هر سؤال فقط ۲ Expert فعال می‌شوند (۱۴ میلیارد). نتیجه: کیفیت نزدیک به مدل ۵۶ میلیاردی با هزینه محاسباتی مدل ۱۴ میلیاردی!

بخش چهارم

مقایسه Dense و MoE

اعداد واقعی: چرا GPT-4 از MoE استفاده می‌کند؟
ویژگی Dense 700B Sparse MoE (100×7B)
پارامتر کل ۷۰۰ میلیارد ۷۰۰ میلیارد
پارامتر فعال در هر سؤال ۷۰۰ میلیارد ۱۴-۲۸ میلیارد
سرور لازم ۱۸-۷۳ ۴
هزینه ۵۴-۲۱۹ میلیارد ۸-۱۲ میلیارد
سرعت استنتاج کند سریع
کیفیت ۱۰۰٪ ۸۵-۹۵٪
درس بزرگ GPT-4: شایعات قوی حاکی از آن است که GPT-4 از معماری MoE با ۸ تا ۱۶ Expert استفاده می‌کند — نه یک مدل Dense عظیم. این یعنی OpenAI هم به این نتیجه رسیده که هوشمندانه استفاده کردن از منابع، بهتر از منابع بیشتر است.

بخش پنجم

جمع‌بندی

مسیر ما: از ۱۰۰ مدل 7B تا یک MoE قدرتمند

حالا که مفاهیم پایه را فهمیدیم، می‌دانیم چرا استراتژی ۱۰۰ مدل 7B هوشمندانه است: به‌جای اینکه یک مدل Dense 700 میلیاردی عظیم بسازیم که همه چیز را همیشه فعال کند، ۱۰۰ مدل 7B تخصصی می‌سازیم — هر کدام برای یک زبان یا یک تخصص دانشگاهی — و با یک Router هوشمند، فقط ۲-۴ مدل مرتبط را برای هر سؤال فعال می‌کنیم.

نتیجه: ۷۰۰ میلیارد پارامتر کل با هزینه محاسباتی فقط ۱۴-۲۸ میلیارد در هر سؤال. این یعنی کیفیت نزدیک به GPT-4 با یک‌دهم هزینه — و مهم‌تر از همه، قابل اجرا با ۴ سرور که در مقالات قبلی طراحی کردیم.

🧩

حالا آماده‌ایم

با فهم Dense، Sparse و MoE، در مقاله بعدی به سراغ آموزش عملی ۱۰۰ مدل 7B می‌رویم — از داده‌های تخصصی تا مسیریاب و استقرار نهایی.