← بازگشت به فرادیدپست
✍️ سید ابوالفضل موسوی 📅 ۳۱ مرداد ۱۴۰۵ ساعت ۰۴:۲۴ 👁️ 3 بازدید
فرادید پست

هوش مصنوعی چندوجهی

متن، تصویر و صدا — گسترش سیستم MoE از مدل‌های زبانی به مدل‌های بینایی و شنیداری

بخش اول

Multimodal چیست؟

وقتی هوش مصنوعی می‌بیند، می‌شنود و می‌فهمد

Multimodal AI یعنی هوش مصنوعی که می‌تواند چند نوع ورودی را همزمان پردازش کند: متن، تصویر، صدا، و حتی ویدیو. انسان‌ها به طور طبیعی Multimodal هستند — ما می‌بینیم، می‌شنویم، می‌خوانیم و همه این‌ها را با هم می‌فهمیم. یک مدل Multimodal هم همین کار را می‌کند.

تصور کنید کاربری یک عکس از یک گیاه می‌فرستد و می‌پرسد: «این گیاه چیست و چطور از آن مراقبت کنم؟» یک مدل متنی ساده نمی‌تواند عکس را ببیند. اما مدل Multimodal عکس را تحلیل می‌کند، نوع گیاه را تشخیص می‌دهد، و راهنمایی متنی ارائه می‌دهد. این ترکیب بینایی + زبان قدرت اصلی Multimodal است.

👁️

بینایی (Vision)

تشخیص اشیا، خواندن متن از تصویر (OCR)، تحلیل عکس‌های پزشکی، درک صحنه‌های بصری.

👂

شنیداری (Audio)

تشخیص گفتار، تولید گفتار، تحلیل احساسات از صدا، ترجمه همزمان شفاهی.

📝

متنی (Text)

تولید متن، ترجمه، خلاصه‌سازی، پاسخ به سؤالات، استدلال منطقی.


بخش دوم

مدل‌های Multimodal

معرفی مدل‌های متن‌باز برای تصویر و صدا

مدل‌های بینایی (Vision Models)

مدل پارامتر کار نیاز GPU
LLaVA 7B ۷ میلیارد فهم تصویر + متن ۱۶-۳۲ گیگابایت
LLaVA 13B ۱۳ میلیارد فهم تصویر پیشرفته ۳۲-۶۴ گیگابایت
Qwen-VL 7B ۷ میلیارد چندزبانه + تصویر ۱۶-۳۲ گیگابایت
InternVL 13B ۱۳ میلیارد فهم دقیق تصویر ۳۲-۶۴ گیگابایت

مدل‌های تولید تصویر (Image Generation)

مدل کار نیاز GPU
Stable Diffusion 1.5 تولید تصویر پایه ۴-۸ گیگابایت
Stable Diffusion XL تولید تصویر با کیفیت بالا ۸-۱۶ گیگابایت
FLUX.1 نسل جدید تولید تصویر ۱۶-۲۴ گیگابایت
نکته مهم: با یک سرور دارای ۱۹۲ گیگابایت حافظه GPU، می‌توانید ۶ تا ۱۲ مدل LLaVA 7B را همزمان بارگذاری کنید — یا ترکیبی از مدل‌های متنی، تصویری و صوتی. این یعنی یک سرور برای سرویس‌دهی Multimodal کافی است.

بخش سوم

آموزش مدل‌های Multimodal

اضافه کردن ۵۰ مدل تصویری و صوتی به ۱۰۰ مدل متنی

حالا که ۱۰۰ مدل متنی داریم، می‌خواهیم ۵۰ مدل Multimodal اضافه کنیم: ۱۵ مدل تصویری، ۱۰ مدل صوتی، و ۵ مدل ترکیبی. با همان روش LoRA و آموزش موازی روی ۴ سرور، این کار ۳.۵ ماه طول می‌کشد.

فاز مدل‌ها زمان
۱: متنی ۱۰۰ مدل 7B ۶ ماه
۲: تصویری ۱۵ مدل ۲-۳ ماه
۳: صوتی ۱۰ مدل ۱-۲ ماه
۴: ترکیبی ۵ مدل ۱ ماه
جمع ۱۳۰ مدل ۱۰-۱۲ ماه

🔄 فرآیند آموزش Multimodal

📥
۱. جمع‌آوری داده تصویری/صوتی

تصاویر برچسب‌خورده، عکس‌های پزشکی، فایل‌های صوتی با متن پیاده‌شده

🧊
۲. Fine-tuning با LoRA

مدل پایه LLaVA یا Qwen-VL با داده تخصصی آموزش می‌بیند

💾
۳. ذخیره روی Storage

هر مدل Multimodal ۷-۱۴ گیگابایت فضا می‌گیرد

🧭
۴. اتصال به Router

Router جدید تشخیص می‌دهد: متن؟ تصویر؟ صدا؟


بخش چهارم

معماری نهایی Multimodal

یک سیستم یکپارچه که می‌بیند، می‌شنود و می‌فهمد

🏗️ معماری کامل Multimodal MoE

📥
ورودی کاربر

متن / تصویر / صدا / ترکیبی

🧭
Router اصلی

تشخیص نوع ورودی: متنی؟ تصویری؟ صوتی؟

📝
Expert های متنی

۱۰۰ مدل 7B — زبان‌ها و تخصص‌ها

👁️
Expert های تصویری

۱۵ مدل — LLaVA، Qwen-VL، Stable Diffusion

👂
Expert های صوتی

۱۰ مدل — تشخیص و تولید گفتار

📤
ترکیب و پاسخ

پاسخ نهایی می‌تواند متن، تصویر یا صدا باشد

🔮 مثال واقعی: کاربر عکس MRI می‌فرستد و می‌پرسد: «مشکل کجاست؟» Router تشخیص می‌دهد: تصویر + پزشکی. Expert تصویری پزشکی عکس را تحلیل می‌کند و Expert متنی فارسی توضیح می‌دهد. پاسخ نهایی: «در ناحیه L3 دیسک بیرون‌زدگی دیده می‌شود...» — ترکیبی از بینایی و زبان.

بخش پنجم

جمع‌بندی

از متن به چندوجهی — یک قدم تا AGI

با اضافه شدن ۵۰ مدل Multimodal به ۱۰۰ مدل متنی، سیستم ما حالا ۱۳۰ Expert دارد که می‌توانند متن، تصویر و صدا را پردازش کنند. پارامتر کل سیستم به ۱ تریلیون نزدیک می‌شود — اما در هر سؤال فقط ۱۴-۲۸ میلیارد پارامتر فعال می‌شوند.

این سیستم حالا می‌تواند:

🌟

گام بعدی: Dense Model

در مقاله بعدی، به سراغ فشرده‌سازی این ۱۳۰ مدل به یک Dense Model می‌رویم — تا دانش همه Expert ها را در یک مدل یکپارچه جمع کنیم.