متن، تصویر و صدا — گسترش سیستم MoE از مدلهای زبانی به مدلهای بینایی و شنیداری
Multimodal AI یعنی هوش مصنوعی که میتواند چند نوع ورودی را همزمان پردازش کند: متن، تصویر، صدا، و حتی ویدیو. انسانها به طور طبیعی Multimodal هستند — ما میبینیم، میشنویم، میخوانیم و همه اینها را با هم میفهمیم. یک مدل Multimodal هم همین کار را میکند.
تصور کنید کاربری یک عکس از یک گیاه میفرستد و میپرسد: «این گیاه چیست و چطور از آن مراقبت کنم؟» یک مدل متنی ساده نمیتواند عکس را ببیند. اما مدل Multimodal عکس را تحلیل میکند، نوع گیاه را تشخیص میدهد، و راهنمایی متنی ارائه میدهد. این ترکیب بینایی + زبان قدرت اصلی Multimodal است.
تشخیص اشیا، خواندن متن از تصویر (OCR)، تحلیل عکسهای پزشکی، درک صحنههای بصری.
تشخیص گفتار، تولید گفتار، تحلیل احساسات از صدا، ترجمه همزمان شفاهی.
تولید متن، ترجمه، خلاصهسازی، پاسخ به سؤالات، استدلال منطقی.
| مدل | پارامتر | کار | نیاز GPU |
|---|---|---|---|
| LLaVA 7B | ۷ میلیارد | فهم تصویر + متن | ۱۶-۳۲ گیگابایت |
| LLaVA 13B | ۱۳ میلیارد | فهم تصویر پیشرفته | ۳۲-۶۴ گیگابایت |
| Qwen-VL 7B | ۷ میلیارد | چندزبانه + تصویر | ۱۶-۳۲ گیگابایت |
| InternVL 13B | ۱۳ میلیارد | فهم دقیق تصویر | ۳۲-۶۴ گیگابایت |
| مدل | کار | نیاز GPU |
|---|---|---|
| Stable Diffusion 1.5 | تولید تصویر پایه | ۴-۸ گیگابایت |
| Stable Diffusion XL | تولید تصویر با کیفیت بالا | ۸-۱۶ گیگابایت |
| FLUX.1 | نسل جدید تولید تصویر | ۱۶-۲۴ گیگابایت |
حالا که ۱۰۰ مدل متنی داریم، میخواهیم ۵۰ مدل Multimodal اضافه کنیم: ۱۵ مدل تصویری، ۱۰ مدل صوتی، و ۵ مدل ترکیبی. با همان روش LoRA و آموزش موازی روی ۴ سرور، این کار ۳.۵ ماه طول میکشد.
| فاز | مدلها | زمان |
|---|---|---|
| ۱: متنی | ۱۰۰ مدل 7B | ۶ ماه |
| ۲: تصویری | ۱۵ مدل | ۲-۳ ماه |
| ۳: صوتی | ۱۰ مدل | ۱-۲ ماه |
| ۴: ترکیبی | ۵ مدل | ۱ ماه |
| جمع | ۱۳۰ مدل | ۱۰-۱۲ ماه |
تصاویر برچسبخورده، عکسهای پزشکی، فایلهای صوتی با متن پیادهشده
مدل پایه LLaVA یا Qwen-VL با داده تخصصی آموزش میبیند
هر مدل Multimodal ۷-۱۴ گیگابایت فضا میگیرد
Router جدید تشخیص میدهد: متن؟ تصویر؟ صدا؟
متن / تصویر / صدا / ترکیبی
تشخیص نوع ورودی: متنی؟ تصویری؟ صوتی؟
۱۰۰ مدل 7B — زبانها و تخصصها
۱۵ مدل — LLaVA، Qwen-VL، Stable Diffusion
۱۰ مدل — تشخیص و تولید گفتار
پاسخ نهایی میتواند متن، تصویر یا صدا باشد
با اضافه شدن ۵۰ مدل Multimodal به ۱۰۰ مدل متنی، سیستم ما حالا ۱۳۰ Expert دارد که میتوانند متن، تصویر و صدا را پردازش کنند. پارامتر کل سیستم به ۱ تریلیون نزدیک میشود — اما در هر سؤال فقط ۱۴-۲۸ میلیارد پارامتر فعال میشوند.
این سیستم حالا میتواند:
در مقاله بعدی، به سراغ فشردهسازی این ۱۳۰ مدل به یک Dense Model میرویم — تا دانش همه Expert ها را در یک مدل یکپارچه جمع کنیم.