فشردهسازی دانش ۱۳۰ مدل تخصصی در یک مدل یکپارچه — از Sparse به Dense
تاکنون سیستمی با ۱۳۰ مدل تخصصی ساختهایم — ۱۰۰ مدل متنی، ۱۵ مدل تصویری، ۱۰ مدل صوتی و ۵ مدل ترکیبی. این سیستم Sparse (تنک) با معماری MoE کار میکند و فقط ۲-۴ مدل را برای هر سؤال فعال میکند. اما یک مشکل دارد: پیچیدگی مدیریت. ۱۳۰ مدل یعنی ۱۳۰ بار بهروزرسانی، ۱۳۰ بار بکاپگیری، و ۱۳۰ بار مانیتورینگ.
Dense Model همه این دانش را در یک مدل یکپارچه جمع میکند. بهجای ۱۳۰ فایل جداگانه، یک فایل ۷-۱۴ گیگابایتی. بهجای ۱۳۰ بار بهروزرسانی، یک بار. بهجای Router پیچیده، یک مدل ساده. این سادگی برای استقرار در موبایل، Edge و API ارزان حیاتی است.
| ویژگی | Sparse (۱۳۰ مدل) | Dense (۱ مدل) |
|---|---|---|
| حافظه | ۹۱۰ گیگابایت | ۷-۱۴ گیگابایت |
| سرعت استنتاج | کند | سریع |
| GPU لازم | ۱۹۲ گیگابایت | ۱۶-۳۲ گیگابایت |
| مدیریت | پیچیده | ساده |
| قابل حمل | ❌ | ✅ موبایل و Edge |
Knowledge Distillation (تقطیر دانش) روشی است که در آن یک مدل بزرگ و قدرتمند (Teacher) به یک مدل کوچکتر (Student) آموزش میدهد. Teacher ها همان ۱۳۰ مدل تخصصی ما هستند و Student یک Dense Model جدید است.
فرآیند کار ساده است: Teacher ها به هزاران سؤال پاسخ میدهند و Student از این پاسخها یاد میگیرد. Student سعی میکند تقلید کند — نه فقط پاسخ نهایی، بلکه الگوی فکری Teacher را. نتیجه: دانش ۱۳۰ مدل در یک مدل جمع میشود.
هر Teacher به هزاران سؤال در حوزه تخصصی خود پاسخ میدهد
پاسخهای Teacher ها به عنوان داده آموزشی ذخیره میشود
Student از پاسخهای Teacher ها یاد میگیرد — تقلید میکند
یک مدل یکپارچه با دانش همه Teacher ها
روش دوم برای رسیدن به Dense، Linear Fusion است. در این روش، خروجیهای مدلهای مختلف (Embedding ها) با یک لایه خطی ترکیب میشوند. هر مدل یک بردار عددی (Embedding) تولید میکند که معنای ورودی را نشان میدهد — این بردارها با هم جمع و به یک فضای مشترک تبدیل میشوند.
combined = Linear([text_embedding, image_embedding, audio_embedding])
این روش مخصوصاً برای Multimodal مفید است: متن یک Embedding ۵۱۲ بعدی تولید میکند، تصویر یک Embedding ۷۶۸ بعدی، و صدا یک Embedding ۲۵۶ بعدی. Linear Fusion این سه را به یک بردار ۵۱۲ بعدی مشترک تبدیل میکند که Dense Model از آن استفاده میکند.
| مرحله | کار | زمان |
|---|---|---|
| ۱ | تولید پاسخ از ۱۳۰ Teacher | ۱-۲ هفته |
| ۲ | آموزش Student با Distillation | ۲-۳ هفته |
| ۳ | Linear Fusion برای Multimodal | ۱ هفته |
| ۴ | تست و بهینهسازی | ۱ هفته |
| جمع | Dense Model نهایی | ۵-۷ هفته |
با Distillation و Linear Fusion، دانش ۱۳۰ مدل تخصصی در یک Dense Model جمع میشود. این مدل:
در مقاله بعدی، به سراغ Evolutionary AI میرویم — جایی که Dense Model ها با هم ترکیب میشوند تا نسلهای جدیدتر و باهوشتری بسازند.
حالا که Dense داریم، میتوانیم چند Dense بسازیم و آنها را ترکیب کنیم — تا به نسل بعدی هوش مصنوعی برسیم.