چالشها و فرصتها — از کمبود داده تا تسلط بر بازار ۱۱۰ میلیون فارسیزبان
زبان فارسی حدود ۱۱۰ میلیون گویشور در ایران، افغانستان و تاجیکستان دارد — اما سهم آن در مدلهای هوش مصنوعی جهانی بسیار کمتر از این رقم است. دلیل اصلی: کمبود داده دیجیتال. مدلهای بزرگ مثل GPT-4 عمدتاً روی دادههای انگلیسی آموزش دیدهاند — حدود ۹۰٪ دادههای آموزشی انگلیسی است. فارسی شاید کمتر از ۱٪ از دادههای آموزشی را تشکیل دهد.
| چالش | توضیح | شدت |
|---|---|---|
| کمبود داده متنی | متن دیجیتال فارسی کمتر از انگلیسی | بسیار بالا |
| کمبود داده تخصصی | مقالات پزشکی، حقوقی، مهندسی فارسی محدود | بسیار بالا |
| پیچیدگی خط | راستبهچپ، حروف چسبان، نیمفاصله | متوسط |
| تنوع گویشها | فارسی ایران، دری، تاجیکی | متوسط |
| تحریمها | دسترسی محدود به API های جهانی | بسیار بالا |
همان چالشها، بزرگترین فرصتها هستند. چون مدلهای جهانی فارسی را خوب نمیفهمند، بازار فارسی بکر است. هر کسی که مدل فارسی تخصصی بسازد، میتواند رهبر بازار شود — نه فقط در ایران، بلکه در افغانستان و تاجیکستان.
اولین کسی که ۱۰۰ مدل فارسی تخصصی بسازد، رهبر بازار میشود.
بازار ۱۱۰ میلیون فارسیزبان — بدون رقیب جدی.
از ایران به افغانستان و تاجیکستان — بازار مشترک.
پزشکی فارسی، حقوقی فارسی، مهندسی فارسی — هیچکس نساخته.
برای آموزش ۱۰۰ مدل فارسی، نیاز به دادههای متنوع و باکیفیت داریم. منابع اصلی:
| منبع | نوع داده | حجم تقریبی |
|---|---|---|
| ویکیپدیای فارسی | مقالات عمومی | ۱ میلیون مقاله |
| کتابهای دیجیتال | ادبیات، علمی، درسی | صدها هزار جلد |
| مقالات علمی فارسی | پزشکی، مهندسی، علوم | صدها هزار مقاله |
| وبسایتهای فارسی | خبری، تخصصی، فروشگاهی | میلیونها صفحه |
| مکالمات و گفتگو | پیامرسانها، شبکههای اجتماعی | میلیاردها پیام |
برای هر تخصص — پزشکی، حقوقی، مهندسی — داده جداگانه جمع شود
حذف تکراریها، تصحیح غلطها، یکسانسازی نیمفاصله و علائم
مدل پایه LLaMA 7B با داده فارسی تخصصی آموزش میبیند
تشخیص زبان و تخصص — فارسی؟ پزشکی؟ حقوقی؟
ذخیره روی Storage + ارائه API فارسی
زبان فارسی در هوش مصنوعی عقبتر از انگلیسی است — اما همین عقبماندگی، بزرگترین فرصت است. بازار ۱۱۰ میلیون فارسیزبان بکر است و هیچ رقیب جدی وجود ندارد. با زیرساختی که در این مجموعه مقالات طراحی کردیم، میتوانید اولین کسی باشید که این بازار را تسخیر میکند.
در مقاله بعدی — آخرین مقاله — به سراغ مقایسه مدلهای Open Source و تجاری میرویم.
کدام مدلها برای زیرساخت شما مناسبترند؟