EleutherAI، هاب متنباز پشت توسعهٔ مدلهای بزرگ زبانی
EleutherAI یک گروه پژوهشی و توسعهٔ متنباز است که مدلها، وزنها، مجموعهدادهها و ابزارهای ارزیابی را در اختیار جامعهٔ پژوهشی قرار داده تا اجرای مدلهای بزرگ زبانی بدون وابستگی صرف به APIهای تجاری ممکن شود. مخازن و مدلهای این گروه روی GitHub و Hugging Face قابل دسترسی هستند و نشاندهندهٔ مشارکت گستردهٔ جامعه در توسعهٔ ابزارها و دادهها است.
GPT‑Neo: بازتولید معماریهای اتورگرسیو مشابه GPT‑3
خانوادهٔ GPT‑Neo هدفگذاری کرد معماریهای اتورگرسیو شبیه به GPT‑3 را بهصورت متنباز در دسترس قرار دهد. کارت مدل نسخهٔ 125M مشخصات فنی و نکات اجرایی را صریح توضیح داده است:
- پارامترها: 125,000,000 پارامتر.
- دادههای آموزشی: آموزش روی مجموعهٔ Pile که توسط EleutherAI گردآوری شده (مقالهٔ Pile).
- میزان آموزش: حدود 300,000,000,000 توکن در 572,300 گام با هدف پیشبینی توکن بعدی و تابع زیان کراساِنتروپی.
- روشهای اجرا: نمونههای استفاده برای کتابخانههایی مانند Transformers، سرویس vLLM و استقرار مبتنی بر Docker در کارت مدل ارائه شدهاند.
کارت مدل ریسکهای محتوا را نیز ذکر کرده است: چون مجموعهٔ Pile شامل متونی با زبان توهینآمیز یا نامناسب است، خروجیهای GPT‑Neo ممکن است حاوی محتوای نامناسب باشند و نیازمند پالایش انسانی یا فیلترینگ باشند. آمار دانلودها نشاندهندهٔ توجه جامعه است؛ بهعنوان نمونه حدود 405,194 دانلود در ماه گزارش شده است.
نتایج ارزیابی
نتایج بنچمارکها نشان میدهد عملکرد GPT‑Neo در وظایف مختلف متفاوت است. نمونهای از مقادیر گزارششده:
- ARC (25-shot): 22.95
- HellaSwag (10-shot): 30.26
- MMLU (5-shot): 25.97
- TruthfulQA (0-shot): 45.58
- Winogrande (5-shot): 51.78
- GSM8K (5-shot): 0.3
- DROP (3-shot): 3.69
GPT‑J: مدل متنباز 6 میلیارد پارامتری
GPT‑J یکی از برجستهترین پروژههای EleutherAI است؛ یک مدل اتورگرسیو با حدود 6 میلیارد پارامتر که روی مجموعهٔ Pile آموزش داده شد. کارت مدل GPT‑J در Hugging Face شامل توضیحات فنی، نمونهکد و وزنهای مدل برای اجرا در محیطهای محلی یا ابری است. این عرضه نشان داد مدلهای بزرگتر را میتوان خارج از انحصار شرکتهای بزرگ توسعه داد، اگرچه نیاز به منابع محاسباتی و مدیریت ریسک قابلتوجهی وجود دارد.
Pile: ستون دادهای اکوسیستم متنباز
Pile مجموعهدادهای حدود 800 گیگابایت از متنهای متنوع و عمومی است که برای پیشآموزش مدلهای زبانی گردآوری شده است. این مجموعه مستندسازیشده به پژوهشگران امکان داد مدلهای مختلف را با معیارهای آموزشی مشابه ارزیابی و مقایسه کنند. مرجع فنی و جزئیات مجموعه در مقالهٔ Pile در دسترس است.
اهمیت متنباز و چالشهای اصلی
متنباز کردن مدلها و دادهها تأثیرات عملی و ساختاری دارد که بهصورت خلاصه در ادامه آمده است.
مزایا
- شتاب نوآوری با دسترسی گسترده به مدلها و دادهها.
- افزایش قابلیت بازتولید نتایج پژوهشی و مقایسهٔ منصفانهٔ مدلها.
- توزیع دانش فنی و توانمندسازی جوامع پژوهشی و صنعتی کوچکتر.
چالشها
- مدیریت ریسکها و محتوای مشکلساز در دادهها و خروجیها؛ نیاز به پالایش و سیاستهای اخلاقی دارد.
- نیازهای محاسباتی و زیرساختی برای آموزش و استقرار مدلهای بزرگ.
- ملاحظات امنیتی و سوءاستفادهٔ احتمالی از مدلهای متنباز.
چشمانداز و جمعبندی
تجربهٔ EleutherAI نشان داده توسعهٔ LLMها میتواند مشارکتی و شفافتر باشد؛ ترکیب پروژههای متنباز، مجموعهدادههای جامعهمحور و ابزارهای عمومی بستر رقابتی و قابل بررسی فراهم میکند. مسیر آینده احتمالاً ترکیبی از همکاری متنباز و راهحلهای تجاری خواهد بود که تمرکز آنها بر کاهش ریسکهای اخلاقی، بهینهسازی هزینهها و فراهمکردن دسترسپذیری فنی خواهد بود.





