EleutherAI، هاب متن‌باز پشت توسعهٔ مدل‌های بزرگ زبانی

EleutherAI یک گروه پژوهشی و توسعهٔ متن‌باز است که مدل‌ها، وزن‌ها، مجموعه‌داده‌ها و ابزارهای ارزیابی را در اختیار جامعهٔ پژوهشی قرار داده تا اجرای مدل‌های بزرگ زبانی بدون وابستگی صرف به APIهای تجاری ممکن شود. مخازن و مدل‌های این گروه روی GitHub و Hugging Face قابل دسترسی هستند و نشان‌دهندهٔ مشارکت گستردهٔ جامعه در توسعهٔ ابزارها و داده‌ها است.

GPT‑Neo: بازتولید معماری‌های اتورگرسیو مشابه GPT‑3

خانوادهٔ GPT‑Neo هدف‌گذاری کرد معماری‌های اتورگرسیو شبیه به GPT‑3 را به‌صورت متن‌باز در دسترس قرار دهد. کارت مدل نسخهٔ 125M مشخصات فنی و نکات اجرایی را صریح توضیح داده است:

  • پارامترها: 125,000,000 پارامتر.
  • داده‌های آموزشی: آموزش روی مجموعهٔ Pile که توسط EleutherAI گردآوری شده (مقالهٔ Pile).
  • میزان آموزش: حدود 300,000,000,000 توکن در 572,300 گام با هدف پیش‌بینی توکن بعدی و تابع زیان کراس‌اِنتروپی.
  • روش‌های اجرا: نمونه‌های استفاده برای کتابخانه‌هایی مانند Transformers، سرویس vLLM و استقرار مبتنی بر Docker در کارت مدل ارائه شده‌اند.

کارت مدل ریسک‌های محتوا را نیز ذکر کرده است: چون مجموعهٔ Pile شامل متونی با زبان توهین‌آمیز یا نامناسب است، خروجی‌های GPT‑Neo ممکن است حاوی محتوای نامناسب باشند و نیازمند پالایش انسانی یا فیلترینگ باشند. آمار دانلودها نشان‌دهندهٔ توجه جامعه است؛ به‌عنوان نمونه حدود 405,194 دانلود در ماه گزارش شده است.

نتایج ارزیابی

نتایج بنچ‌مارک‌ها نشان می‌دهد عملکرد GPT‑Neo در وظایف مختلف متفاوت است. نمونه‌ای از مقادیر گزارش‌شده:

  • ARC (25-shot): 22.95
  • HellaSwag (10-shot): 30.26
  • MMLU (5-shot): 25.97
  • TruthfulQA (0-shot): 45.58
  • Winogrande (5-shot): 51.78
  • GSM8K (5-shot): 0.3
  • DROP (3-shot): 3.69

GPT‑J: مدل متن‌باز 6 میلیارد پارامتری

GPT‑J یکی از برجسته‌ترین پروژه‌های EleutherAI است؛ یک مدل اتورگرسیو با حدود 6 میلیارد پارامتر که روی مجموعهٔ Pile آموزش داده شد. کارت مدل GPT‑J در Hugging Face شامل توضیحات فنی، نمونه‌کد و وزن‌های مدل برای اجرا در محیط‌های محلی یا ابری است. این عرضه نشان داد مدل‌های بزرگ‌تر را می‌توان خارج از انحصار شرکت‌های بزرگ توسعه داد، اگرچه نیاز به منابع محاسباتی و مدیریت ریسک قابل‌توجهی وجود دارد.

Pile: ستون داده‌ای اکوسیستم متن‌باز

Pile مجموعه‌داده‌ای حدود 800 گیگابایت از متن‌های متنوع و عمومی است که برای پیش‌آموزش مدل‌های زبانی گردآوری شده است. این مجموعه مستندسازی‌شده به پژوهشگران امکان داد مدل‌های مختلف را با معیارهای آموزشی مشابه ارزیابی و مقایسه کنند. مرجع فنی و جزئیات مجموعه در مقالهٔ Pile در دسترس است.

تصویر مرتبط با EleutherAI و مدل‌های زبانی متن‌باز

اهمیت متن‌باز و چالش‌های اصلی

متن‌باز کردن مدل‌ها و داده‌ها تأثیرات عملی و ساختاری دارد که به‌صورت خلاصه در ادامه آمده است.

مزایا

  • شتاب نوآوری با دسترسی گسترده به مدل‌ها و داده‌ها.
  • افزایش قابلیت بازتولید نتایج پژوهشی و مقایسهٔ منصفانهٔ مدل‌ها.
  • توزیع دانش فنی و توانمندسازی جوامع پژوهشی و صنعتی کوچک‌تر.

چالش‌ها

  • مدیریت ریسک‌ها و محتوای مشکل‌ساز در داده‌ها و خروجی‌ها؛ نیاز به پالایش و سیاست‌های اخلاقی دارد.
  • نیازهای محاسباتی و زیرساختی برای آموزش و استقرار مدل‌های بزرگ.
  • ملاحظات امنیتی و سوءاستفادهٔ احتمالی از مدل‌های متن‌باز.

چشم‌انداز و جمع‌بندی

تجربهٔ EleutherAI نشان داده توسعهٔ LLMها می‌تواند مشارکتی و شفاف‌تر باشد؛ ترکیب پروژه‌های متن‌باز، مجموعه‌داده‌های جامعه‌محور و ابزارهای عمومی بستر رقابتی و قابل بررسی فراهم می‌کند. مسیر آینده احتمالاً ترکیبی از همکاری متن‌باز و راه‌حل‌های تجاری خواهد بود که تمرکز آن‌ها بر کاهش ریسک‌های اخلاقی، بهینه‌سازی هزینه‌ها و فراهم‌کردن دسترس‌پذیری فنی خواهد بود.

منابع مفید