شکستن سقف عملکردی مدلهای محلی
هجدهم آوریل 2024 تاریخچهٔ مدلهای زبانی با وزن باز را تغییر داد. متا با انتشار LLaMA3 توانست مرزهای مشخصی را که تا قبل از آن مدلهای متنباز را با چالش مواجه میکرد، در هم بشکند. اگرچه نسخههای پیشین اثبات کرده بودند که وزنهای باز قابلیت استفادهٔ عملی دارند، اما متخصصان همواره شکافهایی در اندازهٔ واژگان، کیفیت استدلال و کارایی تولید کد مشاهده میکردند. در کنار مدلهایی مانند Mistral و Gemma که سطح مدلهای 7B را ارتقا داده بودند، مدلهای تجاری بسته همچنان در صدر جدول امتیازهای صنعت قرار داشتند. LLaMA3 با ادعای ارائهٔ عملکرد همسطح پیشرفتهترین مدلها در طیف گستردهای از بنچمارکها، این معادله را عوض کرد.
شمارهها این ادعا را تأیید کردند. مدل 8B نه تنها از رقبای مستقیم 7B خود پیشی گرفت، بلکه در بنچمارک MMLU از نسل قبلی خود یعنی LLaMA2 با 70B پارامتر که تقریباً نه برابر حجم بیشتری داشت نیز جلوتر بود. نسخهٔ 70B به عملکردی در سطح GPT-3.5 رسید و در بخش تولید کد فاصلهٔ چندانی با APIهای پیشرو نداشت. این دستاوردها اصلاحات جزئی نبودند؛ آنها نشان میدادند یک مدل قابل اجرا بهصورت محلی میتواند عملکردی فراتر از پیشبینیهای بازار ارائه دهد.
آزمایشهای عملکردی و چرخش بازار
خانوادهٔ LLaMA3 با چهار مدل همزمان وارد بازار شد. تمام نسخهها بلافاصله در هاب Hugging Face در دسترس توسعهدهندگان قرار گرفتند:
- Meta-Llama-3-8B مدل پایه با 8.03 میلیارد پارامتر
- Meta-Llama-3-8B-Instruct نسخهٔ تنظیمشده برای دستورپذیری
- Meta-Llama-3-70B مدل پایه با 70.55 میلیارد پارامتر
- Meta-Llama-3-70B-Instruct نسخهٔ تنظیمشده برای دستورپذیری
مشخصات فنی مشترک
| جزئیات | مقدار |
|---|---|
| تاریخ عرضه | 18 آوریل 2024 |
| معماری | ترنسفورمرِ فقطِ رمزگشا با توجه گروهبندیشده (GQA) |
| پنجرهٔ متن (Context Window) | 8,192 توکن |
| اندازهٔ واژگان | 128,256 توکن (BPE مبتنی بر tiktoken) |
| توکنهای آموزشی | حدود 15 تریلیون |
| تاریخ قطع دانش | مارس 2023 |
| نوع مدالیته | فقط متن ورودی و خروجی |
| پشتیبانی زبانی | عمدتاً انگلیسی با پوشش محدود چندزبانه |
| مجوز استفاده | Llama 3 Community License |
متا در زمان انتشار اعلام کرد آموزش مدل 400 میلیارد پارامتری در حال انجام است که بعدها به نسخهٔ 405B در LLaMA3.1 تبدیل شد. برای حذف گلوگاههای سرعت در روزهای اول، متا با Groq همکاری کرد تا استنتاجِ فوقسریعی را فراهم کند. این حرکت مدل 8B را به گزینهای ایدهآل برای جایگزینیِ GPT-3.5 در خط تولید کسبوکارها تبدیل کرد. توسعهدهندگان دیگر نیازی به پرداخت هزینه به ازای هر توکن نداشتند و میتوانستند بدون نگرانی از نقض حریمِ دادهها، مدل را در زیرساختِ داخلی استقرار دهند.
معماری داخلی؛ هوشمندسازی با GQA و جهشِ واژگانی
LLaMA3 معماری ترنسفورمرِ نسلهای قبل را حفظ کرد اما بهبودهای مهندسی دقیقی را در لایههای توجه و پوششِ زبانی اعمال نمود. نسخهٔ پیشین از توجه گروهبندیشده به پرسوجو (GQA) تنها در مدلهای 34B و 70B استفاده میکرد و برای نسخههای کوچکتر به توجهٔ چندسریِ استاندارد (MHA) تکیه داشت. در LLaMA3 این پیکربندی به تمام اندازهها تعمیم یافت.
سازوکار توجه گروهبندیشده
| پارامتر | 8B | 70B |
|---|---|---|
| تعداد لایهها | 32 | 80 |
| سرهای توجه | 32 | 64 |
| سرهای کلید-مقدار (KV) | 8 | 8 |
| بعد شبکهٔ پیشخور | 14,336 | 28,672 |
| بعدِ تعبیهسازی (Embedding) | 4,096 | 8,192 |
| بعد هر سر | 128 | 128 |
مدل 8B از نسبت 4 به 1 و مدل 70B از نسبت 8 به 1 برای سرهای پرسوجو و KV استفاده میکنند. این طراحی نیازِ حافظه برای کشِ KV را بهطور قابل توجهی کاهش میدهد و نرخِ استنتاج را بالا میبرد. برای بارهای کاری طولانی که در آنها انباشتِ کشِ KV به گلوگاه تبدیل میشود، این مهندسی معمارانه تفاوت بین یک مدل کند و یک مدل واکنشگرا را رقم میزند.
واژگان 128 هزار توکنی
افزایش اندازهٔ واژگان از 32,000 توکن در نسخهٔ پیشین به 128,256 توکن، یکی از مهمترین تغییرات فنی این نسل محسوب میشود. این جهشِ چهاربرابری باعث میشود مدل، زبانهای کمترِ رایج و کدهای برنامهنویسی را با توکنهای کوتاهتر پردازش کند. نتیجهٔ مستقیم آن کاهش هزینهٔ محاسباتی و افزایش سرعتِ استنتاج است، زیرا مدل به توکنهای کمتری نیاز دارد تا مفهوم یک جمله یا یک بلوکِ کد را درک کند. متا با بهکارگیریِ الگوریتمِ BPE در کنارِ tiktoken، این واژگان را با دقتِ بالا برای پوششِ مفاهیمِ چندزبانه و تخصصیِ فنی بهینه کرد.
پیامدهای عملیاتی و چشمانداز آینده
جابهجایی از APIهای بسته به مدلهای محلی صرفاً یک تغییرِ فنی نیست. کسبوکارها میتوانند با استقرارِ LLaMA3 کنترلِ کامل بر چرخهٔ دادههای حساسِ خود داشته باشند، از هزینههای متغیر خارج شوند و سناریوهای سفارشیسازی را مستقیماً در بسترِ زیرساختِ خود پیادهسازی کنند. ترکیبِ پنجرهٔ متن 8 هزار توکنی با دانشِ بهروز شده تا مارس 2023 و بهبودهای ساختاری در لایههای توجه، مدل را به پایهای مناسب برای سیستمهای چتباتِ سازمانی، تحلیلِ مستنداتِ پیچیده و تولیدِ کدِ خودکار تبدیل کرده است. در حالی که اکوسیستم حولِ محورِ وزنهای باز در حال شکلگیری است، نسلِ بعدی مدلها و ابزارهای بهینهسازِ استنتاج مسیر را برای هوشمصنوعی قابلاعتماد و مقیاسپذیر در بسترهای متنوع ترسیم خواهند کرد.





