شکستن سقف عملکردی مدل‌های محلی

هجدهم آوریل 2024 تاریخچهٔ مدل‌های زبانی با وزن باز را تغییر داد. متا با انتشار LLaMA‌3 توانست مرزهای مشخصی را که تا قبل از آن مدل‌های متن‌باز را با چالش مواجه می‌کرد، در هم بشکند. اگرچه نسخه‌های پیشین اثبات کرده بودند که وزن‌های باز قابلیت استفادهٔ عملی دارند، اما متخصصان همواره شکاف‌هایی در اندازهٔ واژگان، کیفیت استدلال و کارایی تولید کد مشاهده می‌کردند. در کنار مدل‌هایی مانند Mistral و Gemma که سطح مدل‌های 7B را ارتقا داده بودند، مدل‌های تجاری بسته همچنان در صدر جدول امتیازهای صنعت قرار داشتند. LLaMA‌3 با ادعای ارائهٔ عملکرد هم‌سطح پیشرفته‌ترین مدل‌ها در طیف گسترده‌ای از بنچمارک‌ها، این معادله را عوض کرد.

شماره‌ها این ادعا را تأیید کردند. مدل 8B نه تنها از رقبای مستقیم 7B خود پیشی گرفت، بلکه در بنچمارک MMLU از نسل قبلی خود یعنی LLaMA‌2 با 70B پارامتر که تقریباً نه برابر حجم بیشتری داشت نیز جلوتر بود. نسخهٔ 70B به عملکردی در سطح GPT-3.5 رسید و در بخش تولید کد فاصلهٔ چندانی با APIهای پیشرو نداشت. این دستاوردها اصلاحات جزئی نبودند؛ آن‌ها نشان می‌دادند یک مدل قابل اجرا به‌صورت محلی می‌تواند عملکردی فراتر از پیش‌بینی‌های بازار ارائه دهد.

آزمایش‌های عملکردی و چرخش بازار

خانوادهٔ LLaMA‌3 با چهار مدل هم‌زمان وارد بازار شد. تمام نسخه‌ها بلافاصله در هاب Hugging Face در دسترس توسعه‌دهندگان قرار گرفتند:

  • Meta-Llama-3-8B مدل پایه با 8.03 میلیارد پارامتر
  • Meta-Llama-3-8B-Instruct نسخهٔ تنظیم‌شده برای دستورپذیری
  • Meta-Llama-3-70B مدل پایه با 70.55 میلیارد پارامتر
  • Meta-Llama-3-70B-Instruct نسخهٔ تنظیم‌شده برای دستورپذیری

مشخصات فنی مشترک

جزئیات مقدار
تاریخ عرضه18 آوریل 2024
معماریترنسفورمرِ فقطِ رمزگشا با توجه گروه‌بندی‌شده (GQA)
پنجرهٔ متن (Context Window)8,192 توکن
اندازهٔ واژگان128,256 توکن (BPE مبتنی بر tiktoken)
توکن‌های آموزشیحدود 15 تریلیون
تاریخ قطع دانشمارس 2023
نوع مدالیتهفقط متن ورودی و خروجی
پشتیبانی زبانیعمدتاً انگلیسی با پوشش محدود چندزبانه
مجوز استفادهLlama 3 Community License

متا در زمان انتشار اعلام کرد آموزش مدل 400 میلیارد پارامتری در حال انجام است که بعدها به نسخهٔ 405B در LLaMA‌3.1 تبدیل شد. برای حذف گلوگاه‌های سرعت در روزهای اول، متا با Groq همکاری کرد تا استنتاجِ فوق‌سریعی را فراهم کند. این حرکت مدل 8B را به گزینه‌ای ایده‌آل برای جایگزینیِ GPT-3.5 در خط تولید کسب‌وکارها تبدیل کرد. توسعه‌دهندگان دیگر نیازی به پرداخت هزینه به ازای هر توکن نداشتند و می‌توانستند بدون نگرانی از نقض حریمِ داده‌ها، مدل را در زیرساختِ داخلی استقرار دهند.

معماری داخلی؛ هوشمندسازی با GQA و جهشِ واژگانی

LLaMA‌3 معماری ترنسفورمرِ نسل‌های قبل را حفظ کرد اما بهبودهای مهندسی دقیقی را در لایه‌های توجه و پوششِ زبانی اعمال نمود. نسخهٔ پیشین از توجه گروه‌بندی‌شده به پرس‌وجو (GQA) تنها در مدل‌های 34B و 70B استفاده می‌کرد و برای نسخه‌های کوچک‌تر به توجهٔ چندسریِ استاندارد (MHA) تکیه داشت. در LLaMA‌3 این پیکربندی به تمام اندازه‌ها تعمیم یافت.

سازوکار توجه گروه‌بندی‌شده

پارامتر 8B 70B
تعداد لایه‌ها3280
سرهای توجه3264
سرهای کلید-مقدار (KV)88
بعد شبکهٔ پیش‌خور14,33628,672
بعدِ تعبیه‌سازی (Embedding)4,0968,192
بعد هر سر128128

مدل 8B از نسبت 4 به 1 و مدل 70B از نسبت 8 به 1 برای سرهای پرس‌وجو و KV استفاده می‌کنند. این طراحی نیازِ حافظه برای کشِ KV را به‌طور قابل توجهی کاهش می‌دهد و نرخِ استنتاج را بالا می‌برد. برای بارهای کاری طولانی که در آن‌ها انباشتِ کشِ KV به گلوگاه تبدیل می‌شود، این مهندسی معمارانه تفاوت بین یک مدل کند و یک مدل واکنش‌گرا را رقم می‌زند.

واژگان 128 هزار توکنی

افزایش اندازهٔ واژگان از 32,000 توکن در نسخهٔ پیشین به 128,256 توکن، یکی از مهم‌ترین تغییرات فنی این نسل محسوب می‌شود. این جهشِ چهاربرابری باعث می‌شود مدل، زبان‌های کمترِ رایج و کدهای برنامه‌نویسی را با توکن‌های کوتاه‌تر پردازش کند. نتیجهٔ مستقیم آن کاهش هزینهٔ محاسباتی و افزایش سرعتِ استنتاج است، زیرا مدل به توکن‌های کمتری نیاز دارد تا مفهوم یک جمله یا یک بلوکِ کد را درک کند. متا با به‌کارگیریِ الگوریتمِ BPE در کنارِ tiktoken، این واژگان را با دقتِ بالا برای پوششِ مفاهیمِ چندزبانه و تخصصیِ فنی بهینه کرد.

پیامدهای عملیاتی و چشم‌انداز آینده

جابه‌جایی از APIهای بسته به مدل‌های محلی صرفاً یک تغییرِ فنی نیست. کسب‌وکارها می‌توانند با استقرارِ LLaMA‌3 کنترلِ کامل بر چرخهٔ داده‌های حساسِ خود داشته باشند، از هزینه‌های متغیر خارج شوند و سناریوهای سفارشی‌سازی را مستقیماً در بسترِ زیرساختِ خود پیاده‌سازی کنند. ترکیبِ پنجرهٔ متن 8 هزار توکنی با دانشِ به‌روز شده تا مارس 2023 و بهبودهای ساختاری در لایه‌های توجه، مدل را به پایه‌ای مناسب برای سیستم‌های چت‌باتِ سازمانی، تحلیلِ مستنداتِ پیچیده و تولیدِ کدِ خودکار تبدیل کرده است. در حالی که اکوسیستم حولِ محورِ وزن‌های باز در حال شکل‌گیری است، نسلِ بعدی مدل‌ها و ابزارهای بهینه‌سازِ استنتاج مسیر را برای هوش‌مصنوعی قابل‌اعتماد و مقیاس‌پذیر در بسترهای متنوع ترسیم خواهند کرد.