هنگامی که متا در ماه مه 2023 وزن‌های مدل LLaMA-1 را در اختیار پژوهشگران قرار داد، انتظار این طوفان تکنولوژیک را نداشت. این هسته اصلی بر پایه مکانیسم‌های دقیق تعبیه موقعیت چرخشی (RoPE)، RMSNorm پیش‌نرمال و فعال‌سازی‌های SwiGLU بنا شده بود. با داشتن واژگان SentencePiece به ابعاد 32,000 توکن و پنجره متنی 2,048 توکن، این مدل در چهار نسخه 7، 13، 33 و 65 میلیاردی عرضه شد و بر روی بیش از 1.4 تریلیون توکن داده عمومی آموزش دید.

نکته کلیدی که همه چیز را تغییر داد، انتشار وزنها تحت یک مجوز تحقیقاتی غیرتجاری بود. تنها چند هفته پس از شروع این پدیده، مخازن گیت‌هاب پر از پروژه‌های تنظیم دقیق شد. تیم‌هایی مانند دانشگاه استنفورد با مدل Alpaca و آزمایشگاه LMSYS با Vicuna راه‌های جدیدی را گشودند. انتشار فرمت GGUF و کتابخانه llama.cpp راه را برای اجرای این معماری‌های سنگین روی سخت‌افزارهای خانگی هموار کرد. این اتفاق ثابت کرد که داده‌های آزاد به تنهایی می‌توانند رقیبی جدی برای سرویس‌های تجاری ایجاد کنند و مسیر پژوهش در میان مدل‌های زبانی بزرگ را برای همیشه هموار کنند.

دو رویکرد متضاد: گفتگوی انسانی در برابر دستورالعمل‌های پیچیده

Vicuna: تسلط بر گفتگوهای چندنوبته

مدل Vicuna که محصول تیم LMSYS است، بر پایه حدود 70,000 مکالمه واقعی کاربران ChatGPT تنظیم دقیق شد. نوآوری این پروژه در پر کردن شکاف تنظیم‌های تک‌مرحله‌ای بود. با تزریق داده‌های چندنوبته، مدل توانست لحنی طبیعی و روان پیدا کند و در دیالوگ‌های پیوسته مهارت بالایی از خود نشان دهد. این ویژگی تضاد روشنی با مدل‌های اولیه‌ای داشت که تنها از پس اجرای دستورات ایستا برمی‌آمدند.

WizardLM: کیمیاگری با Evol-Instruct

از سوی دیگر، پروژه WizardLM مسیری کاملاً متفاوت را انتخاب کرد. به جای تکیه بر مکالمات خام کاربران، این تیم از تکنیک Evol-Instruct بهره برد. در این روش، یک مدل قدرتمند مانند GPT-4 دستورات اولیه را مکرراً بازنویسی و پیچیده‌تر می‌کند. از حدود 7,000 دستور پایه، هزاران نسخه گسترده‌تر و سخت‌گیرانه‌تر استخراج شد. مدل WizardLM-30B حتی در بنچمارک‌های MMLU و HellaSwag عملکردی نزدیک به text-davinci-003 ارائه داد و ثابت کرد که ساخت داده‌ی مصنوعی ولی باکیفیت، می‌تواند مرزهای پردازش زبان طبیعی را به جلو پرتاب کند.

WizardVicunaLM: پیوند دو جهان تکنولوژیک

در ماه مه 2023، توسعه‌دهنده‌ای با نام مستعار melodysdreamj تصمیم گرفت دو فلسفه متفاوت را در قالب یک آزمایش عملی ترکیب کند. او با الهام از نقاط قوت هر دو پروژه، پایه‌ای را ساخت که به WizardVicunaLM معروف شد. این مدل صراحتاً یک اثبات مفهوم (Proof of Concept) بود تا یک محصول نهایی، اما فرآیند ساخت آن درسی ارزشمند برای مهندسان داده محسوب می‌شود.

خط لوله تولید این مخلوط از سه مرحله اصلی تشکیل شده بود:

  1. گسترش هوشمند داده‌ها: تیم با تکیه بر 7 هزار پایه WizardLM شروع کرد. به جای فرمت خشک دستوری، هر سطر مکالمه را به بخش‌های متعدد تقسیم کرده و با ChatGPT 3.5 به صورت چندزیرنویس تکمیل کردند.
  2. آموزش و تنظیم دقیق: مجموعه داده نهایی که به 70,000 مکالمه رسید، در 3 مه 2023 در Hugging Face منتشر شد. مراحل آموزش دقیقاً با الگوی Vicuna نسخه 1.1 پیش رفت.
  3. هزینه محاسباتی: این فرآیند سنگین بر بستر 8 پردازنده گرافیکی A100 به طول 35 ساعت انجام پذیرفت.

توسعه‌دهنده اصلی اشاره کرد که جایگزینی چت‌بات 3.5 با GPT-4 و بهره‌گیری از پنجره context 32,000 توکنی، می‌تواند عمق و غنای پاسخ‌ها را چندین برابر کند. ارزیابی‌های اولیه که GPT-4 نقش داور را در آن ایفا می‌کرد، نشان داد که این معماری ترکیبی می‌تواند درک عمیق‌تری از بافت گفتگوهای پیچیده پیدا کند و آینده‌ی ابزارهای شخصی‌سازی‌شده را نوید دهد.

کشف کردیم که ترکیب گسترش ساختاریافته دستورالعمل‌ها با فرمت طبیعی گفتگو، به مدل کمک می‌کند تا هم منطق پیچیده را حفظ کند و هم انعطاف‌پذیری زبانی لازم برای مکالمات روزمره را به دست آورد.

سفر LLaMA-1 تا WizardVicunaLM تنها یک مطالعه تاریخی نیست؛ بلکه نمادی از قدرت همکاری غیرمتمرکز در جامعه متن‌باز است. وقتی شرکت‌های بزرگ هنوز روی حفظ انحصار داده‌ها تمرکز می‌کنند، جامعه توسعه‌دهندگان با ترکیب خلاقانه الگوریتم‌ها و داده‌های آزاد، مرزهای عملکردی صنعت را جابجا می‌کنند. نسل بعدی ابزارهای هوشمند احتمالاً از جایشان در همین آزمایشگاه‌های غیررسمی و پروژه‌های اشتراکی متولد خواهند شد.