هنگامی که متا در ماه مه 2023 وزنهای مدل LLaMA-1 را در اختیار پژوهشگران قرار داد، انتظار این طوفان تکنولوژیک را نداشت. این هسته اصلی بر پایه مکانیسمهای دقیق تعبیه موقعیت چرخشی (RoPE)، RMSNorm پیشنرمال و فعالسازیهای SwiGLU بنا شده بود. با داشتن واژگان SentencePiece به ابعاد 32,000 توکن و پنجره متنی 2,048 توکن، این مدل در چهار نسخه 7، 13، 33 و 65 میلیاردی عرضه شد و بر روی بیش از 1.4 تریلیون توکن داده عمومی آموزش دید.
نکته کلیدی که همه چیز را تغییر داد، انتشار وزنها تحت یک مجوز تحقیقاتی غیرتجاری بود. تنها چند هفته پس از شروع این پدیده، مخازن گیتهاب پر از پروژههای تنظیم دقیق شد. تیمهایی مانند دانشگاه استنفورد با مدل Alpaca و آزمایشگاه LMSYS با Vicuna راههای جدیدی را گشودند. انتشار فرمت GGUF و کتابخانه llama.cpp راه را برای اجرای این معماریهای سنگین روی سختافزارهای خانگی هموار کرد. این اتفاق ثابت کرد که دادههای آزاد به تنهایی میتوانند رقیبی جدی برای سرویسهای تجاری ایجاد کنند و مسیر پژوهش در میان مدلهای زبانی بزرگ را برای همیشه هموار کنند.
دو رویکرد متضاد: گفتگوی انسانی در برابر دستورالعملهای پیچیده
Vicuna: تسلط بر گفتگوهای چندنوبته
مدل Vicuna که محصول تیم LMSYS است، بر پایه حدود 70,000 مکالمه واقعی کاربران ChatGPT تنظیم دقیق شد. نوآوری این پروژه در پر کردن شکاف تنظیمهای تکمرحلهای بود. با تزریق دادههای چندنوبته، مدل توانست لحنی طبیعی و روان پیدا کند و در دیالوگهای پیوسته مهارت بالایی از خود نشان دهد. این ویژگی تضاد روشنی با مدلهای اولیهای داشت که تنها از پس اجرای دستورات ایستا برمیآمدند.
WizardLM: کیمیاگری با Evol-Instruct
از سوی دیگر، پروژه WizardLM مسیری کاملاً متفاوت را انتخاب کرد. به جای تکیه بر مکالمات خام کاربران، این تیم از تکنیک Evol-Instruct بهره برد. در این روش، یک مدل قدرتمند مانند GPT-4 دستورات اولیه را مکرراً بازنویسی و پیچیدهتر میکند. از حدود 7,000 دستور پایه، هزاران نسخه گستردهتر و سختگیرانهتر استخراج شد. مدل WizardLM-30B حتی در بنچمارکهای MMLU و HellaSwag عملکردی نزدیک به text-davinci-003 ارائه داد و ثابت کرد که ساخت دادهی مصنوعی ولی باکیفیت، میتواند مرزهای پردازش زبان طبیعی را به جلو پرتاب کند.
WizardVicunaLM: پیوند دو جهان تکنولوژیک
در ماه مه 2023، توسعهدهندهای با نام مستعار melodysdreamj تصمیم گرفت دو فلسفه متفاوت را در قالب یک آزمایش عملی ترکیب کند. او با الهام از نقاط قوت هر دو پروژه، پایهای را ساخت که به WizardVicunaLM معروف شد. این مدل صراحتاً یک اثبات مفهوم (Proof of Concept) بود تا یک محصول نهایی، اما فرآیند ساخت آن درسی ارزشمند برای مهندسان داده محسوب میشود.
خط لوله تولید این مخلوط از سه مرحله اصلی تشکیل شده بود:
- گسترش هوشمند دادهها: تیم با تکیه بر 7 هزار پایه WizardLM شروع کرد. به جای فرمت خشک دستوری، هر سطر مکالمه را به بخشهای متعدد تقسیم کرده و با ChatGPT 3.5 به صورت چندزیرنویس تکمیل کردند.
- آموزش و تنظیم دقیق: مجموعه داده نهایی که به 70,000 مکالمه رسید، در 3 مه 2023 در Hugging Face منتشر شد. مراحل آموزش دقیقاً با الگوی Vicuna نسخه 1.1 پیش رفت.
- هزینه محاسباتی: این فرآیند سنگین بر بستر 8 پردازنده گرافیکی A100 به طول 35 ساعت انجام پذیرفت.
توسعهدهنده اصلی اشاره کرد که جایگزینی چتبات 3.5 با GPT-4 و بهرهگیری از پنجره context 32,000 توکنی، میتواند عمق و غنای پاسخها را چندین برابر کند. ارزیابیهای اولیه که GPT-4 نقش داور را در آن ایفا میکرد، نشان داد که این معماری ترکیبی میتواند درک عمیقتری از بافت گفتگوهای پیچیده پیدا کند و آیندهی ابزارهای شخصیسازیشده را نوید دهد.
کشف کردیم که ترکیب گسترش ساختاریافته دستورالعملها با فرمت طبیعی گفتگو، به مدل کمک میکند تا هم منطق پیچیده را حفظ کند و هم انعطافپذیری زبانی لازم برای مکالمات روزمره را به دست آورد.
سفر LLaMA-1 تا WizardVicunaLM تنها یک مطالعه تاریخی نیست؛ بلکه نمادی از قدرت همکاری غیرمتمرکز در جامعه متنباز است. وقتی شرکتهای بزرگ هنوز روی حفظ انحصار دادهها تمرکز میکنند، جامعه توسعهدهندگان با ترکیب خلاقانه الگوریتمها و دادههای آزاد، مرزهای عملکردی صنعت را جابجا میکنند. نسل بعدی ابزارهای هوشمند احتمالاً از جایشان در همین آزمایشگاههای غیررسمی و پروژههای اشتراکی متولد خواهند شد.





