پایان عصر بنچمارک‌های ایستا

رقابت بی‌سابقه میان توسعه‌دهندگان مدل‌های زبانی بزرگ، یک معضل اساسی ایجاد کرده است: چگونه واقعاً کارایی مدل‌ها را بسنجیم؟ تست‌های استاتیک قدیمی که پاسخ‌های چند گزینه‌ای یا درستی صرف را می‌سنجیدند، دیگر بازتاب‌دهنده پیچیدگی مکالمات انسانی نیستند. پلتفرم‌های بسته نیز شفافیت لازم را برای جامعه فنی فراهم نمی‌کنند. اینجا جایی است که سازمان LMSYS وارد میدان شد. با هدف ایجاد استانداردهای قابل اعتماد، این تیم دو ابزار کلیدی را به جامعه تحویل داد: چت‌بات متن‌باز ویکونیا (Vicuna) و پلتفرم مقایسه زنده Chatbot Arena. این دو پروژه به‌طور همزمان نحوه ساخت و سنجش هوش مصنوعی‌های گفتگو‌محور را متحول کرده‌اند.

اکوسیستم LMSYS؛ پیوند آموزش و ارزش‌سنجی

مسیر پیشرفت سازمان LMSYS به دو بخش جدا اما هم‌افزا تقسیم می‌شود. در لایه زیرساختی، تیم فنی ابزارهایی نظیر موتور سرویس‌دهی FastChat برای مدیریت مدل‌ها، سیستم‌های سازگار با هزاران آداپتور LoRA و الگوریتم‌های رمزگشایی موازی را توسعه داده است. این پایه‌ها اجازه می‌دهند مدل‌های چندوجهی و زبانی با حداکثر پرفورمنس در محیط‌های واقعی اجرا شوند.

در مقابل، بخش ارزیابی بر پایه سه ستون استوار است:

  • Chatbot Arena: پلتفرمی مبتنی بر رای‌گیری کاربران برای مقایسه ناشناس و تصادفی مدل‌ها
  • پایپلاین خودکار: تبدیل داده‌های تعاملی زنده به بنچمارک‌های دقیق و به‌روز
  • سوال MT-Bench: مجموعه پرسش‌های چالشی چندمرحله‌ای برای سنجش درک عمیق مدل

این معماری باعث شده تمام زنجیره از آموزش تا رتبه‌بندی نهایی، کاملاً شفاف و در دسترس پژوهشگران بماند.

ویکونیا؛ معیار جدید سرعت و کیفیت

ویکونیا در مارس 2023 با ادعایی جسورانه وارد بازار شد. سازندگان آن مدعی شدند این مدل با بهره‌گیری از پایه Llama 2، توانسته به نودی از کیفیت ChatGPT دست یابد و عملکردی قابل مقایسه با GPT-4 ارائه دهد. انتشار نسخه 1.5 در آگوست همین سال، پشتیبانی از بافت 16 هزار توکن را اضافه کرد. برای اجرای دقیق این نسخه، استفاده از کتابخانه transformers به‌روزرسانی شده (نسخه 4.31 به بالا) الزامی است.

تمام وزن‌های مدل با تفاسیر مختلف در مخزن عمومی Hugging Face قرار دارند و هر توسعه‌دهنده می‌تواند با چند دستورات ساده، مدل را به پروژه خود متصل کند.

  • 7B: lmsys/vicuna-7b-v1.5
  • 7B-16K: lmsys/vicuna-7b-v1.5-16k
  • 13B: lmsys/vicuna-13b-v1.5
  • 13B-16K: lmsys/vicuna-13b-v1.5-16k
  • 33B: lmsys/vicuna-33b-v1.3

دستور اجرای محلی به سادگی زیر است:

python3 -m fastchat.serve.cli --model-path lmsys/vicuna-7b-v1.5
نمایش گرافیکی عملکرد پلتفرم مقایسه چت‌بات‌ها و توزیع مدل‌های زبانی

دسترسی آسان و اجرای روی سخت‌افزارهای معمولی

تمرکز اصلی تیم سازندگان ویکونیا، حذف موانع سخت‌افزاری برای اجرای مدل‌های پیشرفته است. نسخه 7 میلیارد پارامتری این مدل با حداقل 14 گیگابایت حافظه گرافیکی و نسخه 13 میلیاردی با 28 گیگابایت، روی کارت‌های میان‌رده معمولی نیز پاسخ‌های سریع می‌دهند. قابلیت موازی‌سازی و مدیریت دقیق تخصیص حافظه از طریق پارامترهای مخصوص، به کاربران اجازه می‌دهد از تمام پتانسیل سخت‌افزار خود بهره ببرند.

حتی روی سیستم‌های بدون شتاب‌دهنده گرافیکی، با حداقل 30 گیگابایت رم سیستمی برای نسخه 7B و 60 گیگابایت برای نسخه 13B، اجرای مدل‌ها ممکن خواهد بود. پشتیبانی از دستورات پردازشی خاص اینتل (AVX512_BF16/AMX) نیز مسیر اجرای مدل‌های سبک‌تر را هموار کرده است.

رابط خط فرمان FastChat برای اجرای محلی مدل ویکونیا روی سخت‌افزارهای معمولی

آینده ارزش‌سنجی گفتگومحور

تحول شفاف در آرنای چت‌بات‌ها و دسترسی آسان به مدل‌های سطح بالا، نشان می‌دهد که عصر انحصار در ارزیابی هوش مصنوعی به پایان رسیده است. وقتی ابزارهای سنجش بر اساس تعاملات واقعی کاربران و مدل‌های باز روی سخت‌افزارهای معمولی اجرا می‌شوند، توسعه‌دهندگان و پژوهشگران فرصت بهتری برای ساخت سامانه‌های پایدارتر و قابل‌اعتمادتر خواهند داشت. تمرکز فعلی بر بهینه‌سازی سرعت در مکالمات طولانی‌مدت و کاهش هزینه‌های محاسباتی نشان می‌دهد که آینده این حوزه به سمت تعادل کامل بین کارایی محاسباتی و شفافیت داده‌محور حرکت خواهد کرد.