پایان عصر بنچمارکهای ایستا
رقابت بیسابقه میان توسعهدهندگان مدلهای زبانی بزرگ، یک معضل اساسی ایجاد کرده است: چگونه واقعاً کارایی مدلها را بسنجیم؟ تستهای استاتیک قدیمی که پاسخهای چند گزینهای یا درستی صرف را میسنجیدند، دیگر بازتابدهنده پیچیدگی مکالمات انسانی نیستند. پلتفرمهای بسته نیز شفافیت لازم را برای جامعه فنی فراهم نمیکنند. اینجا جایی است که سازمان LMSYS وارد میدان شد. با هدف ایجاد استانداردهای قابل اعتماد، این تیم دو ابزار کلیدی را به جامعه تحویل داد: چتبات متنباز ویکونیا (Vicuna) و پلتفرم مقایسه زنده Chatbot Arena. این دو پروژه بهطور همزمان نحوه ساخت و سنجش هوش مصنوعیهای گفتگومحور را متحول کردهاند.
اکوسیستم LMSYS؛ پیوند آموزش و ارزشسنجی
مسیر پیشرفت سازمان LMSYS به دو بخش جدا اما همافزا تقسیم میشود. در لایه زیرساختی، تیم فنی ابزارهایی نظیر موتور سرویسدهی FastChat برای مدیریت مدلها، سیستمهای سازگار با هزاران آداپتور LoRA و الگوریتمهای رمزگشایی موازی را توسعه داده است. این پایهها اجازه میدهند مدلهای چندوجهی و زبانی با حداکثر پرفورمنس در محیطهای واقعی اجرا شوند.
در مقابل، بخش ارزیابی بر پایه سه ستون استوار است:
- Chatbot Arena: پلتفرمی مبتنی بر رایگیری کاربران برای مقایسه ناشناس و تصادفی مدلها
- پایپلاین خودکار: تبدیل دادههای تعاملی زنده به بنچمارکهای دقیق و بهروز
- سوال MT-Bench: مجموعه پرسشهای چالشی چندمرحلهای برای سنجش درک عمیق مدل
این معماری باعث شده تمام زنجیره از آموزش تا رتبهبندی نهایی، کاملاً شفاف و در دسترس پژوهشگران بماند.
ویکونیا؛ معیار جدید سرعت و کیفیت
ویکونیا در مارس 2023 با ادعایی جسورانه وارد بازار شد. سازندگان آن مدعی شدند این مدل با بهرهگیری از پایه Llama 2، توانسته به نودی از کیفیت ChatGPT دست یابد و عملکردی قابل مقایسه با GPT-4 ارائه دهد. انتشار نسخه 1.5 در آگوست همین سال، پشتیبانی از بافت 16 هزار توکن را اضافه کرد. برای اجرای دقیق این نسخه، استفاده از کتابخانه transformers بهروزرسانی شده (نسخه 4.31 به بالا) الزامی است.
تمام وزنهای مدل با تفاسیر مختلف در مخزن عمومی Hugging Face قرار دارند و هر توسعهدهنده میتواند با چند دستورات ساده، مدل را به پروژه خود متصل کند.
- 7B: lmsys/vicuna-7b-v1.5
- 7B-16K: lmsys/vicuna-7b-v1.5-16k
- 13B: lmsys/vicuna-13b-v1.5
- 13B-16K: lmsys/vicuna-13b-v1.5-16k
- 33B: lmsys/vicuna-33b-v1.3
دستور اجرای محلی به سادگی زیر است:
python3 -m fastchat.serve.cli --model-path lmsys/vicuna-7b-v1.5
دسترسی آسان و اجرای روی سختافزارهای معمولی
تمرکز اصلی تیم سازندگان ویکونیا، حذف موانع سختافزاری برای اجرای مدلهای پیشرفته است. نسخه 7 میلیارد پارامتری این مدل با حداقل 14 گیگابایت حافظه گرافیکی و نسخه 13 میلیاردی با 28 گیگابایت، روی کارتهای میانرده معمولی نیز پاسخهای سریع میدهند. قابلیت موازیسازی و مدیریت دقیق تخصیص حافظه از طریق پارامترهای مخصوص، به کاربران اجازه میدهد از تمام پتانسیل سختافزار خود بهره ببرند.
حتی روی سیستمهای بدون شتابدهنده گرافیکی، با حداقل 30 گیگابایت رم سیستمی برای نسخه 7B و 60 گیگابایت برای نسخه 13B، اجرای مدلها ممکن خواهد بود. پشتیبانی از دستورات پردازشی خاص اینتل (AVX512_BF16/AMX) نیز مسیر اجرای مدلهای سبکتر را هموار کرده است.
آینده ارزشسنجی گفتگومحور
تحول شفاف در آرنای چتباتها و دسترسی آسان به مدلهای سطح بالا، نشان میدهد که عصر انحصار در ارزیابی هوش مصنوعی به پایان رسیده است. وقتی ابزارهای سنجش بر اساس تعاملات واقعی کاربران و مدلهای باز روی سختافزارهای معمولی اجرا میشوند، توسعهدهندگان و پژوهشگران فرصت بهتری برای ساخت سامانههای پایدارتر و قابلاعتمادتر خواهند داشت. تمرکز فعلی بر بهینهسازی سرعت در مکالمات طولانیمدت و کاهش هزینههای محاسباتی نشان میدهد که آینده این حوزه به سمت تعادل کامل بین کارایی محاسباتی و شفافیت دادهمحور حرکت خواهد کرد.





