معرفی کلایبری
اجرای مدلهای زبانی بزرگ (LLM) در خانه به دلیل افزایش هزینه اشتراکهای هوش مصنوعی و نگرانیهای حریم خصوصی محبوبیت یافته است. اما محدودیت حافظه مانعی بزرگ است. مهندس ایتالیایی وینچنزو (JustVugg) با پروژه کلایبری (Colibrì) این محدودیت را شکسته است. او موفق شد مدل GLM-5.2 با ۷۴۴ میلیارد پارامتر و حجم ۱.۵ ترابایت را روی یک CPU معمولی، تنها ۲۵ گیگابایت رم و یک درایو NVMe مجازی با سرعت ۱ گیگابایت بر ثانیه اجرا کند.

چگونه کار میکند؟
مدل GLM-5.2 از معماری مخلوطی از متخصصان (MoE) استفاده میکند. این مدل شامل صدها زیرمدل متخصص برای موضوعات مختلف است. به جای بارگذاری کل مدل روی GPUهای گرانقیمت، کلایبری از این معماری بهره میبرد: برای هر توکن (بخشی از کلمه)، متخصصان مورد نیاز را به صورت تکهای بارگذاری و حذف میکند. این کار باعث میشود حتی یک سیستم ارزانقیمت بتواند از مدلی بزرگ استفاده کند، اما با هزینه عملکردی بالا.
کد انتخاب متخصص کلایبری یک فایل C واحد با وابستگیهای کم است. همچنین مدل GLM-5.2 با کوانتیزاسیون (رمزگذاری با افت) فشرده شده تا فضای کمتری اشغال کند.
محدودیتها و چالشها
سرعت کلایبری در تنظیمات وینچنزو تنها ۰.۰۵ تا ۰.۱ توکن در ثانیه است که برای مکالمه عملی غیرقابل استفاده است. یک سوال ممکن است ساعتها طول بکشد. گلوگاه اصلی سرعت ذخیرهسازی NVMe است، سپس محدودیت RAM و هستههای CPU.
- بازه I/O ذخیرهسازی: بارگذاری و حذف مکرر دادهها فشار زیادی به SSD وارد میکند.
- پهنای باند حافظه: حتی با RAM کافی، انتقال داده محدودیت ایجاد میکند.
- هستههای CPU: پردازش موازی محدود است.

آینده پروژه
کلایبری هنوز یک اثبات مفهوم است و روی GPU اجرا نمیشود. حتی اگر اجرا شود، جابجایی داده به کارت گرافیک گلوگاه اصلی خواهد بود. با این حال، این پروژه به تازگی منتشر شده و محبوبیت یافته است. وینچنزو در حال جمعآوری دادههای معیار و رفع اشکال است. ممکن است در آینده بتوان مدلهای هوشمند را روی سختافزار مصرفکننده با سرعت مناسب اجرا کرد.
منبع: Tom's Hardware





