PrismML، شرکتی که بنیان‌گذارانش محققان کالتک (Caltech) هستند، مدل Bonsai 27B را منتشر کرده است؛ یک مدل استدلال باز (open-weight) با ۲۷ میلیارد پارامتر که به طور کلی بر پایه Qwen3.6-27B علی‌بابا ساخته شده، اما با فشرده‌سازی رادیکال به حجمی رسیده که می‌تواند مستقیماً روی آیفون اجرا شود.

چرا اجرای مدل روی دستگاه (On-Device) حیاتی است؟

PrismML استدلال می‌دهد که برنامه‌های مدرن هوش مصنوعی به مدل‌های قدرتمندِ محلی نیاز دارند. یک «عامل» (Agent) می‌تواند صدها فراخوانی مدل را به صورت متوالی انجام دهد؛ هر فراخوانی زمینه (context) را حمل می‌کند، خروجی ساختاریافته تولید می‌کند و به مرحله‌ی بعد تغذیه می‌کند. در ابر، هزینه‌های هر توکن انباشته می‌شود، تأخیر شبکه اضافه می‌شود، و داده‌های خصوصی—مانند محتوای صفحه نمایش یا اسناد—از دستگاه خارج می‌شوند.

اجرای مدل روی دستگاه، هزینه حاشیه‌اییِ این حلقه‌ها را به صفر می‌رساند و داده‌های کاربر را کاملاً محلی نگه می‌دارد. PrismML این را پایه‌ی دستیارهای همیشه‌فعال، آفلاین، و سیستم‌های ترکیبی (Hybrid) می‌داند: وظایف ساده و حساس‌به‌حریم‌خصوصی روی دستگاه، و تنها مراحل سخت به مدل‌های پیشرو در ابر ارسال می‌شوند.

دو نسخه: از لپ‌تاپ تا آیفون ۱۷ پرو ماکس

یک مدل ۲۷ میلیارد پارامتری معمول، حدود ۵۴ گیگابایت فضای ذخیره‌سازی اشغال می‌کند. حتی با کوانتایزیشن (Quantization) استاندارد، همچنان به ~۱۸ گیگابایت نیاز دارد. PrismML دو نسخه بسیار کوچک‌تر ارائه می‌دهد:

  • نسخه متمرکز بر کیفیت: ~۵.۹ گیگابایت (برای لپ‌تاپ‌ها). بسته‌های فعلی بسته به ران‌تایم (llama.cpp ~۷.۲ GB، MLX ~۸.۴۹ GB) بزرگ‌تر هستند.
  • نسخه فشرده‌ترین: ~۳.۹ گیگابایت — کوچک‌ترین که در فضای آیفون ۱۷ پرو ماکس (با ۱۲ GB رم، که ~۶ GB برای یک اپ در دسترس است) جا می‌شود.
مقایسه اندازه مدل‌های Bonsai 27B با مدل‌های معمولی
مقایسه حجم مدل‌های Bonsai با روش‌های فشرده‌سازی معمول

فشرده‌سازی بیتی: یک یا دو بیت به ازای هر وزن

به جای ذخیره هر وزن شبکه عصبی به صورت ۱۶ بیتی (FP16)، PrismML از یک یا کمتر از دو بیت استفاده می‌کند:

  • در نسخه تهاجمی: هر وزن فقط دو حالت دارد (۱ بیت در عمل).
  • در نسخه کمی بزرگ‌تر: سه حالت (~۱.۵۸ بیت).

این رویکرد بر کل مدل زبانی اعمال شده. PrismML به عنوان مثال، مدل Qwen3.6-27B-IQ2_XXS را که برچسب «۲ بیت» دارد، اما میانگین ۲.۸ بیت به ازای هر وزن ثبت می‌کند، نقد کرده است.

تأثیر بر کیفیت: ۹۰ تا ۹۵ درصد حفظ عملکرد

بر اساس ارزیابی PrismML روی ۱۵ بنچ‌مارک:

  • نسخه بزرگ‌تر (کیفیت): ۹۵٪ عملکرد اصلی حفظ شده.
  • نسخه کوچک‌تر: ۹۰٪ حفظ شده.
  • ریاضیات و کدنویسی: «عملاً تحت تأثیر قرار نگرفته».

کاهش‌های قابل‌توجه در نسخه تهاجمی در درک تصویر، پیروی از دستورالعمل‌ها، و استفاده از ابزار (Tool Use) نمایان شد. جالب است که یک مدل معمولی ۹.۴ گیگابایتی فقط ۷۲.۷ امتیاز می‌گیرد، در حالی که Bonsai ۳.۹ گیگابایتی به ۷۶.۱ می‌رسد.

نمودار عملکرد Bonsai 27B در بنچ‌مارک‌ها
عملکرد نسبتی نسخه‌های Bonsai در مقایسه با مدل اصلی و خط پایه

عملکرد روی آیفون: ۱۱ توکن/ثانیه و ۶۷ هزار توکن در یک شارژ

بر اساس مقاله‌ی سفید (Whitepaper) منتشرشده:

  • سرعت استنتاج: ~۱۱ توکن در ثانیه روی آیفون ۱۷ پرو ماکس.
  • باتری: ~۶۷۲ توکن در هر درصد باتری → تخمین ~۶۷,۰۰۰ توکن در شارژ کامل.
  • تراشه پس از ~۵ دقیقه کمی تروتل (Throttle) کرد.

اپل در حال تست؛ مذاکرات «بسیار اولیه» اما «پیشرفت خوب»

بر اساس گزارش CNBC، PrismML در مذاکره با اپل درباره فناوری فشرده‌سازی است. بابک حسینی، مدیرعامل PrismML، تأیید کرد که اپل و شرکت‌های دیگر مدل‌ها را برای سرعت، مصرف برق و عملکرد تست می‌کنند. مذاکرات «بسیار اولیه» هستند اما «چیزها به خوبی پیش می‌روند».

این فناوری می‌تواند به اپل کمک کند شکاف هوش مصنوعی محلی (On-Device AI) را در برابر رقبا بپوشاند، به‌ویژه با توجه به تمرکز اپل بر حریم خصوصی و محاسبه روی دستگاه.

مجوز باز، اجرا روی MLX و انویدیا، و دسترسی توسعه‌دهندگان

  • وزن‌ها تحت مجوز Apache 2.0 منتشر شده‌اند.
  • اجرا روی دستگاه‌های اپل از طریق فریم‌ورک MLX و روی GPUهای انویدیا.
  • دموی زنده روی هاگینگ‌فس و API پیش‌نمایش توسعه‌دهنده (Developer Preview) رایگان با محدودیت زمانی.

شرکت با حمایت Khosla Ventures تأسیس شده و تیمی از محققان کالتک را در بر می‌گیرد. Bonsai 27B گامی بزرگ نحوه‌ی Demokratization (دموکراسی‌سازی) مدل‌های استدلالِ قدرتمند روی گوشی‌های هوشمند است.