PrismML، شرکتی که بنیانگذارانش محققان کالتک (Caltech) هستند، مدل Bonsai 27B را منتشر کرده است؛ یک مدل استدلال باز (open-weight) با ۲۷ میلیارد پارامتر که به طور کلی بر پایه Qwen3.6-27B علیبابا ساخته شده، اما با فشردهسازی رادیکال به حجمی رسیده که میتواند مستقیماً روی آیفون اجرا شود.
چرا اجرای مدل روی دستگاه (On-Device) حیاتی است؟
PrismML استدلال میدهد که برنامههای مدرن هوش مصنوعی به مدلهای قدرتمندِ محلی نیاز دارند. یک «عامل» (Agent) میتواند صدها فراخوانی مدل را به صورت متوالی انجام دهد؛ هر فراخوانی زمینه (context) را حمل میکند، خروجی ساختاریافته تولید میکند و به مرحلهی بعد تغذیه میکند. در ابر، هزینههای هر توکن انباشته میشود، تأخیر شبکه اضافه میشود، و دادههای خصوصی—مانند محتوای صفحه نمایش یا اسناد—از دستگاه خارج میشوند.
اجرای مدل روی دستگاه، هزینه حاشیهاییِ این حلقهها را به صفر میرساند و دادههای کاربر را کاملاً محلی نگه میدارد. PrismML این را پایهی دستیارهای همیشهفعال، آفلاین، و سیستمهای ترکیبی (Hybrid) میداند: وظایف ساده و حساسبهحریمخصوصی روی دستگاه، و تنها مراحل سخت به مدلهای پیشرو در ابر ارسال میشوند.
دو نسخه: از لپتاپ تا آیفون ۱۷ پرو ماکس
یک مدل ۲۷ میلیارد پارامتری معمول، حدود ۵۴ گیگابایت فضای ذخیرهسازی اشغال میکند. حتی با کوانتایزیشن (Quantization) استاندارد، همچنان به ~۱۸ گیگابایت نیاز دارد. PrismML دو نسخه بسیار کوچکتر ارائه میدهد:
- نسخه متمرکز بر کیفیت: ~۵.۹ گیگابایت (برای لپتاپها). بستههای فعلی بسته به رانتایم (llama.cpp ~۷.۲ GB، MLX ~۸.۴۹ GB) بزرگتر هستند.
- نسخه فشردهترین: ~۳.۹ گیگابایت — کوچکترین که در فضای آیفون ۱۷ پرو ماکس (با ۱۲ GB رم، که ~۶ GB برای یک اپ در دسترس است) جا میشود.
فشردهسازی بیتی: یک یا دو بیت به ازای هر وزن
به جای ذخیره هر وزن شبکه عصبی به صورت ۱۶ بیتی (FP16)، PrismML از یک یا کمتر از دو بیت استفاده میکند:
- در نسخه تهاجمی: هر وزن فقط دو حالت دارد (۱ بیت در عمل).
- در نسخه کمی بزرگتر: سه حالت (~۱.۵۸ بیت).
این رویکرد بر کل مدل زبانی اعمال شده. PrismML به عنوان مثال، مدل Qwen3.6-27B-IQ2_XXS را که برچسب «۲ بیت» دارد، اما میانگین ۲.۸ بیت به ازای هر وزن ثبت میکند، نقد کرده است.
تأثیر بر کیفیت: ۹۰ تا ۹۵ درصد حفظ عملکرد
بر اساس ارزیابی PrismML روی ۱۵ بنچمارک:
- نسخه بزرگتر (کیفیت): ۹۵٪ عملکرد اصلی حفظ شده.
- نسخه کوچکتر: ۹۰٪ حفظ شده.
- ریاضیات و کدنویسی: «عملاً تحت تأثیر قرار نگرفته».
کاهشهای قابلتوجه در نسخه تهاجمی در درک تصویر، پیروی از دستورالعملها، و استفاده از ابزار (Tool Use) نمایان شد. جالب است که یک مدل معمولی ۹.۴ گیگابایتی فقط ۷۲.۷ امتیاز میگیرد، در حالی که Bonsai ۳.۹ گیگابایتی به ۷۶.۱ میرسد.
عملکرد روی آیفون: ۱۱ توکن/ثانیه و ۶۷ هزار توکن در یک شارژ
بر اساس مقالهی سفید (Whitepaper) منتشرشده:
- سرعت استنتاج: ~۱۱ توکن در ثانیه روی آیفون ۱۷ پرو ماکس.
- باتری: ~۶۷۲ توکن در هر درصد باتری → تخمین ~۶۷,۰۰۰ توکن در شارژ کامل.
- تراشه پس از ~۵ دقیقه کمی تروتل (Throttle) کرد.
اپل در حال تست؛ مذاکرات «بسیار اولیه» اما «پیشرفت خوب»
بر اساس گزارش CNBC، PrismML در مذاکره با اپل درباره فناوری فشردهسازی است. بابک حسینی، مدیرعامل PrismML، تأیید کرد که اپل و شرکتهای دیگر مدلها را برای سرعت، مصرف برق و عملکرد تست میکنند. مذاکرات «بسیار اولیه» هستند اما «چیزها به خوبی پیش میروند».
این فناوری میتواند به اپل کمک کند شکاف هوش مصنوعی محلی (On-Device AI) را در برابر رقبا بپوشاند، بهویژه با توجه به تمرکز اپل بر حریم خصوصی و محاسبه روی دستگاه.
مجوز باز، اجرا روی MLX و انویدیا، و دسترسی توسعهدهندگان
- وزنها تحت مجوز Apache 2.0 منتشر شدهاند.
- اجرا روی دستگاههای اپل از طریق فریمورک MLX و روی GPUهای انویدیا.
- دموی زنده روی هاگینگفس و API پیشنمایش توسعهدهنده (Developer Preview) رایگان با محدودیت زمانی.
شرکت با حمایت Khosla Ventures تأسیس شده و تیمی از محققان کالتک را در بر میگیرد. Bonsai 27B گامی بزرگ نحوهی Demokratization (دموکراسیسازی) مدلهای استدلالِ قدرتمند روی گوشیهای هوشمند است.





