FreeToken، موتور استنتاج متنباز حاصل پژوهشهای UC Berkeley و MIT با مشارکت پژوهشگرانی مانند Matei Zaharia و Ion Stoica، اجرای مدلهای Mixture-of-Experts (MoE) را روی سختافزار مصرفی ممکن میسازد. این پروژه رویکرد اجرای مدلها را از «گرههای متمرکز مرکز داده» به «بافتهای محاسباتی کشسان و ناهمگن» منتقل میکند و استفاده محلی از مدلهای بزرگ را تسهیل میکند.
چالش اصلی: پهنایباند و تأخیر در سختافزار مصرفی
معماریهای MoE برای هر توکن تنها تعداد محدودی اکسپرت را فعال میکنند، اما فرایند دیکدینگ به دسترسی به صدها میلیارد وزن غیرفعال نیاز دارد. در مراکز داده، پیوندهای پرسرعت مانند NVLink هزینهٔ انتقال اکسپرتها را پنهان میکنند؛ اما روی سختافزار مصرفی، توان عملیاتی PCIe و تأخیر حافظهٔ میزبان گلوگاه میشوند. رانتایمهای فعلی معمولاً از offloading ایستا استفاده میکنند که در زمان cache miss اجرای GPU را متوقف کرده و عملکرد را شدیداً کاهش میدهد. برای اطلاعات تکمیلی دربارهٔ استانداردهای رابطهای ارتباطی رجوع به PCI Express مفید است.
نوآوری FreeToken: سیاست q* و همزمانسازی پویا
بهجای offloading ایستا، FreeToken یک زمانبندی پویا به نام «سیاست q*» معرفی میکند که محاسبات توکن را بین هستههای CPU و هستههای تنسور GPU بر اساس پهنایباند واقعی پیوند تقسیم میکند. این رویکرد از توقف کامل اجرای GPU جلوگیری کرده و بار را بر اساس شرایط واقعی شبکه و حافظه تطبیق میدهد.
اجزا و مکانیسمهای کلیدی
- فرمت وزن سریع (FTW) برای کاهش هزینهٔ انتقال وزنها.
- double buffering لایهای کامل که استریم وزنها روی PCIe را با محاسبات لایههای فعال همپوشانی میدهد و از idle شدن GPU جلوگیری میکند.
- مدیر حافظهٔ کشسان که VRAM را بین کش KV و اسلاتهای اکسپرت مقیم بازتخصیص میدهد بدون نیاز به بارگذاری مجدد مدل.
- محاسبهٔ تقسیمهای بهینه بهصورت بسته که تخصیص محاسبات را برای هر لایه بلادرنگ تعیین میکند و FreeToken را از قواعد offloading ایستا متمایز میکند.
حفظ وضعیت و واکنش سریع به ویرایشهای پرامپت
عاملهای خودگردان و دستیارهای کدنویسی معمولاً الگوهای اجرایی پویایی دارند: پرامپتها و پیشوندها مرتباً تغییر میکنند و ابزارها فراخوانی میشوند. موتورهای مرسوم هنگام تغییر پیشوندها کشهای خطی KV را دور میاندازند و مجبور به recompute کل توالی میشوند. FreeToken با «نقطهبندی با لنگر معنایی» (semantic anchor checkpointing) وضعیتهای میانی attention و فعالسازیهای بازگشتی را در مرزهای منطقی ذخیره میکند تا هنگام ویرایش زیرتوالیها نیازی به محاسبات مجدد گسترده نباشد و پاسخدهی سریعتر حفظ شود.
عملکرد و بنچمارکها
نتایج منتشرشده نشان میدهد FreeToken نمونههایی از مدلهای بسیار بزرگ را روی سختافزار مصرفی عملیاتی کرده است:
- Qwen3.6-35B: حدود 39 توکن بر ثانیه روی یک لپتاپ مجهز به RTX 4060 با 8GB VRAM.
- DeepSeek-V4-Flash (284B): سروینگ قابلاستفاده روی دسکتاپ با RTX 5090.
- GLM-5.2 (753B): اجرا روی یک GPU ایستگاه کاری منفرد.
رابط خط فرمان و کلاینت دسکتاپ FreeToken از طریق FlashML.ai و مخزنهای پروژه در GitHub در دسترساند. پشتیبانی از کارتهای NVIDIA RTX سری 30، 40 و 50 روی لینوکس و ویندوز گزارش شده است.
مقایسه با رانتایمهای موجود
- Ollama و llama.cpp: مناسب برای کوانتیزاسیون GGUF و offloading لایهای؛ اما تقسیم بار پویا بین میزبان و دستگاه برای اکسپرتهای پراکنده را پوشش نمیدهند. FreeToken در مدلهای MoE ادعا میکند دیکد را 3–4 برابر و prefill را 6–30 برابر سریعتر میکند.
- vLLM و SGLang: برای throughput مراکز داده و تکنیکهایی مثل PagedAttention طراحی شدهاند و فرض را بر پهنایباند بالا گذاشتهاند، نه سلسلهمراتب حافظهٔ ناهمگنِ سختافزار مصرفی.
- KTransformers: مبتنی بر قواعد offloading ایستا است، در حالی که FreeToken تقسیمهای بهینه را بلادرنگ محاسبه میکند.
واکنش جامعه و پیامدهای عملی
بحثها در Hacker News و فروم LocalLLaMA از استقبال توسعهدهندگان نسبت به امکان «حاکمیت محلیِ سختافزاری» حکایت دارد؛ ترکیب سروینگ MoE با هزینه و محدودیتهای حافظهٔ مصرفی، آستانهٔ میزبانی محلی عاملهای استنتاجی را کاهش میدهد و وابستگی به APIهای ابری را کمتر میکند. در مقابل، پرسشهای فنی دربارهٔ پایداری زمانبندی q* در بارهای همزمان و تعاملات پیچیدهٔ CPU/GPU و حافظه مطرح است که نیاز به ارزیابی در محیطهای واقعی دارد.
نتیجهگیری برای توسعهدهندگان
FreeToken نشان میدهد با نوآوری در مدیریت حافظه و تقسیم بار بلادرنگ میتوان اجرای مدلهای بزرگ را از مراکز داده به ماشینهای شخصی منتقل کرد. این رویکرد میتواند هزینهٔ استفاده از مدلهای پیشرفته را کاهش دهد، حریم خصوصی را تقویت کند و امکان اجرای آفلاین و خودمیزبان را فراهم آورد. موفقیت عملی به تبادل تجارب جامعه و آزمون در محیطهای واقعی بستگی دارد و احتمالاً رقابت جدیدی میان رانتایمها و نوآوریهای سختافزاری شکل خواهد داد.





