شرکت پولساید (Poolside) سومین مدل کدنویسی خود را در عرض سه ماه رونمایی کرد. لاگونا S 2.1 (Laguna S 2.1) با تمرکز بر رفتار هوشمندتر در جلسات طولانی عاملمحور (Agentic)، به جای تکیه صرف بر مقیاس خام، توانسته است مدلهای بسیار بزرگتر را کنار بگذارد. این مدل از معماری ترکیبی متخصصان (Mixture-of-Experts) بهره میبرد و در مجموع ۱۱۸ میلیارد پارامتر دارد که برای هر توکن تنها ۸ میلیارد پارامتر آن فعال میشود. پشتیبانی از پنجرههای زمینه (Context Windows) با ظرفیت یک میلیون توکن و ارائه حالتهای تفکر و بدون تفکر، از ویژگیهای برجسته این نسخه است.
پولساید تا پیش از آوریل ۲۰۲۶ تمرکز خود را بر مشتریان دولتی و بخش عمومی گذاشته بود، اما با عرضه مدلهای Laguna M.1 و XS.2، نخستین محصولات خود را تحت مجوز متنباز Apache 2.0 در اختیار مخاطبان بیشتری قرار داد. لاگونا S 2.1 سومین نسخه از این سری است که در حدود سه ماه گذشته منتشر شده و عملکردی فراتر از کلاس وزنی خود ارائه میدهد.
غلبه بر مدلهای متنباز عظیم
با فعال بودن حالت تفکر، لاگونا S 2.1 در بنچمارک Terminal-Bench 2.1 که وظایف طولانیمدت ترمینال را میسنجد، نمره 70.2 درصد را کسب میکند و در این رتبهبندی دقیقاً پس از Hy3 تنسنت و پیش از مدلهای متنباز عظیمی مانند DeepSeek-V4-Pro-Max و Nemotron 3 Ultra قرار میگیرد. جدول کلی رهبری این بنچمارک در دست مدلهایی نظیر GPT-5.6 Sol از OpenAI و Claude Fable 5 از Anthropic است.
بنچمارک DeepSWE از Datacurve مقایسه واقعیتری ارائه میدهد؛ جایی که لاگونا S 2.1 نمره 40.4 درصدی میگیرد، در حالی که برخی مدلهای متنباز با بیش از یک تریلیون پارامتر همچنان زیر 10 درصد باقی میمانند. تفاوت عملکرد در حالتهای تفکر چشمگیر است. بدون این قابلیت، نمره Terminal-Bench به 60.4 درصد و نمره DeepSWE به 16.5 درصد سقوط میکند که نشاندهنده بیشترین شکاف عملکردی در میان مدلهای لاگونا تا به امروز است.
استمرار به جای مقیاس خام
پولساید استمرار را به عنوان جایگزینی برای مقیاس خام معرفی میکند. این شرکت در توضیح رویکرد خود میگوید هدف افزودن هوش بیشتر نبوده، بلکه بهبود رفتارهایی نظیر تأیید گامبهگام، پرهیز از اعلام زودهنگام پیروزی و استمرار در رویکردها مدنظر بوده است. مدلهای قبلی گاهی پس از گذراندن بخشی از آزمونها متوقف میشدند، اما لاگونا S 2.1 با بازبینی رویکردهای ناموفق مسیر جدیدی را در پیش گرفته است.
پولساید ادعاهای خود را با سه اجرای مستند پشتیبانی میکند. در یک آزمایش، لاگونا S 2.1 در عرض 50 دقیقه و از یک پوشه خالی، موتور مرورگری کارآمد ساخت که قابلیت رندر HTML و CSS را داشت. در آزمایشی دیگر، این مدل در یک محیط ایزوله (Sandbox) و بدون دسترسی به پایتون، اثباتی برای مسئله اردوش شماره 397 که از سال 1975 حلنشده بود، کشف کرد.
آموزش پسین در 409 هزار محیط
جهش عملکردی از نسخه XS 2.1 به S 2.1 عمدتاً ناشی از آموزش پسین (Post-training) در 409 هزار محیط بوده است. این مرحله شامل 83 هزار محیط برای وظایف ترمینال و 168 هزار محیط برای گردشکار مهندسی نرمافزار بود. حدود 38 هزار کامیت واقعی از 17 هزار مخزن مختلف، به مدل آموزش داد تا وابستگیها را نصب و مجموعه آزمایشی را اجرا کند. همچنین، سیستم سندباکس جدیدی برای جلوگیری از تقلب در پاداشدهی (Reward Hacking) توسعه یافته است. مدل بزرگتری از لاگونا نیز در حال حاضر در مرحله پیشآموزش قرار دارد و انتظار میرود در آیندهای نزدیک رونمایی شود.





