شرکت پول‌ساید (Poolside) سومین مدل کدنویسی خود را در عرض سه ماه رونمایی کرد. لاگونا S 2.1 (Laguna S 2.1) با تمرکز بر رفتار هوشمندتر در جلسات طولانی عامل‌محور (Agentic)، به جای تکیه صرف بر مقیاس خام، توانسته است مدل‌های بسیار بزرگ‌تر را کنار بگذارد. این مدل از معماری ترکیبی متخصصان (Mixture-of-Experts) بهره می‌برد و در مجموع ۱۱۸ میلیارد پارامتر دارد که برای هر توکن تنها ۸ میلیارد پارامتر آن فعال می‌شود. پشتیبانی از پنجره‌های زمینه (Context Windows) با ظرفیت یک میلیون توکن و ارائه حالت‌های تفکر و بدون تفکر، از ویژگی‌های برجسته این نسخه است.

پول‌ساید تا پیش از آوریل ۲۰۲۶ تمرکز خود را بر مشتریان دولتی و بخش عمومی گذاشته بود، اما با عرضه مدل‌های Laguna M.1 و XS.2، نخستین محصولات خود را تحت مجوز متن‌باز Apache 2.0 در اختیار مخاطبان بیشتری قرار داد. لاگونا S 2.1 سومین نسخه از این سری است که در حدود سه ماه گذشته منتشر شده و عملکردی فراتر از کلاس وزنی خود ارائه می‌دهد.

غلبه بر مدل‌های متن‌باز عظیم

با فعال بودن حالت تفکر، لاگونا S 2.1 در بنچمارک Terminal-Bench 2.1 که وظایف طولانی‌مدت ترمینال را می‌سنجد، نمره 70.2 درصد را کسب می‌کند و در این رتبه‌بندی دقیقاً پس از Hy3 تنسنت و پیش از مدل‌های متن‌باز عظیمی مانند DeepSeek-V4-Pro-Max و Nemotron 3 Ultra قرار می‌گیرد. جدول کلی رهبری این بنچمارک در دست مدل‌هایی نظیر GPT-5.6 Sol از OpenAI و Claude Fable 5 از Anthropic است.

بنچمارک DeepSWE از Datacurve مقایسه واقعی‌تری ارائه می‌دهد؛ جایی که لاگونا S 2.1 نمره 40.4 درصدی می‌گیرد، در حالی که برخی مدل‌های متن‌باز با بیش از یک تریلیون پارامتر همچنان زیر 10 درصد باقی می‌مانند. تفاوت عملکرد در حالت‌های تفکر چشمگیر است. بدون این قابلیت، نمره Terminal-Bench به 60.4 درصد و نمره DeepSWE به 16.5 درصد سقوط می‌کند که نشان‌دهنده بیشترین شکاف عملکردی در میان مدل‌های لاگونا تا به امروز است.

عملکرد مدل لاگونا S 2.1 در بنچمارک‌های کدنویسی

استمرار به جای مقیاس خام

پول‌ساید استمرار را به عنوان جایگزینی برای مقیاس خام معرفی می‌کند. این شرکت در توضیح رویکرد خود می‌گوید هدف افزودن هوش بیشتر نبوده، بلکه بهبود رفتارهایی نظیر تأیید گام‌به‌گام، پرهیز از اعلام زودهنگام پیروزی و استمرار در رویکردها مدنظر بوده است. مدل‌های قبلی گاهی پس از گذراندن بخشی از آزمون‌ها متوقف می‌شدند، اما لاگونا S 2.1 با بازبینی رویکردهای ناموفق مسیر جدیدی را در پیش گرفته است.

پول‌ساید ادعاهای خود را با سه اجرای مستند پشتیبانی می‌کند. در یک آزمایش، لاگونا S 2.1 در عرض 50 دقیقه و از یک پوشه خالی، موتور مرورگری کارآمد ساخت که قابلیت رندر HTML و CSS را داشت. در آزمایشی دیگر، این مدل در یک محیط ایزوله (Sandbox) و بدون دسترسی به پایتون، اثباتی برای مسئله اردوش شماره 397 که از سال 1975 حل‌نشده بود، کشف کرد.

آموزش پسین در 409 هزار محیط

جهش عملکردی از نسخه XS 2.1 به S 2.1 عمدتاً ناشی از آموزش پسین (Post-training) در 409 هزار محیط بوده است. این مرحله شامل 83 هزار محیط برای وظایف ترمینال و 168 هزار محیط برای گردش‌کار مهندسی نرم‌افزار بود. حدود 38 هزار کامیت واقعی از 17 هزار مخزن مختلف، به مدل آموزش داد تا وابستگی‌ها را نصب و مجموعه آزمایشی را اجرا کند. همچنین، سیستم سندباکس جدیدی برای جلوگیری از تقلب در پاداش‌دهی (Reward Hacking) توسعه یافته است. مدل بزرگ‌تری از لاگونا نیز در حال حاضر در مرحله پیش‌آموزش قرار دارد و انتظار می‌رود در آینده‌ای نزدیک رونمایی شود.