تست جدید شرکت Anysphere نشان میدهد که ترکیب مدلهای پیشرفته با مدلهای سبکتر، میتواند بار اصلی تولید کد را بر دوش بگیرد.
در آزمایشی که یک ازدحام عامل ارتقایافته با نسخه پیشین خود برای بازنویسی کامل پایگاهداده SQLite به زبان Rust مقایسه شد، هر چهار پیکربندی سیستم جدید به امتیاز 100 درصد در مجموعهآزمونها دست یافت. نسخه قدیمی اما در چنبره تعارضهای ادغام خود گیر کرده بود و توانایی تکمیل وظیفه را نداشت. این شکاف عملکردی، مسیر جدیدی را برای توسعهدهندگانی که به دنبال کاهش هزینههای محاسباتی بدون افت کیفیت کد هستند، هموار کرده است.
در مستندات فنی جدید Cursor آمده است که ناوگان عاملها از یک پروژه پژوهشی به بخش اصلی محصول تبدیل شده است. توسعهدهندگان با نسخه 3 میتوانند ناوگانهای کاملی از عاملهای هوش مصنوعی را بهطور موازی اجرا کنند. شرکت سازنده این ابزار، Anysphere، اخیراً توسط SpaceX متعلق به ایلان ماسک به ارزش 60 میلیارد دلار خریداری شده است.
معمای کاتالوگ هوشمند: تفکیک برنامهریز و مجری

در معماری قدیمی، یک عامل واحد باید هم نقش مدیر پروژه را بازی کند و هم کد بنویسد. این دوگانه باعث میشود عامل در پروژههای بلندمدت از مسیر اصلی منحرف شود، زیرا کاتالوگ اطلاعاتی بهسرعت اشباع میشود. راهکاری که تیم Cursor ارائه کرده، جداسازی کامل این دو نقش است. عاملهای برنامهریز بر پایه مدلهای پیشرفته طراحی میشوند و اهداف پیچیده را به گامهای کوچکتر تجزیه میکنند. در مقابل، عاملهای مجری که از مدلهای سریعتر و کمهزینهتر بهره میبرند، مستقیماً وظایف تعیینشده را اجرا میکنند.
نتیجه، یک درخت وظیفه پویاست که با پیشرفت کار و کشف موانع جدید، خودش را تطبیق میدهد. این ساختار باعث میشود برنامهریزها کدنویسی نکنند و مجریها درگیر طراحی سیستمی نشوند. تیم فنی معتقد است این تفکیک وظایف، مشکل اصلی مربوط به محدودیت کاتالوگ را که در کارهای طولانی عاملها را از مسیر خارج میکند، حل مینماید.
فراتر از گیت: بحران هزار کامیت در ثانیه

نسخه قبلی مرورگر Cursor حدود هزار کامیت در ساعت را روی سیستم کنترل نسخه گیت مدیریت میکرد. اما ازدحام جدید سرعت را به هزار کامیت در ثانیه رساند. این جهش عملکردی، ساختارهای سنتی مدیریت نسخه و حتی لایههای یکپارچهسازی را فلج کرد. عاملهای یکپارچهساز قدیمی بهجای حل تعارضها، گلوگاههای جدیدی خلق کردند.
برای غلبه بر این بحران، توسعهدهندگان Cursor یک سیستم کنترل نسخه اختصاصی پیادهسازی کردند. حالتهای شکست در این سرعت کاری، سناریوهایی هستند که حتی تیمهای بزرگ انسانی هرگز با آنها مواجه نمیشوند. تیم فنی پدیدهای را که طراحی دوپاره نامگذاری کرده، بهعنوان یکی از چالشهای بارز این سرعت معرفی کرده است. دو برنامهریز بدون آگاهی از یکدیگر، یک ایده مشابه را در نقاط جداگانه کدبیس میساختند و آن را به روشهای متفاوت پیادهمیکردند.
بازبینی سه لایه و حافظه میدانی خودگردان

اعتبارسنجی کد تولیدشده توسط ازدحام عاملها، نیازمند زاویهدیدهای متعدد است. در آزمایشهای شرکت سازنده، سه نوع بازبینکننده مستقل عمل کردند: یکی متن کامل گفتگوهای عامل مجری، دیگری فقط خروجی نهایی و سومی فقط تغییرات کدبیس را میدید. هیچکدام بهتنهایی تصویر کاملی ارائه نمیدادند، اما ترکیب این دیدگاههای غیرهمبسته، دقت و قابلیت اطمینان را بهطرز چشمگیری بالا برد.
فراتر از بازبینی، یک راهنمای میدانی خودگردان نیز توسعه یافت. این پوشه دانشمحور، محدودیت مشخصی در تعداد خطوط داشت و خود عاملها مسئول بهروزرسانی آن بودند. از آنجا که وزنهای مدلها پس از آموزش ثابت میمانند، ثبت یافتههای غیرمنتظره و میانبرهای اثباتشده در این پوشه، به عاملهای جدید اجازه میدهد از تجربیات قبلی استفاده کنند.
تفاوت فاحش در کارایی و تولید بیهوده
برای اندازهگیری واقعی عملکرد، تیم فنی مستندات 835 صفحهای SQLite را در اختیار ازدحام عاملها قرار داد و شرط ساخت یک پیادهسازی کامل به زبان Rust را اعمال کرد. دسترسی به کد منبع و اینترنت بهطور کامل مسدود شد. تنها هدف، پیروی از مستندات و پاس کردن تستهای شناختهشده sqllogictest بود.
چهار پیکربندی مورد سنجش قرار گرفت:
- پیکربندیهای مدلهای GPT-5.5 و Grok 4.5 بهعنوان عامل مستقل
- ترکیب Opus 4.8 بهعنوان برنامهریز و Composer 2.5 بهعنوان مجری
- ترکیب Fable 5 بهعنوان برنامهریز و Composer 2.5 بهعنوان مجری
گذشت چهار ساعت از اجرای آزمایش، سیستم جدید امتیازی بین 73 تا 85 درصد کسب کرده بود، در حالی که نسخه قدیمی در بازه 11 تا 77 درصد گیر کرده بود. اما معجزه نه این بود که قدیمیها شکست خوردند، بلکه این بود که تمام پیکربندیهای سیستم جدید در نهایت به امتیاز 100 درصد رسیدند.
سنگآزمایی SQLite و مقایسه پیکربندیها

پیکربندیهای Grok 4.5 در سیستم قدیمی، دلیل عقبماندگی را لو داد. ازدحام پیشین در دو ساعت، 68 هزار کامیت تولید کرد که حدود 70 برابر فعالیت سیستم حاضر و عمدتاً بیهوده بود. این سیستم بیش از 70 هزار تعارض ادغام بهبار آورد. پرتعارضترین فایل توسط 1173 عامل مختلف، 7771 بار تکرار و درگیری شد.
در مقابل، ازدحام جدید در همان آزمایش، تعداد تعارضات را به زیر هزار نگه داشت و مدیریت ساختار بستهها را با ایجاد دقیق 9 کرات بهجای 54 کرات گسسته در نسخه پیشین، بسیار متمرکزتر انجام داد. عاملها حتی توانستند خارج از محدوده تعیینشدهٔ خود کدی را اصلاح کنند و کامپایلر این تغییر را در سراسر سیستم اعمال نماید.
این جهش معمارانه نشان میدهد که آینده توسعه نرمافزار با هوش مصنوعی، در رقابت برای تولید مدلهای تمامعیار و گرانقیمت نهفته نیست. تمرکز بر ارکستراسیون هوشمند، تفکیک نقشهای برنامهریزی و اجرا، و مدیریت خودکار گلوگاههای زیرساختی، کاتالوگ را برای تیمهای مستقل و کسبوکارهای کوچک نیز باز میکند. وقتی هزینههای محاسباتی از مسیرهای ناکارآمد حذف شوند، چرخه تولید نرمافزار نهتنها تسریع میشود، بلکه پتانسیل کشف معماریهای منطقی جدید در لایههای پایینتر کدبیسها نیز برمیانگیزد. نوبت به تیمهای توسعه است که این ابزارهای همکار را در چارچوبهای امنیتی و معماری انعطافپذیر خود جای دهند.





