Nous Research، استارت‌آپ متن‌باز هوش مصنوعی که توسط شرکت سرمایه‌گذاری رمزارزی Paradigm پشتیبانی می‌شود، روز دوشنبه یک مدل برنامه‌نویسی رقابتی جدید منتشر کرد که به گفته‌ی خود، از چندین سیستم اختصاصی بزرگ‌تر پیشی می‌گیرد یا با آن‌ها برابری می‌کند. این مدل تنها در چهار روز با استفاده از 48 واحد از جدیدترین پردازنده‌های گرافیکی B200 انویدیا آموزش دیده است.

این مدل که NousCoder-14B نام دارد، یکی دیگر از ورودی‌ها در زمینه‌ی شلوغ دستیاران کدنویسی هوش مصنوعی است، اما در لحظه‌ای به‌ویژه پرتنش عرضه شده است: Claude Code، ابزار برنامه‌نویسی عاملی از رقیب Anthropic، از روز اول سال نو بر بحث‌های رسانه‌های اجتماعی تسلط داشته است، و توسعه‌دهندگان با تعریف‌های پرشور از قابلیت‌های آن، پست‌های تحسین‌آمیزی منتشر کرده‌اند. این تحولات هم‌زمان نشان می‌دهد که توسعه‌ی نرم‌افزار به کمک هوش مصنوعی با چه سرعتی در حال تکامل است — و اینکه شرکت‌های بزرگ و کوچک چقدر شدیداً برای تصاحب آنچه که بسیاری معتقدند به فناوری پایه‌ای برای نوشتن نرم‌افزار تبدیل خواهد شد، رقابت می‌کنند.

عملکرد چشمگیر NousCoder-14B در ارزیابی‌های استاندارد

NousCoder-14B به نرخ دقت 67.87 درصدی در LiveCodeBench v6 دست یافته است، یک ارزیابی استاندارد که مدل‌ها را در مسائل برنامه‌نویسی رقابتی منتشر شده بین آگوست 2024 و مه 2025 آزمایش می‌کند. این رقم نشان‌دهنده‌ی بهبود 7.08 درصدی نسبت به مدل پایه‌ای است که از روی آن آموزش دیده، یعنی Qwen3-14B از علی‌بابا، طبق گزارش فنی Nous Research که هم‌زمان با انتشار منتشر شده است.

«من یک توضیح از مشکل به Claude Code دادم، و آن همان چیزی را که سال گذشته در یک ساعت ساخته بودیم، تولید کرد،» نوشته Jaana Dogan، مهندس اصلی گوگل مسئول Gemini API، در یک پست ویروسی در X در هفته گذشته که حال و هوای غالب پیرامون ابزارهای کدنویسی هوش مصنوعی را به تصویر کشید. Dogan یک سیستم توزیع‌شده‌ی هماهنگ‌سازی عامل‌ها را توصیف می‌کرد که تیمش یک سال روی توسعه‌ی آن صرف کرده بود — سیستمی که Claude Code از یک پرامپت سه‌بندی تقریب زد.

این کنار هم قرار دادن آموزنده است: در حالی که Claude Code از Anthropic با نمایش‌های توسعه‌ی نرم‌افزار سرتاسری تخیلات را تسخیر کرده است، Nous Research شرط می‌بندد که جایگزین‌های متن‌باز آموزش‌دیده روی مسائل قابل تأیید می‌توانند شکاف را ببندند — و اینکه شفافیت در نحوه‌ی ساخت این مدل‌ها به اندازه‌ی توانایی خام اهمیت دارد.

شفافیت کامل: چگونه Nous Research یک مدل قابل تکرار ساخت

آنچه که انتشار NousCoder-14B را از بسیاری از اعلامیه‌های رقبا متمایز می‌کند، باز بودن رادیکال آن است. Nous Research نه تنها وزن‌های مدل، بلکه محیط کامل یادگیری تقویتی، مجموعه‌ی معیارها، و مهار آموزش را منتشر کرده است — که بر پایه‌ی چارچوب Atropos شرکت ساخته شده است — و هر محققی با قدرت محاسباتی کافی می‌تواند کار را تکرار یا گسترش دهد. «متن‌باز کردن پشته‌ی Atropos زیرساخت لازم را برای تحقیقات استدلال سطح المپیاد قابل تکرار فراهم می‌کند،» یکی از ناظران در X خاطرنشان کرد، و اهمیت آن را برای جوامع دانشگاهی و متن‌باز خلاصه کرد.

سفر یادگیری شخصی محقق اصلی

این مدل توسط Joe Li آموزش داده شد، یک محقق مقیم در Nous Research و خود یک برنامه‌نویس رقابتی سابق. گزارش فنی Li یک بعد غیرمنتظره‌ی شخصی را آشکار می‌کند: او مسیر بهبود مدل را با مسیر خودش در Codeforces مقایسه کرد، پلتفرم برنامه‌نویسی رقابتی که در آن شرکت‌کنندگان بر اساس عملکرد مسابقه رتبه‌بندی می‌شوند.

بر اساس تخمین‌های تقریبی که نمرات LiveCodeBench را به رتبه‌بندی‌های Codeforces نگاشت می‌کند، Li محاسبه کرد که بهبود NousCoder-14B — از حدود محدوده‌ی رتبه‌ی 1600-1750 تا 2100-2200 — منعکس‌کننده‌ی جهشی است که خود او تقریباً دو سال تمرین مداوم بین سنین 14 تا 16 طول کشید. این مدل معادل آن را در چهار روز انجام داد. «تماشای آن اجرای نهایی آموزش یک تجربه‌ی نسبتاً سورئال بود،» Li در گزارش فنی نوشت. اما Li به سرعت به یک نکته‌ی مهم اشاره کرد که به پرسش‌های گسترده‌تر درباره‌ی کارایی هوش مصنوعی مربوط می‌شود: او در طول آن دو سال حدود 1000 مسئله را حل کرد، در حالی که مدل به 24000 مسئله نیاز داشت. انسان‌ها، حداقل در حال حاضر، یادگیرنده‌های بسیار کارآمدتری از نظر نمونه هستند.

نگاهی به سیستم یادگیری تقویتی NousCoder-14B

فرآیند آموزش NousCoder-14B پنجره‌ای به تکنیک‌های به‌طور فزاینده‌ای پیچیده‌ای ارائه می‌دهد که محققان برای بهبود قابلیت‌های استدلال هوش مصنوعی از طریق یادگیری تقویتی استفاده می‌کنند. رویکرد بر چیزی تکیه دارد که محققان آن را «پاداش‌های قابل تأیید» می‌نامند — یک سیستم امتیازدهی خودکار که از نتایج صحیح برنامه‌نویسی برای هدایت یادگیری استفاده می‌کند. این روش نه تنها دقت را افزایش می‌دهد، بلکه مدل را به سمت تولید راه‌حل‌های کارآمدتر سوق می‌دهد. با استخراج از مجموعه‌ی عظیم 24000 مسئله‌ای، مدل در چهار روز یاد گرفت که الگوهای پیچیده را تشخیص دهد و راه‌حل‌های بهینه ارائه کند.

انتشار NousCoder-14B نشان‌دهنده‌ی روند رو به رشدی است که در آن مدل‌های متن‌باز با استفاده از تکنیک‌های پیشرفته آموزشی، شکاف با سیستم‌های اختصاصی را کاهش می‌دهند. Nous Research با ارائه‌ی همه‌ی اجزای آموزشی، نه تنها شفافیت را افزایش می‌دهد، بلکه جامه‌ی تحقیقاتی را برای تکرار و بهبود سریع‌تر این فناوری توانمند می‌کند. در دنیایی که ابزارهای کدنویسی هوش مصنوعی به سرعت در حال تعریف مجدد فرآیند توسعه‌ی نرم‌افزار هستند، این رویکرد می‌تواند چشم‌انداز رقابت را تغییر دهد.