Nous Research، استارتآپ متنباز هوش مصنوعی که توسط شرکت سرمایهگذاری رمزارزی Paradigm پشتیبانی میشود، روز دوشنبه یک مدل برنامهنویسی رقابتی جدید منتشر کرد که به گفتهی خود، از چندین سیستم اختصاصی بزرگتر پیشی میگیرد یا با آنها برابری میکند. این مدل تنها در چهار روز با استفاده از 48 واحد از جدیدترین پردازندههای گرافیکی B200 انویدیا آموزش دیده است.
این مدل که NousCoder-14B نام دارد، یکی دیگر از ورودیها در زمینهی شلوغ دستیاران کدنویسی هوش مصنوعی است، اما در لحظهای بهویژه پرتنش عرضه شده است: Claude Code، ابزار برنامهنویسی عاملی از رقیب Anthropic، از روز اول سال نو بر بحثهای رسانههای اجتماعی تسلط داشته است، و توسعهدهندگان با تعریفهای پرشور از قابلیتهای آن، پستهای تحسینآمیزی منتشر کردهاند. این تحولات همزمان نشان میدهد که توسعهی نرمافزار به کمک هوش مصنوعی با چه سرعتی در حال تکامل است — و اینکه شرکتهای بزرگ و کوچک چقدر شدیداً برای تصاحب آنچه که بسیاری معتقدند به فناوری پایهای برای نوشتن نرمافزار تبدیل خواهد شد، رقابت میکنند.
عملکرد چشمگیر NousCoder-14B در ارزیابیهای استاندارد
NousCoder-14B به نرخ دقت 67.87 درصدی در LiveCodeBench v6 دست یافته است، یک ارزیابی استاندارد که مدلها را در مسائل برنامهنویسی رقابتی منتشر شده بین آگوست 2024 و مه 2025 آزمایش میکند. این رقم نشاندهندهی بهبود 7.08 درصدی نسبت به مدل پایهای است که از روی آن آموزش دیده، یعنی Qwen3-14B از علیبابا، طبق گزارش فنی Nous Research که همزمان با انتشار منتشر شده است.
«من یک توضیح از مشکل به Claude Code دادم، و آن همان چیزی را که سال گذشته در یک ساعت ساخته بودیم، تولید کرد،» نوشته Jaana Dogan، مهندس اصلی گوگل مسئول Gemini API، در یک پست ویروسی در X در هفته گذشته که حال و هوای غالب پیرامون ابزارهای کدنویسی هوش مصنوعی را به تصویر کشید. Dogan یک سیستم توزیعشدهی هماهنگسازی عاملها را توصیف میکرد که تیمش یک سال روی توسعهی آن صرف کرده بود — سیستمی که Claude Code از یک پرامپت سهبندی تقریب زد.
این کنار هم قرار دادن آموزنده است: در حالی که Claude Code از Anthropic با نمایشهای توسعهی نرمافزار سرتاسری تخیلات را تسخیر کرده است، Nous Research شرط میبندد که جایگزینهای متنباز آموزشدیده روی مسائل قابل تأیید میتوانند شکاف را ببندند — و اینکه شفافیت در نحوهی ساخت این مدلها به اندازهی توانایی خام اهمیت دارد.
شفافیت کامل: چگونه Nous Research یک مدل قابل تکرار ساخت
آنچه که انتشار NousCoder-14B را از بسیاری از اعلامیههای رقبا متمایز میکند، باز بودن رادیکال آن است. Nous Research نه تنها وزنهای مدل، بلکه محیط کامل یادگیری تقویتی، مجموعهی معیارها، و مهار آموزش را منتشر کرده است — که بر پایهی چارچوب Atropos شرکت ساخته شده است — و هر محققی با قدرت محاسباتی کافی میتواند کار را تکرار یا گسترش دهد. «متنباز کردن پشتهی Atropos زیرساخت لازم را برای تحقیقات استدلال سطح المپیاد قابل تکرار فراهم میکند،» یکی از ناظران در X خاطرنشان کرد، و اهمیت آن را برای جوامع دانشگاهی و متنباز خلاصه کرد.
سفر یادگیری شخصی محقق اصلی
این مدل توسط Joe Li آموزش داده شد، یک محقق مقیم در Nous Research و خود یک برنامهنویس رقابتی سابق. گزارش فنی Li یک بعد غیرمنتظرهی شخصی را آشکار میکند: او مسیر بهبود مدل را با مسیر خودش در Codeforces مقایسه کرد، پلتفرم برنامهنویسی رقابتی که در آن شرکتکنندگان بر اساس عملکرد مسابقه رتبهبندی میشوند.
بر اساس تخمینهای تقریبی که نمرات LiveCodeBench را به رتبهبندیهای Codeforces نگاشت میکند، Li محاسبه کرد که بهبود NousCoder-14B — از حدود محدودهی رتبهی 1600-1750 تا 2100-2200 — منعکسکنندهی جهشی است که خود او تقریباً دو سال تمرین مداوم بین سنین 14 تا 16 طول کشید. این مدل معادل آن را در چهار روز انجام داد. «تماشای آن اجرای نهایی آموزش یک تجربهی نسبتاً سورئال بود،» Li در گزارش فنی نوشت. اما Li به سرعت به یک نکتهی مهم اشاره کرد که به پرسشهای گستردهتر دربارهی کارایی هوش مصنوعی مربوط میشود: او در طول آن دو سال حدود 1000 مسئله را حل کرد، در حالی که مدل به 24000 مسئله نیاز داشت. انسانها، حداقل در حال حاضر، یادگیرندههای بسیار کارآمدتری از نظر نمونه هستند.
نگاهی به سیستم یادگیری تقویتی NousCoder-14B
فرآیند آموزش NousCoder-14B پنجرهای به تکنیکهای بهطور فزایندهای پیچیدهای ارائه میدهد که محققان برای بهبود قابلیتهای استدلال هوش مصنوعی از طریق یادگیری تقویتی استفاده میکنند. رویکرد بر چیزی تکیه دارد که محققان آن را «پاداشهای قابل تأیید» مینامند — یک سیستم امتیازدهی خودکار که از نتایج صحیح برنامهنویسی برای هدایت یادگیری استفاده میکند. این روش نه تنها دقت را افزایش میدهد، بلکه مدل را به سمت تولید راهحلهای کارآمدتر سوق میدهد. با استخراج از مجموعهی عظیم 24000 مسئلهای، مدل در چهار روز یاد گرفت که الگوهای پیچیده را تشخیص دهد و راهحلهای بهینه ارائه کند.
انتشار NousCoder-14B نشاندهندهی روند رو به رشدی است که در آن مدلهای متنباز با استفاده از تکنیکهای پیشرفته آموزشی، شکاف با سیستمهای اختصاصی را کاهش میدهند. Nous Research با ارائهی همهی اجزای آموزشی، نه تنها شفافیت را افزایش میدهد، بلکه جامهی تحقیقاتی را برای تکرار و بهبود سریعتر این فناوری توانمند میکند. در دنیایی که ابزارهای کدنویسی هوش مصنوعی به سرعت در حال تعریف مجدد فرآیند توسعهی نرمافزار هستند، این رویکرد میتواند چشمانداز رقابت را تغییر دهد.





