مدل جدید Claude Opus 5 ساخت شرکت Anthropic موفق شده رکورد بنچمارک چالشبرانگیز ARC-AGI-3 را در هم بشکند. این مدل هوش مصنوعی با کسب نمره 30.2 درصد، عملکرد رقبا را با اختلافی چشمگیر پشت سر گذاشت و جریانهای تازهای را در مسیر رسیدن به هوش مصنوعی عمومی (AGI) رقم زد.
رکورد قبلی این آزمون، با نمره 7.8 درصد در اختیار مدل GPT-5.6 Sol متعلق به OpenAI بود. تیم تحقیقاتی ARC Prize، دلیل این جهش خیرهکننده را قدرت استدلال منطقی برتر این مدل میداند که به آن اجازه میدهد محیطهای کاملاً ناآشنا را با دقت بالایی تحلیل و کاوش کند.
تسلط بیسابقه بر محیطهای حلنشده
Opus 5 در جریان آزمایشها توانست پنج محیطی را که تا به حال هرگز توسط هیچ مدل هوش مصنوعی دیگری حل نشده بودند، پیادهسازی کند. عملکرد این مدل در چهار مورد از این پنج محیط، در سطح انسان یا حتی بالاتر ارزیابی شد. این موفقیت چشمگیر، مدلهای کلاس «Fable» خود شرکت Anthropic را که نمرهای حدود 20 درصد کسب کرده بودند، نیز با اختلاف زیادی کنار زد.
پژوهشگران در بررسی رفتار این مدل، شاهد واکنشهایی بودند که پیشتر در هیچ شبکه عصبی دیگری مشاهده نشده بود. Opus 5 برای درک بهتر مسائل، وظایف محول شده را به صورت مستقیم به نمادگذاری جبری (Algebraic Notation) ترجمه میکند و حتی توانایی تدوین معادلات بازتابی (Reflection Equations) را دارد. همین ویژگیها به مدل کمک میکند تا قوانین یک محیط تعاملی را سریعتر استنتاج کرده و اقدامات خود را گامبهگام و بدون نیاز به دانش از پیش حفظشده، برنامهریزی کند.
تفاوت آزمون ARC-AGI-3 با سایر معیارهای سنجشی چیست؟
برخلاف بنچمارکهای سنتی که میزان دانش ذخیرهشده در مدل را میسنجند، ARC-AGI-3 به طور ویژه برای ارزیابی هوش واقعی طراحی شده است. ساختار این آزمون شباهت زیادی به بازیهای ویدئویی دارد. مدل باید قوانین حاکم بر یک محیط کاملاً جدید را کشف کند، چالشها را پیشبینی کرده و برای حل آنها نقشهای عملیاتی بکشد.
تیم ARC Prize تاکید دارد که سیستمهای هوش مصنوعی آینده نباید برای حل مسائل جدید به نرمافزارهای واسط یا «هارنس» (Harness) متکی باشند. نمرات رسمی این آزمون صرفاً عملکرد خالص مدل زبانی را نشان میدهد و Opus 5 نشان داد که حتی بدون ابزارهای خارجی میتواند استدلالهای پیچیدهای انجام دهد. در نسخههای قدیمیتر این آزمون نیز، Opus 5 به ترتیب نمرات 90.4 درصد در ARC-AGI-2 و 97.5 درصد در ARC-AGI-1 را ثبت کرد.
آیا این پیشرفت ناشی از آموزش روی دادههای خاص است؟
تیم توسعهدهنده Anthropic جزئیات فنی این جهش را فاش نکرده است، با این حال، کارشناسان بر این باورند که ترکیب یادگیری تقویتی (Reinforcement Learning) و برچسبگذاری دقیق دادهها نقش کلیدی در این موفقیت داشته است. از آنجا که مدل Opus 5 پس از عمومی شدن فرمت پازلهای ARC-AGI-3 آموزش دیده، احتمال دارد که توسعهدهندگان تواناییهای کشف قوانین و خوداصلاحی مدل را به طور هدفمند تقویت کرده باشند.
با این حال، نتایج آزمایشهای مستقل، نشاندهنده پیشرفتهای متعادلتر در سایر حوزهها است. بررسی عملکرد این مدل روی بنچمارک خصوصی Witness (متعلق به گوانگهان نینگ برای بازیهای پازل تعاملی) نشان داد که Opus 5 در این بخش نمره 43.4 را کسب کرد. این میزان پیشرفت نسبت به نسلهای قبلی (مانند Opus 4.8) کمتر از جهش دیده شده در بنچمارک ARC است. این موضوع ممکن است نشاندهنده تمرکز دادههای آموزشی روی فرمتهای خاصی از معماها باشد.
گرگ کامرادت (Greg Kamradt)، یکی از پژوهشگران ارشد این پروژه، معتقد است که این نتیجه ضعیفتر در بنچمارکهای جانبی، دستاوردهای کلی مدل در زمینه استدلال اصولی را زیر سوال نمیبرد. ظهور قابلیتهایی نظیر ترجمه مسائل به زبان ریاضی، نشاندهنده بلوغ چشمگیر مدلهای زبانی در مسیر درک مفاهیم انتزاعی است.





