مدل جدید Claude Opus 5 ساخت شرکت Anthropic موفق شده رکورد بنچمارک چالش‌برانگیز ARC-AGI-3 را در هم بشکند. این مدل هوش مصنوعی با کسب نمره 30.2 درصد، عملکرد رقبا را با اختلافی چشمگیر پشت سر گذاشت و جریان‌های تازه‌ای را در مسیر رسیدن به هوش مصنوعی عمومی (AGI) رقم زد.

رکورد قبلی این آزمون، با نمره 7.8 درصد در اختیار مدل GPT-5.6 Sol متعلق به OpenAI بود. تیم تحقیقاتی ARC Prize، دلیل این جهش خیره‌کننده را قدرت استدلال منطقی برتر این مدل می‌داند که به آن اجازه می‌دهد محیط‌های کاملاً ناآشنا را با دقت بالایی تحلیل و کاوش کند.

مقایسه عملکرد مدل Opus 5 با رقبای خود در آزمون ARC-AGI-3

تسلط بی‌سابقه بر محیط‌های حل‌نشده

Opus 5 در جریان آزمایش‌ها توانست پنج محیطی را که تا به حال هرگز توسط هیچ مدل هوش مصنوعی دیگری حل نشده بودند، پیاده‌سازی کند. عملکرد این مدل در چهار مورد از این پنج محیط، در سطح انسان یا حتی بالاتر ارزیابی شد. این موفقیت چشمگیر، مدل‌های کلاس «Fable» خود شرکت Anthropic را که نمره‌ای حدود 20 درصد کسب کرده بودند، نیز با اختلاف زیادی کنار زد.

پژوهشگران در بررسی رفتار این مدل، شاهد واکنش‌هایی بودند که پیش‌تر در هیچ شبکه عصبی دیگری مشاهده نشده بود. Opus 5 برای درک بهتر مسائل، وظایف محول شده را به صورت مستقیم به نمادگذاری جبری (Algebraic Notation) ترجمه می‌کند و حتی توانایی تدوین معادلات بازتابی (Reflection Equations) را دارد. همین ویژگی‌ها به مدل کمک می‌کند تا قوانین یک محیط تعاملی را سریع‌تر استنتاج کرده و اقدامات خود را گام‌به‌گام و بدون نیاز به دانش از پیش حفظ‌شده، برنامه‌ریزی کند.

تفاوت آزمون ARC-AGI-3 با سایر معیارهای سنجشی چیست؟

برخلاف بنچمارک‌های سنتی که میزان دانش ذخیره‌شده در مدل را می‌سنجند، ARC-AGI-3 به طور ویژه برای ارزیابی هوش واقعی طراحی شده است. ساختار این آزمون شباهت زیادی به بازی‌های ویدئویی دارد. مدل باید قوانین حاکم بر یک محیط کاملاً جدید را کشف کند، چالش‌ها را پیش‌بینی کرده و برای حل آن‌ها نقشه‌ای عملیاتی بکشد.

تیم ARC Prize تاکید دارد که سیستم‌های هوش مصنوعی آینده نباید برای حل مسائل جدید به نرم‌افزارهای واسط یا «هارنس» (Harness) متکی باشند. نمرات رسمی این آزمون صرفاً عملکرد خالص مدل زبانی را نشان می‌دهد و Opus 5 نشان داد که حتی بدون ابزارهای خارجی می‌تواند استدلال‌های پیچیده‌ای انجام دهد. در نسخه‌های قدیمی‌تر این آزمون نیز، Opus 5 به ترتیب نمرات 90.4 درصد در ARC-AGI-2 و 97.5 درصد در ARC-AGI-1 را ثبت کرد.

آیا این پیشرفت ناشی از آموزش روی داده‌های خاص است؟

تیم توسعه‌دهنده Anthropic جزئیات فنی این جهش را فاش نکرده است، با این حال، کارشناسان بر این باورند که ترکیب یادگیری تقویتی (Reinforcement Learning) و برچسب‌گذاری دقیق داده‌ها نقش کلیدی در این موفقیت داشته است. از آنجا که مدل Opus 5 پس از عمومی شدن فرمت پازل‌های ARC-AGI-3 آموزش دیده، احتمال دارد که توسعه‌دهندگان توانایی‌های کشف قوانین و خوداصلاحی مدل را به طور هدفمند تقویت کرده باشند.

با این حال، نتایج آزمایش‌های مستقل، نشان‌دهنده پیشرفت‌های متعادلتر در سایر حوزه‌ها است. بررسی عملکرد این مدل روی بنچمارک خصوصی Witness (متعلق به گوانگهان نینگ برای بازی‌های پازل تعاملی) نشان داد که Opus 5 در این بخش نمره 43.4 را کسب کرد. این میزان پیشرفت نسبت به نسل‌های قبلی (مانند Opus 4.8) کمتر از جهش دیده شده در بنچمارک ARC است. این موضوع ممکن است نشان‌دهنده تمرکز داده‌های آموزشی روی فرمت‌های خاصی از معماها باشد.

گرگ کامرادت (Greg Kamradt)، یکی از پژوهشگران ارشد این پروژه، معتقد است که این نتیجه ضعیف‌تر در بنچمارک‌های جانبی، دستاوردهای کلی مدل در زمینه استدلال اصولی را زیر سوال نمی‌برد. ظهور قابلیت‌هایی نظیر ترجمه مسائل به زبان ریاضی، نشان‌دهنده بلوغ چشمگیر مدل‌های زبانی در مسیر درک مفاهیم انتزاعی است.