AVO انویدیا: رساندن Claude Opus 5 در ARC‑AGI‑3 از 30.2% به 100%
انویدیا با سامانهٔ سیستمی Agentic Variation Operators (AVO) نشان داد که میتوان توان یک مدل زبانی را به عملکرد یک عامل خودگردان پایدار تبدیل کرد. وقتی Claude Opus 5 در چارچوب AVO اجرا شد، امتیاز آن در معیار ARC‑AGI‑3 از گزارش اولیهٔ 30.2% به 100% رسید؛ کلید موفقیت، پیادهسازی حافظهٔ پایا و ناظر سیستم بود.
AVO چیست و چرا اهمیت دارد
AVO مجموعهای از مکانیزمهای سیستمی است که عاملهای خودگردان را برای انجام وظایف چندمرحلهای و بلندمدت قادر میسازد. تیم پنجنفرهٔ انویدیا در یک گزارش فنی معماری AVO را تشریح کردند؛ تمرکز اصلی روی پایداری عملیات در طول زمان و مدیریت وضعیت است تا تکیهٔ صرف بر توان محاسباتی مدل.
برای مرجع کلی دربارهٔ انویدیا و بنچمارکها میتوانید به صفحهٔ NVIDIA و توضیحات معیارها در ویکیپدیا مراجعه کنید.
مکانیزمهای کلیدی AVO
AVO دو سازوکار اساسی اضافه میکند که نقش محوری در ارتقاء عملکرد عاملها داشتند:
- حافظهٔ پایا: نگهداری وضعیت، خروجیهای قبلی، نتایج اجرا و استدلالهای انباشتهشده تا عامل بتواند کار را از همان نقطه ادامه دهد و بازسازی کامل تاریخچه لازم نباشد.
- ناظر سیستم (overseer): ماژولی که روند جستجو و تصمیمگیری را رصد میکند و در مواجهه با بنبستها سیاستهای کنترلی یا راهحلهای کمکی اعمال میکند.
ترکیب این دو اجازه میدهد عاملها با فرضیات ناکامل پیش بروند، اقدام کنند، پیامدها را مشاهده و از آنها یاد بگیرند، فروض نادرست را اصلاح کنند و پیشرفت را در افقهای طولانی حفظ کنند.
چطور AVO امتیاز را از 30.2% به 100% رساند
تیم انویدیا تأکید کرده که موفقیت نتیجهٔ طراحی سیستم است نه افزایش صرفِ ظرفیت مدل. AVO با فراهم کردن حافظهٔ پایا و ناظر، نرخ تکمیل وظایف و کارایی اقدامات را بهطرزی بنیادین بهینه میکند و بدین ترتیب امتیاز آزمایشی Claude Opus 5 در ARC‑AGI‑3 به مقدار کامل رسید.
معیار ARC‑AGI‑3 و مفهوم RHAE
معیار ARC‑AGI‑3 از Relative Human Action Efficiency (RHAE) استفاده میکند؛ معیاری که هم تکمیل وظیفه و هم کارایی اقدامات را نسبت به اجرای انسانی اولیه میسنجد. انویدیا گزارش داده که AVO به «100.00 RHAE» در تمام 25 محیط عمومی دست یافته و همهٔ 183 سطح مجموعه را تکمیل کرده است — دستاوردی که نشاندهندهٔ تفاوت ارزیابی مدلهای منفرد و ارزیابی عاملهای سیستممحور است.
کارزارهای آزمایشی: از هستهٔ GPU تا محیطهای تعاملی
AVO ابتدا روی مسائل مهندسی نرمافزار و بهینهسازی کرنلهای GPU آزمایش شد؛ حوزهای که شامل کد منبع، کامپایلرها و پروفایلینگ است. سپس همان رویکرد سیستممحور روی ARC‑AGI‑3 اعمال شد که مجموعهای از محیطهای تعاملی و چالشبرانگیز را در بر میگیرد. الگوی عملیاتی مشترک این زمینهها عبارت است از: فرضیهسازی، اقدام از طریق رابط خارجی، مشاهدهٔ نتایج و نگهداری حالت مفید برای مراحل بعدی.
آزمونها با Claude Opus 5 و GPT‑5.6 Sol
انویدیا نتایج گستردهای با Claude Opus 5 منتشر کرد و AVO را همچنین با مدل مرزی GPT‑5.6 Sol ترکیب کرد تا عملکرد در زیرمجموعهای چالشی از محیطها مقایسه شود. در برخی سناریوها Sol از نظر زمان دیواری (wall‑clock) سریعتر به سطوح مشابه رسید، در حالی که Opus بر اساس معیار تعداد اقدامات محیطی کارآمدتر عمل نمود.
تفاوت «زمان دیواری» و «زمان پردازشی» اهمیت عملیاتی دارد: زمان دیواری مدت واقعی سپریشده را میسنجد و تجربهٔ کاربری و قابلیت بهرهبرداری عامل را تحت تأثیر قرار میدهد.
پیامدها برای ارزیابی و توسعه
این دستاورد نشان داد که افزایش قابلیت عاملها از طریق سازوکارهای سیستمی (مانند حافظهٔ پایا و نظارت) گاهی مؤثرتر از تمرکز صرف بر معماری مدل است. بنابراین چارچوبهای سنجش باید از ارزیابی خالصِ مدل به سمت ارزیابیِ سیستمهای عاملمحور توسعه یابند؛ تغییری که هم در پژوهش و هم در تولید محصول تأثیرگذار خواهد بود.
نگاهی به جلو
اجرای موفق AVO در ARC‑AGI‑3 مسیر را برای کاربردهای پیچیدهتر هموار میکند؛ مواردی که در آن عاملها باید وظایف طولانیمدت، چندمرحلهای و با اطلاعات ناکامل را بدون دخالت مداوم انسان انجام دهند. در کنار پیشرفت مدلهای پایه، طراحی سیستمهایی که توان یک مدل را به عملکرد مداوم تبدیل کنند احتمالاً نقش تعیینکنندهای در پروژههای آیندهٔ هوش مصنوعی خواهد داشت.
برای مطالعهٔ بیشتر دربارهٔ مفاهیم و تحلیلها میتوانید گزارشهای فنی و مقالات تحلیلی در منابعی مانند TechCrunch و دیگر مراجع تخصصی را دنبال کنید.





