اواخر سال 2017، آزمایشگاه دیپمایند (DeepMind) whirlwind جدیدی در دنیای هوش مصنوعی به پا کرد. آلفازیرو (AlphaZero)، یک سامانه یکپارچه، توانست بدون هیچ دانش ازپیشتعبیهشدهای، سه مورد از پیچیدهترین بازیهای فکری بشر یعنی شطرنج، شوگی (شطرنج ژاپنی) و گو را از نقطه صفر بیاموزد و قدرتمندترین نرمافزارهای قهرمان جهان در هر سه رشته را شکست دهد. ارزیابیهای دقیق این موفقیت که بعدها در مجله معتبر Science منتشر شد، نشان داد آلفازیرو با تکیه بر قواعد پایه و بازیهای تصادفی، در زمانی بسیار کوتاه به قدرتمندترین بازیکن تاریخ این بازیها تبدیل شد.
عبور از آلفاگو به سمت یک الگوریتم عمومی
پیشتر، نرمافزار آلفاگو ثابت کرده بود که ترکیب شبکههای عصبی با الگوریتمهای جستوجو میتواند انسان را در بازی پیچیده «گو» شکست دهد. با این حال، آلفاگو صرفاً یک سیستم تخصصی برای این بازی بود؛ به طوری که برای یادگیری به 30 میلیون بازی انسانی، دهها ویژگی ورودی دستساز و بهرهگیری از تقارن هشتگانه صفحه گو وابسته بود.
تیم توسعهدهنده آلفازیرو پرسیدی جسورانهتر را مطرح کرد: آیا میتوان همین کارایی را بدون هیچگونه مهندسی اختصاصی، برای هر بازی رومیزی دیگری تکرار کرد؟ پاسخ مثبت بود. آلفازیرو هر سه بازی شطرنج، شوگی و گو را با یک الگوریتم واحد و کاملاً یکسان اجرا میکند. این سیستم به هیچ کتاب گشایش یا پایگاه داده پایانی بازی نیازی ندارد و صرفاً از بازنمایی خام مهرهها و قواعد بنیادین بهره میبرد.
شکست موتورهای سنتی با یادگیری تقویتی
موتورهای کلاسیک شطرنج مانند استاکفیش (Stockfish) یا دیپبلوی آیبیام، برای محاسبه حرکات بعدی به هزاران قانون و الگوریتم ابتکاری متکیاند که توسط استادان بزرگ انسانی طراحی شدهاند. اما آلفازیرو این مسیر را به طور کامل کنار گذاشت و قواعد دستساز را با یک شبکه عصبی عمیق جایگزین کرد.
این سیستم برای یادگیری، از روشی به نام «یادگیری تقویتی» (Reinforcement Learning) استفاده میکند. یک شبکه عصبی آموزشندیده، میلیونها بار با خودش بازی میکند. در ابتدا حرکات کاملاً تصادفی هستند، اما سامانه به مرور زمان با تحلیل پیامدهای بردها و باختها، پارامترهای خود را تنظیم میکند. زمان لازم برای تسلط آلفازیرو بر شطرنج تنها 9 ساعت، برای شوگی 12 ساعت و برای بازی پیچیده گو حدود 13 روز بود. مقاله پژوهشی این پروژه نشان میدهد که این هوش مصنوعی تنها در عرض 24 ساعت توانست در هر سه بازی به سطحی فراتر از توانایی بشر دست یابد.
معماری شبکه و جستوجوی درختی مونتکارلو
از نظر معماری، آلفازیرو از یک شبکه عمیق پسماندی (Deep Residual Network) با دو شاخه خروجی متمایز بهره میبرد:
- شاخه سیاست (Policy Head): احتمال تمام حرکات مجاز را در یک وضعیت مشخص از صفحه بازی محاسبه میکند.
- شاخه ارزش (Value Head): وضعیت فعلی بازی را ارزیابی کرده و پیشبینی میکند که کدام طرف در مسیر پیروزی قرار دارد.
دادههای صفحه بازی وارد این شبکه یکپارچه میشوند. شبکه آموزشدیده سپس الگوریتمی به نام جستوجوی درختی مونتکارلو (MCTS) را با اجرای حدود 800 شبیهسازی برای پیدا کردن بهترین حرکت هدایت میکند. در این چرخه آموزشی، شبکه از MCTS میآموزد و MCTS نیز برای جستوجوهای دقیقتر به شبکه متکی میشود؛ یک تقویت متقابل که منجر به تکامل خیرهکننده سیستم در طول زمان میشود.
پایان دوران موتورهای دستساز
موفقیت چشمگیر آلفازیرو نشان داد که الگوریتمهای همهمنظوره هوش مصنوعی، بدون نیاز به دانش تخصصی انسانی یا قواعد سختگیرتهای بازی، میتوانند خلاقیت و قدرت تحلیل را به مرزهای جدیدی ببرانند. این موفقیت نه تنها فصل جدیدی در تاریخ بازیهای رومیزی رقم زد، بلکه مسیر توسعه هوش مصنوعی در حل مسائل پیچیدهتر در دنیای واقعی را با الگوبرداری از این چرخههای یادگیری خودکار، هموارتر از همیشه کرد.





