ریچارد ساتن، یکی از پیشگامان یادگیری تقویتی (RL) و برنده اخیر جایزه تورینگ (معادل نوبل علوم کامپیوتر)، با夥伴ی خُرَم جاوید استارت‌آپ آزمایشگاه اوک (Oak Lab) را در تورنتو راه‌اندازی کرده است. این اقدام نشان‌دهنده یک تغییر پارادایم در رویکرد به دستیابی به هوش مصنوعی عمومی (AGI) است.

چرا ساتن روش‌های فعلی یادگیری عمیق را «ضعیف و ناکارآمد» می‌نامد؟

ساتن معتقد است که مدل‌هایGenerative AI فعلی، اگرچه در تقلید الگوهای داده‌های آموزشی فوق‌العاده موفق‌اند، اما فاقد قابلیت ارزیابی الذاتي و کشف واقعی هستند. در اظهارنामाهای اخیر خود (ژوئن ۲۰۲۴) او تأکید کرد که این سیستم‌ها «نم می‌توانند خروجی‌های خود را بسنجند» و بنابراین برای پیشبرد علم یا حل مسائل نوین، ناکارآمدند. او می‌گوید: "ما نیاز به تنظیمات جزئی (tweaks) نداریم، بلکه به ایده‌های بنیادین نوین و یک بازبینی کامل (thorough reworking) نیاز داریم."

دیدگاه آزمایشگاه اوک: عاملان با یادگیری مداوم و خودمختار

هسته فلسفه Oak Lab بر سه ستون استوار است:

  • یادگیری آنلاین و مداوم: برخلاف آموزش یک‌باره روی دیتاست‌های ایستا (Offline Training)، عاملان اوک باید در حین عملیات (Online) و از تعامل با محیط یاد بگیرند.
  • سازماندهی مدل‌های جهان درونی (World Models): ساخت نمایش‌های انتزاعی از محیط برای پیش‌بینی و برنامه‌ریزی.
  • مدیریت خودمختار تغییر، ارزیابی و انتخاب: عامل باید بتواند بدون نظارت انسانی، استراتژی‌های جدید را امتحان، ارزیابی و برگزیند.

این رویکرد ریشه در کارهای بنیادین ساتن در یادگیری تقویتی دارد و直線اً با دیدگاه جان کارمک (John Carmack) در شرکت فناوری‌های کین (Keen Technologies) هم‌سو است، جایی که ساتن و جاوید قبلاً همکاری می‌کردند.

تمایز با پارادایم حاکم: از «آموزش یک‌باره» به «تجربه‌محوری»

اکثر مدل‌های بزرگ زبان (LLM) امروز پس از فاز پیش‌آموزش (Pre-training) ثابت می‌مانند. در مقابل،ؤية ساتن برای Oak Lab، عاملی است که طی کل عمر عملیات‌اش در حال یادگیری است. این یعنی پارامترهای مدل به‌صورت پیوسته با جریانات داده‌های واقعی به‌روزرسانی می‌شوند، همانند مغز الأحياء.

هدف بلندمدت: تریلیون پارامتر، زمان درو پارامتر با مصرف ۲۰ وات انرژی

ساتن یک هدف سخت‌افزاری و الگوریتمی جسور تعریف کرده: یک عامل با تریلیون پارامتر که در زمان واقعی (Real-time) یاد می‌گیرد و برنامه‌ریزی می‌کند، با بودجه انرژی تنها ۲۰ وات – نزدیک به مصرف انرژی مغز انسان. دستیابی به این کار نیازمند پیشرفت‌های همزمان در معماری شبکه‌های عصبی، الگوریتم‌های RL بهینه‌سازی‌شده برای سخت‌افزار، و вероятно طراحی تراشه‌های عصبی-مورفیک (Neuromorphic) است.

تیم بنیان‌گذار: ترکیبی از نظریه و اجرا

  • ریچارد ساتن: استاد دانشگاه آلبِرتا، محقق ارشد در DeepMind، 공동‌نویس کتاب مرجع Reinforcement Learning: An Introduction.
  • خُرَم جاوید: متخصص یادگیری ماشین با تمرکز بر مقیاس‌پذیری و سیستم‌های توزیع‌شده، سابقه همکاری در Keen Technologies و محقق در Mila (موسسه کوپِک).

تأسیس Oak Lab سیگنال قوی‌ای برای جامعه محققان و سرمایه‌گذاران است: آینده هوش مصنوعی نه در مدل‌های ثابت بزرگ‌تر، بلکه در سیستم‌های یادگیرنده، سازگار و کارا است. اگر ساتن و تیمش موفق شوند، ما شاهد تولد نسل جدیدی از هوش مصنوعی خواهیم بود که واقعی «فکر می‌کند» و «یاد می‌گیرد»، نه تنها «پیش‌بینی می‌کند".