ریچارد ساتن، یکی از پیشگامان یادگیری تقویتی (RL) و برنده اخیر جایزه تورینگ (معادل نوبل علوم کامپیوتر)، با夥伴ی خُرَم جاوید استارتآپ آزمایشگاه اوک (Oak Lab) را در تورنتو راهاندازی کرده است. این اقدام نشاندهنده یک تغییر پارادایم در رویکرد به دستیابی به هوش مصنوعی عمومی (AGI) است.
چرا ساتن روشهای فعلی یادگیری عمیق را «ضعیف و ناکارآمد» مینامد؟
ساتن معتقد است که مدلهایGenerative AI فعلی، اگرچه در تقلید الگوهای دادههای آموزشی فوقالعاده موفقاند، اما فاقد قابلیت ارزیابی الذاتي و کشف واقعی هستند. در اظهارنामाهای اخیر خود (ژوئن ۲۰۲۴) او تأکید کرد که این سیستمها «نم میتوانند خروجیهای خود را بسنجند» و بنابراین برای پیشبرد علم یا حل مسائل نوین، ناکارآمدند. او میگوید: "ما نیاز به تنظیمات جزئی (tweaks) نداریم، بلکه به ایدههای بنیادین نوین و یک بازبینی کامل (thorough reworking) نیاز داریم."
دیدگاه آزمایشگاه اوک: عاملان با یادگیری مداوم و خودمختار
هسته فلسفه Oak Lab بر سه ستون استوار است:
- یادگیری آنلاین و مداوم: برخلاف آموزش یکباره روی دیتاستهای ایستا (Offline Training)، عاملان اوک باید در حین عملیات (Online) و از تعامل با محیط یاد بگیرند.
- سازماندهی مدلهای جهان درونی (World Models): ساخت نمایشهای انتزاعی از محیط برای پیشبینی و برنامهریزی.
- مدیریت خودمختار تغییر، ارزیابی و انتخاب: عامل باید بتواند بدون نظارت انسانی، استراتژیهای جدید را امتحان، ارزیابی و برگزیند.
این رویکرد ریشه در کارهای بنیادین ساتن در یادگیری تقویتی دارد و直線اً با دیدگاه جان کارمک (John Carmack) در شرکت فناوریهای کین (Keen Technologies) همسو است، جایی که ساتن و جاوید قبلاً همکاری میکردند.
تمایز با پارادایم حاکم: از «آموزش یکباره» به «تجربهمحوری»
اکثر مدلهای بزرگ زبان (LLM) امروز پس از فاز پیشآموزش (Pre-training) ثابت میمانند. در مقابل،ؤية ساتن برای Oak Lab، عاملی است که طی کل عمر عملیاتاش در حال یادگیری است. این یعنی پارامترهای مدل بهصورت پیوسته با جریانات دادههای واقعی بهروزرسانی میشوند، همانند مغز الأحياء.
هدف بلندمدت: تریلیون پارامتر، زمان درو پارامتر با مصرف ۲۰ وات انرژی
ساتن یک هدف سختافزاری و الگوریتمی جسور تعریف کرده: یک عامل با تریلیون پارامتر که در زمان واقعی (Real-time) یاد میگیرد و برنامهریزی میکند، با بودجه انرژی تنها ۲۰ وات – نزدیک به مصرف انرژی مغز انسان. دستیابی به این کار نیازمند پیشرفتهای همزمان در معماری شبکههای عصبی، الگوریتمهای RL بهینهسازیشده برای سختافزار، و вероятно طراحی تراشههای عصبی-مورفیک (Neuromorphic) است.
تیم بنیانگذار: ترکیبی از نظریه و اجرا
- ریچارد ساتن: استاد دانشگاه آلبِرتا، محقق ارشد در DeepMind، 공동نویس کتاب مرجع Reinforcement Learning: An Introduction.
- خُرَم جاوید: متخصص یادگیری ماشین با تمرکز بر مقیاسپذیری و سیستمهای توزیعشده، سابقه همکاری در Keen Technologies و محقق در Mila (موسسه کوپِک).
تأسیس Oak Lab سیگنال قویای برای جامعه محققان و سرمایهگذاران است: آینده هوش مصنوعی نه در مدلهای ثابت بزرگتر، بلکه در سیستمهای یادگیرنده، سازگار و کارا است. اگر ساتن و تیمش موفق شوند، ما شاهد تولد نسل جدیدی از هوش مصنوعی خواهیم بود که واقعی «فکر میکند» و «یاد میگیرد»، نه تنها «پیشبینی میکند".





