رشد شبکه‌ای که مرزهای پردازش تصویر را جابجا کرد

سال ۲۰۱۲ نقطهٔ عطفی بود که دنیای بیناییِ ماشین و یادگیریِ عمیق را برای همیشه دگرگون کرد. در ماه سپتامبر همان سال، سه پژوهشگر دانشگاهِ تورنتو با معرفیِ الکس‌نت در مسابقاتِ چالشِ بصریِ ایمج‌نت، اختلافِ عملکردی چنان فاحشی را به نمایش گذاشتند که کلِ جامعهٔ علمی مجبور به بازنگری در فرضیاتِ پایه‌ایِ شبکه‌هایِ عصبی شد. این معماری صرفاً یک الگوریتمِ نوین نبود، بلکه ماشینی بود که آیندهٔ محاسباتِ پردازشِ تصویر را ترسیم کرد.

تیمِ سوپرویزن و معماریِ هشت‌لایه

این دستاورد حاصلِ هم‌افزاییِ الکسِ کریژفسکی، ایلیاِ سوتسکور و جفریِ هینتون است. تیمِ آن‌ها شبکه‌ایِ پیچشی (CNN) توسعه داد که برای طبقه‌بندیِ تصاویر در 1000 دستهٔ مختلف بهینه‌سازی شده بود. ویژگیِ متمایزِ این مدل، مقیاسِ غیرمعمولِ آن بود: 60 میلیون پارامتر و 650 هزار نورون. پیاده‌سازی با زبان‌های CUDA و C++ انجام شد تا از قدرتِ موازی‌سازیِ GPU‌ها به‌طورِ کامل بهره برده شود. یافتهٔ کلیدیِ پژوهشگران ثابت کرد که افزایشِ عمقِ شبکه مستقیماً با بهبودِ دقتِ مدل‌هایِ پیچشی گره خورده است.

ساختارِ الکس‌نت به شرحِ زیر است:

  • بخشِ اول: دو گروه با لایه‌هایِ پیچشیِ غیرخطی و تجمیعِ حداکثر
  • بخشِ دوم: سه لایهٔ پیچشیِ متوالی بدون عملیاتِ کاهشِ ابعاد
  • بخشِ سوم: دو لایهٔ کاملاً متصل به همراهِ تابعِ غیرفعال‌سازی و منظم‌سازیِ قطع
  • لایهٔ خروجی: یک‌لایهٔ خطی و تابعِ سوفت‌مکس

یکی از تصمیماتِ حیاتی در طراحی، جایگزینیِ تابعِ فعال‌سازیِ ReLU در برابرِ توابعِ اشباع‌شوندهٔ tanh و سیگموید بود. این انتخاب سرعتِ همگراییِ شبکه را چندین برابر کرد. از آنجا که حافظهٔ کارت‌هایِ گرافیکِ نسلِ پیشرفتِ آن دوران امکانِ بارگذاریِ تمامِ لایه‌ها روی یک پردازنده را نداشت، معماران ساختار را به دو بخش تقسیم کرده و هر بخش را روی یک NVIDIA GTX 580 مستقل قرار دادند.

آموزش بر بسترِ سخت‌افزارِ نسلِ قبل

مجموعهٔ دادهٔ آموزشی شاملِ 1.2 میلیون تصویر با حجمِ کلیِ 27 گیگابایت بود. برای پردازشِ این حجم از اطلاعات، از دو کارتِ گرافیکِ Nvidia GTX 580 استفاده شد که هرکدام 3 گیگابایت حافظهٔ اختصاصی داشتند. کلِ فرایندِ آموزش در 90 دوره و طیِ 5 تا 6 روز انجام گرفت. در این چیدمان، کارت‌هایِ گرافیک محاسباتِ سنگینِ شبکه را بر عهده داشتند و پردازنده‌هایِ مرکزی صرفاً عملیاتِ بارگذاری و افزایشِ داده را مدیریت می‌کردند.

نمودار معماری شبکه عصبی الکس‌نت و لایه‌های پیچشی

آموزش با بهینه‌سازِ گرادیانِ کاهشیِ مومِنتوم و اندازهٔ دستهٔ 128 انجام شد. نرخِ یادگیری با مقدارِ اولیهٔ 10^-2 آغاز شد و در هر مرحله‌ای که خطایِ اعتبارسنجی ثابت می‌ماند، به‌صورتِ دستی کاهش می‌یافت تا از نوسانات جلوگیری شود. در نهایت این نرخ به 10^-5 رسید. استفاده از منظم‌سازیِ قطع با احتمالِ 0.5 و نرمال‌سازیِ محلیِ پاسخ‌ها، مانعِ از بیش‌برازشِ اطلاعات در لایه‌هایِ نهایی شد.

ترفندهایِ افزایشِ داده و مقیاس‌پذیری

تیمِ تحقیقاتی برای بهره‌برداریِ حداکثری از داده‌هایِ موجود، دو روشِ افزایشِ داده را به‌صورتِ محلی و آنی پیاده‌سازی کرد. در روشِ اول، تصاویر به‌گونه‌ای مقیاس می‌شدند که کوتاه‌ترینِ ضلعِ آن‌ها 256 پیکسل شود. در روشِ دوم، برش‌هایِ تصادفیِ 224x224 از میانِ برش‌هایِ بزرگ‌تر استخراج می‌شد. ترکیبِ این برش‌ها با انعکاسِ افقیِ آن‌ها، حجمِ مؤثرِ مجموعهٔ آموزشی را 2048 برابر افزایش داد. همچنین تغییرِ تصادفیِ رنگ‌هایِ RGB در سه محورِ اصلی، تنوعِ داده‌ها را برای شرایطِ نوریِ مختلف تضمین کرد.

الگویی که استانداردهایِ پردازشِ موازی را دگرگون کرد

موفقیتِ الکس‌نت فراتر از یک رکوردِ رقابتی بود. این مدل ثابت کرد که استفادهٔ هم‌زمان از شبکه‌هایِ عمیق و سخت‌افزارهایِ گرافیکیِ قدرتمند می‌تواند گلوگاه‌هایِ محاسباتیِ گذشته را بشکند. الگوهایی که در این پروژه تدوین شد، پایه‌گذارِ ساختارهایِ جدیدِ پیش‌بینی و طبقه‌بندیِ تصویری در سال‌هایِ بعد شد. امروزه اگرچه معماری‌هایِ مبتنی‌برِ ترانسفورمر و مدل‌هایِ بزرگِ زبانی توجه‌ها را به خود جلب کرده‌اند، اما همانِ اصولِ بهینه‌سازی، مدیریتِ حافظه و کاهشِ نرخِ یادگیری که در الکس‌نت به‌کار رفت، هنوز در دیباگ و آموزشِ هزاران شبکهٔ عصبیِ مدرن استفاده می‌شود و پایهٔ آیندهٔ سیستم‌هایِ خود‌ران و تشخیصِ پزشکی را شکل خواهد داد.