پیش از آنکه نام هوش مصنوعی سر تیتر رسانه‌ها قرار گیرد، محقق جوانی در آزمایشگاه‌های بل (Bell Labs) مشغول طراحی شالوده بینایی ماشین بود. یان لوکان (Yann LeCun) در فاصله سال‌های 1988 تا 1998 مجموعه‌ای از شبکه‌های عصبی کانولوشنی را توسعه داد که با نام LeNet شناخته می‌شوند و پایه و اساس انقلاب شبکه‌های عصبی глубок را بنا نهادند.

مردی که معماری شبکه‌های مدرن را متحول کرد

یان لوکان که در حومه پاریس متولد شد، دوران دکتری خود را در سال 1987 در دانشگاه پیر و ماری کوری به پایان رساند. او در این دوره نسخه اولیه‌ای از الگوریتم پس‌انتشار (Backpropagation) را پیشنهاد داد. این الگوریتم بعدها به موتور محرک یادگیری در شبکه‌های عصبی تبدیل شد. وی پیش از پیوستن به تیم تحقیقاتی شرکت مخابراتی AT&T، یک سال را به عنوان پژوهشگر پسادکتری در دانشگاه تورنتو و زیر نظر جفری هینتون سپری کرد؛ دانشمندی که سال‌ها بعد جایزه تورینگ را به‌طور مشترک با او به اشتراک گذاشت.

تولد LeNet در آزمایشگاه‌های بل

در اکتبر 1988، پیوستن لوکان به بخش تحقیقات سیستم‌های تطبیقی در نیوجرسی، نقطه عطفی در هوش مصنوعی رقم زد. در آن زمان، شبکه‌های عصبی موجود برای تشخیص نویسه‌ها به شدت به تنظیمات دستی وابسته بودند و انعطاف‌پذیری لازم برای یادگیری عمیق را نداشتند.

اولین تلاش‌های گروه لوکان رویکردی ترکیبی داشت که شامل مقیاس‌بندی، رفع کجی و استخراج اسکلت تصویر به همراه یک لایه کانولوشنی با 18 کرنل طراحی‌شده بود. اما دستاورد بزرگ در سال 1989 رخ داد؛ زمانی که آن‌ها الگوریتم پس‌انتشار را برای خواندن اعداد دست‌نویس ارائه شده توسط خدمات پستی ایالات متحده به کار گرفتند.

غللب بر چالش‌های یادگیری ماشین

این پروتوتایپ که بعدها LeNet-1 نام گرفت، نشان داد کاهش پارامترهای آزاد در شبکه و استفاده از ویژگی‌های ناوردا نسبت به جابه‌جایی، عملکرد مدل را به شکل خیره‌کننده‌ای ارتقا می‌دهد. این اصل طلایی، اکنون به یکی از مبانی اساسی در طراحی معماری‌های هوش مصنوعی مدرن تبدیل شده است. سیستم لوکان در خواندن کدهای پستی به نرخ خطای تنها 1 درصد دست یافت و توانست با دقت بالایی چک‌های بانکی را پردازش کند.

مسئله‌ای که شبکه‌های کانولوشنی حل کردند

روش‌های سنتی برای تشخیص تصویر، پیکسل‌ها را به صورت یک آرایه مسطح به مدل می‌دادند. این روش ناتوانی شدیدی در درک ساختار فضایی تصاویر داشت. معماری شبکه عصبی کانولوشنی (CNN) با اعمال فیلترهای یادگیرنده، توانست ویژگی‌های بصری را لایه به لایه استخراج کند. موفقیت LeNet در تشخیص نویسه، مسیر را برای ساخت سیستم‌های بینایی ماشین پیچیده هموار ساخت و ثابت کرد شبکه‌های عصبی می‌توانند در محیط‌های عملیاتی و دنیای واقعی به کار گرفته شوند.

میراث شبکه‌های عصبی و آینده یادگیری عمیق

کارهای اولیه یان لوکان نشان داد که محدودیت‌های ساختاری هوشمندانه می‌توانند به جای مانع، ابزاری قدرتمند برای یادگیری Allgemein باشند. امروزه، با وجود پیشرفت شگرف مدل‌های پیشرفته پردازش تصویر و شبکه‌های عصبی پیچیده، همچنان ردپای ایده‌های اولیه LeNet را می‌توان در نحوه اتصال لایه‌ها و استخراج ویژگی‌ها مشاهده کرد. این سفر علمی ثابت می‌کند که ایده‌های ساده اما دقیق، چگونه می‌توانند یک انقلاب فناوری را طی چند دهه شکل دهند.