چالش تبدیل دنباله و ظهور بردار زمینه

قبل از آنکه ترنسفورمرها و مدل‌های زبانی بزرگ، چهره‌ی هوش مصنوعی را دگرگون کنند، یک تغییر بنیادین و نسبتاً آرام در پردازش زبان طبیعی شکل گرفت. ایده‌ی ساده اما قدرتمندی پشت این تحول نهفته بود: یک شبکه عصبی وظیفه‌ی خواندن یک دنباله‌ی اطلاعاتی را بر عهده داشته باشد و شبکه‌ای دیگر وظیفه‌ی تولید دنباله‌ای جدید را. این دو در کنار هم توانستند تقریباً هر نوع داده‌ای را به خروجی دیگری تبدیل کنند. عصر یادگیری دنباله به دنباله یا هم‌ین Seq2seq شکل گرفت و داستانی از انتزاعات ریاضی، گلوگاه‌های سخت‌افزاری و یک مکانیزم انقلابی را رقم زد که در نهایت پل را برای نسل بعدی هوش مصنوعی بست.

این چارچوب بر پایه‌ی یک عملیات اصلی بنا شده است: تبدیل یک دنباله به دنباله‌ای دیگر. در مرکز کارشناسی این حوزه، مسئله‌ای قرار دارد که به «تبدیل وکتور به وکتور» شهرت دارد. دشواری اصلی در این است که دنباله‌های ورودی و خروجی اغلب طول‌های متفاوتی دارند و هیچ الگویی برای تطبیق مستقیم آن‌ها بین داده‌ها وجود ندارد. معماری‌های سری مدل‌های Seq2seq این چالش را با ایجاد یک ساختار واحد حل کردند که در آن انکودر وظیفه‌ی درک ورودی و دکدر وظیفه‌ی تولید خروجی را بر عهده دارد. این یکپارچه‌سازی پیشرفت در کل حوزه‌ی پردازش زبان طبیعی را به صورت چشمگیری تسریع کرد و کارهایی نظیر ترجمه ماشینی، توضیح تصاویر، تشخیص گفتار، خلاصه‌سازی متن و حتی پیش‌بینی سری‌های زمانی را از سیستم‌های پیچیده و تکه‌تکه به یک مدل قابل آموزش از ابتدا تا انتها تبدیل نمود.

نمودار شماتیک معماری انکودر و دکدر» class=

از نظریه اطلاعات تا جدال سال ۲۰۱۴

ریشه‌های فکری این معماری فراتر از یادگیری عمیق می‌رود. در نامه‌ای تاریخی به نوربرت وینر در سال ۱۹۴۷، وارن ویور اشاره کرد که ترجمه متون خارجی شبیه به رمزگشایی پیام‌های رمزنگاری شده است. این شهود اولیه بذر مفهوم ترانداکشن دنباله را در نظریه‌ی اطلاعات کاشت، جایی که ارتباط به عنوان فرآیند کدگذاری، انتقال و رمزگشایی تعریف می‌شد. دهه‌ها بعد، شبکه‌های عصبی به این استعاره‌ی ریاضی پیکربندی عملی بخشیدند.

ایده‌ی ترانداکشن دنباله با معماری انکودر-دکدر در اوایل دهه‌ی ۲۰۱۰ توسعه یافت، اما مقالاتی که معمولاً به عنوان مبدعان این حوزه استناد می‌شوند، دو مقاله از سال ۲۰۱۴ هستند. در معماری پیشنهادی آن‌ها، هم انکودر و هم دکدر از شبکه‌های LSTM (حافظه کوتاه و بلند) استفاده می‌کردند. یکی از این مقالات کلیدی در گوگل برین منتشر شد و چارچوب را در اصل به توسعه‌دهنده‌ی ویتنامی آن زمان، ویت کوک لیه، نسبت می‌دهد. این تحقیق تأثیر سریع و ملموسی در صنعت گذاشت و به گوگل اجازه داد در سال ۲۰۱۶ موتور ترجمه‌ی خود را به صورت کامل به سیستم عصبی بازطراحی کند.

با این حال، این دوران با یک مناقشه‌ی اولویت نیز همراه است. توماس میکولوف ادعا می‌کرد که ایده‌ی استفاده از یک مدل زبانی عصبی روی جفت‌های جمله و تولید ترجمه پس از مشاهده‌ی جمله‌ی اول را پیش از ورود به گوگل برین توسعه داده است. او معتقد است ایده را در محیط گوگل با ایلیا سوتسکیور و کوک لیه در میان گذاشته، اما نامی از او در مقالات منتشر شده برده نشده است. این اختلاف نظر اگرچه حاشیه‌ای است، اما نشان می‌دهد که چگونه مفاهیم پایه‌ای هوش مصنوعی اغلب به صورت موازی و در محیط‌های آکادمیک و صنعتی شکل می‌گیرند.

معماری کلاسیک و گلوگاه بردار زمینه

در معماری کلاسیک این مدل‌ها، یک شبکه عصبی بازگشتی تمام کلمات جمله‌ی ورودی را اسکن می‌کند و اطلاعات آن‌ها را در یک بردار با طول ثابت فشرده می‌سازد. شبکه‌ی دیگر سپس این بردار را می‌خواند و به صورت تکراری کلمات جمله‌ی ترجمه یا خروجی را تولید می‌کند. این طراحی به ظاهر ساده بود، اما با یک محدودیت اساسی روبرو بود: بردار زمینه نمی‌توانست تمام جزئیات جمله‌های طولانی را در خود جای دهد. وقتی جمله‌ی ورودی بلند می‌شد، اطلاعات انتهای آن در طول پردازش فراموش می‌شد و خروجی نهایی کیفیت خود را از دست می‌داد.

این گلوگاه باعث شد پژوهشگران به دنبال راهی بگردند که دکدر بتواند در هر مرحله‌ی تولید، به کل دنباله‌ی ورودی دسترسی مستقیم داشته باشد. پاسخ به این نیاز، مکانیسم اترنشن توجه بود. با معرفی این مکانیسم، شبکه‌ی دکدر می‌توانست در لحظه تصمیم بگیرد که روی کدام بخش از ورودی تمرکز کند، بدون اینکه مجبور باشد کل اطلاعات را در یک بردار فشرده نگه دارد. این بهبود کوچک اما حیاتی، مستقیماً راه را برای معماری‌های بعدی هموار کرد.

گذار به ترنسفورمر و میراث جاودان

مکانیسم اترنشن ابتدا برای حل مشکل حافظه‌ی کوتاه‌مدت در شبکه‌های بازگشتی طراحی شد، اما به زودی ثابت شد که می‌تواند از تمام ساختارهای تکرارشونده جایگزین شود. حذف کامل اتصالات بازگشتی و جایگزینی آن با محاسبات موازی برداری، منجر به تولد معماری ترنسفورمر شد. اگرچه ترنسفورمرها اکنون ستون فقرات بزرگترین مدل‌های زبانی جهان هستند، اما معماری انکودر-دکدر به مثابه‌ی آزمایشگاهی ایده‌آل عمل کرد که بسیاری از مفاهیم پایه را تست و اصلاح نمود. امروزه می‌توان دید که بسیاری از الگوهای مولد کوانتومی و متاداده‌ی زبانی، هنوز از طرز تفکر اولیه‌ی تبدیل دنباله به دنباله الهام می‌گیرند. آینده‌ی پردازش اطلاعات احتمالاً در ترکیب این منطق بنیادین با محاسبات توزیع‌شده‌ی نسل جدید رقم خواهد خورد.