لحظهای که مسیر هوش مصنوعی تغییر کرد
هفتم ژوئن سال ۲۰۱۷ مقالهای کوتاه با عنوان Attention Is All You Need در بستر arXiv منتشر شد. این نوشته که توسط هشت پژوهشگر گوگل تألیف شده بود، هیچ ردپایی از ادعاهای دراماتیک نداشت، اما عملاً مسیر هوش مصنوعی را برای همیشه تغییر داد. اگر امروز با چتباتهای تولیدکننده متن یا مدلهای بینایی ماشین روبرو میشوید، موتور پنهان تمام آنها به همین سند ساده بازمیگردد.
تا پیش از انتشار این پژوهش، معماریهای تسلطیافته بر پردازش دنبالههای متنی بر پایه شبکههای عصبی بازگشتی (RNN) یا مدلهای لغزان بودند. این ساختارها ذاتاً مجبور بودند دادهها را پیمایش کنند و این موضوع باعث گلوگاههای شدیدی در دوره آموزش و مقیاسپذیری میشد. پژوهشگران گوگل پرسشی پایهای مطرح کردند: اگر بتوانیم وابستگیهای بین کلمات را مستقیماً و بدون پیمایش مرحلهبهمرحله به دست آوریم، چه اتفاقی میافتد؟ پاسخ به معماری ترانسفورمر انجامید.
حذف بازگشت و کانولوشنها
نوآوری اصلی این مقاله نه در افزودن لایههای جدید، بلکه در حذف کامل لایههای بازگشتی و کانولوشنال بود. تیم گوگل ساختاری را طراحی کرد که کاملاً بر مکانیسم توجه (Attention) استوار است. این تغییر پارادایمی، اجازه داد مدارک ورودی به صورت همزمان پردازش شوند و عملاً گلوگاه موازیسازی را از بین برد. این معماری که در پیکربندی رمزگذار-رمزگشا (Encoder-Decoder) چیده شد، نشان داد که نیاز به حافظه داخلی برای نگهداری اطلاعات قبلی دنباله، حذف میشود.
گروهی که همه چیز را عوض کردند
تیم مؤسس این پژوهش شامل آشیش واسوانی، نوام شازیر، نیکی پارمار، یاکوب اوسزکوریت، لیون جونز، آیدان گومز، لوکاش کایزر و ایلیا پولوسوکین بود. نکتهای که در استانداردهای آکادمیک بیسابقه بود، برابری کامل تمام نویسندگان در تألیف نوشته و ترتیب تصادفی نامها در فهرست مؤلفان است. سرنوشت این گروه پس از انتشار اثری که کل صنعت را متحول کرد، بسیار جالب درآمد. یکی پس از دیگری، تمام این هشت پژوهشگر شرکت گوگل را ترک کردند و مسیر خود را در شرکتهای پیشگام هوش مصنوعی یا استارتاپهای مستقل خودشان هموار کردند.
نامگذاری این معماری نیز به اندازه محتوایش غیرمتعارف بود. عنوان مقاله ارجاعی مستقیم به آهنگ گروه بیتلز All You Need Is Love بود. خود کلمه ترانسفورمر صرفاً به این دلیل انتخاب شد که یاکوب اوسزکوریت از آهنگ آن خوشش میآمد. اسناد اولیه طراحی حتی تصویری از کاراکترهای کمیکهای ترانسفورمرها را در خود جای داده بود.
موتور محاسباتی: از توجه خودکار تا چندسری
قلب تپنده این معماری، مکانیسم توجه حاصلضرب نقطهای مقیاسشده (Scaled Dot-Product Attention) است. مدل در این ساختار به سه ماتریس پرسوجو (Q)، کلید (K) و مقدار (V) تکیه میکند که همگی از خود دنباله ورودی استخراج میشوند. این روش امکان محاسبه وزنهای مرتبط بین هر کلمه و سایر کلمات متن را در یک مرحله فراهم میکند. برای پایدار نگه داشتن شیبهای گرادیان در طول آموزش، پژوهشگران یک عامل مقیاسشده مبتنی بر ابعاد بردار کلید (معمولاً عدد ۶۴) را معرفی کردند که تأثیر بسزایی در همگرایی مدل داشت.
یکی از جلوههای خلاقانه، توجه چندسری (Multi-Head Attention) است. به جای استفاده از یک لایه توجه واحد، مدل این فضا را به چندی سر موازی تقسیم میکند. هر سر با وزنهای خطی متفاوتی روی Q، K و V کار میکند و جنبههای گوناگون رابطه بین کلمات را از زوایای مختلف بررسی مینماید. خروجیهای این سرها در نهایت با هم پیوند داده شده و از یک لایه خطی نهایی عبور میکنند. این ساختار دقیقاً همان چیزی است که امروز در معماری ترانسفورمر در ویکیپدیا به عنوان پایه و اساس شبکههای عصبی مدرن شناخته میشود.
رمزگذاری موقعیت و درک ترتیب کلمات
ترانسفورمر ذاتاً فاقد حافظه ترتیبی است و کلمات را به صورت یک دسته همزمان دریافت میکند. برای حل این معما، مؤلفان به راهحلی ریاضی متوسل شدند: جایگذاری اطلاعات موقعیتی مستقیم در تعبیههای اولیه کلمات. آنها از توابع موج سینوس و کسینوس با فرکانسهای مختلف استفاده کردند. این روش ظریف نه تنها به مدل اجازه داد ترتیب کلمات را درک کند، بلکه به الگوریتم امکان تعمیم دادن ساختار به متنهای طولانیتر از طول دوره آموزش را نیز داد.
نتایج درخشان و میراثی جاودان
آزمایشهای اولیه روی وظیفه ترجمه انگلیسی به آلمانی در رقابت WMT 2014، شکاف بین نسل قبل و این معماری را آشکار کرد. مدل پیشنهادی نمرهٔ BLEUِ ۲۸.۴ را ثبت کرد و مدلهای پیشبینیشده با گروههای چندگانه (Ensembles) را با اختلافی آشکار پشت سر گذاشت. این موفقیت، در مقاله اصلی در arXiv نیز با جزئیات فنی گزارش شده است و عملاً نشان داد که معماری مبتنی بر توجه میتواند رکوردهای جهانی را جابجا کند.
پیشبینی هر محقق هوش مصنوعی که بگوید این معماری تنها به ترجمه ماشینی محدود میشود، محال به نظر میرسید. ترانسفورمر به سرعت بستر فکری را برای پیدایش مدلهای خودنظارتی و آموزشدیده روی کل اینترنت فراهم کرد. از ساختارهای پیشگام تا مدلهای چندوجهی فعلی، همه و همه بر شانههای همین یک ایده ساده ایستادهاند: «فقط به توجه نیاز دارید». آینده پردازش زبان طبیعی دیگر به دنبال بازگشت به معماریهای قدیمی نیست و مسیر به سمت مهندسی لایههای توجه دقیقتر و پردازشهای چندرسانهای همزمان هموار شده است. در این مسیر، سؤال اصلی دیگر چگونه مدل بسازیم نیست، بلکه نحوه جهتدهی مسئولانه به این معماری قدرتمند است.





