بستن گلوگاهِ یادگیریِ نظارتی
تولدِ GPT-1 در ژوئنِ 2018 نقطهای بود که بهسرعت مسیرِ پژوهشهای هوشِ مصنوعی را تغییر داد. مدلِ 117 میلیونپارامتری که در نگاهِ اول در مقیاسِ نسلهای امروز ساده بهنظر میرسد، در واقع جرقهای برای دگرگونیِ معماریهای پردازشِ زبانِ طبیعی (NLP) محسوب میشد. این پروژه بهطورِ عملی ثابت کرد که ترکیبِ پیشآموزشِ تولیدیِ بدوننظارت با تنظیمِ دقیقِ نظارتی، میتواند درکی عمیق و چندبعدی از ساختارِ زبانِ انسانی ایجاد کند.
تا پیش از ظهورِ این مدل، اکوسیستمِ NLP در اواسطِ دههٔ 2010 با محدودیتهایِ شدیدِ یادگیریِ نظارتی دستوپنجه نرم میکرد. مدلهای عصبی برای رسیدن به دقتِ مطلوب نیاز به دادههایِ حجیمِ برچسبگذاریشده داشتند که دستیابی به آنها نهتنها هزینهبر بود، بلکه فرایندی بسیار زمانبر محسوب میشد. این وابستگیِ حیاتی باعث شده بود مدلها در زبانهای با منابعِ محدود مانند سواحیلی یا کریولِ هائیتی ناتوان عمل کنند. پژوهشگران سالها در پی بهرهگیری از انبوهِ متنهای بدونِ برچسبِ موجود در وب بودند، اما شکستهایِ مکرر در روشهای نیمهنظارتی نشان میداد که چالشِ اصلی در حجمِ داده نیست، بلکه در معماریِ الگوریتم نهفته است. برای بررسیِ ریشههای این محدودیتها میتوانید به تاریخچهٔ پردازشِ زبانِ طبیعی در ویکیپدیا مراجعه کنید.
ایدهٔ کلیدی: پیشآموزشِ بدوننظارت برای درکِ زبان
آلک رادفورد، کارتیک ناراسیمهان، تیم سالیمنس و ایلیا سوکتسور با ارائهٔ یک مسیرِ تازه متوجه شدند که یک مدلِ زبانیِ ساده که وظیفهٔ پیشبینیِ کلمهٔ بعدی در یک توالی را بر عهده دارد، میتواند بازنماییهایِ قدرتمندی از قواعد و معانیِ زبانی را کشف کند. این کشفِ بنیادین منجر به ظهورِ یک چارچوبِ آموزشیِ دوگانه شد: در گامِ نخست، پارامترهایِ پایهٔ مدل با خواندنِ متونِ عظیمِ بدونِ برچسب تنظیم میشود تا الگوهایِ دستوری و معناییِ عمومی فراگیرد؛ در گامِ دوم، این پارامترهایِ بلوغیافته روی یک مأموریتِ خاص و با دادههایِ محدودِ برچسبدار، تنظیمِ دقیق میشوند. این معماریِ نیمهنظارتی اجازه داد مدلها پیش از تخصصیشدن، زبان را بهخوبی درک کنند و درکِ عمیقِ آنها از بسترِ متن، مرزهایِ جدیدی را در مأموریتهای متنوع گشود.
معماریٔ دیکودر-تنها و توجهِ خود
هستهٔ فنیِ GPT-1 بر شانههایِ ترانسفورمر استوار بود. اگرچه ساختارِ اصلی معرفیشده توسط محققانِ گوگل در سالِ 2017 از دو بخشِ رمزگذار و رمزگشا تشکیل شده بود، تیمِ OpenAI با انتخابی آگاهانه بخشِ رمزگشا را بهتنهایی با مکانیسمِ توجهِ خودِ پوشاندهشده (masked self-attention) بهکار گرفت. این انتخابِ معماری باعث شد هر توکنِ ورودی فقط به توکنهایِ پیشین دسترسی داشته باشد و نتواند به آینده نگاهی بیندازد. این ویژگیِ جهتدار، مدل را برای تولیدِ توالیهای متنی و پیشبینیِ گامبهگام بهینه ساخت. 
مشخصاتِ فنی و میراثِ معماری
طراحیِ مهندسیشدهٔ این مدل، تعادلی دقیق بین پیچیدگیِ محاسباتی و کارایی ایجاد کرده بود. ساختارِ شبکهٔ عصبیِ آن از مشخصاتِ زیر تشکیل شده است:
- 12 بلوکِ ترانسفورمر: لایههایِ عمیق که هستهٔ اصلیِ یادگیریِ مدل را تشکیل میدهند.
- 768 بعدِ پنهان: فضایِ برداری برای بازنماییِ دقیقِ توکنها و کلمات.
- 12 سرِ توجهِ 64-بعدی: مکانیسمِ موازی برای تحلیلِ همزمانِ جنبههای مختلفِ جمله.
- 3072 بعدِ پیشخور: گسترشِ فضایی در شبکههایِ عصبیِ موقعیتی.
- 117 میلیون پارامتر: حجمِ کلِ وزنهایِ قابلِ آموزش در شبکه.
- طولِ بافتارِ 512 توکنی: محدودیتِ ورودی برای پردازشِ توالیهای متنی.
- واژگانِ 40,000تاییِ BPE: تکنیکِ بخشبندیِ کلمات برای پوششِ طیفِ وسیعی از توکنها.
- تابعِ فعالسازی GELU: جایگزینی نرمتر نسبتبه ReLU برای بهبودِ همگرایی.
- جاسازیِ موقعیتیِ یادگرفتهشده: انعطافپذیریِ بالاتر نسبتبه نمادگذاریِ سینوسی.
- نرخِ ریزشِ 0.1: روشِ منظمسازی برای جلوگیری از بیشبرازشِ مدل.
تمرینِ اصلی روی پیکرهٔ BookCorpus انجام شد و مدل توانست درختنگری (Perplexity) برابرِ با 18.4 را روی مجموعههایِ تست ثبت کند. الگوریتمِ بهینهسازیِ آدام با پیمانهبندیِ نرخِ یادگیری در طولِ 2000 بافتِ اول، پایداریِ آموزش را تضمین میکرد. این پایهریزیِ فنی، شالودهای شد که بعدها با افزایشِ پارامترها و بهبودِ الگوریتمهایِ همگرایی، به نسلهایِ بعدیِ GPT و مدلهایِ هوشِ مصنوعیِ مولد تبدیل شد. 
پایداریِ این معماریِ ساده اما کارآمد، فراتر از هر پیشبینیای برای آینده رقم خورد. همان خطوطِ کد و منطقِ دیکودر-تنها، پایهای شد تا مدلهایِ بعدی با هزاران برابر پارامتر مرزهایِ هوشِ مصنوعیِ مولد را جابهجا کنند. امروزه وقتی سیستمهایِ زبانی تواناییِ نوشتنِ کد، تحلیلِ داده یا تولیدِ محتوا را بهشکلی روان از خود نشان میدهند، ریشهٔ تمامِ این دستاوردها به همان نسخهٔ نخست بازمیگردد. نسلِ بعدیِ مدلها با تغییر در مقیاسِ داده و عمقِ لایهها ثابت کردند که یک معماریِ درست در زمانِ درست، میتواند صنعتِ فناوری را برایِ دههها به سمتی هدایت کند که در نگاهِ اول غیرواقعی بهنظر میرسد. آیندهٔ صنعتِ هوشِ مصنوعی در گروِ تداومِ این همسویی میانِ معماریهایِ پایا و دادههایِ حجیم است و پیشبینی میشود نسلهایِ بعدی با تمرکزِ بر بهینهسازیِ محاسباتی و کاهشِ ردپایِ کربنی، هوشِ مصنوعی را برای بهرهبرداریِ گستردهتر در صنایعِ واقعی آمادهتر کنند.





