خانوادهٔ GPT و سیرِ تکاملِ پارامترها

مدل‌های GPT با تکیه بر معماری ترنسفورمر، پردازشِ زبانِ طبیعی را متحول کرده‌اند. پایهٔ این سیستم‌ها بر سازوکارهای خود‌توجهی بنا شده که ورودی‌ها را به توالی‌های خروجیِ معنادار تبدیل می‌کنند. ویژگیٔ مشترکِ همهٔ نسخه‌های این خانواده، قابلیتِ فرا‌یادگیری است؛ یعنی مدل‌ها بدون نیاز به باز‌آموزیِ ساختاریافته برای هر وظیفهٔ جدید، قادر به انجامِ طیفِ وسیعی از کارها هستند.

جدولِ زیر نشان می‌دهد چگونه حجمِ داده و تعدادِ متغیرهای قابل‌تنظیم در هر نسل رشد داشته است:

مدلسال عرضهتعداد پارامترها
GPT-12018117 میلیون
GPT-220191.5 میلیارد
GPT-32020175 میلیارد
GPT-42023100 تریلیون

معماری و نقاط‌ضعف GPT-3

معرفیٔ GPT-3 در سال 2020 با 175 میلیارد پارامتر، مرزهای پردازشِ متن را جابه‌جا کرد. این مدل می‌تواند تا 2048 توکن متنِ پیوسته تولید کند و در طیفِ گسترده‌ای از سناریوها از کد‌نویسی تا ترجمه عملکردِ قابل‌توجهی دارد. ساختارِ داخلیِ آن شامل 175 لایهٔ پردازشی و آموزش‌دیده بر روی حدودِ 570 گیگابایت دادهٔ متنی از کتاب‌ها و مقالاتِ علمی است.

چالش‌های اجرایی

  • هزینهٔ محاسباتی بالا: آموزش و اجرای این مدل به فضای ذخیره‌سازی و پردازشی عظیم نیاز دارد که مقیاس‌پذیریِ آن را در پلتفرم‌های سبک محدود می‌کند.
  • سوگیریِ داده‌ها: آموزش بر روی کلِ وب بدون فیلترِ دقیق باعث می‌شود مدل گاهی پاسخ‌هایی تولید کند که بازتاب‌دهندهٔ تعصباتِ موجود در منابعِ آموزشی است.
  • عدمِ سازگاریِ دقیق با دستورات: اگرچه درکِ زمینه قوی است، اما در پیروی از سناریوهای چند‌مرحله‌ای یا دستورالعمل‌های پیچیده گاهی دچار خطا می‌شود.
نمودار مقایسه معماری و پارامترهای مدل‌های زبانی

تغییرات محوری در GPT-3.5

نسخهٔ 3.5 لزوماً با افزایشِ انفجاریِ تعدادِ پارامترها عرضه نشد. هستهٔ اصلیِ بهبودها در روش‌های آموزش نهفته است. تیم‌های توسعه با به‌کارگیریِ پشته‌های داده‌دستکاری‌شده و بازخوردِ انسانی (RLHF)، توانستند سازگاریِ مدل با دستوراتِ کاربر را تا سطحِ معناداری ارتقا دهند. این تکنیک مدل را به سمت تولیدِ پاسخ‌های ایمن‌تر، ساختاریافته‌تر و سازگارتر با هدفِ کاربر سوق داد.

در کنارِ این رویکرد، بهینه‌سازی‌های معماری باعث کاهشِ تأخیر در تولیدِ توکن‌ها و بهبودِ دقت در سناریوهای کد‌نویسی شد. پیاده‌سازیِ پشته‌های پیام برای مدیریتِ گفتگو و حفظِ حافظهٔ مکالمه، نوسازیِ اساسی در تجربهٔ کاربری بر این نسل ایجاد کرد.

شبکه‌های عصبی و فرایند آموزش با بازخورد انسانی

مقایسهٔ عملیاتی و انتخابِ نسخهٔ مناسب

انتخاب بین این دو رده بر اساسِ هدفِ پروژه انجام می‌شود. اگر نیاز به تستِ ایده‌های اولیه با هزینهٔ کم دارید، معماریِ پایه همچنان گزینهٔ قابل‌توجهی است. اما برای محصولاتِ تجاری که به دقتِ پاسخ‌گویی، رعایتِ محدودیت‌های ایمنی و سازگاری با چت‌بات‌های پیشرفته نیاز دارند، نسخهٔ 3.5 با کاهشِ خطایِ دستور‌پذیری و بهبودِ کاراییِ محاسباتی برتریِ واضحی دارد.

این شکافِ تکنیکی نشان می‌دهد مسیرِ توسعهٔ هوشِ مصنوعی از مقیاس‌پذیریِ محض به سمتِ بهینه‌سازیِ روش‌های آموزش و تعاملِ انسانی حرکت کرده است. تمرکزِ آینده بر افزایشِ شفافیتِ تصمیم‌گیری و کاهشِ مصرفِ انرژی در دیتاسنترها خواهد بود.