انتشارِ مدلِ GPT-3 توسطِ اوپن‌ای‌آی در مهٔ ۲۰۲۰، خط‌کش‌هایِ پردازشِ زبانِ طبیعی را برای همیشه جابه‌جا کرد. این مدل تنها یک به‌روزرسانیِ نرم‌افزاری نبود؛ بلکه با تکیه بر ۱۷۵ میلیارد پارامتر، دروازه‌ای به قابلیت‌هایی گشود که پیش‌تر صرفاً در قلمروِ نظریه‌هایِ محاسباتی قرار داشت. یکی از ملموس‌ترین و تأثیرگذارترین پیامدهایِ این جهشِ تکنولوژیک، تولدِ مهندسیِ پرامپت بود؛ شاخه‌ای که از آزمون‌وخطاهایِ اولیه به یک روش‌شناسیِ دقیق و ساختاریافته تبدیل شد و اکنون ستونِ فقراتِ تقریباً تمامِ اپلیکیشن‌هایِ هوشِ مصنوعیِ مدرن را تشکیل می‌دهد.

معماری مدل زبانی بزرگ GPT-3 و لایه‌های ترانسفورمر

جهشِ مقیاس: از مدلِ کوچکِ GPT-2 تا غولِ ۱۷۵ میلیاردی

برای درکِ ریشه‌هایِ مهندسیِ پرامپت، باید ابتدا ابعادِ واقعیِ جهشِ مقیاسی را که نسخهٔ سومِ مدل‌هایِ زبانی تجربه کرد مرور کنیم. مدلِ GPT-2 که در فوریهٔ ۲۰۱۹ رونمایی شد، خود با داشتنِ ۱٫۵ میلیارد پارامتر دستاوردی چشمگیر بود. پژوهشگران در آن دوره متوجه شده بودند که نحوِ نگارشِ ورودی‌ها تأثیرِ مستقیمی بر کیفیتِ خروجی دارد، اما این مشاهده هنوز در قالبِ یک چارچوبِ علمی یا ابزارِ مهندسی درآمده نبود؛ پرامپت در آن زمان صرفاً یک متغیرِ ورودیِ ساده محسوب می‌شد.

وضعیت با معرفیِ GPT-3 کاملاً دگرگون شد. معماریِ این مدل شاملِ ۹۶ لایهٔ ترانسفورمر، ۹۶ سرِ توجه و یک بُعدِ پنهانِ ۱۲٬۲۸۸ تایی بود. این اعداد نه تنها یک بهبودِ کمی، بلکه جهشی کیفی در قدرتِ تحلیلِ سیگنال‌هایِ معنایی ایجاد کردند. پنجرهٔ زمینهٔ ۲۰۴۸ توکنی به مدل اجازه می‌داد تا در حینِ پیش‌بینی، متناسب با حدودِ ۱۵۰۰ کلمه متن را در حافظهٔ فعال نگه دارد. ظرفیتِ بازنماییِ هر توکن با رشدِ ۱۶ برابریِ بُعدِ پنهان نسبت به نسخهٔ نخست، به مدل این امکان را داد تا ظرافت‌هایِ معنایی را با دقتی بی‌نظیر تفکیک کند. برای مثال، کلمهٔ «bank» با توجه به زمینه‌هایِ اطرافش به شکل‌های کاملاً مجزایی در فضایِ برداریِ مدل کدگذاری می‌شد. برای بررسیِ جزئیاتِ فنی و معماریِ شبکهٔ عصبیِ ترانسفورمر می‌توانید به مستنداتِ GPT-3 در ویکی‌پدیا مراجعه کنید.

یادگیریِ کم‌نمونه (Few-shot learning): کشفی که معادلات را دگرگون کرد

نکته‌ای که استانداردهایِ توسعهٔ مدل‌هایِ زبانی را برای همیشه تغییر داد، پدیده‌ای به نامِ یادگیریِ کم‌نمونه بود. مقالهٔ محوریِ تیمِ تحقیقاتیِ اوپن‌ای‌آی نشان داد که می‌توان با قرار دادنِ چند مثالِ کاربردی درونِ متنِ ورودی، عملکردِ مدل را بدون هیچ‌گونهٔ به‌روزرسانیٔ وزن‌ها یا تنظیمِ دقیق متحول کرد. این قابلیت ذاتاً نوپدید نبود؛ ریشه در هدفِ آموزشیِ مدل در مرحلهٔ پیش‌آموزش داشت. مدل در طولِ آموزشِ خود میلیون‌ها نمونه از ساختارهایِ پرسش‌وپاسخ، ترجمه و تکمیلِ کد را پردازش کرده بود و حالا در این مقیاسِ بزرگ، توانسته‌بود این الگوها را شناسایی و الگوبرداری کند.

این تحول به کاربردهایِ عملی سرعتی غیرمنتظره بخشید. توسعه‌دهندگان نیازی نداشتند همچون گذشته برای هر وظیفهٔ جدید ماه‌ها را صرفِ جمع‌آوری و برچسب‌گذاریِ داده‌ها کنند. یک پرامپتِ خوب‌ساخته می‌توانست مدل را واردِ یک چرخهٔ تحلیلِ خودکار کند. این روش‌شناسیِ جدید، سرعتِ چرخهٔ توسعهٔ نرم‌افزار را چندین‌ برابر کرد و آستانهٔ ورود به حوزهٔ تحلیلِ داده‌هایِ پیچیده را به‌شدت پایین آورد. تیم‌هایِ فنی امروزه با استناد به تحلیل‌هایِ پیشرو در حوزهٔ هوشِ مصنوعی درمی‌یابند که هدایتِ دقیقِ مدل‌هایِ زبانی از طریقِ زبانِ طبیعی می‌تواند جایگزینِ بهینه‌ای برای بهینه‌سازی‌هایِ سنگینِ کدنویسی باشد.

پایانِ تنظیمِ دقیق به‌عنوانِ پارادایمِ پیش‌فرض

پیش از این دوره، استانداردهایِ توسعهٔ هوشِ مصنوعی بر مبنایِ یک جریانِ خطی استوار بود: آموزشِ عظیم روی پایگاه‌هایِ دادهٔ عمومی، دنبال‌شده با تنظیمِ دقیق روی مجموعه‌هایِ دادهٔ اختصاصی. اگرچه این روش کارآمد بود، اما هزینه‌هایِ محاسباتی و انسانیِ سنگینی به همراه داشت و کارشناسان برای هر کاربردِ خاص مجبور بودند مدل‌هایِ موازی و جداگانه مستقر کنند. این رویکرد اغلب با پدیدهٔ فراموشیِ فاجعه‌بار مواجه می‌شد؛ حالتی که در آن یادگیریِ یک تسکِ جدید تواناییِ مدل را در وظایفِ قبلی تخریب می‌کرد.

ورودِ طراحیِ هوشمندانهٔ دستوراتِ متنی به صحنه، این کابوسِ عملیاتی را پایان داد. به جای مدیریتِ چندینِ مدلِ تخصصی، توسعه‌دهندگان اکنون تنها یک هوشِ مصنوعیِ عمومی و یک مجموعهٔ دستورالعملِ متنی را مدیریت می‌کردند. این تغییرِ پارادایم، چابکیِ تیم‌هایِ محصول را به سطحی جدید ارتقا داد و امکانِ پیاده‌سازیِ سریعِ پروتوتایپ‌ها را فراهم کرد.

از آزمون‌وخطا تا یک علمِ دقیق

مهندسیِ پرامپت در ابتدا به شانس و آزمایش‌هایِ تصادفی وابسته بود، اما به‌سرعت و در سایهٔ کاربردِ گسترده‌اش نیاز به استانداردسازی آشکار شد. امروزه این رشته فراتر از نوشتنِ یک سؤالِ ساده رفته و شاملِ تکنیک‌هایی نظیرِ زنجیرهٔ فکر، کالیبراسیونِ مثال‌ها و طراحیِ سیستم‌هایِ دینامیک می‌شود. با پالایشِ دستورالعمل‌ها برای هدایتِ دقیق‌ترِ الگوریتم‌هایِ زبانی، متخصصان می‌توانند خطایِ مدل را کاهش دهند و خروجی‌هایِ قابلِ استنادتری برای کاربردهایِ حساسِ تجاری تولید کنند.

جهشِ مقیاس در نسخهٔ سومِ مدل‌هایِ زبانی ثابت کرد که هوشِ مصنوعی دیگر صرفاً یک ماشینِ پیش‌بینیِ محض نیست، بلکه ابزاری است که با زبانِ انسان هماهنگ می‌شود. به‌زودی تعاملِ ما با ماشین‌ها از قالب‌هایِ خشکِ کدنویسی فاصله خواهد گرفت و با روش‌هایِ طبیعی‌تر و انعطاف‌پذیرتر ادغام خواهد شد. این بستر، زمینهٔ ظهورِ عاملانِ هوشمندِ خودگردان و سیستم‌هایِ تصمیم‌گیرِ تطبیق‌پذیر را در آیندهٔ نزدیک هموار کرده است.