انتشارِ مدلِ GPT-3 توسطِ اوپنایآی در مهٔ ۲۰۲۰، خطکشهایِ پردازشِ زبانِ طبیعی را برای همیشه جابهجا کرد. این مدل تنها یک بهروزرسانیِ نرمافزاری نبود؛ بلکه با تکیه بر ۱۷۵ میلیارد پارامتر، دروازهای به قابلیتهایی گشود که پیشتر صرفاً در قلمروِ نظریههایِ محاسباتی قرار داشت. یکی از ملموسترین و تأثیرگذارترین پیامدهایِ این جهشِ تکنولوژیک، تولدِ مهندسیِ پرامپت بود؛ شاخهای که از آزمونوخطاهایِ اولیه به یک روششناسیِ دقیق و ساختاریافته تبدیل شد و اکنون ستونِ فقراتِ تقریباً تمامِ اپلیکیشنهایِ هوشِ مصنوعیِ مدرن را تشکیل میدهد.
جهشِ مقیاس: از مدلِ کوچکِ GPT-2 تا غولِ ۱۷۵ میلیاردی
برای درکِ ریشههایِ مهندسیِ پرامپت، باید ابتدا ابعادِ واقعیِ جهشِ مقیاسی را که نسخهٔ سومِ مدلهایِ زبانی تجربه کرد مرور کنیم. مدلِ GPT-2 که در فوریهٔ ۲۰۱۹ رونمایی شد، خود با داشتنِ ۱٫۵ میلیارد پارامتر دستاوردی چشمگیر بود. پژوهشگران در آن دوره متوجه شده بودند که نحوِ نگارشِ ورودیها تأثیرِ مستقیمی بر کیفیتِ خروجی دارد، اما این مشاهده هنوز در قالبِ یک چارچوبِ علمی یا ابزارِ مهندسی درآمده نبود؛ پرامپت در آن زمان صرفاً یک متغیرِ ورودیِ ساده محسوب میشد.
وضعیت با معرفیِ GPT-3 کاملاً دگرگون شد. معماریِ این مدل شاملِ ۹۶ لایهٔ ترانسفورمر، ۹۶ سرِ توجه و یک بُعدِ پنهانِ ۱۲٬۲۸۸ تایی بود. این اعداد نه تنها یک بهبودِ کمی، بلکه جهشی کیفی در قدرتِ تحلیلِ سیگنالهایِ معنایی ایجاد کردند. پنجرهٔ زمینهٔ ۲۰۴۸ توکنی به مدل اجازه میداد تا در حینِ پیشبینی، متناسب با حدودِ ۱۵۰۰ کلمه متن را در حافظهٔ فعال نگه دارد. ظرفیتِ بازنماییِ هر توکن با رشدِ ۱۶ برابریِ بُعدِ پنهان نسبت به نسخهٔ نخست، به مدل این امکان را داد تا ظرافتهایِ معنایی را با دقتی بینظیر تفکیک کند. برای مثال، کلمهٔ «bank» با توجه به زمینههایِ اطرافش به شکلهای کاملاً مجزایی در فضایِ برداریِ مدل کدگذاری میشد. برای بررسیِ جزئیاتِ فنی و معماریِ شبکهٔ عصبیِ ترانسفورمر میتوانید به مستنداتِ GPT-3 در ویکیپدیا مراجعه کنید.
یادگیریِ کمنمونه (Few-shot learning): کشفی که معادلات را دگرگون کرد
نکتهای که استانداردهایِ توسعهٔ مدلهایِ زبانی را برای همیشه تغییر داد، پدیدهای به نامِ یادگیریِ کمنمونه بود. مقالهٔ محوریِ تیمِ تحقیقاتیِ اوپنایآی نشان داد که میتوان با قرار دادنِ چند مثالِ کاربردی درونِ متنِ ورودی، عملکردِ مدل را بدون هیچگونهٔ بهروزرسانیٔ وزنها یا تنظیمِ دقیق متحول کرد. این قابلیت ذاتاً نوپدید نبود؛ ریشه در هدفِ آموزشیِ مدل در مرحلهٔ پیشآموزش داشت. مدل در طولِ آموزشِ خود میلیونها نمونه از ساختارهایِ پرسشوپاسخ، ترجمه و تکمیلِ کد را پردازش کرده بود و حالا در این مقیاسِ بزرگ، توانستهبود این الگوها را شناسایی و الگوبرداری کند.
این تحول به کاربردهایِ عملی سرعتی غیرمنتظره بخشید. توسعهدهندگان نیازی نداشتند همچون گذشته برای هر وظیفهٔ جدید ماهها را صرفِ جمعآوری و برچسبگذاریِ دادهها کنند. یک پرامپتِ خوبساخته میتوانست مدل را واردِ یک چرخهٔ تحلیلِ خودکار کند. این روششناسیِ جدید، سرعتِ چرخهٔ توسعهٔ نرمافزار را چندین برابر کرد و آستانهٔ ورود به حوزهٔ تحلیلِ دادههایِ پیچیده را بهشدت پایین آورد. تیمهایِ فنی امروزه با استناد به تحلیلهایِ پیشرو در حوزهٔ هوشِ مصنوعی درمییابند که هدایتِ دقیقِ مدلهایِ زبانی از طریقِ زبانِ طبیعی میتواند جایگزینِ بهینهای برای بهینهسازیهایِ سنگینِ کدنویسی باشد.
پایانِ تنظیمِ دقیق بهعنوانِ پارادایمِ پیشفرض
پیش از این دوره، استانداردهایِ توسعهٔ هوشِ مصنوعی بر مبنایِ یک جریانِ خطی استوار بود: آموزشِ عظیم روی پایگاههایِ دادهٔ عمومی، دنبالشده با تنظیمِ دقیق روی مجموعههایِ دادهٔ اختصاصی. اگرچه این روش کارآمد بود، اما هزینههایِ محاسباتی و انسانیِ سنگینی به همراه داشت و کارشناسان برای هر کاربردِ خاص مجبور بودند مدلهایِ موازی و جداگانه مستقر کنند. این رویکرد اغلب با پدیدهٔ فراموشیِ فاجعهبار مواجه میشد؛ حالتی که در آن یادگیریِ یک تسکِ جدید تواناییِ مدل را در وظایفِ قبلی تخریب میکرد.
ورودِ طراحیِ هوشمندانهٔ دستوراتِ متنی به صحنه، این کابوسِ عملیاتی را پایان داد. به جای مدیریتِ چندینِ مدلِ تخصصی، توسعهدهندگان اکنون تنها یک هوشِ مصنوعیِ عمومی و یک مجموعهٔ دستورالعملِ متنی را مدیریت میکردند. این تغییرِ پارادایم، چابکیِ تیمهایِ محصول را به سطحی جدید ارتقا داد و امکانِ پیادهسازیِ سریعِ پروتوتایپها را فراهم کرد.
از آزمونوخطا تا یک علمِ دقیق
مهندسیِ پرامپت در ابتدا به شانس و آزمایشهایِ تصادفی وابسته بود، اما بهسرعت و در سایهٔ کاربردِ گستردهاش نیاز به استانداردسازی آشکار شد. امروزه این رشته فراتر از نوشتنِ یک سؤالِ ساده رفته و شاملِ تکنیکهایی نظیرِ زنجیرهٔ فکر، کالیبراسیونِ مثالها و طراحیِ سیستمهایِ دینامیک میشود. با پالایشِ دستورالعملها برای هدایتِ دقیقترِ الگوریتمهایِ زبانی، متخصصان میتوانند خطایِ مدل را کاهش دهند و خروجیهایِ قابلِ استنادتری برای کاربردهایِ حساسِ تجاری تولید کنند.
جهشِ مقیاس در نسخهٔ سومِ مدلهایِ زبانی ثابت کرد که هوشِ مصنوعی دیگر صرفاً یک ماشینِ پیشبینیِ محض نیست، بلکه ابزاری است که با زبانِ انسان هماهنگ میشود. بهزودی تعاملِ ما با ماشینها از قالبهایِ خشکِ کدنویسی فاصله خواهد گرفت و با روشهایِ طبیعیتر و انعطافپذیرتر ادغام خواهد شد. این بستر، زمینهٔ ظهورِ عاملانِ هوشمندِ خودگردان و سیستمهایِ تصمیمگیرِ تطبیقپذیر را در آیندهٔ نزدیک هموار کرده است.





