مبانیِ معماری و سیستمِ Pathways
نسخهٔ اولیهٔ PaLM یک تغییرِ پارادایمِ واقعی در ساخت و آموزشِ مدلهای زبانیِ بزرگ بود. گوگل با بهرهگیری از زیرساختهای قدرتمندِ TPU نسلِ ۴ و معماریِ Pathways، مرزهایِ مقیاسپذیری را جابجا کرد. ایدهٔ مرکزیِ این سیستم آموزشِ توزیعشده و استفاده از روشهای محاسباتیِ تنک (Sparse) بود که اجازه داد مدل بدونِ هدررفتِ منابعِ محاسباتی، روی وظایفِ متنوع از پردازشِ زبانِ طبیعی تا کدنویسی پیشرفت کند. پایهٔ این معماری بر ترانسفورمرها استوار است؛ همان معماریِ بنیادینی که در مقالهٔ معروفِ «Attention Is All You Need» معرفی شد و اساسِ ساختِ شبکههای عصبیِ مدرن را بنا نهاد.
رویکردِ مقیاسپذیریِ PaLM مستقیماً از پژوهشهای پیشین در زمینهٔ مسیریابیِ ترکیبِ متخصصان (Mixture-of-Experts) الهام گرفته بود. این شیوه به سیستم اجازه میدهد تا در هر گامِ محاسباتی تنها بخشهایِ تخصصیِ شبکهٔ عصبی را فعال کند. همین مکانیزم باعث میشود سرعتِ یادگیری و بازدهیِ مدل بهطرزِ چشمگیری افزایش یابد، بدونِ آنکه حجمِ دادهها و زمانِ آموزش بهشکلِ نامتناسبی بالا برود.
تغییرِ فلسفهٔ مقیاسپذیری در توسعهٔ مدلها
تجربهٔ بیش از یکدههٔ گوگل در توسعهٔ شبکههای عصبی نشان داد که بزرگتر کردنِ صرفِ مدلها پاسخگویِ چالشهایِ واقعی نیست. یافتههایِ کلیدی نشان داد که خلاقیت در مهندسیِ معماری و بهینهسازیِ فرآیندِ آموزش، عواملِ تعیینکنندهٔ اصلیاند. این شناخت منجر به توسعهٔ روشهایِ آموزشِ کمهزینهتر و دقیقتر شد. تیمِ تحقیقاتی با ادغامِ مکانیزمهایِ بازخوردِ انسانی و رویکردهایِ چندوجهی (Multimodality)، بلوکهایِ سازندهای پدید آورد که به مدلهایِ زبانیِ امروز اجازه میدهد نهتنها درکِ عمیقتری از متن داشته باشند، بلکه خروجیِ قابلپیشبینیتری برای کاربردهایِ صنعتی و روزمره ارائه کنند.
نسلِ بعدی: ویژگیهایِ کلیدیِ PaLM 2
در ادامهٔ این مسیر، گوگل مدلِ PaLM 2 را رونمایی کرد. این مدل با عبور از محدودیتهایِ نسلِ اول، جهشی قابلِ توجه را در سه حوزهٔ اصلی ایجاد کرده است. بر اساسِ مستنداتِ فنیِ منتشرشده در گزارشِ رسمیِ PaLM 2، این مدل با تلفیقِ چندین هدفِ آموزشی (Multi-objective training) توانسته تعادلی نو میانِ کاراییِ محاسباتی و دقتِ خروجی برقرار کند.
ظرفیتِ چندزبانه فراتر از تصور
یکی از نقاطِ عطفِ PaLM 2، آموزشِ گسترده برِ رویِ دادههایِ بیش از ۱۰۰ زبانِ مختلف است. این مدل قادر است با درکِ عمیقِ مفاهیمِ فرهنگی و زبانی، متونِ پیچیده، اصطلاحاتِ خاص، اشعار و حتی معماها را در زبانهایِ گوناگون بهدقت تولید و ترجمه کند. عملکردِ این مدل تا آنچنان دقیق است که در آزمونهایِ استانداردِ سنجشِ سطحِ زبان، به سطحِ تسلطِ بالا دست یافته است.
استدلالِ منطقی و ریاضیِ بهبودیافته
دیتاستهایِ بهروزِ PaLM 2 شاملِ منابعِ علمیِ معتبر، مقالاتِ پژوهشی و محتوایِ وبسایتهایِ تخصصی با فرمولهایِ ریاضی است. این غنیسازیِ دادهها، استدلالِ منطقی، منطقِ عمومی و حلِ مسائلِ ریاضی را به سطحی برده که در نسلهایِ قبل کمتر دیده میشد. ترکیبِ این قابلیتها با معماریِ بهینه، مدل را برای کاربردهایِ پیچیده از تحلیلِ داده تا پشتیبانیِ فنی آماده کرده است. آیندهٔ توسعهٔ مدلهایِ زبانی بهسمتِ معماریهایی سبکتر، هوشمندتر و همگرا با نیازهایِ واقعیِ روزافزون است و این دستاوردها تنها آغازِ مسیرِ تبدیلِ ایدههایِ پژوهشی به ابزارهایِ کاربردی در اکوسیستمِ جهانی محسوب میشوند.





