مبانیِ معماری و سیستمِ Pathways

نسخهٔ اولیهٔ PaLM یک تغییرِ پارادایمِ واقعی در ساخت و آموزشِ مدل‌های زبانیِ بزرگ بود. گوگل با بهره‌گیری از زیرساخت‌های قدرتمندِ TPU نسلِ ۴ و معماریِ Pathways، مرزهایِ مقیاس‌پذیری را جابجا کرد. ایدهٔ مرکزیِ این سیستم آموزشِ توزیع‌شده و استفاده از روش‌های محاسباتیِ تنک (Sparse) بود که اجازه داد مدل بدونِ هدررفتِ منابعِ محاسباتی، روی وظایفِ متنوع از پردازشِ زبانِ طبیعی تا کدنویسی پیشرفت کند. پایهٔ این معماری بر ترانسفورمرها استوار است؛ همان معماریِ بنیادینی که در مقالهٔ معروفِ «Attention Is All You Need» معرفی شد و اساسِ ساختِ شبکه‌های عصبیِ مدرن را بنا نهاد.

رویکردِ مقیاس‌پذیریِ PaLM مستقیماً از پژوهش‌های پیشین در زمینهٔ مسیریابیِ ترکیبِ متخصصان (Mixture-of-Experts) الهام گرفته بود. این شیوه به سیستم اجازه می‌دهد تا در هر گامِ محاسباتی تنها بخش‌هایِ تخصصیِ شبکهٔ عصبی را فعال کند. همین مکانیزم باعث می‌شود سرعتِ یادگیری و بازدهیِ مدل به‌طرزِ چشمگیری افزایش یابد، بدونِ آن‌که حجمِ داده‌ها و زمانِ آموزش به‌شکلِ نامتناسبی بالا برود.

معماری شبکه عصبی و سیستم Pathways گوگل

تغییرِ فلسفهٔ مقیاس‌پذیری در توسعهٔ مدل‌ها

تجربهٔ بیش از یک‌دههٔ گوگل در توسعهٔ شبکه‌های عصبی نشان داد که بزرگ‌تر کردنِ صرفِ مدل‌ها پاسخگویِ چالش‌هایِ واقعی نیست. یافته‌هایِ کلیدی نشان داد که خلاقیت در مهندسیِ معماری و بهینه‌سازیِ فرآیندِ آموزش، عواملِ تعیین‌کنندهٔ اصلی‌اند. این شناخت منجر به توسعهٔ روش‌هایِ آموزشِ کم‌هزینه‌تر و دقیق‌تر شد. تیمِ تحقیقاتی با ادغامِ مکانیزم‌هایِ بازخوردِ انسانی و رویکردهایِ چندوجهی (Multimodality)، بلوک‌هایِ سازنده‌ای پدید آورد که به مدل‌هایِ زبانیِ امروز اجازه می‌دهد نه‌تنها درکِ عمیق‌تری از متن داشته باشند، بلکه خروجیِ قابل‌پیش‌بینی‌تری برای کاربردهایِ صنعتی و روزمره ارائه کنند.

نسلِ بعدی: ویژگی‌هایِ کلیدیِ PaLM 2

در ادامهٔ این مسیر، گوگل مدلِ PaLM 2 را رونمایی کرد. این مدل با عبور از محدودیت‌هایِ نسلِ اول، جهشی قابلِ توجه را در سه حوزهٔ اصلی ایجاد کرده است. بر اساسِ مستنداتِ فنیِ منتشرشده در گزارشِ رسمیِ PaLM 2، این مدل با تلفیقِ چندین هدفِ آموزشی (Multi-objective training) توانسته تعادلی نو میانِ کاراییِ محاسباتی و دقتِ خروجی برقرار کند.

ظرفیتِ چندزبانه فراتر از تصور

یکی از نقاطِ عطفِ PaLM 2، آموزشِ گسترده برِ رویِ داده‌هایِ بیش از ۱۰۰ زبانِ مختلف است. این مدل قادر است با درکِ عمیقِ مفاهیمِ فرهنگی و زبانی، متونِ پیچیده، اصطلاحاتِ خاص، اشعار و حتی معماها را در زبان‌هایِ گوناگون به‌دقت تولید و ترجمه کند. عملکردِ این مدل تا آن‌چنان دقیق است که در آزمون‌هایِ استانداردِ سنجشِ سطحِ زبان، به سطحِ تسلطِ بالا دست یافته است.

نمایش قدرت استدلال و پردازش زبان در مدل PaLM 2

استدلالِ منطقی و ریاضیِ بهبود‌یافته

دیتاست‌هایِ به‌روزِ PaLM 2 شاملِ منابعِ علمیِ معتبر، مقالاتِ پژوهشی و محتوایِ وب‌سایت‌هایِ تخصصی با فرمول‌هایِ ریاضی است. این غنی‌سازیِ داده‌ها، استدلالِ منطقی، منطقِ عمومی و حلِ مسائلِ ریاضی را به سطحی برده که در نسل‌هایِ قبل کمتر دیده می‌شد. ترکیبِ این قابلیت‌ها با معماریِ بهینه، مدل را برای کاربردهایِ پیچیده از تحلیلِ داده تا پشتیبانیِ فنی آماده کرده است. آیندهٔ توسعهٔ مدل‌هایِ زبانی به‌سمتِ معماری‌هایی سبک‌تر، هوشمندتر و همگرا با نیازهایِ واقعیِ روزافزون است و این دستاوردها تنها آغازِ مسیرِ تبدیلِ ایده‌هایِ پژوهشی به ابزارهایِ کاربردی در اکوسیستمِ جهانی محسوب می‌شوند.