ساندار پیچای در ۱۰ اردیبهشت ۱۴۰۲ (۱۰ مه ۲۰۲۳) صحنه کنفرانس Google I/O را وارد کرد و از «مدل زبانی مسیرها ۲» رونمایی کرد؛ مدلی که بیشتر با نام پالم ۲ شناخته می‌شود و قرار بود زیربنای نسل بعدی محصولات مبتنی بر هوش مصنوعی گوگل باشد. گوگل بارد، چت‌بات مکالمه‌ای این شرکت، پیش از اعلام رسمی نیز بی‌سروصدا از قدرت این مدل بهره می‌برد. پالم ۲ به‌عنوان پاسخ مستقیم گوگل به GPT-4 شرکت OpenAI مطرح شد و در قالب بسته‌ای سریع‌تر و کارآمدتر، درک چندزبانه بهتر، توانایی استدلال قوی‌تر و قابلیت‌های پیشرفته‌تر برنامه‌نویسی را یکجا ارائه می‌کند.

از پالم تا پالم ۲؛ تغییر پارادایم در طراحی مدل

مدل اولیه PaLM که در سال ۲۰۲۲ عرضه شد، یک غول ۵۴۰ میلیارد پارامتری بود که در چندین معیار سنجش استدلال به عملکردی پیشرو دست یافت و قابلیت‌هایی نظیر استنتاج منطقی و حتی توضیح لطیفه‌ها را به نمایش گذاشت. اما پالم ۲ مسیر متفاوتی در پیش گرفت.

گوگل طی یک دهه پژوهش در حوزه هوش مصنوعی دریافت که کلیشه «بزرگ‌تر بهتر است» بیش از حد ساده‌انگارانه است و خلاقیت در پژوهش، کلید ساخت مدل‌های قدرتمند محسوب می‌شود. هرچند گوگل تعداد پارامترهای پالم ۲ را فاش نکرده، اما تأکید دارد این مدل در عین کوچک‌تر و سریع‌تر بودن، در طیف گسترده‌ای از معیارها عملکردی به‌مراتب بهتر از نسخه قبلی دارد. بر اساس گزارش فنی پالم ۲، این مدل از معماری مبتنی بر ترنسفورمر بهره می‌برد و با ترکیبی از اهداف آموزشی توسعه یافته است.

معماری و ساختار مدل زبانی پالم ۲ در گوگل

بازنگری در قوانین مقیاس‌گذاری

یکی از کلیدی‌ترین تغییرات فنی پشت پالم ۲، شیوه جدید گوگل در مقیاس‌گذاری مدل است. تیم پژوهشی، قوانین مقیاس‌گذاری را با دقت بررسی کرد تا بهینه‌ترین ترکیب از توان محاسباتی، اندازه مدل و حجم داده را بیابد. نتیجه جالب توجه بود: برای یک بودجه محاسباتی مشخص، اندازه داده و اندازه مدل باید «تقریباً به نسبت ۱ به ۱» رشد کنند. این نتیجه با رویه‌های پیشین تفاوت اساسی داشت، جایی که اندازه مدل با نرخی سه‌برابرِ اندازه داده افزایش می‌یافت. این بازتنظیم، دلیل اصلی توانایی پالم ۲ در ارائه عملکرد بهتر با ابعادی کوچک‌تر و کارآمدتر است.

ترکیب هوشمندانه اهداف آموزشی

پالم اولیه با هدف استاندارد مدل‌سازی زبان و بر مجموعه‌داده‌ای آموزش داده شد که متن انگلیسی در آن غالب بود. پالم ۲ این فرمول را از دو جهت تغییر داد:

  • تنوع زبانی و دامنه‌ای: مجموعه‌داده آموزشی از طیف متنوع‌تری از زبان‌ها و حوزه‌های دانش تشکیل شده است.
  • ترکیب اهداف: به‌جای اتکا به یک هدف واحد برای مدل‌سازی زبان، پالم ۲ با «ترکیبی تنظیم‌شده» از چندین هدف آموزش دیده است که زیربنای عملکرد بهتر آن در چندزبانگی و استدلال محسوب می‌شود.

قابلیت‌های فنی محوری پالم ۲

تسلط بر بیش از ۱۰۰ زبان

پالم ۲ با حجم بسیار بیشتری از متن‌های چندزبانه آموزش دیده و بیش از ۱۰۰ زبان را پوشش می‌دهد. این موضوع توانایی مدل را برای درک، تولید و ترجمه متن‌های ظریف — از جمله اصطلاحات، اشعار و معماها — در طیف گسترده‌ای از زبان‌ها به‌طور چشمگیری بهبود می‌بخشد؛ حوزه‌ای که همواره یکی از دشوارترین چالش‌های پردازش زبان طبیعی بوده است. این مدل در آزمون‌های پیشرفته مهارت زبانی به سطح «تسلط» دست یافته و همین قدرت چندزبانه، عامل اصلی گسترش گوگل بارد به زبان‌های جدید بود.

استدلال و منطق

مجموعه‌داده آموزشی پالم ۲ شامل مقالات علمی و صفحات وبی با عبارات ریاضی است. در نتیجه، این مدل قابلیت‌های چشمگیری در منطق، استدلال عقل سلیم و ریاضیات نشان می‌دهد. پالم ۲ فراتر از تولید صرفِ پاسخ، می‌تواند مراحل استدلال خود را تشریح کند و حتی نمودار ارائه دهد؛ به‌طور مؤثری «روند حل مسئله» را گام‌به‌گام به نمایش می‌گذارد.

توانایی‌های برنامه‌نویسی

پالم ۲ با حجم قابل‌توجهی از مجموعه‌داده‌های کد منبع عمومی، شامل بیش از ۲۰ زبان برنامه‌نویسی، پیش‌آموزش دیده است. این مدل در زبان‌های پرکاربردی مانند پایتون و جاوااسکریپت عملکرد بسیار قوی دارد، اما در زبان‌های تخصصی‌تری مانند پرولوگ، فورتران و Verilog نیز توانایی‌های خود را به نمایش می‌گذارد. این قابلیت‌ها پالم ۲ را به ابزاری ارزشمند برای توسعه‌دهندگان تبدیل کرده و در سرویس‌هایی مانند Google Colab و ابزارهای کمکی برنامه‌نویسی گوگل به‌کار گرفته شده است.

تأثیر پالم ۲ بر اکوسیستم گوگل

فراتر از گوگل بارد، پالم ۲ در طیف گسترده‌ای از محصولات گوگل ادغام شده است. از بهبود قابلیت‌های ترجمه در Google Translate تا پیشرفت‌های مدل پزشکی Med-PaLM 2 و ابزارهای تخصصی امنیت سایبری، این مدل زبانی بزرگ، ستون فقرات استراتژی هوش مصنوعی گوگل را تشکیل می‌دهد. گوگل همچنین نسخه‌های مختلفی از پالم 2 را معرفی کرده تا طیف متنوعی از نیازهای سخت‌افزاری را پوشش دهد.

خانواده‌ای از مدل‌ها برای هر نیاز

گوگل چهار اندازه مختلف از پالم 2 را طراحی کرده است:

  • Gecko: سبک‌ترین نسخه با قابلیت اجرا روی دستگاه‌های موبایل و حتی به‌صورت آفلاین
  • Otter: نسخه متوسط با تعادل بین کارایی و توان محاسباتی
  • Bison: نسخه بزرگ‌تر برای کاربردهای پیشرفته‌تر در سطح سازمانی
  • Unicorn: قدرتمندترین نسخه برای پیچیده‌ترین وظایف پردازشی

این رویکرد ماژولار نشان می‌دهد گوگل به‌جای ساخت یک غول یکپارچه، به سمت توسعه خانواده‌ای از مدل‌ها حرکت کرده که هر کدام برای نیاز خاصی بهینه‌سازی شده‌اند. چنین استراتژی‌ای می‌تواند چالش‌های مربوط به هزینه و مصرف انرژی در استقرار مدل‌های زبانی را به‌طور مؤثری کاهش دهد و دسترسی به توان‌های هوش مصنوعی قدرتمند را حتی روی دستگاه‌های لبه (Edge) ممکن سازد. مسیری که گوگل با پالم ۲ آغاز کرده، می‌تواند الگوی جدیدی برای آینده توسعه مدل‌های زبانی بزرگ ترسیم کند؛ جایی که کارایی و هوشمندی، نه صرفاً حجم، معیار موفقیت خواهد بود.