یکی از مهم‌ترین گره‌های کور در توسعه هوش مصنوعی این پرسش است: زمانی که یک بودجه محاسباتی ثابت در اختیار داریم، چگونه باید آن را میان اندازه مدل و داده‌های آموزشی تقسیم کنیم؟ دو پژوهش تاریخی در این حوزه، پاسخ‌های کاملاً متضادی ارائه دادند و همین تضاد، تصمیمات مربوط به آموزش مدل‌های زبانی بزرگ (LLM) با ارزش میلیاردها دلار را در سال‌های اخیر شکل داد.

دو مطالعه مشهور با عناوین «کاپلان» (Kaplan) و «چینچیلا» (Chinchilla) مسیر متفاوتی را پیشنهاد دادند. اکنون، پژوهش‌های جدیدی ریشه این اختلاف علمی را کشف کرده و نشان می‌دهند که چگونه یک خطای محاسباتی در مقیاس کوچک، منجر به هدررفت ظرفیت عظیمی از پردازش و انرژی در مراکز داده شد.

نمودار مقایسه مدل‌های زبانی بزرگ و قوانین مقیاس‌پذیری

قانون اولیه مقیاس‌پذیری و_on_us=تاکید بر مدل‌های غول‌پیکر

قوانین مقیاس‌پذیری (Scaling Laws) روابطی تجربی و نظری هستند که افت عملکرد یا همان تست لاس (Test Loss) در شبکه‌های عصبی را نسبت به تعداد پارامترها، حجم داده‌ها و توان محاسباتی پیش‌بینی می‌کنند. این فرمول‌ها به مهندسان کمک می‌کنند تا برای بالابردن کارایی، منابع را به درستی بین ابعاد سخت‌افزاری و داده‌های آموزشی تقسیم کنند.

در سال 2020، تیم تحقیقاتی به سرپرستی «جردن کاپلان» در اوپن‌ای‌آی (OpenAI) نشان داد که در معماری ترنسفورمر (Transformer)، میزان خطا با افزایش تعداد پارامترها و توکن‌های آموزشی مطابق یک قانون توانی کاهش می‌یابد. بر اساس تحلیل تیم کاپلان، در یک محیط با توان پردازشی ثابت (C)، اندازه بهینه مدل باید با توان 0.73 (N_optimal ∝ C^0.73) رشد کند.

این کشف به یک باور غلط اما تأثیرگذار در صنعت منجر شد: «مدل‌های بزرگ بسیار مهم‌تر از داده‌های بزرگ هستند.» در نتیجه این دیدگاه، توسعه‌دهندگان مدل‌های زبانی بزرگ در سال‌های پس از آن، سرمایه و توان پردازشی بیشتری را صرف افزایش سایز شبکه‌های عصبی کردند تا کیفیت داده‌ها.

تغییر مسیر با مدل چینچیلا و قانون تقسیم ۵۰:۵۰

تنها دو سال بعد، در سال 2022، تیمی از دیپ‌مایند (DeepMind) به سرپرگری «جردن هافمن» با ارائه پژوهشی با نام رمز «چینچیلا»، ضرایب معادله کاپلان را به چالش کشید. این تیم با گسترش دامنه آزمایش‌ها و در نظر گرفتن کل پارامترهای مدل (از جمله لایه‌های تعبیه‌سازی یا Embedding Layers)، به عدد کاملاً متفاوتی رسیدند.

نمودار مقایسه آموزش مدل‌های هوش مصنوعی

بر اساس مدل چینچیلا، تخصیص بهینه توان محاسباتی معادل N_optimal ∝ C^0.50 بود. این یعنی بهترین نتیجه زمانی حاصل می‌شود که رشد مدل و افزایش حجم داده‌ها به شکلی کاملاً متوازن و با نسبت «۵۰:۵۰» پیش بروند. نتیجه‌گیری دیپ‌مایند کاملاً صریح بود:

«برای بسیاری از مدل‌های زبانی بزرگ کنونی، به جای ساختن مدل‌های غول‌پیکر، باید از مدل‌های کوچک‌تری استفاده می‌شد و آن‌ها را با تعداد توکن‌های بسیار بیشتری آموزش می‌دادیم تا بتوان به بهترین عملکرد ممکن رسید.»

این کشف باعث شد تا چرخه توسعه هوش مصنوعی وارد فاز جدیدی شود و اکنون کیفیت و حجم دیتاسِت‌ها بیش از پیش به عنوان یک اصل حیاتی در آموزش مدل‌های پایه به شمار می‌رود.

ریشه اختلاف میان C^0.73 و C^0.50 چه بود؟

این اختلاف نظر میان ضرایب صرفاً یک بحث تئوری در میز کار محققان نبود. اتکای نادرست به نتایج پژوهش کاپلان باعث شد تا حجم عظیمی از توان پردازش گرافیکی (GPU)، انرژی الکتریکی و میلیاردها دلار سرمایه به شکلی ناکارآمد صرف ساختن مدل‌هایی شود که می‌توانستند با اندازه‌ای کوچک‌تر و داده‌های بیشتر، عملکردی بسیار بهتری ارائه دهند.

مقاله‌ای علمی در سال 2024 با عنوان «تطبیق قوانین مقیاس‌پذیری کاپلان و چینچیلا» (Reconciling Kaplan and Chinchilla Scaling Laws) دلیل اصلی این اختلاف فاحش را کشف کرد. تیم پژوهشی دریافت که اختلاف برآورد دو تیم، ناشی از دو اشتباه در متدولوژی پژوهش کاپلان بوده است:

  • روش شمارش پارامترها: در پژوهش کاپلان، لایه‌های خطی مربوط به تعبیه واژگان و موقعیت‌ها (Non-Embedding Parameters) از محاسبات حذف شده بودند؛ در حالی که دیپ‌مایند (چینچیلا) کل پارامترهای مدل را در نظر گرفت.
  • مقیاس کوچک آزمایش‌ها: داده‌های تیم کاپلان روی مدل‌های نسبتاً کوچک (بین 768 میلیون تا 1.5 میلیارد پارامتر) استخراج شده بود. نکته کلیدی اینجاست که در مدل‌های بسیار بزرگ، سهم لایه‌های تعبیه‌سازی در کل پارامترها و هزینه محاسباتی ناچیز می‌شود. اما در مقیاس‌های کوچک، حذف این لایه‌ها منجر به تحریف شدید فرمول‌های پیش‌بینی‌کننده می‌شود.

همین خطای محاسباتی در مقیاس کوچک، باعث شد تا فرمول نهایی به اشتباه طرفدار مدل‌های بزرگ‌تر و غول‌پیکر باشد. درک این موضوع نشان می‌دهد که توسعه و آموزش مدل‌های زبانی تنها به سخت‌افزار وافزار قدرتمند نیست، بلکه نیازمند دقت ریاضی در متدولوژی تخصیص منابع است.