نسل بعدی مدل‌های زبانی بزرگ در دست بازیگران نوظهور

ترنسفورمرها همچنان هستهٔ بسیاری از مدل‌های زبانی بزرگ هستند، اما هزینه‌های محاسباتی و محدودیت پنجرهٔ زمینه چالشی جدی ایجاد کرده که گروهی از استارتاپ‌ها به‌دنبال حل آن‌اند. این شرکت‌ها از روش‌هایی مانند توجه پراکنده، حافظهٔ بازیابی‌شونده و معماری‌های جایگزین استفاده می‌کنند تا مدل‌ها را سریع‌تر، کم‌هزینه‌تر و کاربردی‌تر کنند.

چرا ترنسفورمرها به چالشی بزرگ تبدیل شده‌اند

مکانیزم پایه‌ای ترنسفورمرها یعنی توجه چگال (dense attention) با افزایش طول متن به‌سرعت هزینه‌های محاسباتی و مصرف انرژی را بالا می‌برد. برای مثال پردازش یک سند 10٬000 کلمه‌ای می‌تواند به میلیون‌ها عمل ضرب و جمع نیاز داشته باشد که هزینه‌های سخت‌افزاری و انرژی را افزایش می‌دهد. شرکت‌هایی مانند OpenAI میلیاردها دلار روی محاسبات سرمایه‌گذاری کرده‌اند؛ در نتیجه تغییر در نحوهٔ محاسبهٔ توجه و ذخیرهٔ اطلاعات برای ادامهٔ کارآیی و مقیاس‌پذیری ضروری شده است.

رویکردهای رقیب و نقاط قوت هر کدام

جهش‌های نوآورانه حول چهار محور اصلی شکل می‌گیرند. هر رویکرد مزایا و محدودیت‌های مشخصی دارد و ترکیب آن‌ها می‌تواند نسل بعدی مدل‌ها را بسازد.

1. بازاندیشیِ توجه

توجه پراکنده (sparse attention) محاسبات را فقط روی جفت‌های مهم کلمه اجرا می‌کند نه همهٔ زوج‌ها، بنابراین پیچیدگی و هزینه کاهش می‌یابد. در گذشته برخی پیاده‌سازی‌ها افت دقت نشان داده‌اند، اما شرکت‌هایی مانند Subquadratic و Manifest AI مکانیزم‌هایی معرفی کرده‌اند که در وظایفی مانند جست‌وجو و کدنویسی عملکردی رقابتی ارائه می‌دهند.

  • مزایا: کاهش چشمگیر محاسبات، مناسب برای متن‌های طولانی.
  • محدودیت‌ها: احتمال از دست رفتن ارتباطات ظریف در متن و نیاز به تنظیم دقیق برای حفظ دقت.

2. حافظه و بازیابی (Retrieval & Memory)

به‌جای افزایش نامحدود پنجرهٔ زمینه، افزودن لایه‌های حافظهٔ خارجی یا اتصال به پایگاه دانش راه‌حل دیگری است. مدل تنها بخش‌های مرتبط را بازیابی می‌کند و بدین‌ترتیب محاسبات و نیاز به نگهداری اطلاعات داخلی کاهش می‌یابد.

  • مزایا: امکان به‌روزرسانی سریع دانش، کاهش هزینهٔ استنتاج، مناسب برای محیط‌های داده‌محور.
  • محدودیت‌ها: پیچیدگی سیستم بازیابی، نیاز به فشرده‌سازی و نمایه‌سازی کارآمد.
نمونه‌ای از معماری‌های جایگزین برای مدل‌های زبانی

3. معماری‌های جایگزین و حالات خطی

گروهی از پژوهش‌ها به‌دنبال جایگزینی کامل یا جزئی ترنسفورمر با ساختارهای سبک‌تر هستند: مدل‌های مبتنی بر فضاهای حالت مانند S4، روش‌های خطی‌سازی توجه و شبکه‌های MLP یا معماری‌های هیبریدی. این روش‌ها وعدهٔ کاهش پیچیدگی از O(n^2) به O(n) یا O(n log n) را داده‌اند که برای متن‌های طولانی بسیار مؤثر است.

  • مزایا: کاهش شدید مصرف حافظه و زمان اجرا، مناسب برای مقیاس‌بندی روی متن‌های طولانی.
  • محدودیت‌ها: نیاز به ارزیابی دوبارهٔ قابلیت‌های استدلال و تطابق با وظایف متنوع.

4. همگرایی سخت‌افزار و نرم‌افزار

هماهنگ‌سازی طراحی معماری مدل با بهینه‌سازی‌های سخت‌افزاری و کتابخانه‌های اختصاصی می‌تواند بهره‌وری را بالا ببرد. همکاری میان استارتاپ‌های الگوریتمی و تولیدکنندگان سخت‌افزار، از طراحی تراشهٔ سفارشی تا بهینه‌سازی در سطح اجرا، به کاهش مصرف انرژی و هزینه‌های عملیاتی کمک می‌کند.

استارتاپ‌ها کجا سرمایه‌گذاری می‌کنند؟

برخی شرکت‌ها بر یک قطعهٔ مشخص تمرکز می‌کنند—مثلاً افزایش پنجرهٔ زمینه، کاهش هزینهٔ استنتاج یا بهبود حافظهٔ بلندمدت—درحالی‌که دیگران محصولاتی ترکیبی عرضه می‌کنند. ریسک فنی و تجاری بالا است، اما موفقیت می‌تواند جایگاه استراتژیک در زنجیرهٔ ارزش مدل‌های زبانی و کاهش چشمگیر هزینه‌های عملیاتی برای سازمان‌ها به همراه داشته باشد.

پیامدها برای توسعه‌دهندگان و کسب‌وکارها

  • کاهش هزینهٔ پردازش، دسترسی شرکت‌های کوچک به مدل‌های بزرگ را آسان‌تر می‌کند.
  • مدل‌هایی که می‌توانند حجم بیشتری از اسناد یا کد را در یک بار پردازش کنند، کاربردهای حقوقی، پژوهشی و مهندسی را متحول می‌کنند.
  • ترکیب حافظهٔ خارجی و بازیابی، امکان به‌روزرسانی سریع‌تر دانش و کاهش خطر اطلاعات منسوخ را فراهم می‌آورد.

چه آینده‌ای محتمل است؟

ترنسفورمرها احتمالاً برای مدتی محور باقی می‌مانند، اما رقابت بر سر کارآمدسازی و افزودن قابلیت‌های جدید در حال تغییر قواعد بازی است. در چند سال آینده انتظار می‌رود ابزارهای هیبریدی و معماری‌های جایگزین به‌تدریج وارد محصولات تجاری شوند و توانایی مدل‌ها را در مسائل استدلال بلندمدت و مدیریت دانش سازمانی بهبود بخشند. دنبال‌کردن پیشرفت این استارتاپ‌ها فرصتی برای دسترسی زودهنگام به راه‌حل‌های کم‌هزینه‌تر و مقیاس‌پذیر فراهم می‌کند.

منبع مرتبط: برای مطالعهٔ بیشتر دربارهٔ ترنسفورمرها و تاریخچهٔ آن‌ها، صفحهٔ ویکی‌پدیا مربوطه مفید است: Transformer (machine learning).