شرکت Mistral AI در دسامبر 2023 با عرضه مدل Mixtral 8x7B ثابت کرد که برای رقابت با غولهای هوش مصنوعی، نیازی به افزایش بیرویه مقیاس نیست. این مدل نشان داد که معماری تنک ترکیب متخصصان (SMoE) میتواند عملکردی همسطح یا حتی بهتر از مدلهایی با 5 برابر اندازه مؤثر داشته باشد، آن هم با مصرف کسری از توان محاسباتی در هر گذر رو به جلو. Mixtral نخستین مدل MoE با وزنهای باز بود که بهطور گسترده در دسترس قرار گرفت و امکان دانلود، استقرار و ریزتنظیم سالها پژوهش روی محاسبات شرطی را برای توسعهدهندگان فراهم کرد.
چالشی که Mixtral پشت سر گذاشت
طراحی مدلهای زبانی بزرگ همواره با یک دوگانگی اساسی مواجه است: مدلهای بزرگتر عملکرد بهتری دارند، اما هزینه اجرای آنها نیز به همان نسبت بالا میرود. اجرای یک مدل 70 میلیارد پارامتری تقریباً 5 برابر گرانتر از یک مدل 13 میلیارد پارامتری است، در حالی که کاربران کیفیت مدل 70 میلیاردی را با هزینه 13 میلیاردی میخواهند. مقیاسدهی متراکم مرسوم راه گریزی از این وضعیت ندارد و دو برابر کردن پارامترها، هزینه استنتاج را نیز دو برابر میکند.
معماریهای تنک این رابطه را با ذخیره پارامترهای بیشتر از آنچه محاسبه میکنند، میشکنند. مانند کتابخانهای بزرگ که برای پاسخ به یک پرسش، بهجای خواندن همه کتابها، تنها دو کتاب مرتبطتر را مطالعه میکنید. دانش کتابهای نخوانده همچنان در دسترس است، اما تنها هزینه بازیابی اطلاعات واقعی پرداخت میشود. این جوهره طراحی Mixtral است.
ترکیب متخصصان چیست؟
در مدلهای ترنسفورمر، ترکیب متخصصان (MoE) از دو بخش اصلی تشکیل میشود:
- لایههای تنک MoE: جایگزین لایههای متراکم شبکه پیشخور (FFN) در ترنسفورمرهای استاندارد میشوند. هر لایه MoE شامل چندین متخصص است (در Mixtral هشت متخصص) که هرکدام خود یک شبکه عصبی هستند. این متخصصان عموماً FFN هستند، اما میتوانند ساختارهای پیچیدهتر یا حتی خودشان یک MoE باشند و MoEهای سلسلهمراتبی را بسازند.
- شبکه دروازهای یا روتر: تعیین میکند هر توکن به کدام متخصص ارسال شود. روتر از پارامترهای یادگرفتنی تشکیل شده و در کنار سایر بخشهای شبکه پیشآموزش میبیند. نحوه مسیریابی توکنها حیاتیترین تصمیم طراحی در هر سامانه MoE است.
کالبدشکافی معماری Mixtral
پایهگذاری بر مدل Mistral 7B
معماری Mixtral کاملاً شبیه به Mistral 7B است، با یک تفاوت بنیادین: هر لایه بهجای یک FFN متراکم، از هشت بلوک پیشخور (متخصص) تشکیل شده است. Mixtral تمام اجزای Mistral 7B که بر کارایی تمرکز دارند را در لایههای توجه (Attention) حفظ میکند. این شامل توجه پنجرهای لغزان برای متنهای طولانی، توجه پرسوجوی گروهبندیشده (GQA) برای استنتاج سریعتر و RoPE برای کدگذاری موقعیت میشود.
این تفکیک بازتابدهنده یک بینش معماری مهم است: سازوکار توجه استدلال در سطح توالی و مسیریابی اطلاعات را بر عهده دارد، در حالی که لایههای پیشخور بهعنوان مخزن دانش و موتور تبدیل ویژگیها عمل میکنند. توجه مانند حافظه کاری و FFN مانند حافظه بلندمدت رفتار میکند. Mixtral با تنک کردن فقط لایههای FFN، یکپارچگی توالی در توجه را حفظ کرده و از مزیت محاسبات شرطی در بخشهای دانشمحور بهره میگیرد.
هشت متخصص و مسیریابی Top-2
در هر لایه و برای هر توکن، شبکه روتر دو متخصص از میان هشت متخصص را برای پردازش انتخاب کرده و خروجی آنها را ترکیب میکند. نکته کلیدی این است که توکنهای مختلف در یک جمله میتوانند به متخصصان متفاوتی اختصاص یابند. این یعنی مدل میتواند بهصورت پویا بر اساس نیاز هر توکن، منابع خود را تخصیص دهد. با استفاده از مسیریابی Top-2، Mixtral توازنی میان تنوع و تخصصگرایی ایجاد میکند تا هم دقت بالا برود و هم هزینه محاسبات کنترل شود.
محاسبات پارامترها در Mixtral
مدل Mixtral 8x7B حدود 46.7 میلیارد پارامتر دارد، اما در هر توکن تنها 12.9 میلیارد پارامتر فعال میشود. این عدد نزدیک به یک مدل 13 میلیارد پارامتری است. یعنی از نظر سرعت استنتاج، Mixtral مانند یک مدل 13 میلیاردی عمل میکند، اما از نظر گنجایش دانش و کیفیت، با مدلهای بسیار بزرگتر رقابت میکند.
نتایج بنچمارکها و عملکرد
Mixtral در بسیاری از بنچمارکهای استاندارد، از جمله درک مطلب، ریاضیات و تولید کد، از Llama 2 70B عملکرد بهتری نشان داد. این موفقیت نشان میدهد که استفاده از متخصصان به جای یک شبکه متراکم یکپارچه، میتواند بهبود چشمگیری در بهینهسازی هزینه و سرعت ایجاد کند.
بدهبستانهای عملی
با وجود مزایا، استقرار مدلهای MoE چالشهای خاص خود را دارد. حافظه مورد نیاز برای بارگذاری 46.7 میلیارد پارامتر در حافظه تصویری (VRAM) همچنان بالاست، حتی اگر در هر لحظه فقط بخشی از آنها محاسبه شوند. همچنین مدیریت بارگذاری و تخلیه متخصصان از حافظه (Offloading) نیازمند مهندسی دقیق است تا گلوگاههای ناشی از پهنای باند حافظه به حداقل برسد.
آینده مدلهای زبانی وابسته به توسعه بیشتر معماریهای مبتنی بر ترکیب متخصصان است. با افزایش تقاضا برای مدلهای کارآمد و مقیاسپذیر، رویکردی که Mixtral اثبات کرد میتواند مسیر را برای مدلهایی هموار کند که بدون نیاز به زیرساختهای عظیم، هوش مصنوعی پیشرفته را به دست کاربران برسانند.





