گروهی از محققان آلمانی به هماهنگی انجمن هوش مصنوعی آلمان (KI Bundesverband) از مدل زبان بزرگ و متن‌باز Soofi S 30B-A3B رونمایی کردند. این مدل که کاملاً روی زیرساخت ابر هوش مصنوعی صنعتی دویچه تلکام در مونیخ آموزش دیده است، با معماری هیبریدی و مصرف منابع بهینه، توانسته در معیارهای ارزیابی زبان انگلیسی و آلمانی از تمام مدل‌های کاملاً باز پیشی بگیرد.

معماری چابک برای زمینه‌های طولانی

نمودار معماری مدل Soofi S با لایه‌های Mamba و Attention

Soofi S یک مدل مخلوطی از متخصصان (Mixture-of-Experts) است. این مدل در مجموع ۳۱.۶ میلیارد پارامتر دارد، اما در هر گام تنها حدود ۳.۲ میلیارد پارامتر فعال می‌شود، که هزینه محاسباتی آن را به مدل‌های ۳ میلیارد پارامتری نزدیک می‌کند. معماری این مدل برگرفته از Nemotron 3 Nano انویدیا است و ترکیبی از لایه‌های Mamba-2 و لایه‌های توجه استاندارد را به کار می‌گیرد.

تفاوت کلیدی با ترنسفورمرهای معمولی در مدیریت حافظه نهان است. در مدل‌های سنتی، حافظه KV Cache با افزایش طول ورودی به‌طور خطی رشد می‌کند و تبدیل به گلوگاه می‌شود. اما در Soofi S تنها ۶ لایه از ۵۲ لایه چنین حافظه‌ای دارند. نتیجه عملی: در طول زمینه ۴۰,۰۰۰ توکن با ۳۲ درخواست موازی، این مدل حدود ۸ برابر توکن در ثانیه به ازای هر GPU نسبت به مدل‌های متراکم ۱۴ تا ۲۴ میلیارد پارامتری تولید می‌کند. توان عملیاتی از ۴,۰۰۰ تا ۲۵۶,۰۰۰ توکن تقریباً ثابت می‌ماند.

ترکیب آموزشی با محوریت زبان آلمانی

نمودار توزیع داده‌های آموزشی مدل Soofi S با سهم بالای آلمانی

کنسرسیوم حدود ۲۷ تریلیون توکن را در سه فاز پردازش کرده است. فاز اول با ۲۰ تریلیون توکن از وب، کد، ریاضی و متون تخصصی به یادگیری اصول زبان اختصاص دارد. فاز دوم با ۶ تریلیون توکن با کیفیت بالاتر برای تقویت الگوها و فاز سوم برای گسترش پنجره زمینه تا یک میلیون توکن. نکته قابل توجه: سهم زبان آلمانی در فاز اول ۷.۲٪ و در فاز دوم به ۱۵.۳٪ می‌رسد، در حالی که در دستورالعمل مرجع Nemotron مجموع زبان‌های غیرانگلیسی تنها ۵٪ است.

منابع داده شامل متن وب آلمانی از HPLT، پیکره German Commons با مجوز باز، بخش‌های آلمانی FinePDFs و FineWiki، و پیکره تجاری Genios با ۱۹۳ میلیون مقاله از ۹۱۶ نشریه آلمانی است. متون ترجمه‌شده ماشینی و تولیدشده مصنوعی نیز تکمیل‌کننده این ترکیب هستند.

پیشتازی در معیارهای آلمانی و انگلیسی

مقایسه امتیازات Soofi S با سایر مدل‌های باز در معیارهای آلمانی و انگلیسی

در ارزیابی‌های انجام‌شده روی ۱۶ مدل باز دیگر، Soofi S در نمرات تجمعی هر دو زبان از مدل‌هایی مانند OLMo 3 32B (از مؤسسه AI آلن) و Apertus 70B (از ETH زوریخ و EPFL) پیشی گرفته است. در تمام معیارهای پایه حاکمیتی اروپایی نیز این مدل با اختلاف دو رقمی در صدر قرار دارد.

عملکرد در کدنویسی و ریاضیات

نتایج Soofi S در معیارهای کدنویسی HumanEval و MBPP

در معیارهای برنامه‌نویسی، Soofi S در HumanEval به ۷۳.۸٪ و در MBPP به ۷۰.۲٪ دست یافته است. در ریاضیات و دانش عمومی نیز نتایج قابل توجهی ثبت شده است. این موفقیت‌ها نشان‌دهنده تعادل خوب مدل در زبان‌های مختلف و حوزه‌های تخصصی است.

اهمیت Soofi S برای جامعه هوش مصنوعی اروپا

لوگوی دویچه تلکام و KI Bundesverband در کنار مدل Soofi S

این مدل نه‌تنها یک دستاورد فنی است، بلکه گامی مهم در جهت خودکفایی اروپا در حوزه هوش مصنوعی محسوب می‌شود. با اتکا به زیرساخت بومی و داده‌های محلی، Soofi S می‌تواند الگویی برای توسعه مدل‌های زبانی با حاکمیت داده و کارایی بالا باشد. کد و وزن‌های مدل به صورت متن‌باز در دسترس قرار گرفته و محققان می‌توانند آن را برای کاربردهای مختلف سفارشی‌سازی کنند.

برای اطلاعات بیشتر می‌توانید به وب‌سایت انجمن هوش مصنوعی آلمان مراجعه کنید.