گروهی از محققان آلمانی به هماهنگی انجمن هوش مصنوعی آلمان (KI Bundesverband) از مدل زبان بزرگ و متنباز Soofi S 30B-A3B رونمایی کردند. این مدل که کاملاً روی زیرساخت ابر هوش مصنوعی صنعتی دویچه تلکام در مونیخ آموزش دیده است، با معماری هیبریدی و مصرف منابع بهینه، توانسته در معیارهای ارزیابی زبان انگلیسی و آلمانی از تمام مدلهای کاملاً باز پیشی بگیرد.
معماری چابک برای زمینههای طولانی

Soofi S یک مدل مخلوطی از متخصصان (Mixture-of-Experts) است. این مدل در مجموع ۳۱.۶ میلیارد پارامتر دارد، اما در هر گام تنها حدود ۳.۲ میلیارد پارامتر فعال میشود، که هزینه محاسباتی آن را به مدلهای ۳ میلیارد پارامتری نزدیک میکند. معماری این مدل برگرفته از Nemotron 3 Nano انویدیا است و ترکیبی از لایههای Mamba-2 و لایههای توجه استاندارد را به کار میگیرد.
تفاوت کلیدی با ترنسفورمرهای معمولی در مدیریت حافظه نهان است. در مدلهای سنتی، حافظه KV Cache با افزایش طول ورودی بهطور خطی رشد میکند و تبدیل به گلوگاه میشود. اما در Soofi S تنها ۶ لایه از ۵۲ لایه چنین حافظهای دارند. نتیجه عملی: در طول زمینه ۴۰,۰۰۰ توکن با ۳۲ درخواست موازی، این مدل حدود ۸ برابر توکن در ثانیه به ازای هر GPU نسبت به مدلهای متراکم ۱۴ تا ۲۴ میلیارد پارامتری تولید میکند. توان عملیاتی از ۴,۰۰۰ تا ۲۵۶,۰۰۰ توکن تقریباً ثابت میماند.
ترکیب آموزشی با محوریت زبان آلمانی

کنسرسیوم حدود ۲۷ تریلیون توکن را در سه فاز پردازش کرده است. فاز اول با ۲۰ تریلیون توکن از وب، کد، ریاضی و متون تخصصی به یادگیری اصول زبان اختصاص دارد. فاز دوم با ۶ تریلیون توکن با کیفیت بالاتر برای تقویت الگوها و فاز سوم برای گسترش پنجره زمینه تا یک میلیون توکن. نکته قابل توجه: سهم زبان آلمانی در فاز اول ۷.۲٪ و در فاز دوم به ۱۵.۳٪ میرسد، در حالی که در دستورالعمل مرجع Nemotron مجموع زبانهای غیرانگلیسی تنها ۵٪ است.
منابع داده شامل متن وب آلمانی از HPLT، پیکره German Commons با مجوز باز، بخشهای آلمانی FinePDFs و FineWiki، و پیکره تجاری Genios با ۱۹۳ میلیون مقاله از ۹۱۶ نشریه آلمانی است. متون ترجمهشده ماشینی و تولیدشده مصنوعی نیز تکمیلکننده این ترکیب هستند.
پیشتازی در معیارهای آلمانی و انگلیسی

در ارزیابیهای انجامشده روی ۱۶ مدل باز دیگر، Soofi S در نمرات تجمعی هر دو زبان از مدلهایی مانند OLMo 3 32B (از مؤسسه AI آلن) و Apertus 70B (از ETH زوریخ و EPFL) پیشی گرفته است. در تمام معیارهای پایه حاکمیتی اروپایی نیز این مدل با اختلاف دو رقمی در صدر قرار دارد.
عملکرد در کدنویسی و ریاضیات

در معیارهای برنامهنویسی، Soofi S در HumanEval به ۷۳.۸٪ و در MBPP به ۷۰.۲٪ دست یافته است. در ریاضیات و دانش عمومی نیز نتایج قابل توجهی ثبت شده است. این موفقیتها نشاندهنده تعادل خوب مدل در زبانهای مختلف و حوزههای تخصصی است.
اهمیت Soofi S برای جامعه هوش مصنوعی اروپا

این مدل نهتنها یک دستاورد فنی است، بلکه گامی مهم در جهت خودکفایی اروپا در حوزه هوش مصنوعی محسوب میشود. با اتکا به زیرساخت بومی و دادههای محلی، Soofi S میتواند الگویی برای توسعه مدلهای زبانی با حاکمیت داده و کارایی بالا باشد. کد و وزنهای مدل به صورت متنباز در دسترس قرار گرفته و محققان میتوانند آن را برای کاربردهای مختلف سفارشیسازی کنند.
برای اطلاعات بیشتر میتوانید به وبسایت انجمن هوش مصنوعی آلمان مراجعه کنید.





