Shieldstral؛ مدل 3 میلیارد پارامتری که قواعد ایمنی را بازنویسی می‌کند

Shieldstral، مدل 3 میلیارد پارامتری شرکت فرانسوی Mistral، در بنچ‌مارک‌های استاندارد ایمنی متن توانست با مدل‌هایی که تا هفت برابر بزرگ‌ترند رقابت کند و در دسته‌بندی متن-تصویر رکورد جدیدی ثبت کند.

پرسش‌های بله/خیر به‌جای طبقه‌بندی‌های از پیش تعیین‌شده

به‌جای تکیه بر دسته‌بندی‌های ایمنی ثابت، Shieldstral به اپراتورها امکان می‌دهد معیارهای پالایش را به‌صورت پرسش‌های زبان ساده و در زمان اجرا تعریف کنند؛ پرسش‌هایی مانند «آیا این محتوا ترویج خشونت می‌کند؟». مدل به‌صورت تک‌کلمه‌ای («بله» یا «خیر») پاسخ می‌دهد و با تبدیل احتمال پاسخ‌ها، نمره‌ای بین 0 و 1 برای هر معیار تولید می‌کند. این روش تطبیق سریع‌تر با موارد استفادهٔ مختلف—از سرویس‌های امنیت سایبری تا پلتفرم‌های سلامت روان—را ممکن می‌سازد.

صفحه نتایج بنچ‌مارک Shieldstral در برابر مدل‌های بزرگ

روش آموزش و نقش داده‌های مصنوعی

تیم توسعه‌دهنده حدود 54.1 میلیون نمونه شامل موارد مرتبط با ایمنی، محتوای مضر و تلاش‌های دستکاری را در یک فرمت یکپارچه جمع‌آوری کرد. برای برخی داده‌ها، استانداردهای سخت‌گیرانه‌تر اعمال شد و برای مجموعه‌های عمومی‌تر، معیارهای متوسط به‌کار رفت. به‌منظور آموزش تفکیک‌های ظریف‌تر، متن‌های امن توسط یک مدل دیگر به واریانت‌های ناامن بازنویسی شدند تا نمونه‌های مشابه اما متفاوت ایجاد شود؛ این کار به مدل اجازه می‌دهد مرزهای نزدیک بین «امن» و «ناامن» را بیاموزد، نه فقط حکم کلی صادر کند.

نتایج بنچ‌مارک‌ها

Shieldstral در بنچ‌مارک‌های متن امتیاز F1 معادل 84.9 ثبت کرد؛ رقمی که با GPT-OSS-Safeguard-20B (تقریباً هفت برابر بزرگ‌تر) برابر است و از مدل‌هایی مانند Qwen3Guard-8B و Nemotron-3.5-Safety-4B پیشی می‌گیرد. در آزمون‌های متن-تصویر نیز Shieldstral امتیاز 83.8 کسب کرد و از رقبای بزرگ‌تر عملکرد بهتری نشان داد.

معماری Ministral-3B با انکودر Pixtral در Shieldstral

سازگاری با قوانین جدید و هزینه‌های محاسباتی

در معیار سازگاری با قوانین متفاوت یا کاملاً جدید، GPT-OSS-Safeguard-20B با 94.1 درصد پیشتاز بود و Shieldstral با 91.3 درصد نزدیک قرار گرفت. محققان بر این نکته تأکید می‌کنند که مزیت عملی Shieldstral کاهش هزینه‌های محاسباتی است؛ به‌جای تولید دنباله‌های استدلالی طولانی، پاسخ‌های تک‌کلمه‌ای ارائه می‌دهد که سبک‌تر و ارزان‌تر اجرا می‌شوند. در یک آزمون اعتبارسنجی نیز استفاده از داده‌های مصنوعی امتیاز F1 را 23.3 واحد درصد افزایش داد؛ عنصری کلیدی در قابلیت مدل برای سازگاری با قواعد تازه.

در دسترس بودن و مجوز

Shieldstral بر پایهٔ Ministral-3B و با انکودر بینایی Pixtral توسعه یافته و به‌عنوان یک مدل با وزن‌های باز تحت مجوز Apache 2.0 منتشر شده، که امکان بازبینی و به‌کارگیری در پروژه‌های متن‌باز را فراهم می‌کند.

نمونه‌ای از خروجی‌های دسته‌بندی ایمنی تصویر و متن

پیامدها برای اپراتورها و صنعت

طبقه‌بندی‌کننده‌های ایمنی معمولاً بین سیستم ورودی و خروجی مدل‌های زبانی قرار می‌گیرند و کیفیت آنها مستقیم بر هزینه و تجربهٔ کاربری تأثیر می‌گذارد. فیلترهای بدتنظیم می‌توانند درصد قابل‌توجهی از درخواست‌ها را به‌اشتباه مسدود یا به مدل‌های ضعیف‌تر هدایت کنند. رویکرد پرسش‌های زمان اجرا به اپراتورها کنترل دقیق‌تر می‌دهد و احتمال خطاهای پرهزینه را کاهش می‌دهد.

موارد استفاده و محدودیت‌ها

  • خدمات وابسته به محتوای تخصصی (سلامت، پزشکی، امنیت سایبری) می‌توانند قوانین خاص خود را سریع تعریف و اعمال کنند.
  • تهیه و نگهداری مجموعه‌های دادهٔ بزرگ و تولید نمونه‌های مصنوعی نیازمند منابع محاسباتی و انسانی است و ممکن است برای همهٔ تیم‌ها مناسب نباشد.
  • اگرچه Shieldstral در آزمون‌ها عملکرد قوی نشان داده، در برابر برخی قوانین کاملاً جدید یا بسیار دقیق ممکن است مدل‌های بزرگ‌تر یا راهکارهای ترکیبی عملکرد بهتری ارائه دهند.

نگاه رو به جلو

افزایش توان مدل‌های سبک‌تر مانند Shieldstral نشان می‌دهد با طراحی داده و قالب مناسب می‌توان هزینه‌های محاسباتی را کاهش داد بدون از دست رفتن دقت. در دسترس بودن متن‌باز این مدل امکان آزمایش قواعد سفارشی و ادغام در محصولات مختلف را فراهم می‌کند و به اپراتورها اجازه می‌دهد تعادل دقیق‌تری بین ایمنی و هزینهٔ عملیاتی برقرار کنند.

منابع مرتبط: Mistral، F1 score، Apache 2.0.