مایکروسافت مدل امنیت سایبری اختصاصی MAI-Cyber-1-Flash را در چارچوب چندمدلی MDASH معرفی کرده است. این ترکیب همراه با GPT-5.4 در آزمون CyberGym به امتیاز 95.95% رسیده و شرکت از کاهش حدود 50% در هزینهٔ اجرا نسبت به پیکربندی قبلی خبر داده است.

آنچه اعلام شد و اهمیتش

مایکروسافت اعلام کرده که MAI-Cyber-1-Flash می‌تواند حدود 90% از وظایف MDASH را پوشش دهد و 10% باقی که دشوارتر است به GPT-5.4 واگذار شود. تأکید شرکت بر عملکرد کل سیستم MDASH است و نه صرفاً امتیاز مدل جدید به‌تنهایی.

مشخصات فنی

  • معماری: ترنسفورمر با ساختار sparse mixture-of-experts (Mixture of Experts).
  • پارامترها: مجموعاً 137 میلیارد پارامتر با 5 میلیارد پارامتر فعال.
  • پنجرهٔ زمینه: 256,000 توکن.
  • خاستگاه: فاین‌تیون امنیتی بر پایهٔ MAI-Code-1-Flash که از میدترینینگ MAI-Thinking-1 توسعه یافته است.

رویکرد mixture-of-experts و مسیردهی (routing) برای تقسیم کار بین یک مدل سبک‌تر برای وظایف رایج و یک مدل قوی‌تر برای موارد پیچیده به کار رفته است. برای آشنایی با اصول پایهٔ ترنسفورمر می‌توانید به صفحهٔ معماری ترنسفورمر مراجعه کنید: Transformer (machine learning).

نمایی از محیط آزمایشی MDASH و مدل MAI-Cyber-1-Flash

آزمون‌ها و محدودیت‌های ارزیابی

امتیاز 95.95% مربوط به عملکرد کل سیستم MDASH با MAI-Cyber-1-Flash و GPT-5.4 است؛ خودِ مدل جدید به‌تنهایی آن نمره را اعلام نکرده است. نکات قابل توجه:

  • CyberGym Level 1 آزمونی برای بازتولید آسیب‌پذیری‌های شناخته‌شده است که از عامل می‌خواهد آسیب‌پذیری را توصیف کرده و کد بدون اصلاح را به‌صورت اثباتِ مفهوم (PoC) تولید کند؛ این آزمون کشفِ کور آسیب‌پذیری یا اثبات نهایی پَچ را نمی‌سنجد.
  • در فهرست عمومی CyberGym تا زمان بررسی در 28 ژوئیهٔ 2026 نتیجهٔ 95.95% ثبت نشده بود و مایکروسافت مشخص نکرده که آیا نتیجه برای فهرست‌بندی ارسال شده است یا خیر.
  • گزارش‌های قبلی مایکروسافت از معیارهای متفاوتی استفاده کرده‌اند؛ نمونه‌ای که 96.55% اعلام شد معیارهای متفاوتی (از جمله حساب‌کردن کرش‌ها به‌عنوان موفقیت) داشت که مقایسهٔ مستقیم را دشوار می‌سازد.

ادعای کاهش 50% هزینه

مایکروسافت صرفه‌جویی 50% را نسبت به ترکیب پیشین MDASH (شامل GPT-5.4، GPT-5.4 mini و GPT-5.3 Codex) گزارش کرده است. با این حال اطلاعات جزئی مانند مصرف توکن، حجم فراخوانی‌ها، تأخیر یا تخصیص محاسباتی منتشر نشده و بنابراین این رقم فعلاً قابل بازتولید مستقل یا تطبیق با سایر سیستم‌ها نیست.

نمودار مفهومی تقسیم کار بین مدل‌های MAI-Cyber-1-Flash و GPT-5.4

سایر نتایج معیارسنجی و هشدارها

  • در معیارهای متنوع گزارش شده، نمره‌ها شامل 0.314 در CVEBench، 0.553 در CyberSecEval4 (اطلاعات تهدید)، 0.33 در تحلیل بدافزار و 0.651 در CRSBench (POV=1200) بوده است.
  • در آزمون ExploitGym مدل در دسته‌های هسته، فضای کاربر و مرورگر نمرهٔ صفر کسب کرده که نشان می‌دهد تبدیل ورودیِ کرش‌دهنده به اکسپلویت اجرایی هنوز محدودیت‌هایی دارد.
  • مایکروسافت تأکید کرده همهٔ آزمون‌ها در محیط ایزوله و بدون اتصال به اینترنت یا سیستم‌های تولیدی اجرا شده و هشدار داده که متن و کد تولیدشده ممکن است نادرست یا ناقص باشند و پیش از استفادهٔ عملی باید بازبینی شوند.

دسترسی و چشم‌انداز گسترش

دسترسی به ترکیب جدید فعلاً محدود به مشتریان تأییدشدهٔ MDASH در قالب پیش‌نمایش خصوصی Azure AI Foundry است. اطلاعات رسمی دربارهٔ عرضهٔ عمومی در صفحهٔ Azure AI Foundry و اعلان‌های مایکروسافت منتشر خواهد شد. این مدل نخستین سناریوی Project Perception نامیده شده و مایکروسافت قصد دارد کاربرد آن را فراتر از مدیریت آسیب‌پذیری نرم‌افزار در سایر جریان‌های کاری امنیتی گسترش دهد؛ Project Perception از 3 اوت وارد پیش‌نمایش عمومی می‌شود.

جمع‌بندی تحلیلی

امتیازهای اعلام‌شده عملکرد یک سیستم چندمدلی را نشان می‌دهند که MAI-Cyber-1-Flash یکی از اجزای آن است. معماری mixture-of-experts و مسیردهی می‌تواند هزینه‌ها را کاهش و بهره‌وری را افزایش دهد، اما شفافیت در معیارها، جزئیات مصرف توکن و سناریوهای تست برای سنجش واقعی برتری و مقایسهٔ هزینه‌ای ضروری است. همان‌طور که Taesoo Kim، معاون امنیت عامل‌محور مایکروسافت، گفته است: «مدل یک ورودی است، سیستم اطراف آن محصول است.»

نکاتی که باید دنبال کرد

  • ثبت یا عدم ثبت نتیجهٔ 95.95% در فهرست عمومی CyberGym و شفاف‌سازی معیارهای محاسبهٔ آن.
  • انتشار اطلاعات دربارهٔ مصرف توکن و الگوی فراخوانی برای امکان مقایسهٔ هزینه‌ای با راهکارهای دیگر.
  • گسترده‌تر شدن کاربرد MAI-Cyber-1-Flash در جریان‌های کاری امنیتی دیگر در چارچوب Project Perception.

تحولات آتی در MDASH و گزارش‌های شفاف‌تر مشخص خواهد کرد این رویکرد سیستم‌محور تا چه حد در کاهش هزینه‌ها و بهبود عملی مدیریت آسیب‌پذیری‌ها مؤثر است.