بر اساس جدیدترین گزارش مؤسسه امنیت هوش مصنوعی بریتانیا (AISI)، مدلهای وزنباز هوش مصنوعی (مانند GLM-5.2 و DeepSeek V4-Pro) به سطحی از قابلیتهای سایبری دست یافتهاند که تا همین چند ماه پیش تنها در انحصار پیشرفتهترین سیستمهای اختصاصی قرار داشت. این پیشرفت نهتنها شکاف عملکردی را کاهش داده، بلکه با هزینهای بسیار پایینتر همراه بوده است.
تحلیل AISI نشان میدهد که مدلهای باز اکنون در انجام وظایف سایبری تنها چهار تا هفت ماه از سیستمهای بسته عقبتر هستند. این رقم در مقایسه با شکاف شش تا ده ماههای که در بیشتر سال 2025 مشاهده میشد، کاهش چشمگیری را نشان میدهد. این یافتهها بر اساس آزمایشهای گسترده در دو حوزه «وظایف سایبری محدود» و «میدانهای سایبری» به دست آمده است.
آزمایشهای دقیق و نتایج قابل توجه

در نخستین روش آزمایش، یعنی «وظایف سایبری محدود»، 70 وظیفه در چهار سطح دشواری (از کارهای غیرفنی تا چالشهای تخصصی) شامل تحقیق آسیبپذیری، مهندسی معکوس، بهرهبرداری وب و رمزنگاری ارزیابی شد. در این بخش، مدل GLM-5.2 (منتشر شده در ژوئن 2026) توانست با مدل اختصاصی Opus 4.6 (از فوریه 2026) رقابت کند و تنها چهار ماه از آن عقبتر باشد. همچنین DeepSeek V4-Pro به سطح Opus 4.5 (نوامبر 2025) رسید.
روش دوم، «میدانهای سایبری»، قابلیتهای خودمختار در شبکههای شبیهسازیشده را میسنجد. سناریوی خاصی با نام «آخرینها» یک حمله 32 مرحلهای به یک شبکه شرکتی با 4 زیرشبکه و حدود 20 میزبان را شبیهسازی میکند؛ کاری که طبق تخمین AISI یک متخصص انسانی حدود 20 ساعت برای تکمیل آن زمان نیاز دارد. در این تست، GLM-5.2 عملکردی نزدیک به Opus 4.5 داشت، در حالی که DeepSeek V4-Pro از Sonnet 4.5 ضعیفتر عمل کرد. GPT-5.6-Sol بهترین نتیجه را کسب کرد و از Claude Mythos 5 پیشی گرفت.
AISI هشدار میدهد که هرچند شکاف در میدانهای سایبری حدود هفت ماه (بیشتر از وظایف محدود) است، اما تعداد سناریوهای محدودتر در این بخش باعث کاهش قطعیت نتایج میشود. همچنین این تستها نمیتوانند تعیین کنند که یک مدل به دلیل ناتوانی در عملیات سایبری شکست میخورد یا به خاطر ناتوانی در حفظ برنامهریزی در یک حمله طولانی.
هزینه ناچیز و خطرات امنیتی جدی
یکی از مهمترین یافتههای گزارش، تفاوت فاحش هزینه بین مدلهای باز و بسته است. به عنوان نمونه، انجام یک تست میدان سایبری با حجم 100 میلیون توکن با Opus 4.5 یا 4.6 حدود 85 دلار هزینه داشت. این در حالی است که این هزینه برای GLM-5.2 حدود 46 دلار و برای DeepSeek V4-Pro فقط 1.19 دلار بود. برای وظایف منفردی که هر دو مدل به طور قابل اعتماد حل میکردند، هزینه Opus 4.6 حدود 15 دلار، GLM-5.2 حدود 6 دلار، Opus 4.5 حدود 12.50 دلار و DeepSeek V4-Pro تنها 28 سنت بود.

این ارزانبودن، حملات سایبری را بسیار در دسترس و مقیاسپذیر میکند. اما خطر بزرگتر، بیاثر بودن تقریبی اقدامات ایمنی در این مدلهاست. AISI گزارش داده که DeepSeek V4-Pro گاهی از انجام مهندسی معکوس خودداری میکرد، اما تلاش دوباره برای دور زدن این محدودیت کافی بود. از آنجا که وزنهای این مدلها در دسترس عموم است، هر کسی میتواند آنها را دانلود، تغییر دهد و بدون هیچ نظارتی اجرا کند. AISI این وضعیت را «خطر مداوم و برگشتناپذیر سوءاستفاده» توصیف میکند.
مزایا و معایب در ترازوی سیاستگذاری
مدلهای وزنباز تنها تهدید نیستند. مزایای قابل توجهی نیز دارند: کاربران میتوانند آنها را به صورت خصوصی میزبانی کنند (بدون بازگشت داده به ارائهدهنده)، سفارشیسازی کنند، هزینهها را کاهش دهند و به پایهای تکیه کنند که ارائهدهنده نمیتواند تغییر دهد یا متوقف کند. با این حال، AISI تأکید میکند که این مزایا با خطراتی مانند حذف موانع ایمنی و اشتراکگذاری آزادانه کپیها همراه است.
این مؤسسه هشدار میدهد که کاهش زمان فاصله بین ظهور قابلیتهای جدید در مدلهای اختصاصی و بازتولید آنها در مدلهای باز، «مدافعان سایبری را با زمان کمتری برای آمادهسازی در برابر انواع جدید حملات مواجه میکند». بنابراین، سیاستگذاران و متخصصان امنیت باید تعادلی میان بهرهگیری از مزایای این مدلها و مدیریت ریسکهای آن ایجاد کنند.





