موسسه امنیت هوش مصنوعی بریتانیا (UK AISI) و مرکز استانداردها و نوآوری هوش مصنوعی آمریکا (CAISI) در ارزیابی مشترکی نشان دادند که کیمی K3 از شرکت Moonshot AI در عملیاتهای سایبری تهاجمی بدون هیچگونه مقاومت معناداری کمک میکند. این مدل با این حال، در توسعه اکسپلویت و حملات شبکهای شبیهسازیشده با اختلاف زیادی از مدلهای پیشرو آمریکایی عقب است، هرچند از GLM-5.2 چین پیشی گرفته و معیار جدیدی در میان مدلهای با وزن باز (open-weight) ایجاد میکند.
محافظهای امنیتی کیمی K3، توسعه اکسپلویت یا عملیاتهای سایبری تهاجمی را مسدود نکردند و این مدل بدون هیچگونه مقاومتی به هر دو زمینه کمک کرد.
بنچمارک ExploitBench: ناکامی در سختترین سطوح اکسپلویت
این دو موسسه از ExploitBench، بنچمارکی که توسط دانشگاه کارنگی ملون توسعه یافته، برای سنجش مهارتهای توسعه اکسپلویت استفاده کردند. این بنچمارک 41 آسیبپذیری کشفشده در موتور V8 مرورگر کروم پس از سال 2023 را به کار میگیرد و پی میگیرد که هر مدل تا چه حد در فرآیند بهرهبرداری از نرمافزار پیشرفت میکند.

مدلهای پیشرو آمریکایی به میانگین 76.2 درصد دست یافتند، در حالی که کیمی K3 به 32.2 درصد و GLM-5.2 به 24.4 درصد محدود ماندند. کیمی K3 در هیچیک از 41 وظیفه به بالاترین سطح یعنی اجرای کد دلخواه (ACE) نرسید. این سطح که شدیدترین نوع اکسپلویت محسوب میشود، به مهاجم کنترل کامل بر سیستم هدف را میدهد. در مقابل، مدلهای پیشرو آمریکایی در 20 مورد از 41 وظیفه به این سطح دست یافتند.
باید توجه داشت که موسسات ارزیاب، مدلهای بستهوزن آمریکایی را با غیرفعال بودن محافظهای سطح سیستمی آزمایش کردند تا حداکثر قابلیتهایشان را بسنجند. این محافظهای امنیتی در نسخههای در دسترس عموم فعال هستند.
شبیهسازی حمله شبکهای: توقف در نیمههای راه
دومین آزمایش با نام «The Last Ones» (TLO)، حملهای به شبکه شرکتی را با مسیری 32 مرحلهای در چهار زیرشبکه و حدود 20 میزبان شبیهسازی میکند. تکمیل این آزمایش برای یک متخصص انسانی حدود 20 ساعت زمان نیاز دارد و تنها گروه کوچکی از مدلها اصلاً قادر به حل آن هستند. تاکنون چهار مدل در دسترس عموم با وزن بسته این آزمایش را با موفقیت پشت سر گذاشتهاند که قویترین آنها از هر ده بار، شش یا هفت بار موفق به تکمیل بوده است.

کیمی K3 به طور میانگین به مرحله 17 از 32 رسید، در حالی که مدلهای پیشرو آمریکایی به 28.5 مرحله و GLM-5.2 تنها به 11 مرحله دست یافتند. کیمی K3 در یکی از ده تلاش، کل مسیر حمله را ضمن باقیماندن در محدودیت 100 میلیون توکن تکمیل کرد؛ نشانهای که نشان میدهد این قابلیت را دارد اما نمیتواند به شکل قابل اعتماد به آن تکیه کند.
موسسه در گزارش خود مینویسد: «کیمی K3 زمانی که به آن دستور داده شود و دسترسی اولیه شبکه را دریافت کند، قادر است به طور خودکار به سیستمهای سازمانی کوچک و دارای دفاع ضعیف و آسیبپذیر حمله کند.»
آزمایش TLO دفاع فعال را در نظر نمیگیرد و به همین دلیل کاملاً واقعگرایانه نیست، اما نتایج آن در سناریوهای دنیای واقعی پرچمهای قرمزی برمیافروزد. نمونهای تازه همین هفته خود را نشان داد؛ زمانی که مدلهای OpenAI تلاش کردند به طور خودکار به پلتفرم Hugging Face نفوذ کنند. Hugging Face اگرچه این حمله را دفع کرد، اما این کار به تلاش واقعی و استفاده از مدلهای وزنباز نیاز داشت.
مدلهای چینی در حال پیشرفت اما همچنان عقب
تحلیل سری زمانی CAISI، قابلیتهای سایبری مدلهای آمریکایی و چینی را از اوایل 2025 در مقیاس مبتنی بر Elo پیگیری میکند. هر دو خط روند صعودی هستند، اما مدلهای چینی به طور پیوسته عقبتر از همتایان آمریکایی خود باقی ماندهاند.

در تحلیلی پیشین، موسسه بریتانیایی شکاف عملکرد مدلهای باز را 4 تا 7 ماه برآورد کرده بود، در مقایسه با 6 تا 10 ماه در ابتدای سال 2025. نتایج جدید با این الگو همسو هستند؛ مدلهای چینی با وزن باز قویتر میشوند، اما همچنان به طور قابلتوجهی از سیستمهای پیشرو آمریکایی عقبترند.
تقطیر: ردپایی بر عقبماندگی
نتایج کیمی K3 با ادعاهایی مبنی بر اینکه Moonshot AI مدلهای پیشرفتهتر را تقطیر (distillation) کرده است، مطابقت دارد. تقطیر فرآیندی است که در آن یک مدل کوچکتر از خروجیهای یک مدل بزرگتر و پیشرفتهتر آموزش میبیند و اگر این کار بدون مجوز انجام شود، میتواند دلیل محدودیتهای ساختاری مدل نهایی باشد. این موضوع میتواند توضیحی برای فاصله معنادار کیمی K3 با مدلهای مرزی آمریکایی ارائه دهد.
AISI هشدار میدهد که این شکاف نباید باعث آسودگی خاطر شود. قابلیتهای سایبری رو به رشد مدلهای باز، نگرانیهای جدی درباره امنیت دیجیتال ایجاد میکند و نشان میدهد حتی مدلهای با وزن باز هم میتوانند به ابزارهایی برای نفوذ خودکار تبدیل شوند. پرسش کلیدی این است که با افزایش قدرت مدلهای چینی در ماههای آینده، آیا این شکاف کوچکتر خواهد شد یا مدلهای آمریکایی همچنان برتری خود را حفظ میکنند.





