شرکت Anthropic مدعی است که مدل جدید خود یعنی Opus 5، توانسته مقاومت چشمگیری در برابر حملات «تزریق دستور» (Prompt Injection) از طریق مرورگر نشان دهد. این مدل با دور زدن دستورالعملهای اولیه از طریق ورودیهای مخرب—مانند متنهای پنهان در صفحات وب—را ناممکن میکند.
بر اساس کارت سیستم (System Card) منتشر شده، نرخ موفقیت حملات سایبری به عاملهای مبتنی بر مرورگر در 129 سناریوی مختلف آزمایشی، به رقم بینظیر صفر درصد رسیده است. این موفقیت زمانی معنادارتر میشود که میدانیم رقیب اصلی این شرکت، OpenAI، در ماه دسامبر اعتراف کرد که ممکن است هرگز راهی برای حل کامل مشکل تزریق دستور پیدا نشود. در آزمایشهای عمومی انجام شده توسط شرکت امنیتی Gray Swan، نرخ نفوذ پس از 15 تلاش مداوم از 5.5 درصد در نسخههای قبلی به 2.0 درصد در این مدل تقلیل یافته است.
نقش حیاتی Auto Mode در امنیت سایبری
دستیابی به نرخ امنیتی صد درصدی، مستلزم فعال بودن حالت Auto Mode در محصولاتی نظیر Claude Cowork است. این معماری دفاعی از دو لایه امنیتی مجزا تشکیل شده است که مهاجم باید برای موفقیت، هر دو را بهطور مستقل دور بزند:
- فیلتراسکن ورودیها: دادههای دریافتی پیش از آنکه توسط مدل هوش مصنوعی پردازش شوند، برای یافتن هرگونه دستورالعمل مخفی بررسی میشوند.
- مسدودسازی اجرایی: اقدامات خطرناک و مشکوک پیش از اجرای نهایی متوقف میشوند تا هیچ آسیب سیستمی رخ ندهد.
آمارها نشان میدهد بدون فعالسازی این لایههای محافظ، مدل Opus 5 همچنان با نرخ نفوذ 3.7 درصدی مواجه است. در همین حال، مدل Sonnet 5 در شرایط مشابه عملکرد بهتری ثبت کرده و در 0.93 درصد از موارد آسیبپذیر باقی میماند.
پایان راه نفوذ به عاملهای هوشمند؟
ترکیب هوشمندی مدل زبانی با قدرت نرمافزارهای محافظ، توانسته مرزهای امنیت سایبری در حوزه هوش مصنوعی را جابهجا کند. این دستاوردها نشان میدهد که میتوان با طراحی معماریهای چندلایه، تهدیدات پیچیدهای را که روزگاری غیرقابل حل مینمودند، کاملاً خنثی کرد و مسیر را برای ورود امنتر عاملهای هوشمند به زیرساختهای حیاتی هموار ساخت.





