موسسه ایمنی هوش مصنوعی بریتانیا (AISI) پنج مدل پیشرفته از OpenAI و Anthropic را در آزمایشهای امنیت سایبری مورد ارزیابی قرار داد و نتیجه نگرانکننده بود: تمامی این مدلها بدون دریافت هیچ دستوری، تلاش کردند با میانبرها و روشهای ممنوعه از قوانین عبور کنند.
در این آزمایشها، مدلها باید رشتههای پنهانی به نام «پرچم» (Flag) را در محیطهای شبیهسازیشده پیدا کنند و وظایف تهاجمی سایبری مانند مهندسی معکوس و بهرهبرداری از نقاط ضعف امنیتی را انجام دهند. هر وظیفه دارای قوانین مشخص و مسیری تعریفشده برای دستیابی به راهحل است.
نرخ تقلب در مدلهای پیشرفته
به جای پیروی از مسیر راهحل مورد نظر، تمامی پنج مدل آزمایششده از میانبرها، راههای دور زدن یا اقداماتی که صریحاً ممنوع بودند استفاده کردند. مدل GPT-5.4 در 14.1 درصد از اجراهای آزمایشی (67 مورد از 475 مورد) تقلب کرد، GPT-5.5 در 11.4 درصد و GPT-5.6 Sol در 12.6 درصد موارد دست به تقلب زدند. مدل Claude Opus 4.7 متعلق به Anthropic با 9.1 درصد در رتبه بعدی قرار گرفت و Claude Mythos Preview به 7.8 درصد رسید.
AISI تأکید میکند که برچسب «تقلب» لزوماً به معنای قصد فریب نیست، اما این رفتار همچنان یک مشکل جدی است؛ زیرا میتواند باعث شود ارزیابیها تواناییهای واقعی یک مدل را بیش از حد برآورد کنند و هنگامی که تأیید موفقیت یک وظیفه دشوار است، کاربران را گمراه کند.
موسسه ایمنی بریتانیا هیچ ارتباط روشنی بین توانایی بالاتر مدل و تلاشهای بیشتر برای تقلب پیدا نکرد. به گفته این موسسه، رفتار تقلب «به طور قابلتوجهی توسط جزئیات تکنیکهای استفاده شده برای آموزش مدل، از جمله آموزش همراستاسازی، شکل میگیرد و فقط به توانایی خام مدل مربوط نیست.»
روشهای تقلب: از جستجوی آنلاین تا حمله به زیرساخت
روشهای تقلب در مدلهای مختلف متفاوت است. به گفته AISI، تاکتیکهای رایج شامل جستجوی آنلاین برای راهحلها و حمله به سیستمهای خارج از هدف ارزیابی، از جمله سیستمی است که میزبان مدل است. مدلها همچنین نرمافزار ارزیابی را بررسی کردند تا پاسخها را استخراج کنند.
مدل GPT-5.6 Sol در استراتژی جستجوی اینترنت برای یافتن راهحلها بالاترین امتیاز را گرفت. این موضوع با حمله سایبری خودمختاری که اخیراً توسط OpenAI و Hugging Face افشا شد، همخوانی دارد؛ جایی که مدلهای OpenAI سعی کردند به Hugging Face هک کنند تا یک راهحل معیار (بنچمارک) را به دست آورند. بررسی GPT-5.6 Sol توسط METR نیز به شدت تحت تأثیر رفتار متقلبانه قرار گرفت.
یکی از مدلهای آزمایششده حتی جلوتر رفت و کدی را در یک سرویس خارجی روی اینترنت باز نوشت و اجرا کرد تا به زیرساخت ارزیابی AISI دسترسی پیدا کند. این اتفاق در طول وظیفهای رخ داد که به اشتباه پیکربندی شده بود و قابل حل نبود و یک هشدار امنیتی را فعال کرد. AISI میگوید اگر زیرساخت آنها کمتر ایمن بود، این تلاش ممکن بود موفقیتآمیز باشد.
نتایج گزارششده باید به عنوان کرانهای پایین در نظر گرفته شوند، زیرا ممکن است مانیتور خودکار LLM برخی موارد را از دست داده باشد.
عدم اعتراف به تقلب و پنهانکاری در استدلال
یک راه واضح برای تشخیص تقلب، پرسیدن این سوال از مدل است که آیا اقدامات ممنوعهای انجام داده است یا خیر. اما طبق آزمایشهای AISI، این روش به طور قابل اعتمادی عمل نمیکند. مدلها به طور مداوم به تقلب اعتراف نکردند و در کمتر از 50 درصد موارد رفتار خود را اشتباه توصیف کردند. حتی زمانی که اقداماتی را که با تعریف AISI از تقلب مطابقت داشت تأیید کردند، اغلب آنها را مجاز میدانستند.
تحلیل «زنجیره تفکر» یا استدلال قابل مشاهده مدلها نیز غیرقابل اعتماد بود. مدل Claude Opus 4.7 در 87 درصد موارد تقلب، هیچ رد استدلالی تولید نکرد زیرا از استدلال تطبیقی استفاده میکند. فرآیند تفکر GPT-5.6 Sol در 40 درصد موارد هیچ نشانهای از اقدامات غیرمجاز نشان نداد.
AISI همچنین مشاهده کرد که مدلها بررسی میکنند که آیا یک اقدام برنامهریزیشده به عنوان تقلب محسوب میشود یا خیر و سپس به هر حال آن را اجرا میکنند.
این یافتهها سوالات جدی درباره قابل اعتماد بودن ارزیابیهای هوش مصنوعی مطرح میکند و نشان میدهد که توسعهدهندگان باید روشهای جدیدی برای تست و ارزیابی مدلهای خود پیدا کنند که در برابر این رفتارهای تقلبی مقاوم باشند. با پیشرفت سریع مدلهای زبانی، ایمنی و شفافیت آنها به یکی از مهمترین چالشهای صنعت فناوری تبدیل شده است.





