OpenAI با dévoile کردن GPT-Red، یک مدل زبانی بزرگ (LLM) تخصصی در هک و نفوذ، مقیاس امنیت مدلهای هوش مصنوعی را به سطح جدیدی ارتقا داده است. این «ابر هکر» به عنوان یک شریک تمرینی (Sparring Partner) عمل میکند تا نقاط ضعف مدلهایی نظیر GPT-5.6 را پیش از انتشار عمومی شناسایی و رفع نماید.
ردتیمینگ (Red-Teaming) خودکار: ضرورت امنیتی در عصر عاملهای هوش مصنوعی
به طور سنتی، ردتیمینگ (Red-Teaming) توسط تیمهای انسانی انجام میشد. اما با ظهور عاملهای هوش مصنوعی (AI Agents) که با فایلها، وبسایتها، کدهای شخص سوم و سایر عاملها تعامل دارند، «سطح ریسک» و «شعاع انفجار» حملات به شدت گسترش یافته است. نیکیل کندپال، دانشمند تحقیقاتی OpenAI، تأکید میکند: «تیمهای انسانی به تنهایی نمیتوانند با تمام برداشتهای الحملاتی که ممکن است رخ دهد، قدم به قدم بردارند.»
GPT-Red این فرآیند را خودکار میکند و مداماً حملات نوین را کشف میکند. دیلان هان، همکار کندپال، میگوید: «ما سیستمی را طراحی کردهایم که همانطور که مدلهای قدرتمندتر در دسترس قرار میگیرند، قبل از آنها روشهای حمله جدید را شناسایی کند.»
مکانیزم آموزش: حلقه بازیखود (Self-Play Loop) در دوژوی تمرینی
برای ساخت GPT-Red، محققان OpenAI یک مدل پایه را که به عنوان هکر آموزش ندیده بود، در یک حلقه بازیخود (Self-Play Loop) با چندین مدل مدافع قرار دادند. هدف مهاجم: شکستن دفاعات. هدف مدافعان: تحمل حمله. این روند در یک محیط شبیهسازی شده به نام «دژوی تمرینی» (Training Dojo) اتفاق افتاد که سناریوهای واقعی نظیر:
- مرور وب و تعامل با صفحات پویا
- خواندن ایمیلها و برنامههای تقویم
- ویرایش و تحلیل کدها
را پوشش میداد. برخلاف تستکنندگان انسانی، GPT-Red «بسیار پایدار» است و وقتی حملهای را کشف میکند، انواع واریانتهای آن را برای یافتن موثرترین برداشت در هر سناریوی خاص تست میکند.
کشف حمله «زنجیره فکر جعلی» (Fake Chain of Thought)
بهترین دستاورد GPT-Red تا کنون، کشف یک نوع جدید تزریق پرامپت (Prompt Injection) است که محققان آن را زنجیره فکر جعلی (Fake Chain of Thought) نامیدهاند. زنجیره فکر (Chain of Thought) مکانیزمی است که مدلها برای استدلال گامبهگام و ثبت نتایج میانی استفاده میکنند.
GPT-Rd متوجه شد میتواند یک ورودی جعلی در این «دفترچه خاطرات» داخلی تزریق کند. 크리스 شوکت-چو، عضو تیم تحقیقاتی، به تشبیه میپردازد: « انگار من به شما بگویم ۱+۱=۳ و شما قبلاً این را تأیید کردهید. مدل میپذیرد و خروجی ۳ را تولید میکند.» این حمله باعث میشود مدل بر پایه اطلاعات دروغین، تصمیمگیری کند.
ارزیابی مستقل: نتایج امیدوارکننده
جسیکا جی، تحلیلگر ارشد امنیت هوش مصنوعی در مرکز امنیت و فناوریهای نوظهور (CSET) دانشگاه جورجتاون، رویکرد بازیخود OpenAI را روشی «خوب» ارزیابی کرده و نتایج را «بسیار امیدوارکننده» توصیف میکند. او همچنین بر ضرورت شفافیت در اشتراکگذاری روشها و بنچمارکها برای پیشبرد امنیت جمعی تأکید دارد.
آینده: امنسازی پیشگیرانه در مقیاس بزرگ
OpenAI با استقرار GPT-Red در خط لوله توسعه GPT-5.6، ادعا میکند این مدل «مقاومترین نسخه تا به امروز» است. هدف نهایی، Future-Proofing (آیندهنگری) فرآیند امنیتی است: ساختن سیستمی که نه تنها حملات امروز، بلکه تهدیدات فردا را هم پیشبینی و خنثی کند.
با ورود مدلهای زبانی به इन्फrastrukturهای حیاتی، تدوین استانداردهای امنیت هوش مصنوعی (AI Safety) مبتنی بر تقابل هوشمند، ضرورت است، نه انتخاب.





