OpenAI با dévoile کردن GPT-Red، یک مدل زبانی بزرگ (LLM) تخصصی در هک و نفوذ، مقیاس امنیت مدل‌های هوش مصنوعی را به سطح جدیدی ارتقا داده است. این «ابر هکر» به عنوان یک شریک تمرینی (Sparring Partner) عمل می‌کند تا نقاط ضعف مدل‌هایی نظیر GPT-5.6 را پیش از انتشار عمومی شناسایی و رفع نماید.

ردتیمینگ (Red-Teaming) خودکار: ضرورت امنیتی در عصر عامل‌های هوش مصنوعی

به طور سنتی، ردتیمینگ (Red-Teaming) توسط تیم‌های انسانی انجام می‌شد. اما با ظهور عامل‌های هوش مصنوعی (AI Agents) که با فایل‌ها، وب‌سایت‌ها، کدهای شخص سوم و سایر عامل‌ها تعامل دارند، «سطح ریسک» و «شعاع انفجار» حملات به شدت گسترش یافته است. نیکیل کندپال، دانشمند تحقیقاتی OpenAI، تأکید می‌کند: «تیم‌های انسانی به تنهایی نمی‌توانند با تمام برداشت‌های الحملاتی که ممکن است رخ دهد، قدم به قدم بردارند.»

GPT-Red این فرآیند را خودکار می‌کند و مداماً حملات نوین را کشف می‌کند. دیلان هان، همکار کندپال، می‌گوید: «ما سیستمی را طراحی کرده‌ایم که همان‌طور که مدل‌های قدرتمندتر در دسترس قرار می‌گیرند، قبل از آن‌ها روش‌های حمله جدید را شناسایی کند.»

نمایه گرافیکی GPT-Red در حال شبیه‌سازی حمله در دوژوی تمرینی OpenAI

مکانیزم آموزش: حلقه بازی‌खود (Self-Play Loop) در دوژوی تمرینی

برای ساخت GPT-Red، محققان OpenAI یک مدل پایه را که به عنوان هکر آموزش ندیده بود، در یک حلقه بازی‌خود (Self-Play Loop) با چندین مدل مدافع قرار دادند. هدف مهاجم: شکستن دفاعات. هدف مدافعان: تحمل حمله. این روند در یک محیط شبیه‌سازی شده به نام «دژوی تمرینی» (Training Dojo) اتفاق افتاد که سناریوهای واقعی نظیر:

  • مرور وب و تعامل با صفحات پویا
  • خواندن ایمیل‌ها و برنامه‌های تقویم
  • ویرایش و تحلیل کدها

را پوشش می‌داد. برخلاف تست‌کنندگان انسانی، GPT-Red «بسیار پایدار» است و وقتی حمله‌ای را کشف می‌کند، انواع واریانت‌های آن را برای یافتن موثرترین برداشت در هر سناریوی خاص تست می‌کند.

کشف حمله «زنجیره فکر جعلی» (Fake Chain of Thought)

بهترین دستاورد GPT-Red تا کنون، کشف یک نوع جدید تزریق پرامپت (Prompt Injection) است که محققان آن را زنجیره فکر جعلی (Fake Chain of Thought) نامیده‌اند. زنجیره فکر (Chain of Thought) مکانیزمی است که مدل‌ها برای استدلال گام‌به‌گام و ثبت نتایج میانی استفاده می‌کنند.

GPT-Rd متوجه شد می‌تواند یک ورودی جعلی در این «دفترچه خاطرات» داخلی تزریق کند. 크리스 شوکت-چو، عضو تیم تحقیقاتی، به تشبیه می‌پردازد: « انگار من به شما بگویم ۱+۱=۳ و شما قبلاً این را تأیید کرده‌ید. مدل می‌پذیرد و خروجی ۳ را تولید می‌کند.» این حمله باعث می‌شود مدل بر پایه اطلاعات دروغین، تصمیم‌گیری کند.

ارزیابی مستقل: نتایج امیدوارکننده

جسیکا جی، تحلیلگر ارشد امنیت هوش مصنوعی در مرکز امنیت و فناوری‌های نوظهور (CSET) دانشگاه جورج‌تاون، رویکرد بازی‌خود OpenAI را روشی «خوب» ارزیابی کرده و نتایج را «بسیار امیدوارکننده» توصیف می‌کند. او همچنین بر ضرورت شفافیت در اشتراک‌گذاری روش‌ها و بنچ‌مارک‌ها برای پیشبرد امنیت جمعی تأکید دارد.

آینده: امن‌سازی پیشگیرانه در مقیاس بزرگ

OpenAI با استقرار GPT-Red در خط لوله توسعه GPT-5.6، ادعا می‌کند این مدل «مقاوم‌ترین نسخه تا به امروز» است. هدف نهایی، Future-Proofing (آینده‌نگری) فرآیند امنیتی است: ساختن سیستمی که نه تنها حملات امروز، بلکه تهدیدات فردا را هم پیش‌بینی و خنثی کند.

با ورود مدل‌های زبانی به इन्फrastrukturهای حیاتی، تدوین استانداردهای امنیت هوش مصنوعی (AI Safety) مبتنی بر تقابل هوشمند، ضرورت است، نه انتخاب.