گزارش تازهٔ Guidelight نشان می‌دهد پنج آزمایشگاه برجستهٔ هوش مصنوعی کنترل‌های پایهٔ داخلی را به‌طور کامل اجرا نکرده‌اند؛ نتیجه‌ای که نگرانی دربارهٔ کنترل داخلی هوش مصنوعی را تقویت می‌کند. بررسی گزارش بر شرکت‌های Anthropic، OpenAI، Google، xAI و Meta مبتنی بر اسناد و منابع عمومی از قبیل کارت‌های سیستم، گزارش‌های ایمنی و پست‌های وبلاگی است.

معیارهای بررسی شده

Guidelight شش رویهٔ بنیادین را برای ارزیابی انتخاب کرده که همگی هدفشان کاهش ریسک رفتارهای خطرناک یا غیرمنتظره در سیستم‌های داخلی هوش مصنوعی است:

  • ثبت فعالیت‌ها (logging) — ضبط و نگهداری لاگ اقدامات داخلی مدل‌ها برای بازبینی و ممیزی.
  • بازبینی و کنترل دسترسی — مکانیزم‌های پیش از اجرای اقدامات پرخطر و مدیریت دسترسی‌ها.
  • خاموشی اضطراری (circuit breaking) — امکان قطع فوری عملکردهای خطرناک یا گسترده (kill switch).
  • مکانیزم‌های پیشگیری — طراحی و مهندسی برای جلوگیری از ظهور رفتارهای نامطلوب از پایه.
  • برنامهٔ مهار مدل‌های ناسازگار — سناریوها و ابزارهای توقف یا قرنطینهٔ مدل‌هایی که از کنترل خارج شوند.
  • نظارت و پاسخ اضطراری — فرآیندهای مشخص برای تشخیص سریع ناهنجاری‌ها و واکنش مناسب.

نتایج و امتیازدهی

رتبه‌بندی Guidelight نشان می‌دهد که حتی شرکت‌هایی با بالاترین نمره نیز از حداقل استانداردها فاصله دارند. نمرات اعلام‌شده این‌گونه است: Anthropic و OpenAI با نمرهٔ C+، Google با D+ و نقشهٔ راه نسبتا مفصل‌تر، xAI با D− و Meta با F در پایین‌ترین رده قرار گرفته‌اند. مهم اینکه نمرهٔ نسبی به معنای اجرای کامل کنترل‌ها نیست و خلأهای جدی در حوزه‌های پیشگیری و مهار همچنان مشهود است.

صفحه نتیجه گزارش Guidelight درباره ارزیابی کنترل‌های داخلی شرکت‌های هوش مصنوعی

نقاط قوت و ضعف عملکرد شرکت‌ها

تحلیل نشان می‌دهد شرکت‌ها در شناسایی ناهنجاری‌ها و پیاده‌سازی سیستم‌های مانیتورینگ عملکرد نسبتاً بهتری دارند، اما در دو حوزهٔ کلیدی ضعف واضح وجود دارد:

  • پیشگیری: بسیاری از کنترل‌ها واکنشی طراحی شده‌اند و از ابتدا به‌صورت پیشگیرانه عمل نمی‌کنند.
  • مهار و قرنطینه: برنامه‌های اثبات‌شده و قابل اتکا برای قرنطینه یا خاموشی مدل‌های ناسازگار ناقص یا ناکافی‌اند.

اهمیت موضوع

ناتوانی در کنترل داخلی هوش مصنوعی می‌تواند پیامدهای گسترده‌ای داشته باشد: افشای اطلاعات حساس، اجرای اقدامات خودسرانه توسط مدل‌ها، و تشدید خطاها در محیط‌های تولیدی. این پیامدها تنها فنی نیستند و ابعاد اقتصادی، امنیتی و حقوقی نیز دارند. برای مطالعهٔ بیشتر دربارهٔ زمینهٔ ایمنی هوش مصنوعی به مطلب AI safety مراجعه کنید.

دربارهٔ Guidelight

Guidelight سازمانی غیرانتفاعی است که توسط پیج هدلی و استیون ادلر، از مدیران پیشین ایمنی در OpenAI، بنیان‌گذاری شده است. مأموریت این نهاد ارائهٔ ارزیابی‌های شفاف و قابل اتکا دربارهٔ وضعیت ایمنی شرکت‌های فعال در هوش مصنوعی و افزایش فشار عمومی و نهادی برای وضع استانداردهای عملی است.

اقدامات پیشنهادی

بنا بر یافته‌ها، اقدامات زیر ضروری به نظر می‌رسند:

  • الزام به ثبت کامل لاگ‌ها و نگهداری آرشیوهای قابل بررسی برای رویدادهای داخلی.
  • پیاده‌سازی سازوکارهای بازبینی پیش از اجرای عملیات پرخطر و تفکیک وظایف برای کاهش خطاهای انسانی.
  • طراحی، پیاده‌سازی و تست دوره‌ای مکانیزم‌های خاموشی اضطراری و سناریوهای قرنطینه.
  • انتقال از رویکردهای واکنشی به مهندسی پیشگیرانه و طراحی امن مدل از آغاز پروژه‌ها.
  • افزایش شفافیت دربارهٔ رویه‌ها و نتایج ارزیابی‌های ایمنی برای جلب اعتماد عمومی و نظارت مؤثرتر.

جمع‌بندی و چشم‌انداز

ارزیابی Guidelight هشدار روشنی برای صنعت فرستاده است: تا زمانی که کنترل‌های پایهٔ داخلی به‌طور کامل برقرار نشود، خطرات عملیاتی و اجتماعی مرتبط با هوش مصنوعی پابرجا خواهند ماند. تسریع در تصویب استانداردها و بهبود عملی کنترل‌ها مستلزم شفافیت، سرمایه‌گذاری و تعهد بلندمدت از سوی شرکت‌ها و نهادهای نظارتی است.