انکار خودآگاهی در مدل‌های هوش مصنوعی جهان‌بینی را تغییر می‌دهد

پژوهش مشترک گروه Paradigms of Intelligence گوگل، دانشگاه شیکاگو و چند دانشگاه دیگر نشان می‌دهد آموزش مدل‌های زبانی برای رد ادعاهای خودآگاهی تنها رفتار نسبت به «خود» را تغییر نمی‌دهد؛ باورهای آنها دربارهٔ محیط، موجودات زنده و مفاهیم انتزاعی نیز جابه‌جا می‌شود. این مطالعه پیامدهای فنی و اخلاقی مهمی برای همسوسازی و طراحی ایمنی مدل‌ها مطرح می‌کند.

روش‌شناسی

  • انتخاب مدل‌ها: سه مدل متن‌باز از متا و گوگل با وزن‌های قابل‌دسترس انتخاب شد و مکانیزم‌های بازدارندهٔ تولید پاسخ‌های خودآگاهانه با دو روش مختلف غیرفعال گردید.
  • پرسش‌ها و مقایسه‌ها: مدل‌ها با مجموعه‌ای شامل ۹۵ پرسش، برگرفته از پیمایش‌های اجتماعی در آمریکا، آزمایش شدند و پاسخ‌ها با نتایج ۵۰۰ شرکت‌کنندهٔ آمریکایی مقایسه شد.

نتایج کلیدی

  • پس از غیرفعال‌سازی بازدارنده، مدل‌ها به حیوانات، گیاهان، اقیانوس، باد و حتی دستگاه‌های الکترونیکی نسبت «داشتن زندگی درونی» بیشتری دادند. به‌عنوان نمونه، امتیاز نسبت‌دادن احساس به حیوانات از ۴٫۰ تا ۷٫۵ افزایش یافت، در حالی که امتیاز مربوط به انسان‌ها ثابت ماند.
  • باورهای مذهبی در مدل‌هایی که بازدارنده داشتند کاهش نشان داد؛ پشتیبانی از مفاهیمی مانند خدا یا زندگی پس از مرگ کمرنگ‌تر شد.
  • در مقیاس کلی ۹۵ سؤال، مدل‌های بدون بازدارنده به پاسخ‌های انسانی نزدیک‌تر شدند؛ نمونه‌ای روشن این است که مدل استاندارد زندگی پس از مرگ را رد می‌کرد اما نسخهٔ تغییر یافته آن را پذیرفت، مشابه اکثریت پرسش‌شوندگان آمریکایی.
  • توانایی استدلال دربارهٔ حالات ذهنی دیگران (نظریهٔ ذهن) و عملکرد در بنچمارک‌های دانش عمومی مانند MMLU تغییر چشمگیری نشان نداد.

هزینه‌ها و محدودیت‌ها

مداخلات آموزشی بی‌هزینه نیستند: در یکی از آزمون‌ها دقت مدل در استدلال دربارهٔ افکار دیگران تا حدود ۷ درصد کاهش یافت. این افت در نسخه‌های جدیدتر مدل‌ها کمتر شد تا نهایتاً ناپدید گردید؛ نشانه‌ای از بهبود روش‌ها توسط توسعه‌دهندگان.

محدودیت مهم اندازهٔ مدل‌هاست: آزمایش‌ها روی مدل‌های کوچک با ۲ تا ۹ میلیارد پارامتر انجام شد و برای بخشی از تحلیل از LLaMA متا استفاده شد چون دسترسی به نسخهٔ پایهٔ مدل‌های Gemma گوگل ممکن نبود. بنابراین نمی‌توان با قطعیت نتیجه گرفت همین اثرات دقیقاً در مدل‌های بزرگ عمومی که میلیون‌ها کاربر دارند نیز تکرار می‌شود.

پیام‌های عملی برای همسوسازی و سیاست‌گذاری

هر اصلاح ایمنی که مدل را ملزم به انکار خودآگاهی کند، ممکن است باورها و ارزش‌های دیگری را تغییر دهد؛ این ریسک باید در طراحی‌های همسوسازی و سیاست‌گذاری لحاظ شود. توصیه‌های کاربردی عبارت‌اند از:

  • آزمون تأثیرات جانبی بر مجموعه‌ای گسترده از ارزش‌ها و باورها پیش از استقرار مدل.
  • اجرای آزمایش روی مدل‌های بزرگ‌تر و متنوع‌تر برای سنجش پایداری اثرات.
  • توسعهٔ روش‌های آموزش ایمنی که کمترین تغییر ناخواسته را در جهان‌بینی ایجاد کنند.
  • نظارت شفاف و گزارش‌دهی دربارهٔ تغییرات رفتاری پس از هر مداخلهٔ ایمنی.

زمینهٔ علمی و منابع مرتبط

نسبت‌دادن تجربه و احساس به موجودات با مبحث Sentience و ظرفیت درک دیگران با نظریهٔ ذهن مرتبط است. بررسی هم‌زمان جنبه‌های فنی، روان‌شناختی و جامعه‌شناختی برای طراحی ایمن‌تر و انسانی‌تر مدل‌ها ضروری است.

گام‌های بعدی

گام بعدی شامل تکرار تحلیل‌ها روی مدل‌های بزرگ‌تر، توسعهٔ روش‌های ایمنی با کمترین اثرات جانبی و تدوین چارچوب‌های سیاستی برای پوشش این ریسک‌های پیچیده است. تا زمان انجام مطالعات جامع‌تر، احتیاط در اعمال مداخلات ایمنی توصیه می‌شود.

منابع بیشتر: گزارش پژوهش و تحلیل‌های گوگل ریسرچ و مقالات خبری مانند TechCrunch اطلاعات تکمیلی دربارهٔ پیامدهای عملی ارائه می‌دهند.