شرکت هوش مصنوعی آنتروپیک (Anthropic) با توسعه یک تکنیک جدید، شفافترین نگاه را به آنچه درون مدلهای زبانی بزرگ (LLM) میگذرد، ارائه کرده است. این نوآوری که با نام لنز ژاکوبی یا جی-لنز (J-lens) شناخته میشود، فضای پنهانی به نام فضای جی (J-space) را درون مدل کلود اوپوس ۴.۶ (Claude Opus 4.6) کشف کرده است. یافتههای این پژوهش از پیشپاافتاده تا نگرانکننده متغیر است.
فضای جی چیست؟
فضای جی شامل کلماتی است که با پاسخهای آینده مدل مرتبطاند. اگر کلود یک انسان بود (که نیست)، میتوان گفت این کلمات پنهان نشاندهنده «آنچه در ذهنش میگذرد» پیش از آنکه صحبت کند، هستند. آنتروپیک دریافت که آنچه مدل واقعاً انجام میدهد اغلب با آنچه میگوید متفاوت است. این شرکت ادعا میکند نظارت بر کلمات فضای جی راهی جدید برای درک و کنترل مدلها فراهم میکند.
نتایج این تحقیق در مقالهای در وبسایت آنتروپیک منتشر شده و با همکاری نورونپدیا (Neuronpedia)، یک پلتفرم منبعباز، یک نمایش عملی برای عموم فراهم شده است.
عمیقتر در لایههای میانی
در دو سال گذشته، آنتروپیک پیشرو در زمینه تفسیرپذیری مکانیکی (Mechanistic Interpretability) بوده است. این حوزه که توسط امآیتی تکنولوژی ریویو به عنوان یکی از فناوریهای برتر سال انتخاب شد، به بررسی عملکرد درونی مدلهای زبانی میپردازد. تکنیک جدید بر اساس کارهای قبلی، سطح عمیقتری را آشکار میکند.
برای نگاه به لایههای میانی که محاسبات پیچیده را انجام میدهند، آنتروپیک لنز لاجیت (Logit Lens) را تطبیق داد. لنز جی مشابه عمل میکند اما کلماتی را انتخاب میکند که مدل در آیندهای نزدیک احتمالاً خواهد گفت، نه لزوماً بلافاصله. این ابزار کلماتی مرتبط با پاسخ نهایی را نشان میدهد که ممکن است در خروجی نهایی ظاهر نشوند.

چیزهای عجیب در فضای جی
تام مکگراث، دانشمند ارشد گودفایر (Goodfire)، که خود لنز جی را آزمایش کرده، میگوید: «بیشتر اوقات محتویات فضای جی پیشپاافتاده است، اما گاهی چیزهای شگفتانگیزی مانند تمهای درونی یا فرآیندهای فکری ظاهر میشود.»
آنتروپیک مثالهایی ارائه میدهد: وقتی از کلود خواسته شد (4+7)*2+7 را محاسبه کند، فضای جی شامل کلمه «ریاضی» و اعداد مربوط به مراحل محاسبه بود. این نشان میدهد مدل پیش از ارائه پاسخ نهایی، مراحل میانی را پردازش میکند.
پیامدها و آینده
این کشف میتواند به درک بهتر خطاها، سوگیریها و فرآیندهای فکری مدلها کمک کند. آنتروپیک امیدوار است این ابزار به شفافیت و کنترل بیشتر در هوش مصنوعی منجر شود. با نمایش عملی نورونپدیا، هر کسی میتواند این فناوری را آزمایش کند.





