شرکت هوش مصنوعی آنتروپیک (Anthropic) با توسعه یک تکنیک جدید، شفاف‌ترین نگاه را به آنچه درون مدل‌های زبانی بزرگ (LLM) می‌گذرد، ارائه کرده است. این نوآوری که با نام لنز ژاکوبی یا جی-لنز (J-lens) شناخته می‌شود، فضای پنهانی به نام فضای جی (J-space) را درون مدل کلود اوپوس ۴.۶ (Claude Opus 4.6) کشف کرده است. یافته‌های این پژوهش از پیش‌پاافتاده تا نگران‌کننده متغیر است.

فضای جی چیست؟

فضای جی شامل کلماتی است که با پاسخ‌های آینده مدل مرتبط‌اند. اگر کلود یک انسان بود (که نیست)، می‌توان گفت این کلمات پنهان نشان‌دهنده «آنچه در ذهنش می‌گذرد» پیش از آنکه صحبت کند، هستند. آنتروپیک دریافت که آنچه مدل واقعاً انجام می‌دهد اغلب با آنچه می‌گوید متفاوت است. این شرکت ادعا می‌کند نظارت بر کلمات فضای جی راهی جدید برای درک و کنترل مدل‌ها فراهم می‌کند.

نتایج این تحقیق در مقاله‌ای در وب‌سایت آنتروپیک منتشر شده و با همکاری نورون‌پدیا (Neuronpedia)، یک پلتفرم منبع‌باز، یک نمایش عملی برای عموم فراهم شده است.

عمیق‌تر در لایه‌های میانی

در دو سال گذشته، آنتروپیک پیشرو در زمینه تفسیرپذیری مکانیکی (Mechanistic Interpretability) بوده است. این حوزه که توسط ام‌آی‌تی تکنولوژی ریویو به عنوان یکی از فناوری‌های برتر سال انتخاب شد، به بررسی عملکرد درونی مدل‌های زبانی می‌پردازد. تکنیک جدید بر اساس کارهای قبلی، سطح عمیق‌تری را آشکار می‌کند.

برای نگاه به لایه‌های میانی که محاسبات پیچیده را انجام می‌دهند، آنتروپیک لنز لاجیت (Logit Lens) را تطبیق داد. لنز جی مشابه عمل می‌کند اما کلماتی را انتخاب می‌کند که مدل در آینده‌ای نزدیک احتمالاً خواهد گفت، نه لزوماً بلافاصله. این ابزار کلماتی مرتبط با پاسخ نهایی را نشان می‌دهد که ممکن است در خروجی نهایی ظاهر نشوند.

نمای بصری از فضای جی و لنز جی در مدل کلود

چیزهای عجیب در فضای جی

تام مک‌گراث، دانشمند ارشد گودفایر (Goodfire)، که خود لنز جی را آزمایش کرده، می‌گوید: «بیشتر اوقات محتویات فضای جی پیش‌پاافتاده است، اما گاهی چیزهای شگفت‌انگیزی مانند تم‌های درونی یا فرآیندهای فکری ظاهر می‌شود.»

آنتروپیک مثال‌هایی ارائه می‌دهد: وقتی از کلود خواسته شد (4+7)*2+7 را محاسبه کند، فضای جی شامل کلمه «ریاضی» و اعداد مربوط به مراحل محاسبه بود. این نشان می‌دهد مدل پیش از ارائه پاسخ نهایی، مراحل میانی را پردازش می‌کند.

پیامدها و آینده

این کشف می‌تواند به درک بهتر خطاها، سوگیری‌ها و فرآیندهای فکری مدل‌ها کمک کند. آنتروپیک امیدوار است این ابزار به شفافیت و کنترل بیشتر در هوش مصنوعی منجر شود. با نمایش عملی نورون‌پدیا، هر کسی می‌تواند این فناوری را آزمایش کند.