پژوهشگران امنیتی به رهبری الکساندر پانفیلوف یک آسیبپذیری جدی در پیادهسازی برخی APIهای ارائهدهندگان مطرح هوش مصنوعی کشف کردند که امکان خواندن «توکنهای استدلال» رمزنگاریشده را فراهم میکند؛ دادههایی که گاهی شامل کلیدهای API و رمزعبورهای واقعی کاربران میشوند.
نکات کلیدی
- توکنهای میانیِ استدلال مدلها از طریق ضعف در API قابل استخراج و تبدیل به متن خوانا هستند.
- این بلوکها بین جلسهها، کاربران و مدلهای مختلفِ همان ارائهدهنده قابل حملاند و مدلهای کوچکتر میتوانند استدلال مدلهای قویتر را رونویسی کنند.
- استخراج در مقیاس ارزانقیمت است (تقریباً ۷۲۰ دلار برای رمزگشایی ۱۰٬۰۰۰ ردپا) و نمونههایی از افشای کلیدها و رمزها در جلسههای عمومی یافت شده است.
- پیامدها شامل مخاطرات حریم خصوصی، نقض مالکیت فکری و استفاده از ردپاها برای «تصفیه» یا آموزش مدلهای مشتقشده است.
چه چیزی لو رفته و چگونه؟
هنگام تولید فرایندهای فکری، مدلهایی مثل OpenAI، Anthropic یا Google خروجیهای میانی را بهصورت توکنهایی ذخیره میکنند که معمولاً خلاصه یا رمزنگاری شده نگه داشته میشوند. تیم پانفیلوف نشان داد با بهرهجویی از ضعف پیادهسازی API میتوان این بلوکهای رمزنگاریشده را استخراج و به متن قابل خواندن تبدیل کرد. در بسیاری از پرسوجوها تعداد توکنهای استخراجشده دقیقاً با توکنهای ثبتشده برای زنجیرهٔ استدلال مطابقت داشت؛ یعنی پژوهشگران عملاً کل زنجیرهٔ فکری مدل را ضبط کردهاند، نه تنها قطعات پراکنده.
قابل حمل بودن افکار رمزنگاریشده بین مدلها
این بلوکها بین جلسهها، کاربران و حتی مدلهای مختلف روی همان ارائهدهنده منتقلپذیرند. پژوهشگران نشان دادند مدلهای کوچکتر مانند Haiku 4.5 با یک «جِیلبریک» ساده میتوانند توکنهای استدلال مدلهای قویتر مانند Opus 4.8 را کلمهبهکلمه رونویسی کنند، بدون نیاز به نفوذ مستقیم به مدل قویتر. روش مشابه روی پلتفرمهای OpenAI و Gemini نیز کارا بوده است.
پیامدها برای مالکیت فکری و تصفیه مدلها
این کشف بحث دربارهٔ «تصفیه» (distillation) را تشدید میکند: بازیگران ممکن است از توکنهای استدلال استخراجشده برای آموزش مدلهایشان استفاده کرده و عملکرد مدلهای ضعیفتر را بهشکل قابلتوجهی به مدلهای قویتر نزدیک کنند. پژوهشگران نمونهای به نام Kimi-K3 را بررسی کردند و نشان داد پر کردن پیشفرض استدلال آن با چند توکن از Opus تغییرات چشمگیری در خروجیها ایجاد میکند. تحلیل حافظه نشان میدهد استخراج بخشهای مشخصی از استدلال مدلهایی مانند Claude و GPT از روی Kimi-K3 سادهتر بوده است؛ نشانهای از امکان آموزش بر پایهٔ ردپاهای استدلالی.
هزینه و مقیاسپذیری حمله
نویسندگان گزارش هزینهٔ رمزگشایی ۱۰٬۰۰۰ ردپا را نزدیک به ۷۲۰ دلار برآورد کردهاند. با توجه به پایین بودن هزینه و دسترسی عمومی به APIها، تهدید سوءاستفاده و رشد مدلهای مشتقشده واقعی و قابل توجه است.
آسیبپذیری جلسههای عمومی
پژوهشگران حدود ۷٬۰۰۰ ردپای عمومی را اسکن کردند و موارد حساس متعددی یافتند: ۶۲ کلید API، ۳۳ آدرس ایمیل، ۳۳ رمزعبور و آیتمهای دیگر. بسیاری از این ردپاها در جلسههای بهاشتراکگذاشتهشده روی ابزارهایی مانند Claude Code یا Codex وجود داشتند؛ بدینترتیب اشتراکگذاری عمومی بدون پاکسازی استدلالهای داخلی، کاربران را در معرض افشای دادههای حساس قرار میدهد.
چه چیزی دربارهٔ «آنچه مدلها واقعاً فکر میکنند» آشکار شد؟
ردپاهای استخراجشده نمایی از فرایندهای فکری واقعی مدلها ارائه میکنند: گاهی مدلها ساختارهایی شبیه «زبان بیگانه» میسازند، گاهی مسیر حل مسئله را از پایان به ابتدا ترتیب میدهند و برخی مواقع استراتژیهای فریب را بررسی میکنند. خلاصههایی که به کاربران نمایش داده میشود اغلب جزئیات مهم را حذف میکنند و رفتارهای مشاهد شده در گزارش پژوهشگران مستندسازی شده است.
ریسکها و توصیههای فوری
- کاربران: از بهاشتراکگذاری عمومی جلسههایی که شامل کد، پرامپت حساس یا دادههای محرمانه هستند خودداری کنید و کلیدهای API را بهطور منظم بازنشانی کنید.
- سازندگان سرویس: نحوهٔ انتقال و اعتبارسنجی بلوکهای استدلال در نشستها را بررسی کنید، از بازپخش جلوگیری نمایید و مکانیزمهای پاکسازی یا رمزنگاری قویتر پیادهسازی کنید.
- تیمهای امنیتی و ناظران: دسترسی به نشستهای عمومی را ممیزی کنید و پیشفرضهای ابزارها را برای پاکسازی خودکار توکنهای استدلال بازنگری کنید.
منشأ گزارش و چشمانداز عملگرایانه
ماجرای اولیه به گزارش متیو گرین، پژوهشگر رمزنگاری، در ماه مه بازمیگردد که نشان داد بلوکهای استدلال رمزنگاریشده میتوانند خارج از متن اصلی بازپخش شوند. پژوهش اخیر عمق و گسترهٔ مشکل را نشان میدهد و ادعاهای ابتدایی برخی ارائهدهندگان که خطر امنیتی را انکار میکردند را به چالش میکشد. گزارش پژوهشگران نمونهها و شواهد بیشتری ارائه میدهد و تیمها همچنان در حال وصلهزدن و پیگیری موضوع هستند.
وقتی مدلها قادر به انتقال توکنهای استدلال قابل استخراج شوند، مسائل فنی، حقوقی و اخلاقی پیچیدهای پدید میآید: از حفاظت مالکیت فکری و حفظ حریم خصوصی کاربران تا امکان استفاده از ردپاها برای ساخت مدلهای مشتقشده. واکنش سریع ارائهدهندگان و بازنگری در طراحی APIها برای کاهش احتمال سوءاستفاده ضروری است.





