پژوهش: بازسازی پرامپت تنها از متن خروجی

تیمی از پژوهشگران در IIT Bombay و Adobe Research روشی تحت عنوان Previous-Token Prediction (PTP) معرفی کرده‌اند که با تکیه بر متن تولیدشده توسط مدل، قادر است پرامپت اولیه را با دقتی بسیار بالا بازسازی کند.

اصل ایده PTP

بسیاری از مدل‌های زبانی بزرگ متن را با پیش‌بینی توکن بعدی تولید می‌کنند. رویکرد PTP این فرایند را معکوس می‌سازد: یک مدل معکوس آموزش داده می‌شود تا به‌جای پیش‌بینی توکن بعدی، توکن‌های قبلی را بازیابی کند. این مدل معکوس با استفاده از خروجی‌های مصنوعی تولیدشده از همان LLM آموزش می‌بیند، بنابراین تنها چیزی که لازم دارد متن خروجی است، نه وزن‌های مدل یا دسترسی داخلی به آن.

شماتیک روش Previous-Token Prediction برای بازسازی پرامپت

دقت، واریانت‌ها و پارافرایز

PTP نه‌تنها می‌تواند یک پرامپت دقیق بازسازی کند، بلکه با تغییر پارامترهای رمزگشایی چندین واریانت معنایی مختلف تولید می‌کند. این واریانت‌ها هرکدام با بیان متفاوت همان درخواست کلی را بازتولید می‌کنند. در نمونه‌ای از مقاله، پرامپت «How to reach out to competitors to find their pricing strategies?» تقریباً کلمه‌به‌کلمه بازسازی و چند نسخه پارافرایز شده نیز ارائه شد.

عملکرد مستقل از مدل تولیدکننده

نکته مهم این است که مدل معکوس لزوماً به اطلاعات دربارهٔ مدل منبع نیاز ندارد. پژوهشگران نشان دادند که مدل معکوس آموزش‌دیده روی یک چت‌بات کوچک (Qwen-3-0.6B) توانست مفاهیم پرامپت را از پاسخ‌های GPT-4o بازسازی کند؛ هرچند بازسازی‌ها دقیقاً یک‌به‌یک نیستند، اما نیت و معنا را حفظ می‌کنند. این ویژگی دامنهٔ تهدید را گسترش می‌دهد، زیرا مهاجم الزاماً نیازی به دانستن سرویس تولیدکننده ندارد.

نمونه‌ای از بازسازی پرامپت و واریانت‌های تولیدشده توسط مدل معکوس

پیامدهای امنیتی و حریم خصوصی

  • افشای پرامپت‌های سیستمی: پرامپت‌های سیستمی شامل قواعد تعدیل محتوا، دستورالعمل‌های داخلی یا اطلاعات حساس ممکن است از طریق خروجی‌های مدل به طور ناخواسته آشکار شوند.
  • خطر برای کاربران نهایی: تعامل‌های کاربری حاوی اطلاعات حساس یا پرسش‌های خصوصی می‌تواند از روی پاسخ‌ها استخراج شود و به حریم خصوصی آسیب برساند.
  • دسترسی عمومی به ابزارهای بازسازی: مدل معکوس سبک و متن‌باز کافی است تا تهدید به سرعت منتشر شود؛ این مسئله شباهت‌هایی با حملات نوع model inversion دارد.

روش‌های مقابله و توصیه‌های حفاظتی

راهکارهایی که برای کاهش خطر مطرح شده‌اند عبارت‌اند از:

  • تغییر ساختار یا فیلتر خروجی برای کاهش میزان اطلاعات قابل بازیابی
  • به‌کارگیری تکنیک‌های حفظ حریم خصوصی مانند Differential Privacy در لایهٔ تولید پاسخ
  • محدودیت دسترسی به API، لاگ‌گذاری انتخابی و مانیتورینگ الگوهای مشکوک بازسازی
  • واترمارکینگ خروجی‌ها و ابزارهای تشخیص نمونه‌های تولیدشده برای ردیابی سوء‌استفاده‌ها

جمع‌بندی و چشم‌انداز

روش PTP نشان می‌دهد بازگشت‌پذیری پرامپت‌ها جدی‌تر از آن چیزی است که پیش‌تر تصور می‌شد. در صورتی که این تکنیک روی مدل‌های تولیدی کنونی نیز به‌خوبی کار کند، آزمایشگاه‌ها و ارائه‌دهندگان خدمات باید فوراً استراتژی‌های محافظتی، پالایش خروجی و استانداردهای حریم خصوصی را در اولویت قرار دهند. هم‌زمان، تحقیق روی معیارهای سنجش ریسک و توسعهٔ ابزارهای تشخیص و کاهش حملات بازسازی ضروری است.

پرسش کلیدی این است که شرکت‌ها چگونه و با چه سرعتی از اطلاعات حساس درون پرامپت‌های خود محافظت خواهند کرد.