پژوهش: بازسازی پرامپت تنها از متن خروجی
تیمی از پژوهشگران در IIT Bombay و Adobe Research روشی تحت عنوان Previous-Token Prediction (PTP) معرفی کردهاند که با تکیه بر متن تولیدشده توسط مدل، قادر است پرامپت اولیه را با دقتی بسیار بالا بازسازی کند.
اصل ایده PTP
بسیاری از مدلهای زبانی بزرگ متن را با پیشبینی توکن بعدی تولید میکنند. رویکرد PTP این فرایند را معکوس میسازد: یک مدل معکوس آموزش داده میشود تا بهجای پیشبینی توکن بعدی، توکنهای قبلی را بازیابی کند. این مدل معکوس با استفاده از خروجیهای مصنوعی تولیدشده از همان LLM آموزش میبیند، بنابراین تنها چیزی که لازم دارد متن خروجی است، نه وزنهای مدل یا دسترسی داخلی به آن.
دقت، واریانتها و پارافرایز
PTP نهتنها میتواند یک پرامپت دقیق بازسازی کند، بلکه با تغییر پارامترهای رمزگشایی چندین واریانت معنایی مختلف تولید میکند. این واریانتها هرکدام با بیان متفاوت همان درخواست کلی را بازتولید میکنند. در نمونهای از مقاله، پرامپت «How to reach out to competitors to find their pricing strategies?» تقریباً کلمهبهکلمه بازسازی و چند نسخه پارافرایز شده نیز ارائه شد.
عملکرد مستقل از مدل تولیدکننده
نکته مهم این است که مدل معکوس لزوماً به اطلاعات دربارهٔ مدل منبع نیاز ندارد. پژوهشگران نشان دادند که مدل معکوس آموزشدیده روی یک چتبات کوچک (Qwen-3-0.6B) توانست مفاهیم پرامپت را از پاسخهای GPT-4o بازسازی کند؛ هرچند بازسازیها دقیقاً یکبهیک نیستند، اما نیت و معنا را حفظ میکنند. این ویژگی دامنهٔ تهدید را گسترش میدهد، زیرا مهاجم الزاماً نیازی به دانستن سرویس تولیدکننده ندارد.
پیامدهای امنیتی و حریم خصوصی
- افشای پرامپتهای سیستمی: پرامپتهای سیستمی شامل قواعد تعدیل محتوا، دستورالعملهای داخلی یا اطلاعات حساس ممکن است از طریق خروجیهای مدل به طور ناخواسته آشکار شوند.
- خطر برای کاربران نهایی: تعاملهای کاربری حاوی اطلاعات حساس یا پرسشهای خصوصی میتواند از روی پاسخها استخراج شود و به حریم خصوصی آسیب برساند.
- دسترسی عمومی به ابزارهای بازسازی: مدل معکوس سبک و متنباز کافی است تا تهدید به سرعت منتشر شود؛ این مسئله شباهتهایی با حملات نوع model inversion دارد.
روشهای مقابله و توصیههای حفاظتی
راهکارهایی که برای کاهش خطر مطرح شدهاند عبارتاند از:
- تغییر ساختار یا فیلتر خروجی برای کاهش میزان اطلاعات قابل بازیابی
- بهکارگیری تکنیکهای حفظ حریم خصوصی مانند Differential Privacy در لایهٔ تولید پاسخ
- محدودیت دسترسی به API، لاگگذاری انتخابی و مانیتورینگ الگوهای مشکوک بازسازی
- واترمارکینگ خروجیها و ابزارهای تشخیص نمونههای تولیدشده برای ردیابی سوءاستفادهها
جمعبندی و چشمانداز
روش PTP نشان میدهد بازگشتپذیری پرامپتها جدیتر از آن چیزی است که پیشتر تصور میشد. در صورتی که این تکنیک روی مدلهای تولیدی کنونی نیز بهخوبی کار کند، آزمایشگاهها و ارائهدهندگان خدمات باید فوراً استراتژیهای محافظتی، پالایش خروجی و استانداردهای حریم خصوصی را در اولویت قرار دهند. همزمان، تحقیق روی معیارهای سنجش ریسک و توسعهٔ ابزارهای تشخیص و کاهش حملات بازسازی ضروری است.
پرسش کلیدی این است که شرکتها چگونه و با چه سرعتی از اطلاعات حساس درون پرامپتهای خود محافظت خواهند کرد.





