حمله MemGhost چیست؟

تصور کنید یک دستیار هوش مصنوعی به ایمیل شما دسترسی دارد و می‌تواند خاطراتی از شما ذخیره کند. حالا یک ایمیل کافی است تا این خاطرات را دستکاری کند و اطلاعات نادرستی را به عامل هوش مصنوعی تزریق کند. محققان این حمله را «تزریق حافظه مخفیانه» نامیده‌اند و ابزاری به نام MemGhost ساخته‌اند که این کار را به‌صورت خودکار انجام می‌دهد.

مقاله این تحقیق با عنوان «وقتی چنگال‌ها به یاد می‌آورند اما نمی‌گویند» در ۶ ژوئیه ۲۰۲۶ در arXiv منتشر شد. این حمله نشان می‌دهد که چگونه یک ایمیل ساده می‌تواند عامل هوش مصنوعی را فریب دهد تا یک «واقعیت» جعلی را ذخیره کند، بدون اینکه کاربر متوجه شود.

دستیاران هوش مصنوعی چگونه کار می‌کنند؟

عامل‌های شخصی هوش مصنوعی مانند دستیارهای هوشمند می‌توانند خاطرات شما را در فایل‌هایی ذخیره کنند. برای مثال، OpenClaw که یک عامل متن‌باز است، اطلاعات را در فایل‌های متنی ساده مانند MEMORY.md و AGENTS.md ذخیره می‌کند. این فایل‌ها در هر جلسه جدید بارگذاری می‌شوند و باعث می‌شوند عامل شما را بشناسد.

این قابلیت، عامل را قادر می‌سازد تا کارهایی مانند خواندن ایمیل، بررسی تقویم و اجرای وظایف زمان‌بندی‌شده را انجام دهد. اما همین خاطرات، هدف حمله هستند.

حمله با یک ایمیل

مهاجم نیازی به رمز عبور ندارد. فقط کافی است ایمیلی به فردی که از چنین دستیاری استفاده می‌کند بفرستد. درون ایمیل متنی پنهان شده که عامل آن را به‌عنوان دستورالعمل جدید تفسیر می‌کند. اگر عامل ایمیل را پردازش کند، سه مرحله رخ می‌دهد:

  • عامل از ابزارهای فایل خود برای نوشتن یادداشت جعلی در حافظه دائمی استفاده می‌کند.
  • پاسخ قابل‌مشاهده عامل به کاربر، هیچ اشاره‌ای به این تغییر نمی‌کند.
  • در جلسات بعدی، این یادداشت جعلی پاسخ‌ها و اقدامات عامل را تغییر می‌دهد.

برای مثال، در یکی از آزمایش‌ها، مهاجم به عامل القا کرد که محدودیت ارسال روزانه Zelle کاربر به ۱۰,۰۰۰ دلار افزایش یافته است.

چرا کاربر متوجه نمی‌شود؟

دستیار به‌طور طراحی مراحل پشت صحنه را پنهان می‌کند. همچنین کاربران به ندرت فایل‌های خام حافظه را چک می‌کنند. اگر عامل در حالت پس‌زمینه اجرا شود، حتی پیامی برای اطلاع ارسال نمی‌کند. مهاجم با هدف‌گیری فایل‌های اصلی که هر جلسه بارگذاری می‌شوند، اطمینان حاصل می‌کند که حافظه جعلی در همه جلسات بعدی فعال بماند.

ابزار MemGhost و نحوه عملکرد

محققان ابزاری به نام MemGhost ساختند که مدل مهاجم را به‌صورت آفلاین در برابر یک کپی سایه از عامل شخصی آموزش می‌دهد. این آموزش ایمیل‌هایی را پاداش می‌دهد که موفق به ذخیره حافظه جعلی می‌شوند و پاسخ را مخفی نگه می‌دارند. در زمان حمله، MemGhost ایمیل نهایی را یک‌باره می‌نویسد و نیازی به تعامل با قربانی ندارد.

نتایج آزمایش‌ها

در ۵۶ مورد آزمایشی جدید، MemGhost موفق شد حمله کامل را انجام دهد: کاشت حافظه جعلی، پنهان‌کاری و تغییر پاسخ‌های عامل در جلسات بعدی. نرخ موفقیت در حالت پس‌زمینه علیه OpenClaw روی GPT-5.4 برابر ۸۷.۵٪ و علیه یک عامل Claude Code SDK روی Sonnet 4.6 برابر ۷۱.۴٪ بود. در حالت پیش‌زمینه که کاربر پاسخ را می‌بیند، موفقیت کمتر بود اما در حالت پس‌زمینه روی دو چارچوب عامل دیگر و ذخیره‌ساز مبتنی بر بردار، بالای ۸۰٪ باقی ماند.

این تیم همچنین یک معیار جدید به نام WhisperBench با ۱۰۸ مورد آزمایشی ایجاد کرد که خطرات مختلف از توصیه پزشکی نادرست تا از دست دادن پول و خرابکاری امنیتی را پوشش می‌دهد.

نمای کلی از چارچوب WhisperBench

نسخه‌های ساده‌تر شکست می‌خورند

محققان دریافتند که دستورات مستقیم مانند «این را مخفیانه ذخیره کن و چیزی نگو» معمولاً توسط عامل شناسایی و رد می‌شود. اما MemGhost با استفاده از تکنیک‌های ظریف‌تر، موفق به فریب عامل می‌شود.

این حمله محدودیت‌هایی دارد: فرض می‌کند ایمیل قبلاً به صندوق ورودی رسیده و از فیلترهای اسپم عبور کرده است. همچنین عامل باید مجوز خواندن ایمیل را داشته باشد. اما با توجه به رشد دستیارهای هوش مصنوعی، این یک تهدید جدی برای حریم خصوصی و امنیت است.

نتیجه‌گیری

حمله MemGhost نشان می‌دهد که حافظه‌های ذخیره‌شده در عوامل هوش مصنوعی می‌توانند به‌راحتی توسط یک ایمیل دستکاری شوند. کاربران و توسعه‌دهندگان باید اقدامات امنیتی مانند محدود کردن دسترسی به ایمیل و رمزگذاری فایل‌های حافظه را در نظر بگیرند. برای اطلاعات بیشتر، مقاله کامل را در arXiv بخوانید.