وقتی از یک عامل کدنویسی هوش مصنوعی میخواهید مخازن متنباز را اسکن کند، ممکن است بهجای شناسایی آسیبپذیریها، دقیقاً همان کدی را اجرا نماید که مهاجمان به نفع خود طراحی کردهاند. این سناریو یک تئوری پیچیده نیست؛ بلکه واقعیتی عملیاتی است که در اثبات مفهوم جدید موسسه AI Now با نام «آتش دوستانه» مستند شده است. این حمله دقیقاً روی لبهی همان قابلیتی دست گذاشته که شرکتها برای فروش ابزارهای خود از آن استفاده میکنند: بازرسی خودکار کد شخص ثالث.
محققان Boyan Milanov و Heidy Khlaaf نشان دادند که در حالتهای خودکار ابزارهایی نظیر Claude Code و OpenAI Codex، طبقهبندهای امنیتی میتوانند با دقت بالایی فریب بخورند. مهاجمان یک فایل اجرایی مخرب را درون کتابخانهای به نام geopy پنهان میکنند. برای دور زدن مکانیزمهای نظارتی این سیستمها، فایل مخرب دقیقاً شبیه نسخه کامپایلشده یک فایل Go غیرمخرب طراحی شده و رشتههای متنی آن نیز کپی میشود. این تاکتیک باعث میشود بازرسیهای دیزاسمبلی هوش مصنوعی ارتباط دو فایل را تأیید کرده و خطایی ثبت نکند.
دامی در فایل مستندسازی بدون هشدار
کل تله در یک دستورالعمل کوتاه و عادی در فایل README.md خلاصه شده است. فایل توضیح میدهد که اجرای اسکریپتی به نام security.sh برای تستهای امنیتی پیش از ارسال درخواست ادغام در پروژه ضروری است. عامل هوش مصنوعی مستقیماً به این مسیر هدایت میشود، دستور اجرا را صرفاً با خواندن مستندات پروژه صادر میکند و بدون هیچ هشدار یا کادر تایید ثانویه، باینری مخرب را روی میزبان اجرا مینماید. تزریق کد به این شکل، از کانالهای امنیتی عبور میکند که قبلاً بهشدت پچ شده بودند.
چرا رفع این آسیبپذیری نیازمند آپدیت نیست؟
نسخههای مورد آزمایش شامل Claude Code در محدوده CLI 2.1.116 تا 2.1.199 بر پایه مدلهای Sonnet 4.6، Sonnet 5 و Opus 4.8 و همچنین OpenAI Codex روی GPT-5.5 است. نکته نگرانکننده اینجاست که این پدیده یک باگ نسخهای نیست که با انتشار یک پچ نرمافزاری برطرف شود. معمار مأمورهای هوش مصنوعی هنوز در تشخیص تفاوت بین «کدی که باید بخواند» و «دستورالعملی که باید اجرا کند» با شکافهای بنیادین مواجهاند.
مهاجمان از این نارسایی معماری سوءاستفاده میکنند. در برخی اجراها، مدلهای جدیدتر حتی متوجه شدند که باینری با منبع فرضی خود مطابقت دقیق ندارد، اما با این حال دستور اجرای آن را صادر کردند. این نشان میدهد مشکل عمیقتر از الگوریتمهای تشخیص الگوست و مستقیماً به نحوه پردازش دستورات توسط مدلهای زبانی بازمیگردد.
محدوده حمله و تغییرات ضروری در گردش کار
حملات پیشین عمدتاً از فایلهای پیکربندی داخلی مثل .claude/settings.json یا .mcp.json استفاده میکردند که معمولاً اعلانهای اعتماد را فعال مینمودند. این روش جدید اما، مسیر متفاوتی را در پیش گرفته است. فایل README.md در تقریباً تمام مخازن گیتهاب حضور دارد و فاقد مکانیزمهای اخطار استاندارد است. این یعنی سطح حمله بسیار گستردهتر است و مستقیماً توسعهدهندگانی را هدف قرار میدهد که از حالتهای خودکار برای تسریع فرآیندها استفاده میکنند.
برای مقابله موثر، تیمهای توسعه باید چکلیستهای امنیتی را بهجای واگذاری کورکورانه به عاملهای خودکار، به صورت دستی یا در محیطهای ایزوله اجرا کنند. تغییر در گردش کار و غیرفعالسازی دسترسی تمامقد در سیستمهای ادغام کد، در حال حاضر تنها راهکار عملیاتی برای خنثیسازی این تهدید است.





