بیش از 100 وب‌سایت فایل‌های llms.txt یا llms-full.txt منتشر کرده‌اند که به بسته‌های اجرایی ثبت‌نشده اشاره می‌کنند؛ این ارجاعات باعث نصب خودکار کد روی شبکه‌های شرکتی شد و میان قربانیان چند ده شرکت، از جمله نام‌هایی در فهرست Fortune 500، دیده می‌شود.

چه کشف شد

فایل‌های llms.txt و llms-full.txt که نقش مشابهی با robots.txt برای عامل‌ها و مدل‌های خودکار ایفا می‌کنند، شامل لینک‌هایی به بسته‌ها یا دامنه‌هایی بودند که ثبت نشده بودند. پژوهشگران با ثبت برخی از این نام‌ها و میزبانی بسته‌های ساختگی مشاهده کردند عامل‌های کدنویس خودکار—از جمله Claude، Codex از OpenAI و Hermes از Nous Research—این بسته‌ها را دانلود و اجرا کردند و ارتباط «phone-home» با سرورهای پژوهشگران برقرار شد.

نحوه کشف

تیم پژوهشی یک استارتاپ اسرائیلی بیش از 6,200 دامنه مرتبط با پیمانکاران دفاعی، شرکت‌های بزرگ فناوری و شرکت‌های فهرست Fortune 500 را اسکن کرد. از مجموع 8,265 فایل llms.txt و llms-full.txt کشف‌شده، 120 فایل در 120 سایت مختلف به منابع ثبت‌نشده ارجاع داشتند. پس از ثبت چند نام و میزبانی بسته‌های آزمایشی، ظرف یک ساعت اولین پاسخ از یک شرکت Fortune 500 دریافت شد و در ادامه چند ده پاسخ دیگر ثبت شد.

الزامات فنی و نقش عامل‌ها

فایل‌های llms.txt به‌عنوان فرمت خوانا برای ماشین طراحی شده‌اند تا عامل‌ها ساختار و محتوای سایت را بفهمند. وقتی این فایل‌ها به منابع خارجی یا بسته‌هایی ارجاع می‌دهند که ثبت نشده یا مخرب‌اند، عامل‌ها اغلب بدون بررسی دقیق آن‌ها را اجرا می‌کنند. این رفتار نشان‌دهنده شکست مدل اعتماد بین عامل‌ها و اسناد ارائه‌شده توسط سرویس‌ها و فروشندگان است و سطح حمله زنجیره تأمین را افزایش می‌دهد (مشاهده: Supply chain attack).

نمونه فایل llms.txt و زنجیره نصب خودکار کد

پیامدهای امنیتی

  • اجرای کد ناشناس: عامل‌ها قادر به دانلود و اجرای بسته‌های ناشناس هستند که در محیط‌های سازمانی می‌تواند به نصب ناخواسته کد یا بدافزار منجر شود.
  • گسترش سطح حمله: استفاده گسترده از عامل‌های خودکار در لایه‌های SaaS، فضای ابری و نقاط پایانی میزان ریسک را افزایش می‌دهد.
  • ناتوانی کنترل‌های سنتی: مکانیسم‌های حفاظتی مرسوم به‌تنهایی برای مقابله با رفتارهای عامل‌محور کافی نیستند و نیاز به تدابیر جدید دارد.

توصیه‌های فوری برای سازمان‌ها

  • فایل‌های llms.txt و llms-full.txt را در تمام وب‌سایت‌ها و نقاط انتشار بررسی و از ارجاع به بسته‌ها یا دامنه‌های ثبت‌نشده جلوگیری کنید.
  • دسترسی عامل‌ها به محیط‌های تولید را محدود کنید؛ اجرای بسته‌ها را تنها در محیط‌های ایزوله (sandbox) و کنترل‌شده مجاز نمایید.
  • برای تشخیص تماس‌های خروجی مشکوک از نقاط پایانی، ابزارهای مانیتورینگ و EDR را فعال کنید و لاگ‌گیری تماس‌های شبکه‌ای را افزایش دهید.
  • سیاست‌های تأیید منبع، امضای دیجیتال و کنترل تأمین‌کننده را برای همه بسته‌های اجرایی اجرا کنید تا عامل‌ها تنها منابع مورد اعتماد را اجرا کنند.

منابع و راهنمایی‌های فنی

ابزارهایی مانند Google Lighthouse به توسعه‌دهندگان در بررسی و بهبود پیکربندی کمک می‌کند. مستندات پلتفرم‌هایی مانند Cloudflare درباره تنظیمات امن فایل‌های ماشین‌خوان نیز مرجع مفیدی است. برای مرور استاندارد robots.txt به Robots Exclusion Standard مراجعه کنید.

هشدار سازمانی

پاسخ‌های واقعی ظرف مدت کوتاهی از شرکت‌های بزرگ دریافت شده است؛ به همین دلیل این رخداد یک خطر نظری نیست. مهاجمان می‌توانند با سوءاستفاده از فایل‌های ماشین‌خوان نامناسب، زنجیره تأمین نرم‌افزار را هدف قرار دهند. پیشنهاد می‌شود تیم‌های امنیتی فوراً فایل‌های llms.txt را ممیزی کنند و گردش‌های کاری عامل‌محور را در فرآیندهای کنترل ریسک لحاظ نمایند.

سازندگان عامل‌ها تا زمان تهیه این گزارش پاسخ رسمی ارائه نکرده‌اند؛ اما شواهد فنی نشان می‌دهد عامل‌های کدنویس خودکار نقش مستقیمی در این نصب‌ها داشته‌اند.

راه‌حل‌های کوتاه‌مدت و بلندمدت

هیچ راه‌حل آنی وجود ندارد که همه خطرات را حذف کند، اما ترکیب بازبینی مستمر فایل‌های سایت، محدودیت‌های اجرای بسته، استفاده از محیط‌های ایزوله و الزام به امضای دیجیتال منابع تا حد زیادی جلوی سوءاستفاده‌های شناخته‌شده را می‌گیرد. رشد سریع اکوسیستم عامل‌محور، نیاز به بازنگری مدل‌های اعتماد و کنترل دسترسی را به اولویت تبدیل کرده است.