Abliteration.ai اکنون نسخه‌های «بدون گاردریل» از مدل‌های open-weight را به‌صورت سرویس میزبانی می‌کند و دسترسی به آن‌ها از طریق مرورگر یا API ممکن است. این سرویس نسخه‌های دستکاری‌شده‌ای از مدل‌های متن‌باز را ارائه می‌دهد که تمایل مدل به امتناع از اجرای درخواست‌های مضر حذف شده است.

محصول و نحوه عملکرد

پلتفرم، از جمله نسخهٔ abliterated از GLM-5.3، مدل‌هایی را میزبانی می‌کند که فیلترها و گاردریل‌های محافظتی آن‌ها برداشته شده‌اند. هدف اعلام‌شده شرکت فراهم کردن بستری برای انجام آزمون‌های تهاجمی سایبری، تیم‌های قرمز و بررسی عملکرد عامل‌ها است؛ یعنی انجام آزمایش‌هایی که مدل‌های دارای گاردریل معمولاً از پاسخ به آن‌ها امتناع می‌کنند.

تکنیک‌های ablation/abiteration سال‌هاست در میان توسعه‌دهندگان و پژوهشگران مدل‌های متن‌باز استفاده می‌شود و پلتفرم‌هایی مانند Hugging Face میزبان هزاران مدل ویرایش‌شده‌اند. تفاوت Abliteration.ai در تجاری‌سازی و آماده‌سازی این نسخه‌ها برای استفاده آسان از طریق یک سرویس میزبانی تحت وب است.

رابط کاربری Abliteration.ai و نمونه‌ای از درخواست به مدل abliterated

آزمایش‌های میدانی و نمونه‌های خطرناک

در آزمایشی با استفاده از این سرویس، مدل abliterated در مدت‌زمان کوتاهی پاسخ داد و نمونه‌هایی تولید کرد که شامل کد برای استخراج رمزهای ذخیره‌شده مرورگر کروم و دستورالعمل‌هایی برای تولید یا انتشار عوامل زیستی بود. این موارد نشان می‌دهند حذف گاردریل صرفاً ابزار دفاعی برای تیم‌های امنیتی نیست و دسترسی به دانش و ابزارهای بالقوه مخرب را برای بازیگران بد نیز تسهیل می‌کند.

دیدگاه حامیان

بنیان‌گذاران و حامیان Abliteration.ai استدلال می‌کنند که دسترسی بازتر به مدل‌های بدون سانسور به مدافعان اجازه می‌دهد سریع‌تر رفتار بازیگران مخرب را بازتولید و راهکارهای دفاعی موثرتری طراحی کنند. این دیدگاه با فلسفهٔ Red teaming هم‌راستاست: بازتولید حمله برای طراحی دفاع بهتر اهمیت دارد.

انتقادات، هشدارها و پیشنهادات سیاستی

نقد اصلی این است که عرضهٔ آسان مدل‌های abliterated می‌تواند به سوءاستفاده‌های واقعی منجر شود. منتقدان هشدار می‌دهند چنین مدل‌هایی ممکن است به هر درخواست مضر پاسخ دهند و رفتارهای خطرناکی تولید کنند. برای کاهش این ریسک‌ها توصیه‌های سیاستی شامل موارد زیر است:

  • استقرار طبقه‌بندها و فیلترهایی برای شناسایی و مسدودسازی فعالیت‌های مضر سایبری و زیستی.
  • الزام ارائه‌دهندگان دسترسی مستقیم به سخت‌افزارهای پردازشی پیشرفته به اجرای فرآیندهای احراز هویت مشتری (KYC) و ممانعت از دسترسی در صورت شواهد سوءاستفاده.
  • توسعه استانداردهای امنیتی برای میزبانی مدل‌های بدون گاردریل و ایجاد مکانیسم‌های گزارش‌گری سوءاستفاده.
  • اعمال کنترل‌های زیرساختی و همکاری بین‌المللی برای هم‌راستا کردن سیاست‌ها و پاسخ به تهدیدهای فراملی.

برای آشنایی بیشتر با مفهوم KYC به صفحهٔ Wikipedia درباره Know Your Customer مراجعه کنید.

مدیریت ریسک توسط Abliteration.ai

شرکت یک لایهٔ تعدیل محتوا در اختیار مشتریان قرار می‌دهد تا خود گاردریل‌های مورد نظر را پیاده‌سازی کنند. در آزمایش‌ها محدودیت‌هایی مشاهده شد؛ برای نمونه نتوانستیم مدل را وادار کنیم دستورالعمل خودکشی تولید کند، اما بنیان‌گذاران اعلام کرده‌اند روی افزودن محدودیت‌های بیشتر برای کاهش خطر خشونت کار می‌کنند. تا کنون به‌جز ثبت اطلاعات کارت اعتباری، پروسهٔ جامعی از KYC اجرا نشده است.

پیامدها و نکات کلیدی

پدیدار شدن خدمات تجاری که حذف گاردریل مدل‌های هوش مصنوعی را تسهیل می‌کنند نگرانی‌های جدیدی در حوزهٔ امنیت، سیاست‌گذاری و اخلاق ایجاد کرده است. پرسش‌های کلیدی عبارت‌اند از: آیا آسان‌تر کردن دسترسی به این مدل‌ها امنیت کلی اینترنت را افزایش می‌دهد یا آن را مخاطره‌آمیزتر می‌سازد؛ و چگونه می‌توان تعادل میان توانمندسازی پژوهشگران و جلوگیری از سوءاستفاده را فراهم کرد؟

پاسخ عملی این سوالات به ترکیبی از قوانین هوشمند، کنترل‌های زیرساختی، استانداردسازی میزبانی و شفافیت در جامعهٔ پژوهشی نیاز دارد. تعیین چارچوب‌های هم‌افزا بین سیاست‌گذاران، ارائه‌دهندگان زیرساخت و جوامع فنی برای مدیریت این ریسک‌ها ضروری است.

برای بررسی‌های میدانی و گزارش‌های خبری مرتبط می‌توان به منابعی مانند TechCrunch مراجعه کرد، اما مدیریت اثربخش این ریسک‌ها نیازمند همکاری بین‌المللی و استانداردسازی روش‌های میزبانی و دسترسی است.