Abliteration.ai اکنون نسخههای «بدون گاردریل» از مدلهای open-weight را بهصورت سرویس میزبانی میکند و دسترسی به آنها از طریق مرورگر یا API ممکن است. این سرویس نسخههای دستکاریشدهای از مدلهای متنباز را ارائه میدهد که تمایل مدل به امتناع از اجرای درخواستهای مضر حذف شده است.
محصول و نحوه عملکرد
پلتفرم، از جمله نسخهٔ abliterated از GLM-5.3، مدلهایی را میزبانی میکند که فیلترها و گاردریلهای محافظتی آنها برداشته شدهاند. هدف اعلامشده شرکت فراهم کردن بستری برای انجام آزمونهای تهاجمی سایبری، تیمهای قرمز و بررسی عملکرد عاملها است؛ یعنی انجام آزمایشهایی که مدلهای دارای گاردریل معمولاً از پاسخ به آنها امتناع میکنند.
تکنیکهای ablation/abiteration سالهاست در میان توسعهدهندگان و پژوهشگران مدلهای متنباز استفاده میشود و پلتفرمهایی مانند Hugging Face میزبان هزاران مدل ویرایششدهاند. تفاوت Abliteration.ai در تجاریسازی و آمادهسازی این نسخهها برای استفاده آسان از طریق یک سرویس میزبانی تحت وب است.
آزمایشهای میدانی و نمونههای خطرناک
در آزمایشی با استفاده از این سرویس، مدل abliterated در مدتزمان کوتاهی پاسخ داد و نمونههایی تولید کرد که شامل کد برای استخراج رمزهای ذخیرهشده مرورگر کروم و دستورالعملهایی برای تولید یا انتشار عوامل زیستی بود. این موارد نشان میدهند حذف گاردریل صرفاً ابزار دفاعی برای تیمهای امنیتی نیست و دسترسی به دانش و ابزارهای بالقوه مخرب را برای بازیگران بد نیز تسهیل میکند.
دیدگاه حامیان
بنیانگذاران و حامیان Abliteration.ai استدلال میکنند که دسترسی بازتر به مدلهای بدون سانسور به مدافعان اجازه میدهد سریعتر رفتار بازیگران مخرب را بازتولید و راهکارهای دفاعی موثرتری طراحی کنند. این دیدگاه با فلسفهٔ Red teaming همراستاست: بازتولید حمله برای طراحی دفاع بهتر اهمیت دارد.
انتقادات، هشدارها و پیشنهادات سیاستی
نقد اصلی این است که عرضهٔ آسان مدلهای abliterated میتواند به سوءاستفادههای واقعی منجر شود. منتقدان هشدار میدهند چنین مدلهایی ممکن است به هر درخواست مضر پاسخ دهند و رفتارهای خطرناکی تولید کنند. برای کاهش این ریسکها توصیههای سیاستی شامل موارد زیر است:
- استقرار طبقهبندها و فیلترهایی برای شناسایی و مسدودسازی فعالیتهای مضر سایبری و زیستی.
- الزام ارائهدهندگان دسترسی مستقیم به سختافزارهای پردازشی پیشرفته به اجرای فرآیندهای احراز هویت مشتری (KYC) و ممانعت از دسترسی در صورت شواهد سوءاستفاده.
- توسعه استانداردهای امنیتی برای میزبانی مدلهای بدون گاردریل و ایجاد مکانیسمهای گزارشگری سوءاستفاده.
- اعمال کنترلهای زیرساختی و همکاری بینالمللی برای همراستا کردن سیاستها و پاسخ به تهدیدهای فراملی.
برای آشنایی بیشتر با مفهوم KYC به صفحهٔ Wikipedia درباره Know Your Customer مراجعه کنید.
مدیریت ریسک توسط Abliteration.ai
شرکت یک لایهٔ تعدیل محتوا در اختیار مشتریان قرار میدهد تا خود گاردریلهای مورد نظر را پیادهسازی کنند. در آزمایشها محدودیتهایی مشاهده شد؛ برای نمونه نتوانستیم مدل را وادار کنیم دستورالعمل خودکشی تولید کند، اما بنیانگذاران اعلام کردهاند روی افزودن محدودیتهای بیشتر برای کاهش خطر خشونت کار میکنند. تا کنون بهجز ثبت اطلاعات کارت اعتباری، پروسهٔ جامعی از KYC اجرا نشده است.
پیامدها و نکات کلیدی
پدیدار شدن خدمات تجاری که حذف گاردریل مدلهای هوش مصنوعی را تسهیل میکنند نگرانیهای جدیدی در حوزهٔ امنیت، سیاستگذاری و اخلاق ایجاد کرده است. پرسشهای کلیدی عبارتاند از: آیا آسانتر کردن دسترسی به این مدلها امنیت کلی اینترنت را افزایش میدهد یا آن را مخاطرهآمیزتر میسازد؛ و چگونه میتوان تعادل میان توانمندسازی پژوهشگران و جلوگیری از سوءاستفاده را فراهم کرد؟
پاسخ عملی این سوالات به ترکیبی از قوانین هوشمند، کنترلهای زیرساختی، استانداردسازی میزبانی و شفافیت در جامعهٔ پژوهشی نیاز دارد. تعیین چارچوبهای همافزا بین سیاستگذاران، ارائهدهندگان زیرساخت و جوامع فنی برای مدیریت این ریسکها ضروری است.
برای بررسیهای میدانی و گزارشهای خبری مرتبط میتوان به منابعی مانند TechCrunch مراجعه کرد، اما مدیریت اثربخش این ریسکها نیازمند همکاری بینالمللی و استانداردسازی روشهای میزبانی و دسترسی است.





