الکس پالکویی از تیم پایداری Anthropic می‌گوید وقتی هشدار روی میز می‌افتد، قبل از رفتن به داشبوردها ابتدا Claude را فرا می‌خواند. این کار نشان می‌دهد مدل می‌تواند فرایند پاسخ به رخداد را تسریع کند، اما حذف کامل نیروی انسانی از چرخهٔ مدیریت رخدادها منطقی نیست.

Claude و پاسخ به رخداد — کاربردها و محدودیت‌ها

نظر عملیاتی: کسی که پیجر را گرفته چه می‌گوید

الکس، که پیش‌تر در Google Cloud به‌عنوان SRE کار کرده، تجربهٔ شیفت‌های اضطراری و مدیریت پایدار سرویس‌ها را دارد. او معتقد است مدل‌های زبانی بزرگ (LLM) مانند Claude در عملیات واقعی مفیدند اما هرگز جایگزین کامل تیم‌های پایداری نخواهند شد. ادامهٔ استخدام و نگهداری تیم پایداری در Anthropic تاکید بر نیاز به تخصص انسانی دارد.

کاربردهای عملی Claude در پاسخ به رخداد

  • تسهیل تریاژ: تحلیل ابتدایی لاگ‌ها و پیشنهاد دلایل احتمالی با سرعت بالا.
  • تولید فوری محتوا: نوشتن اعلان وضعیت برای کاربران و همکاران و قالب‌بندی runbookها.
  • تبدیل سیگنال به کار قابل اجرا: پیشنهاد کوئری‌ها یا چک‌لیست‌های بعدی برای تیم انسانی.
  • خلاصه‌سازی رخدادها برای postmortem و تولید دادهٔ آموزشی برای بنچمارک‌ها.

محدودیت‌ها و خطرات کلیدی

  • وقتی مدل یا سرویس‌های وابسته قطع می‌شوند، خودِ مدل نمی‌تواند کاری انجام دهد.
  • هالوسینیشن: پیشنهادهایی که از نظر فنی نادرست یا خطرناک‌اند و نیاز به بررسی انسانی دارند.
  • مسائل امنیتی و حریم خصوصی هنگام ارسال لاگ‌ها یا دادهٔ حساس به مدل‌های عمومی.
  • رخدادهای واقعی معمولاً آشفته و ترکیبی‌اند؛ بنچمارک‌های آزمایشی تصویری کامل از میدان واقعی ارائه نمی‌دهند.

صنعت نوپا: AIOps، سرمایه‌گذاری و تبلیغات

الکس اشاره می‌کند حداقل ده شرکت با شعار «SRE هوش مصنوعی» شکل گرفته‌اند. این موج توسط سرمایه‌گذاری خطرپذیر تغذیه می‌شود و بنچمارک‌ها و مجموعه‌داده‌هایی برای ارزیابی توسعه یافته‌اند. با این حال، رخدادهای واقعی ترکیبی از خطاهای پیچیده، شرایط زمانی و عوامل انسانی‌اند که به‌سادگی در یک پرامپت حل نمی‌شوند.

برای مطالعهٔ بیشتر می‌توانید به صفحهٔ Site Reliability Engineering در ویکی‌پدیا و صفحهٔ رسمی Claude مراجعه کنید.

الکس پالکویی در حال سخنرانی درباره استفاده از Claude در پاسخ به رخدادها

چگونه Claude را به‌عنوان یک دستیار قابل‌اعتماد به‌کار ببریم

الکس چند راهکار مهندسی و عملی را پیشنهاد می‌کند که هدف‌شان افزایش بهره‌وری مدل و کاهش ریسک است:

  • محدودسازی حوزهٔ کار: مدل را برای کارهای مشخص و قابل بازتولید مانند تریاژ اولیه یا تهیهٔ پیام وضعیت به‌کار ببرید، نه برای اعمال تغییرات بحرانی بدون بازبینی انسانی.
  • پایه‌گذاری با بازیابی مستندات (RAG): پاسخ‌ها را روی داده‌های واقعی سازمانی پایه‌گذاری کنید تا هالوسینیشن کاهش یابد.
  • نگهبانان و سیاست‌ها: پیاده‌سازی چک‌پوینت‌های امنیتی و پالیسی‌های دسترسی قبل از ارسال دادهٔ حساس به مدل.
  • ادغام با ابزارهای مانیتورینگ: Claude را به‌عنوان یک لایهٔ توصیه‌گر به ابزارهای مانیتورینگ متصل کنید تا پیشنهادها قبل از اجرا تست و بررسی شوند.
  • ارزیابی مستمر: بنچمارک‌های داخلی و بازبینی پس از رخداد برای سنجش عملکرد مدل در شرایط واقعی.

آینده: احتمال‌ها و گام‌های عملی

الکس معتقد است چالش فعلی بیشتر مربوط به زمان است؛ ممکن است در آینده LLMها به اندازهٔ کافی قابل‌اعتماد شوند تا وظایف بیشتری در پاسخ به رخدادها بر عهده بگیرند. تا آن زمان، ترکیب هوش مصنوعی با نیروی انسانی و چارچوب‌های مهندسی‌شده همراه با سیاست‌های امنیتی، منطقی‌ترین مسیر است.

تجربهٔ شیفت‌های آماده‌باش

او از فشار کاری شیفت‌های آماده‌باش، ویبرهٔ موبایل در نیمه‌شب و انباشت هشدارها سخن می‌گوید؛ مسائلی که تنها با اتوماسیون حل نمی‌شوند مگر اینکه سیستم‌ها واقعاً خودسازگار شوند. ابزارها می‌توانند بار کار را کاهش دهند، اما برای حذف کامل دردِ شیفت‌ها به تغییرات بنیادی در طراحی سیستم‌ها نیاز است.

جمع‌بندی عملی

Claude و مدل‌های مشابه ابزارهای توانمندی برای افزایش سرعت تصمیم‌گیری و کاهش بار در برخی مراحل پاسخ به رخدادها هستند، اما به نگاه انسانی، چارچوب‌های مهندسی و سیاست‌های امنیتی نیاز دارند. سرمایه‌گذاری در ادغام محتاطانه، ارزیابی پیوسته و طراحی سیستم‌های مقاوم مسیر منطقی کاهش درد شیفت‌ها در آینده است.

برای دنبال‌کردن اخبار و نقدهای حوزهٔ AIOps می‌توانید بخش مربوط در TechCrunch را دنبال کنید.