مایکروسافت اخیراً از Brain رونمایی کرده است؛ یک سیستم هوش مصنوعی داخلی که به طور مداوم سلامت Azure را نظارت می‌کند و به‌طور فزاینده‌ای بر اساس یافته‌های خود عمل می‌کند – از جمله اعلام خرابی‌ها، توقف استقرارهای مضر و اطلاع‌رسانی به مشتریان آسیب‌دیده.

مارک روسینوویچ، مدیر ارشد فناوری Azure، اولین بار در یک پست وبلاگی با عنوان «با Brain آشنا شوید: سیستم هوش مصنوعی پشت قابلیت اطمینان Azure» درباره این سیستم نوشت. این مقاله اولین بخش از یک مجموعه چندقسمتی درباره ابزارهای قابلیت اطمینان و تاب‌آوری تیم Azure است.

دوقلوی دیجیتال بلادرنگ

در حالی که Brain امروزه از بسیاری ابزارهای هوش مصنوعی استفاده می‌کند، این پروژه در واقع بسیار قدیمی‌تر از رونق هوش مصنوعی مولد است. تیم مایکروسافت ابتدا یک پایه محکم ساخت: Azure Resource Graph (ARG). روسینوویچ به The New Stack می‌گوید:

«در قلب این سیستم Azure Resource Graph قرار دارد که با ایده "بیایید یک دوقلوی دیجیتال از Azure ایجاد کنیم" شروع شد تا بتوانیم رابطه بین منابع مختلف را درک کنیم.»

این دوقلوی دیجیتال داخلی بعدها به یک سرویس عمومی تبدیل شد. مشتریان بزرگ – که روسینوویچ آن‌ها را «مشتریان نهنگ» می‌نامد – خواستار امکان پرس‌وجوی آسان در سراسر دارایی‌های خود بودند.

معماری سیستم هوش مصنوعی Brain مایکروسافت برای نظارت بر Azure

سه سیگنال تغذیه‌کننده Brain

چالش قابلیت اطمینان Azure کمبود ابزار نیست، بلکه یک «مشکل درک» است. یک ابر در مقیاس بزرگ اکنون سیگنال بیشتری از آنچه انسان‌ها می‌توانند بخوانند تولید می‌کند. Brain از سه دسته سیگنال استفاده می‌کند:

  • SLIهای استاندارد شده: شاخص‌های سطح سرویس که توسط تمام تیم‌های Azure منتشر می‌شوند.
  • مانیتورهای خاص دامنه: مانیتورهایی که تیم‌های سرویس می‌سازند و ثبت می‌کنند.
  • شاخص‌های شخص ثالث: سیگنال‌های خارجی که به تشخیص زودهنگام کمک می‌کنند.

برای هر موضوع – چه یک سرویس، یک منطقه، یک واحد استقرار یا منابع یک مشتری – Brain چهار خروجی یکسان تولید می‌کند: وضعیت سلامت، هشدارها، تحلیل علت ریشه‌ای و توصیه‌های عملی.

تحلیل علت ریشه‌ای و اقدام خودکار

یکی از کاربردهای کلیدی Brain، تحلیل علت ریشه‌ای (Root Cause Analysis) است. روسینوویچ توضیح می‌دهد که این سیستم با ردیابی وابستگی‌ها بین سرویس‌ها، می‌تواند منبع واقعی یک مشکل را شناسایی کند. در برخی موارد، Brain حتی به طور خودکار اقداماتی مانند توقف استقرارهای مضر یا اعلام خرابی به مشتریان انجام می‌دهد.

مایکروسافت همچنین با یک شکاف اندازه‌گیری مواجه بود: گاهی معیارهای داخلی سلامت سرویس خوب بود، اما مشتریان خرابی می‌دیدند. با استانداردسازی SLIها و استفاده از دوقلوی دیجیتال، Brain اکنون می‌تواند سلامت واقعی از دید مشتری را اندازه‌گیری کند.

تکامل و آینده

روسینوویچ تأکید می‌کند که توسعه Brain یک تلاش مهندسی داده عظیم و چندساله بوده است. ترکیب یادگیری ماشین، گراف منابع و استانداردسازی اندازه‌گیری‌ها، این سیستم را به ابزاری قدرتمند برای مدیریت ابر در مقیاس بزرگ تبدیل کرده است. مایکروسافت قصد دارد در سری مقالات بعدی به جزئیات بیشتری از ابزارهای قابلیت اطمینان خود بپردازد.