افزایش چگالی محاسباتی در خوشه‌های هوش مصنوعی، طراحی رک‌ها را به سطوح حرارتی بالایی رسانده که خنک‌سازی مبتنی بر هوا را کارآمد نمی‌سازد. گذار به خنک‌سازی مایع نه تنها زیرساخت‌ها را تغییر می‌دهد، بلکه نیازمند بازنگری در معماری افزونگی، عملیات نگهداری و سامانه‌های مانیتورینگ است.

رک‌های اکساسکیل و پایان دوران خنک‌سازی با هوا

رک‌های ویژه اجرای مدل‌های بزرگ به‌سادگی به بیش از 100 کیلووات در هر کابینت می‌رسند؛ سطحی که خنک‌سازی مبتنی بر هوا را غیرقابل اتکا می‌کند و سازمان‌ها را به سمت خنک‌سازی مایع سوق می‌دهد. این گذار مدل‌های خطا، رویه‌های عملیاتی و الزامات تاسیساتی را بازتعریف می‌کند.

دو مسیر اصلی: خنک‌سازی مستقیم روی تراشه و غوطه‌وری

خنک‌سازی مستقیم روی تراشه (direct-to-chip یا direct-die) با صفحات سرد متصل به CPU (پردازنده مرکزی) و GPU (پردازشگر گرافیکی) گرما را در نقطه تولید حذف می‌کند. این روش بازده حرارتی بالایی دارد و مصرف توان پمپ را کاهش می‌دهد، اما با حذف بافر حرارتی اتاق، زمان پاسخ سیستم به اختلالات خنک‌کننده به ثانیه‌ها تقلیل می‌یابد.

خنک‌سازی غوطه‌وری قطعات یا کل سرورها را در سیال دی‌الکتریک فرو می‌برد و از نظر کاهش اتصالات سیالی و افزایش جرم حرارتی سطح سیستم مزیت دارد. توضیح فنی و تاریخی درباره غوطه‌وری در مرجع زیر موجود است: Immersion cooling.

چه تغییراتی بنیادی رخ داده‌اند؟

  • افزایش چگالی حرارتی: از چند ده کیلووات در رک‌های سنتی به بیش از 100 کیلووات در رک‌های مدرن.
  • حذف بافر حرارتی اتاق: در طراحی‌های مستقیم، تنها بافر حقیقی حجم مایع حلقه خنک‌کننده است که اغلب زمان ذخیره حرارتی آن زیر 10 ثانیه در بار کامل است.
  • تمرکز ریسک در اتصالات: افزایش تعداد اتصالات مکانیکی به معنای افزایش احتمال خطا و تهدیدی برای قابلیت اطمینان کل سیستم است.

شش حالت ریشه‌ای خرابی در خنک‌سازی مایع

تحلیل رخدادهای واقعی در دیتاسنترهای خنک‌شده با مایع نشان می‌دهد عمده مشکلات در این شش دسته قرار می‌گیرند:

1. نشت در اتصالات

آب‌بندی معیوب، شکست در مهره‌ها یا شل‌شدن اتصالات بر اثر ارتعاش و مونتاژ اشتباه باعث نشت می‌شود. راهکارها: کاهش تعداد اتصالات، استفاده از منیفولدهای یکپارچه، تقسیم‌بندی زون‌ها و نصب حسگرهای موضعی نشت.

2. آلودگی و تخریب سیال

اکسیداسیون، ذرات معلق یا رشد زیستی در سیال می‌تواند هدایت حرارتی را کاهش و مایکروکانال‌ها را مسدود کند. مدیریت باید شامل فیلتراسیون پیوسته، برنامه‌های تعویض سیال و آزمون سازگاری شیمیایی سیال با اجزای سیستم باشد. اصول عمومی خنک‌سازی مایع در مرجع زیر توضیح داده شده است: Liquid cooling.

3. گرفتگی کانال‌ها و رسوب‌گذاری

ذرات و رسوبات می‌توانند صفحات سرد یا میکروکانال‌ها را مسدود کنند و جریان موضعی را قطع سازند. پیشگیری: صافی‌های با بازده بالا، کنترل ورود ذرات و طراحی مسیرهای نگهداری آسان برای امکان سرویس سریع.

4. خرابی تجهیزات توزیع (واحد توزیع خنک‌کننده و پمپ‌ها)

واحد توزیع خنک‌کننده (CDU) و پمپ‌ها نقش مرکزی دارند؛ از کار افتادن یک CDU بدون افزونگی می‌تواند چندین رک را از دسترس خارج کند. راهکار: معماری افزونه، تست‌های دوره‌ای Failover و مانیتورینگ سلامت پیوسته.

5. خطای انسانی و نگهداری نامناسب

اتصال اشتباه، استفاده از ابزار نامناسب یا جابجایی ناایمن می‌تواند منجر به نشت یا خرابی شود. کاهش ریسک با استانداردسازی ابزارها، آموزش‌های اجباری و چک‌لیست‌های دیجیتال همراه با رویه‌های قفل-برچسب (lockout-tagout) امکان‌پذیر است.

6. ضعف در نظارت و تشخیص زودهنگام

بسیاری از رخدادها در مراحل اولیه قابل مهارند اگر سنسورها و سیستم‌های مانیتورینگ هشدار دهند. توصیه می‌شود دما، فشار، جریان، کیفیت سیال و حسگرهای نشت در یک پلتفرم تله‌متری مرکزی با آستانه‌های خودکار و اتصال API ادغام شوند تا واکنش خودکار و انسانی سریع‌تر انجام شود.

پیامدهای تاسیساتی و تغییر در طراحی دیتاسنتر

انتقال به خنک‌سازی مایع نیازمند بازطراحی تاسیسات و فرایندهای اجرایی است. نکات کلیدی:

  • تأمین انرژی و سرمایش متمرکز: CDUها نیاز به تغذیه الکتریکی پایدار، سیستم‌های خنک‌کننده ثانویه و تبادل حرارت محلی دارند.
  • مدیریت سیالات: استانداردهای ایمنی، سیستم‌های دفع و بازیافت سیال و زیرساخت حمل و نگهداری سیالات ویژه ضروری است.
  • کنترل آتش و مقررات ساختمان: استفاده از سیال‌های دی‌الکتریک غیرقابل اشتعال، توجه به رفتار بخار در نقاط جوش و انطباق با مقررات محلی باید از ابتدا لحاظ شود.
  • تهویه و کنترل رطوبت: حتی در طرح‌های غوطه‌وری، فضای سرویس و بخش‌های برقی نیازمند تهویه و کنترل رطوبت دقیق‌اند.
  • افزونگی و مسیرهای جایگزین: توزیع چندگانه CDU، مسیرهای ثانویه لوله‌کشی و توان پشتیبان برای پمپ‌ها باید استاندارد طراحی باشد.

اقدامات عملیاتی و توصیه‌های مهندسی

  • طراحی با حداقل اتصالات مکانیکی و استفاده از منیفولدهای پیش‌ساخته برای کاهش خطا.
  • تعبیه زون‌های قرنطینه با دتکتورهای نشت و دریچه‌های اتوماتیک برای قطع سریع جریان در محل رخداد.
  • اجرای آزمون‌های قطع خنک‌کننده (cold failover) و سناریوهای بازیابی به‌صورت دوره‌ای و خودکار؛ زمان واکنش انسانی در بسیاری از موارد کافی نیست.
  • پیاده‌سازی سامانه تله‌متری متمرکز که دما، فشار، جریان، کیفیت سیال و وضعیت پمپ/CDU را نمایش دهد و از طریق API به سیستم مدیریت دیتاسنتر متصل شود.
  • برنامه آموزشی اجباری برای تیم نگهداری همراه با چک‌لیست‌های قفل-برچسب و روال‌های گشت زنی برای کاهش خطاهای انسانی.

چه سازمان‌هایی باید زودتر وارد عمل شوند؟

اپلیکیشن‌هایی با نیاز بالا به پردازش، مانند آموزش مدل‌های بزرگ، شبیه‌سازی‌های علمی و تحلیل‌های پیچیده، بیشترین بهره را از خنک‌سازی مایع می‌برند. این گروه‌ها هم‌زمان باید در مهندسی تاسیسات، معماری افزونه و عملیات نگهداری سرمایه‌گذاری کنند. برای آگاهی از ابعاد مقیاس اکساسکیل به مرجع زیر مراجعه کنید: Exascale computing.

جمع‌بندی و دیدگاه پیشرو

خنک‌سازی مایع برای خوشه‌های اکساسکیل به یک ضرورت تبدیل شده؛ اما موفقیت نیازمند ترکیب مهندسی دقیق، تدارکات تاسیساتی قوی و انضباط عملیاتی است. سازمان‌هایی که از هم‌اکنون در افزونگی، اتوماسیون عملیات و مانیتورینگ سلامت سرمایه‌گذاری کنند، کاهش هزینه‌های ناشی از رخدادهای بحرانی و افزایش بهره‌وری انرژی و چگالی محاسباتی را تجربه خواهند کرد.