معرفی شتاب‌دهنده MI455X و معماری Helios

شرکت AMD در رویداد Advancing AI خود جزئیات بیشتری از پردازنده گرافیکی MI455X و معماری مقیاس رکی Helios فاش کرد؛ سیستمی که ۷۲ پردازنده گرافیکی را به یک شتاب‌دهنده یکپارچه متصل می‌کند و بزرگ‌ترین سیستم از این نوع در تاریخ AMD محسوب می‌شود. این معماری برای اولین بار به‌طور جدی با طراحی NVL72 انویدیا در نسل‌های Blackwell و Rubin رقابت می‌کند.

AMD از MI455X با عنوان «پیشرفته‌ترین شتاب‌دهنده هوش مصنوعی که تاکنون ساخته‌ایم» یاد می‌کند و از آنچه تاکنون مشاهده شده، این محصول رقابتی‌ترین پیشنهاد AMD در هر دو سطح تراشه و مقیاس رک است که در برابر تسلط کامل انویدیا در بازار محاسبات هوش مصنوعی عرضه شده است.

معماری تراشه: ۳۲۰ میلیارد ترانزیستور با طراحی چیپلت

تراشه کامل MI455X با ۳۲۰ میلیارد ترانزیستور و فناوری‌های بسته‌بندی پیشرفته ساخته شده است. چهار دای کمپلکس شتاب‌دهنده (XCD) با استفاده از پیوند هیبریدی روی هر دای فابریک و کش (FCD) قرار گرفته‌اند. هر یک از این دو FCD به شش استک حافظه HBM4، دو دای ورودی/خروجی و به یکدیگر با استفاده از فناوری CoWoS-L شرکت TSMC متصل می‌شوند.

معماری چیپلت تراشه MI455X شرکت AMD

این طراحی چیپلت به AMD اجازه می‌دهد از پیشرفته‌ترین فرآیند گیت-اِل-اراند (GAA) 2N شرکت TSMC برای XCDها استفاده کند؛ جایی که بیشترین سود را برای مصرف انرژی و عملکرد به همراه دارد. در همین حال، FCDها و دای‌های ورودی/خروجی که عناصر آن‌ها از متراکم‌ترین فرآیندهای تولید سودی نمی‌برند، روی فرآیند N3P تولید می‌شوند.

تغییرات بنیادین معماری CDNA 5

معماری CDNA 5 تغییر بزرگی در ساختار CDNA به‌شمار می‌رود. AMD بلوک سازنده اساسی دای کمپلکس شتاب‌دهنده را از «واحد محاسباتی» (Compute Unit) به «پردازنده گروه کاری» (Work Group Processor) تغییر نام داده است، هرچند چیدمان پایه‌ای دای XCD تا حد زیادی مشابه نسل قبل باقی مانده است.

معماری CDNA 5 و پردازنده گروه کاری

تعداد WGPها در MI455X مانند MI355X روی ۲۵۶ ثابت مانده است. از آنجا که تعداد منابع محاسباتی بنیادین تراشه تغییری نکرده، توان عملیاتی هر WGP در MI455X باید بسیار بالاتر از نسل قبل باشد تا افزایش عملکرد قابل توجه آن محقق شود.

تغییر مدل برنامه‌نویسی: از وِیفرونت ۶۴ به ۳۲

یکی از مهم‌ترین تغییرات این نسل، تحول در مدل برنامه‌نویسی پردازنده‌های گرافیکی Instinct است. عرض وِیفرونت (wavefront) — گروهی از اقلام کاری یا رشته‌ها (threads) که هر پردازنده گروه کاری به آن‌ها آدرس‌دهی می‌کند — از ۶۴ به ۳۲ کاهش یافته است. AMD معتقد است این انتخاب تأخیر دستورالعمل‌ها، جریمه‌های واگرایی شاخه (branch divergence) و فشار ثبات (register pressure) را بهبود می‌بخشد و انعطاف‌پذیری معماری را برای تعامل با اندازه‌های مختلف کاشی‌های تنسور (tensor tiles) و نگاشت هسته‌های محاسباتی به سخت‌افزار افزایش می‌دهد. پردازنده‌های گرافیکی RDNA از زمان معرفی خود از اندازه وِیفرونت بومی ۳۲ استفاده کرده‌اند.

جهش عملکرد: دو تا چهار برابر در فرمت‌های کم‌دقت

معماری CDNA 5 عملکرد محاسباتی را به‌طور قابل‌توجهی نسبت به CDNA 4 افزایش می‌دهد و حداکثر FLOPS ممکن از تراشه را به‌طور تئوریک دو برابر و در برخی موارد چهار برابر می‌کند. MI455X به‌ویژه از فرمت‌های اعشاری شناور با دقت پایین‌تر که امروزه برای استنتاج (inference) رایج شده‌اند، بهره می‌برد. فرمت‌های OCP MXFP8 و MXFP4 به‌طور تئوریک تا ۴ برابر سریع‌تر از MI355X با معماری CDNA 4 عمل می‌کنند.

مقایسه عملکرد MI455X با MI355X و پردازنده گرافیکی Rubin انویدیا

بررسی عددی عملکرد اوج MI455X

فرمت محاسباتی Instinct MI355X Instinct MI455X Nvidia Rubin
NVFP4 (متراکم)----35 PF
OCP MXFP410 PF40.26 PF--
OCP MXFP610 PF20.13 PF17.5 PF
OCP MXFP810 PF20.13 PF17.5 PF
ماتریس FP16/BF162.5 PF5.03 PF4 PF
برداری FP16157.3 TF315 TF--
ماتریس FP32157.3 TF315 TF400 TF
برداری FP32157.3 TF315 TF130 TF

حداقل روی کاغذ، MI455X عملکرد اوج خود را فراتر از آنچه انویدیا برای Rubin ارائه کرده قرار دارد و در ترکیب با معماری مقیاس رکی Helios که سرانجام همان دامنه یکپارچه ۷۲ پردازنده‌ای NVL72 انویدیا را برای AMD فراهم می‌کند، می‌تواند معادلات رقابت در بازار مراکز داده را بازتعریف کند.

معماری Helios در مقیاس رک شرکت AMD

آینده رقابت در بازار شتاب‌دهنده‌های هوش مصنوعی

با معرفی MI455X و معماری Helios، AMD برای اولین بار به سطحی از بلوغ فنی رسیده است که می‌تواند نه‌تنها در سطح تراشه، بلکه در مقیاس کامل رک با پیشرفته‌ترین راهکارهای انویدیا رقابت کند. ترکیب فرآیند پیشرفته GAA 2N برای هسته‌های محاسباتی، حافظه HBM4 با ظرفیت بالا و طراحی یکپارچه ۷۲ پردازنده‌ای، نشان‌دهنده استراتژی AMD برای بازپس‌گیری سهم بازار در حوزه محاسبات هوش مصنوعی است.

رقابت میان AMD و انویدیا در ماه‌های پیش‌رو با عرضه تجاری این محصولات شدت خواهد گرفت و نتایج عملی این برتری‌های نظری در آزمون‌های واقعی بارکاری و استنتاج مدل‌های بزرگ زبانی مشخص خواهد شد.