معماری Xe3P و Crescent Island: پاسخ اینتل به چالش استنتاج مقیاسپذیر
اینتل در Hot Chips 2026، معماری Xe3P و کارت شتابدهنده Crescent Island را به عنوان راهکاری برای بارهای استنتاج (Inference) کممصرف و تراکم بالا رونمایی کرد. برخلاف روند رایج در صنعت که با GPUهای همراه با حافظه HBM و قدرت بالا روبرو هستیم، Crescent Island برای استقرار در سرورهای استاندارد دیتاسنتر، بدون نیاز به خنکسازی مایع یا تغذیه برق اختصاصی، طراحی شده است.
طراحی فیزیکی و سوختهای حرارتی
Crescent Island یک کارت اضافهکارتی (Add-in-Card) با استاندارد PCIe و خنککننده هوایی است که با توان طراحی حرارتی (TDP) ۳۵۰ وات کار میکند. پشتیبانی از حداکثر ۴۸۰ گیگابایت حافظه LPDDR5X، به این کارت اجازه میدهد تا مدلهای بزرگ را در حافظه محلی نگه دارد، در حالی که سازگاری کامل با رکهای مرسوم ۱۹ اینچ و سیستهایهای برق استاندارد را حفظ میکند.
سازماندهی محاسباتی: ۳۲ هسته Xe و ۲۵۶ موتور XMX
تراشه از چهار برش (Slice) مستقل تشکیل شده، هر کدام حاوی ۸ هسته Xe Core هستند؛ در مجموع ۳۲ هسته در یک بستهبندی. هر هسته Xe دارای ۸ واحد برداری (Xe Vector Engine) و ۸ واحد ماتریسی XMX است که جمعاً ۲۵۶ واحد برداری و ۲۵۶ واحد XMX را در اختیار برنامهنویس قرار میدهد. این تراکم محاسباتی، هدف اصلی معماری برای پرestasyon در ماتریس ضربهای سنگین استنتاج است.
سلسلهمراتب حافظه بازطراحیشده: حذف ناهمگامی پهنایباند
اینتل با تمرکز بر کاهش «ریجستر اسپیل» (Register Spilling) و بهینهسازی جریان داده، حافظههای در다ğı را به شدت گسترش داده است:
- فایل رجیستر عمومی (GRF): ارتقا به ۱ مگابایت در هر هسته (برابر ۲ برابر نسل پیشین ۵۱۲ کیلوبایتی).
- حافظه مشترک L1 / Local Memory: افزایش به ۵۱۲ کیلوبایت در هر هسته (از ۲۵۶ کیلوبایت).
- کش L2 مشترک روی تراشه (On-die): ظرفیت ۳۲ مگابایت برای خدمة دادههای داغ بین تمام هستهها.
این تغییرات مستقیماً تأخیر دسترسی به داده را کاهش داده و بهرهوری محاسبه را در کارهای استنتاج که حساس به پهنایباند هستند، بالا میبرد.
موتورهای XMX عمیقتر: سیتولیک ۱۶ مرحلهای
بزرگترین جهش معماری در واحدهای XMX نهفته است. اینتل از یک خط لوله سیتولیک (Systolic) با عمق ۱۶ بهره برده، در مقایسه با عمق ۴ در معماریهای قبلی. این عمق امکان پردازش بلوکهای ماتریسی بزرگتر در یک چرخه محاسبه را فراهم میکند و مستقیماً به افزایش FLOPS به ازای وات در فاز استنتاج کمک میکند.
پشتیبانی جامع از دقتهای داده: از FP4 تا FP64
Xe3P طیف گستردهای از فرمتها را پوشش میدهد. در پایینترین سطح، پشتیبانی از MXFP4 (FP4 با میکروسکیلینگ) برای استنتاج فوق فشرده وجود دارد. در طرف مقابل، ۶۴ واحد FMA با دقت FP64 در هر هسته، دقت دوگانه واقعی را برای محاسبات علمی و HPC فراهم میآورد. این دوگانهسازی، Crescent Island را به پلتفرمی واحد برای بارهای مختلط AI و HPC تبدیل میکند.
واحدهای توابع متعالی و کدک رسانهای
هر هسته Xe واحدهای سختافزاری مخصوص توابع متعالی (Transcendental) نظیر سیگموئید (Sigmoid) و Танژان هذلولی (tanh) دارد؛ توابع حیاتی در لایههای Softmax و نرمالسازی. همچنین، بلوک کدک رسانهای با ۴ انکدر و ۴ دیکدر، پردازش بارهای چندوجهی (Multimodal) و ویدئویی را تسریع میکند. نکته مهم حذف هستههای ردیابی اشعه (RT) است، تصمیمی که سطح سیلیکون را تماما به محاسبات ماتریسی و برداری اختصاص میدهد.
قابلیت اطمینان گراد دیتاسنتر (RAS)
برای استقرار در محیطهای حساس، Crescent Island از مجموعه کامل امکانات RAS بهره میبرد: اصلاح خطا (ECC) و Париتی در سراسر دای، مکانیزمهای اطمینان حافظه و قابلیتهای خدماتی که انتظار 업تایم ۹۹.۹۹٪ در مقیاس بزرگ را میطلبد.
هدفگیری معماری: MoE و Speculative Decoding
اینتل به صراحت دو بار نوظهور را هدف قرار داده است:
- Mixture-of-Experts (MoE): این مدلها با فعالسازی حساس به ورودی زیرشبکههای تخصصی، بار محاسباتی را پراکنده میکنند. حافظه LPDDR5X پهن و کشهای بزرگ Xe3P، گلوگاههای انتقال اکسپرتها را حل میکنند.
- رمزگشایی احتمالی (Speculative Decoding): با تولید پیشنویس توکنهای بعدی و تایید سریع آنها، این تکنیک از پهنایباند محاسباتی بهینهتری استفاده میکند. معماری Xe3P با تأخیر پایین و تراکم محاسبه بالا، کاندیدای ایدهآل برای این الگو است.
دیدگاه نهایی: استراتژی متمایز اینتل در شتابدهی استنتاج
Crescent Island نشان میدهد اینتل به جای مسابقه در قلههای قدرت محاسبه خام (Top-bin HBM GPUs)، روی «کارایی اجرایی» (Operational Efficiency) مانور میدهد. ترکیب خنکسازی هوایی، حافظه LPDDR5X مقیاسپذیر، و معماری بهینهشده برای تراکم محاسبه در وات، این کارت را به گزینهای منطقی برای دیتاسنترهایی تبدیل میکند که هزینههای زیرساختی (CapEx/OpEx) را در اولویت قرار میدهند. معیار نهایی موفقیت، عملکرد در بنچمارکهای واقعی استنتاج مانند MLPerf Inference و استراتژی قیمتگذاری اینتل در قبال رقبای مبتنی بر GPU خواهد بود.
منابع: Hot Chips Symposium، اسناد معماری Intel Xe3P و تحلیلهای صنعت شتابدهندههای AI.




