ارم با رونمایی از پلتفرم Neoverse CSS N4 (نام‌کد رینجر)، معماری محاسبه‌ای نسل بعد خود را برای بازار ابری و زیرساخت‌های داده‌محور 재정بی کرد. این زیرسیستم محاسبهی (Compute Subsystem) تا ۱۲۸ هسته در یک دای واحد را روی فرآیند ساخت پیشرفته N3P شرکت TSMC پیاده‌سازی می‌کند و سقف مقیاس‌پذیری، پهنای باند حافظه و تراکت I/O را به شدت بالا برده است.

برنامه نیمه‌سازمان‌یافته CSS: موتور سیلیکون سفارشی کلان‌مقیاس

برخلاف معماری‌های سنتی که به عنوان هسته‌های ثابت عرضه می‌شوند، CSS (Compute Subsystem) یک برنامه نیمه‌سازمان‌یافته است. مشتریان می‌توانند با استفاده از بلوک‌های IP تأییدشده ارم — هسته‌ها، حافظه نهان، کنترلرهای حافظه، PHYهای سریال و منطق اتصال — تراشه‌ای را که دقیقاً برای بارهای کاری خود بهینه است، در زمان کم‌تر و با ریسک پایین‌تر طراحی کنند. همین مدل، اساس تراشه‌های Azure Cobalt، Google Axion، DPUهای NVIDIA BlueField و اینتل IPU را شکل داده است.

مشخصات فنی Neoverse CSS N4 در یک نگاه

  • تعداد هسته: ۸ تا ۱۲۸ هسته Neoverse N4 (نام‌کد Dionysus) در هر دای
  • فرکانس حداکثر: تا ۳.۸ گیگاهرتز (فرکانس در پیکربندی‌های پرهسته پایین‌تر است)
  • فرآیند ساخت: TSMC N3P (نسخه پیشرفته‌تر ۳ نانومتری)
  • حافظه نهان L2: تا ۲ مگابایت در هر هسته
  • حافظه نهان L3 مشترک: تا ۲۵۶ مگابایت در هر دای
  • حافظه L1: ۶۴ کیلوبایت دستورالعمل + ۶۴ کیلوبایت داده در هر هسته
  • پشتیبانی حافظه: DDR5 و LPDDR6
  • I/O: تا ۱۲۸ لاین PCIe 6.0/7.0 و CXL 4.0
  • اتصال چند چیپлеتی: UCIe و PHYهای اختصاصی شریک برای مقیاس‌پذیری فراتر از ۱۲۸ هسته
نمایه معماری Neoverse CSS N4 با ۱۲۸ هسته
نمایه معماری Neoverse CSS N4 نشان‌دهنده تراکم هسته‌ها و زیرسیستم حافظه

مقایسه با نسل قبلی: جهش کیفیت در تراکم و عملکرد

پلتفرم Neoverse CSS N2 در حداکثر ۶۴ هسته، ۱ مگابایت L2 در هر هسته و ۶۴ مگابایت L3 متوقف می‌شد. N4 این اعداد را دوچندان (هسته و L3) یا چهارچندان (L2) کرده و لاین‌های PCIe/CXL را از ۶۴ به ۱۲۸ ارتقا داده است. ارم ادعا می‌کند با پیکربندی ۱۲۸ هسته در ۳ گیگاهرتز:

  • دو برابر عملکرد سوکتی نسبت به Neoverse N3
  • ۱.۲۵ برابر عملکرد بر وات (بهینه‌سازی برش پرفورمنس-پاور)
  • ۱.۷۵ برابر پهنای باند حافظه

تفاوت استراتژیک سری N و سری V

ارم دو خانواده هسته سروری را موازی پیش می‌برد: سری V برای حداکثر عملکرد خام (مانند NVIDIA Grace، AWS Graviton، Google Axion و خود تراشه AGI ارم) و سری N برای حداکثر کارایی در وات در تسریع‌کننده‌ها و بارهای کاری ابری متراکم. Cobalt 100 مایکروسافت روی N2 ساخته شده بود؛ Cobalt 200 به V3 مهاجرت کرد. N4 اکنون سقف کارایی انرژی را برای DPUها، SmartNICها و سرورهای چ تراکم بالا می‌کشاند.

مقایسه سری N و سری V ارم
موقعیت‌دهی سری N (کارایی) در برابر سری V (عملکرد ماکزیمم) در پورتفوی ارم

زمان‌بندی و اکوسیستم: از اعلام IP تا سیلیکون تحویل‌شده

این اطلاعیه برای شریک‌های CSS است که بلوک‌های تأییدشده را लेकर تراشه نهایی می‌سازند. ارم هنوز نام شریک جدیدی برای N4 فاش نکرده، اما سابقه نشان می‌دهد چند قرارداد کلان (هایپراسکیلرها، فروشندگان شبکه، سازندگان سرور) برای راه‌اندازی خط تولید کافی هستند. تراشه‌های مبتنی بر N4 احتمالاً تا اواخر ۲۰۲۶ یا اوایل ۲۰۲۷ در دیتاسنترها ظاهر می‌شوند.

تراشه AGI ارم: استقرار در اوراکل و بایت‌دنس

هم‌زمان با N4، ارم گسترش استقرار تراشه AGI خود را اعلام کرد. این پردازنده دو دای، با ۱۳۶ هسته Neoverse V3، ۲۷۲ مگابایت L3، فرکانس ۳.۷ گیگاهرتز، حافظه DDR5-8800 تا ۶ ترابایت و قرارگیری حافظه/I/O روی همان دای محاسباتی (خفض تاخیر به زیر ۱۰۰ نانوثانیه) اکنون در زیرساخت‌های اوراکل، بایت‌دنس، متا، لینوو، SAP، OpenAI، Cloudflare و دیگران مستقر می‌شود. ارم ادعای «بیش از دو برابر عملکرد در هر رک نسبت به جدیدترین x86» را بر اساس مدل‌سازی داخلی مطرح کرده؛ بنچمارک‌های مستقل هنوز منتشر نشده‌اند.

تراشه AGI ارم با معماری دو دای
تراشه AGI ارم: ۱۳۶ هسته V3، حافظه روی دای، هدف‌مند برای استنتاج AI

افق رویداد: V4 با نام‌کد Vega در راه است

نقشه راه ۲۰۲۴ ارم مرجع Neoverse CSS V4 (Vega) را هم پیش‌بینی می‌کرد. با N4 که سقف کارایی را بالا برد و AGI که تعادل عملکرد/واط را برای AI نشان داد، V4 احتمالاً سقف عملکرد خام را برای نسل بعد گرایش‌های یادگیری ماشین و HPC جابجا خواهد کرد. رقابت با AMD EPYC و Intel Xeon در حوزهٔ x86 اکنون از لایه ISA به لایه سیستم و اکوسیستم سیلیکون سفارشی منتقل شده است.