فوجیتسو پردازنده سروری 144 هستهای Monaka را رونمایی کرد. این چیپ، کش سطح آخر را روی یک دیسای 5 نانومتری مجزا قرار داده و در هر هسته دو واحد برداری 256‑بیتی SVE2 تعبیه کرده است. طراحی سهتایی دیسای Monaka و تمرکز بر کارایی انرژی، هدفگذاری روشنی دارد: کاهش مصرف و هزینه در مراکز داده برای بارهای هوش مصنوعی و استنتاج.
معماری سهلایه: دیسای محاسباتی 2 نانومتر؛ کش و I/O روی 5 نانومتر
Monaka از سه دیسای مجزا تشکیل شده است: یک دیسای هسته تولیدشده روی فرایند TSMC N2P (2 نانومتر)، یک دیسای SRAM 5 نانومتری که کل کش سطح آخر را در بر میگیرد، و یک دیسای I/O روی 5 نانومتر. دیسای هسته بهصورت رو در رو روی دیسای SRAM از طریق پیوند هیبریدی قرار گرفته و دیسای I/O از طریق اینترپوزر سیلیکونی متصل میشود.
دلایل فنی تقسیمبندی
- نگه داشتن کمتر از 30٪ مساحت بسته بر روی سیلیکون 2 نانومتری برای کاهش هزینه و زمان عرضه.
- انتقال مدارهای آنالوگ حساس مانند رگولاتورهای ولتاژ (LDO) به فرآیند 5 نانومتری، چرا که مقیاسپذیری آنالوگ در 2 نانومتر محدود است.
- قرار دادن LDOها زیر واحدهای ممیز شناور برای تغذیه پویا و ریزتنظیم ولتاژ/فرکانس هر هسته.
این رویکرد Monaka را از تکنیکهایی مانند AMD 3D V-Cache که SRAM اضافی را مستقیماً روی دیسای محاسباتی قرار میدهد متمایز میکند و بیشتر به رویکردهای چندتایل با کش محلی نزدیک شباهت دارد.
Hot Chips 2026" class="my-4 rounded-lg" />
چیپست و مشخصات کلیدی
- هستهها: 144 هسته مبتنی بر معماری Arm، هر هسته حدود 1.47 میلیمتر مربع.
- واحدهای برداری: هر هسته دو واحد SVE2 با پهنای 256 بیت؛ کاهش از 512 بیت در نسلهای قبلی برای کوچکتر کردن هسته و کاهش هزینه.
- حافظه: جایگزینی HBM با 12 کانال DDR5 با سرعت 8000 MT/s.
- مدلها (SKU):
- 350 وات، خنکشده با هوا، فرکانس پایه 2.1 GHz
- 500 وات، خنکشده با مایع، فرکانس پایه 2.9 GHz
- ویژگیهای قابلتوجه: پشتیبانی از ماتریسهای FP8 و INT8 برای استنتاج، ECC و تکثیر در کشهای L1/L2، مکانیزم سختافزاری تکرار دستور برای بازیابی خطاهای گذرا.
چرا SVE2 با پهنای 256 بیت؟
فوجیتسو پهنای برداری را به 256 بیت محدود کرده تا حجم و هزینه هر هسته کاهش یابد و در عین حال کارایی در بارهای عمومی مراکز داده حفظ شود. این انتخاب به طراحی هستههای فشردهتر کمک میکند و پهنای SIMD را در کدهای عمومی کمتر هدر میدهد. برای استنتاج، پشتیبانی اختصاصی از FP8 و INT8 اضافه شده است تا کاهش پهنای برداری تأثیر منفی بر کارهای استنتاجی نداشته باشد.
برای مقایسه، A64FX که نیرو دهنده ابررایانه Fugaku بود، از بردارهای 512 بیتی و HBM2 استفاده میکرد؛ Monaka بهجای HBM، روی ترکیب پهنباند حافظهٔ چندکاناله DDR5 سرمایهگذاری کرده است تا هزینه و قابلیت تولید انبوه را تسهیل کند.
عملکرد اعلامشده و صرفهجویی انرژی
فوجیتسو اعداد اولیه عملکرد را گزارش کرده است:
- 350W: 4,355 GFLOPS در DGEMM و 69.7 TOPS در INT8
- 500W: 6,013 GFLOPS در DGEMM و 96.2 TOPS در INT8
- پهنای باند STREAM Triad: حدود 500 گیگابایت بر ثانیه برای هر دو مدل
شرکت ادعا میکند Monaka میتواند تا دو برابر عملکرد هوش مصنوعی و بیش از 50٪ کاهش هزینه کل مالکیت (TCO) نسبت به نمونههای موجود ارائه دهد. بخشی از این بهدستآوردن ناشی از اجرای هستهها در ولتاژهای بسیار پایین (حدود 30٪ زیر ولتاژ نامی) است که مصرف توان را بهطور چشمگیری کاهش میدهد و امکان قرار دادن 144 هسته در یک بسته 350 واتی را فراهم کرده است.
قابلیت اطمینان و ویژگیهای سازمانی
Monaka ویژگیهایی در سطح مرکز داده ارائه میدهد: ECC و تکثیر در کشهای سطح پایین، بررسی پاریتی روی واحدهای اجرایی و رجیسترها و مکانیزم سختافزاری برای تکرار دستور در صورت رخداد خطاهای گذرا. پیشبینیکنندهٔ شاخه سهسطحی (TAGE) و مجموعهای از ALUها برای بهبود توان عملیاتی عمومی در طراحی لحاظ شدهاند.
رقابت و پیامدها برای بازار
با استراتژی قرار دادن کش روی 5 نانومتر و نگه داشتن محاسبات روی 2 نانومتر، Monaka مسیری متفاوت نسبت به طرحهای AMD و Intel انتخاب کرده است. این رویکرد نشاندهنده اولویتبندی هزینه، مصرف انرژی و قابلیت تولید انبوه است و میتواند برای اپراتورهای مراکز داده که به دنبال کاهش TCO و مصرف انرژی هستند جذاب باشد. بررسی پروژههای مشابه در کنفرانسهایی مانند Hot Chips به درک بهتر رقابت کمک میکند.
زمانبندی عرضه و دسترسی
نمونههای ارزیابی Monaka هماکنون در دسترس اعلام شدهاند و فوجیتسو برنامهریزی کرده تولید انبوه را در سال 2027 آغاز کند. این بازه زمانی فرصت لازم را برای اپراتورها و توسعهدهندگان فراهم میآورد تا سیستمها، درایورها و کتابخانهها را برای بهرهبرداری از قابلیتهای جدید بهینه کنند.
جمعبندی و چشمانداز
Monaka ترکیبی از نوآوری در بستهبندی سیلیکون و تمرکز واقعی بر هزینه و انرژی را به نمایش میگذارد. در صورتی که مصرف و عملکرد وعدهدادهشده در آزمایشهای میدانی تأیید شوند، این پردازنده میتواند نقش محوری در نسل بعدی سرورها و مراکز داده هوش مصنوعی ایفا کند. پایش بنچمارکها و تستهای میدانی در سالهای پیش رو معیار اصلی برای سنجش اثر واقعی این طراحی خواهد بود.





