انویدیا بارِ دیگر با معرفیٔ پردازندهٔ مبتنی‌بر Armِ خود، Vera، توجهِ دنیایِ فناوری را جلب کرده‌است. این شرکت تأکید دارد که معماریِ Vera به‌جای تمرکزِ صرف بر پردازشِ موازی، برای ارائهٔ «حداکثرِ عملکردِ تک‌رشته‌ای در مقیاس» طراحی شده‌است؛ رویکردی که به‌گفتهٔ انویدیا، مزیتی حیاتی برای بارهایِ کاریِ استنتاجِ هوش‌مصنوعیِ عاملی و استنتاج به‌شمار می‌رود.

چندی پیش، وب‌سایت Phoronix فرصتِ آزمایشِ این تراشه را پیدا کرد و در سناریوهایِ تک‌رشته‌ای، عملکردِ Vera را «فوق‌العاده» گزارش کرد. البته AMD نیز با انتشارِ معیارهایِ خود، مدعیٔ افزایشِ ۳.۳ برابریِ عملکرد در مقایسه با Vera برای یک رکِ ۱۰۰ کیلوواتی شد. اما انویدیا دست‌بردار نیست و با معرفیِ هسته‌هایِ نسلِ بعدیِ Rigel (بر پایهٔ معماریِ Arm v9.2) که در پردازندهٔ آینده‌ای به‌نامِ Rosa به‌کار خواهند رفت، وعدهٔ عملکردِ بیشتر به‌ازایِ هر هسته داده‌است.

چرا عملکردِ تک‌رشته‌ای در هوش‌مصنوعی اهمیت دارد؟

انویدیا استدلال می‌کند که بارهایِ کاریِ استنتاجِ هوش‌مصنوعی، به‌ویژه در مدل‌هایِ استدلالی و عاملی، به‌شدت به سرعتِ تک‌رشته‌ای وابسته‌اند. برای مثال، یک مدلِ استدلالی پس از هر گام به خروجیِ گامِ قبل نیاز دارد و بنابراین موازی‌سازی کمکِ چندانی به افزایشِ سرعت نمی‌کند. این وضعیت در عامل‌هایِ هوش‌مصنوعی نیز صادق است؛ جایی که عاملِ A نمی‌تواند بدونِ نتیجهٔ عاملِ B کارِ خود را آغاز کند.

معماری CPU Vera انویدیا با ۸۸ هسته و حافظهٔ LPDDR5X

جزئیاتِ معماریِ Vera: ۸۸ هسته و پهنای‌باندِ حیرت‌انگیز

Vera یک تراشهٔ یکپارچه با ۸۸ هسته است و پشتیبانی از SMT مجموعاً ۱۷۶ رشته را فراهم می‌آورد. انویدیا برای جلوگیری از تنگناهایِ داده از حافظهٔ LPDDR5X با پهنای‌باندِ ۱.۲ ترابایت بر ثانیه و پهنای‌باندِ بین‌هسته‌ای ۳.۴ ترابایت بر ثانیه استفاده کرده‌است که به‌گفتهٔ این شرکت حدوداً سه برابرِ هر CPUِ مرکزِ دادهٔ دیگری است.

این طراحی به هر هسته اجازه می‌دهد تا در زیرِ بارِ سنگین، عملکردِ قوی و تأخیرِ قابلِ پیش‌بینی داشته باشد. به‌گفتهٔ انویدیا، چنین رویکردی برخلافِ پردازنده‌هایِ رایج است که صرفاً تعدادِ هسته‌ها را افزایش می‌دهند.

رقابت با x86: ادعاهایِ عملکردیِ Vera

انویدیا در جدیدترین پستِ وبلاگیِ خود آمارِ زیر را برای مقایسه با رقبایِ x86 (احتمالاً AMD EPYC و Intel Xeon) ارائه کرده است:

  • ۱.۸ برابر عملکردِ بالاتر در بارهایِ کاریِ عاملی (Agentic Execution)
  • ۱.۵ برابر عملکردِ بالاتر در گردشِ کارِ کدنویسی
  • ۳ برابر سرعتِ بیشتر در تحلیلِ پایگاهِ داده
نمودار مقایسهٔ عملکرد CPU Vera با رقبا

این شرکت همچنین از نتایجِ همکاری با شرکت‌هایی نظیرِ Perplexity (افزایشِ ۱.۵ برابری در کدنویسیِ عاملی)، Starburst (افزایشِ ۳ برابری در SQLِ مقیاس‌ِبزرگ) و Redpanda (کاهشِ ۶ برابریِ تأخیر در تحلیلِ بلادرنگ) خبر داده‌است.

هسته‌هایِ نسلِ بعدیِ Rigel: جهش در عملکرد به‌ازایِ هر هسته

انویدیا تأیید کرده است که نسلِ بعدیِ هسته‌هایِ Arm v9.2 با نامِ Rigel در پردازندهٔ Rosa به‌کار خواهند رفت. این هسته‌ها از طریقِ «تحویلِ بهترِ دستورالعمل‌ها»، حافظهٔ نهانِ L2 بیشتر و مدیریتِ پیشرفتهٔ حافظه، عملکردِ بالاتری به‌ازایِ هر هسته در همان فضایِ سیلیکونی ارائه می‌دهند.

این حرکت نشان می‌دهد انویدیا قصد ندارد تنها به Vera اکتفا کند و برنامهٔ بلندمدتی برای رقابت با x86 در مراکزِ داده دارد.

هشدار دربارهٔ معیارهایِ فروشنده

همان‌طور که انتظار می‌رود، معیارهایِ تأییدشده توسطِ فروشنده باید با احتیاط تفسیر شوند. انویدیا مشخص نکرده است که کدام تراشه‌هایِ دقیقِ x86 را در این آزمایش‌ها به‌کار برده است. با این حال، با توجه به طراحیِ اختصاصیِ Vera برای بارهایِ کاریِ هوش‌مصنوعی، ادعاهایِ مطرح‌شده دست‌کم قابل‌توجه به‌نظر می‌رسند.

به‌نظر می‌رسد انویدیا با این استراتژی مسیرِ جدیدی را در طراحیِ پردازنده‌هایِ مرکزِ داده ترسیم کرده است؛ مسیری که در آن عملکردِ تک‌رشته‌ای حرفِ اول را می‌زند.