انویدیا تولید انبوه Groq 3 LPX را آغاز کرد

انویدیا رسماً تولید انبوه شتاب‌دهندهٔ استنتاج تعاملی Groq 3 LPX را آغاز کرد. این چیپ بخشی از پلتفرم Vera Rubin است و برای تولید توکن با نرخ‌های بسیار بالا در سامانه‌های عامل‌محور طراحی شده؛ تحویل به مشتریان تا پایان سال جاری برنامه‌ریزی شده است. رونمایی رسمی در رویداد Hot Chips اعلام شد؛ برای آشنایی با جزئیات رویداد می‌توانید به صفحه Hot Chips در ویکی‌پدیا مراجعه کنید.

بنچمارک و روش اندازه‌گیری

نتیجهٔ آزمایش: 3,400 توکن در ثانیه

گروه مستقل Artificial Analysis روی مدل متن‌باز Gemma 4 31B با پنجرهٔ زمینهٔ 100,000 توکن آزمایشی انجام داد. رک متشکل از LPXها به نرخ پایدار 3,400 توکن در ثانیه رسید؛ اندازه‌گیری طی 50 درخواست متوالی و در بازهٔ ورودی‌های 10,000 تا 100,000 توکن ثابت مانده است. ان‌ویدیا این رقم را بهترین عملکرد ثبت‌شده برای این مدل نامیده و می‌گوید حدود چهار برابر سریع‌تر از رک گزارش‌شدهٔ رقیب بوده است، در حالی که Cerebras نرخ 882 توکن در ثانیه را نشان داده است. برای آشنایی با سازندهٔ رقیب به Cerebras Systems در ویکی‌پدیا مراجعه کنید.

محدودیت‌ها در مقایسهٔ خام سرعت

چند نکتهٔ فنی باعث می‌شود مقایسهٔ سادهٔ نرخ توکن گمراه‌کننده باشد:

  • معماری Groq بر پایهٔ جریان داده و حافظهٔ SRAM است؛ هر واحد پردازشی (LPU) حدود 500 مگابایت حافظه دارد. بر اساس گزارش The Register، این مقدار به‌طور قابل توجهی کمتر از حافظهٔ یک GPU روبین با 288 گیگابایت است.
  • به‌خاطر محدودیت حافظه، مدل‌های بزرگ باید میان چندین شتاب‌دهنده تقسیم شوند؛ یک رک می‌تواند تا 256 LPU جای دهد و معمولاً برای رسیدن به عملکرد اعلام‌شده نیاز به خوشه‌ای از چیپ‌ها وجود دارد.
  • آزمایش‌ها نشان می‌دهد نقش‌ها بین GPU و LPU تقسیم می‌شوند: GPUها معمولاً فاز «پری‌فیل» (prefill) با محاسبات سنگین را اجرا می‌کنند و LPUها فاز رمزگذاری/دیکدینگ با پهنای‌باند بالا را به عهده می‌گیرند. بنابراین عدد 3,400 توکن در ثانیه حاصل ترکیب سخت‌افزار و نرم‌افزار است، نه عملکرد یک واحد منفرد.
  • در گزارش‌های اولیه به تعداد چیپ‌ها توجه کافی نشده است: Cerebras ممکن است با یک یا دو شتاب‌دهنده مدل را اجرا کند، در حالی که پیاده‌سازی گزارش‌شده برای Groq به حداقل 64 چیپ نیاز داشته است؛ همچنین مقایسهٔ نسل تازهٔ CS-4 در نظر گرفته نشده بود.

چالش‌های مقیاس‌پذیری برای مدل‌های بزرگ

  • مدل‌هایی مانند Gemma 4 31B مثال‌هایی از طراحی‌های متراکم‌اند که می‌توانند در یک رک جای بگیرند، اما مدل‌های مبتنی بر mixture-of-experts (MoE) چالش‌های متفاوتی پدید می‌آورند.
  • برای نمونه، مدل DeepSeek V3 برآورد شده به حدود 1,342 شتاب‌دهنده نیاز دارد (معادل کمی بیش از پنج رک)، که نشان می‌دهد مقیاس‌پذیری و هزینهٔ عملیاتی برای مدل‌های بسیار بزرگ هنوز مورد سوال است.

اقتصاد عرضه و ارائهٔ تجاری

گزارش‌ها حاکی از آن است که انویدیا برای به‌دست آوردن حق استفاده از طراحی Groq مبلغی بالغ بر 20,000,000,000 دلار پرداخت کرده و پس از آن نیروی انسانی از جمله جاناتان راس و سانی مادرا به تیم افزوده شده‌اند. شرکت Nebius اعلام کرده قصد دارد اولین ارائه‌دهندهٔ ابری باشد که این چیپ را از طریق سرویس Token Factory عرضه می‌کند و خود Groq نیز در میان کاربران اولیه قرار دارد.

جمع‌بندی و چشم‌انداز

ادعای انویدیا دربارهٔ «چهار برابر» سرعت نسبت به Cerebras مبتنی بر بنچمارک‌های رک است؛ اما وقتی معماری، تعداد چیپ‌ها، نیاز به شبکه و نقش مکمل GPUها را در نظر بگیریم، تصویر کارکردی پیچیده‌تر می‌شود. برای مهندسان و ارائه‌دهندگان ابری، معیارهای حیاتی عبارت‌اند از: عملکرد در بار کاری واقعی، تأخیر، هزینهٔ کل پیاده‌سازی و سهولت مدیریت. رقابت میان معماری‌های مبتنی بر SRAM و راه‌حل‌هایی با حافظهٔ بزرگ‌تر احتمالاً به کاهش تأخیر و بهینه‌سازی هزینهٔ هر توکن منجر خواهد شد و در پی آن مشتریان امسال گزینه‌های متنوع‌تری برای ارزیابی خواهند داشت.

منابع و مطالعهٔ بیشتر: صفحهٔ Groq در ویکی‌پدیا، گزارش‌های The Register و تحلیل‌های گروه Artificial Analysis.