انویدیا تولید انبوه Groq 3 LPX را آغاز کرد
انویدیا رسماً تولید انبوه شتابدهندهٔ استنتاج تعاملی Groq 3 LPX را آغاز کرد. این چیپ بخشی از پلتفرم Vera Rubin است و برای تولید توکن با نرخهای بسیار بالا در سامانههای عاملمحور طراحی شده؛ تحویل به مشتریان تا پایان سال جاری برنامهریزی شده است. رونمایی رسمی در رویداد Hot Chips اعلام شد؛ برای آشنایی با جزئیات رویداد میتوانید به صفحه Hot Chips در ویکیپدیا مراجعه کنید.
بنچمارک و روش اندازهگیری
نتیجهٔ آزمایش: 3,400 توکن در ثانیه
گروه مستقل Artificial Analysis روی مدل متنباز Gemma 4 31B با پنجرهٔ زمینهٔ 100,000 توکن آزمایشی انجام داد. رک متشکل از LPXها به نرخ پایدار 3,400 توکن در ثانیه رسید؛ اندازهگیری طی 50 درخواست متوالی و در بازهٔ ورودیهای 10,000 تا 100,000 توکن ثابت مانده است. انویدیا این رقم را بهترین عملکرد ثبتشده برای این مدل نامیده و میگوید حدود چهار برابر سریعتر از رک گزارششدهٔ رقیب بوده است، در حالی که Cerebras نرخ 882 توکن در ثانیه را نشان داده است. برای آشنایی با سازندهٔ رقیب به Cerebras Systems در ویکیپدیا مراجعه کنید.
محدودیتها در مقایسهٔ خام سرعت
چند نکتهٔ فنی باعث میشود مقایسهٔ سادهٔ نرخ توکن گمراهکننده باشد:
- معماری Groq بر پایهٔ جریان داده و حافظهٔ SRAM است؛ هر واحد پردازشی (LPU) حدود 500 مگابایت حافظه دارد. بر اساس گزارش The Register، این مقدار بهطور قابل توجهی کمتر از حافظهٔ یک GPU روبین با 288 گیگابایت است.
- بهخاطر محدودیت حافظه، مدلهای بزرگ باید میان چندین شتابدهنده تقسیم شوند؛ یک رک میتواند تا 256 LPU جای دهد و معمولاً برای رسیدن به عملکرد اعلامشده نیاز به خوشهای از چیپها وجود دارد.
- آزمایشها نشان میدهد نقشها بین GPU و LPU تقسیم میشوند: GPUها معمولاً فاز «پریفیل» (prefill) با محاسبات سنگین را اجرا میکنند و LPUها فاز رمزگذاری/دیکدینگ با پهنایباند بالا را به عهده میگیرند. بنابراین عدد 3,400 توکن در ثانیه حاصل ترکیب سختافزار و نرمافزار است، نه عملکرد یک واحد منفرد.
- در گزارشهای اولیه به تعداد چیپها توجه کافی نشده است: Cerebras ممکن است با یک یا دو شتابدهنده مدل را اجرا کند، در حالی که پیادهسازی گزارششده برای Groq به حداقل 64 چیپ نیاز داشته است؛ همچنین مقایسهٔ نسل تازهٔ CS-4 در نظر گرفته نشده بود.
چالشهای مقیاسپذیری برای مدلهای بزرگ
- مدلهایی مانند Gemma 4 31B مثالهایی از طراحیهای متراکماند که میتوانند در یک رک جای بگیرند، اما مدلهای مبتنی بر mixture-of-experts (MoE) چالشهای متفاوتی پدید میآورند.
- برای نمونه، مدل DeepSeek V3 برآورد شده به حدود 1,342 شتابدهنده نیاز دارد (معادل کمی بیش از پنج رک)، که نشان میدهد مقیاسپذیری و هزینهٔ عملیاتی برای مدلهای بسیار بزرگ هنوز مورد سوال است.
اقتصاد عرضه و ارائهٔ تجاری
گزارشها حاکی از آن است که انویدیا برای بهدست آوردن حق استفاده از طراحی Groq مبلغی بالغ بر 20,000,000,000 دلار پرداخت کرده و پس از آن نیروی انسانی از جمله جاناتان راس و سانی مادرا به تیم افزوده شدهاند. شرکت Nebius اعلام کرده قصد دارد اولین ارائهدهندهٔ ابری باشد که این چیپ را از طریق سرویس Token Factory عرضه میکند و خود Groq نیز در میان کاربران اولیه قرار دارد.
جمعبندی و چشمانداز
ادعای انویدیا دربارهٔ «چهار برابر» سرعت نسبت به Cerebras مبتنی بر بنچمارکهای رک است؛ اما وقتی معماری، تعداد چیپها، نیاز به شبکه و نقش مکمل GPUها را در نظر بگیریم، تصویر کارکردی پیچیدهتر میشود. برای مهندسان و ارائهدهندگان ابری، معیارهای حیاتی عبارتاند از: عملکرد در بار کاری واقعی، تأخیر، هزینهٔ کل پیادهسازی و سهولت مدیریت. رقابت میان معماریهای مبتنی بر SRAM و راهحلهایی با حافظهٔ بزرگتر احتمالاً به کاهش تأخیر و بهینهسازی هزینهٔ هر توکن منجر خواهد شد و در پی آن مشتریان امسال گزینههای متنوعتری برای ارزیابی خواهند داشت.
منابع و مطالعهٔ بیشتر: صفحهٔ Groq در ویکیپدیا، گزارشهای The Register و تحلیلهای گروه Artificial Analysis.





