اتحاد AMD و Cerebras برای پلتفرم استنتاج هوش مصنوعی کمتأخیر
شرکتهای AMD و Cerebras Systems اعلام کردهاند که برای توسعه یک پلتفرم مشترک همکاری میکنند که پردازندههای EPYC را در زیرساخت رکی Helios با راهکارهای Wafer-Scale Engine (WSE) شرکت Cerebras ترکیب میکند. هدف این اتحاد، ارائه سیستمی برای استنتاج هوش مصنوعی است که تأخیر پایین پردازندههای CPU و GPUهای Instinct AMD را با توان پردازشی بالای پردازندههای WSE پیوند دهد.

تفکیک بارکاری استنتاج برای بازدهی بیشتر
در این پلتفرم جدید، بخشهای مختلف از یک بارکاری استنتاج به معماریهای بهینهشده برای آنها اختصاص مییابد. رک AMD Helios که به پردازندههای EPYC و شتابدهندههای سری Instinct MI400 مجهز است، وظیفه پردازش پرامپت و مدیریت پنجرههای بافتار بزرگ را بر عهده دارد. در سمت دیگر، پردازندههای WSE شرکت Cerebras که پهنای باند حافظه بالایی ارائه میکنند، مرحله تولید توکنِ نیازمندِ پهنای باند بالا را مدیریت خواهند کرد.
AMD و Cerebras انتظار دارند پلتفرم استنتاج تفکیکشده آنها با این روش، تا 5 برابر توکن بیشتر در ثانیه به ازای هر وات (T/s/W) ارائه دهد. در این معماری، AMD Helios ظرفیت پردازشی در مقیاس رک و حجم زیادی از درخواستهای پیچیده را فراهم میکند، در حالی که Cerebras WSE تولید توکن حساس به تأخیر را بر عهده میگیرد. این دو پلتفرم پردازشی در یک گردش کار استنتاج واحد عمل خواهند کرد، هرچند شرکتها جزئیات بیشتری از عملکرد یا نحوه اتصال این سیستمها را فاش نکردهاند.
رویکردی معکوس در برابر Nvidia

ایده اساسی پلتفرم AMD + Cerebras تا حدودی شبیه به مفهوم CPX شرکت Nvidia است، با این تفاوت که AMD و Cerebras سختافزار تخصصی را به مرحله مخالف استنتاج اختصاص میدهند. طراحی تفکیکشده Nvidia، استنتاج را به دو مرحله بافتار/پیشپر کردن (context/prefill) و تولید/رمزگشایی (generation/decode) تقسیم میکند. پردازنده گرافیکی Rubin CPX که لغو شد و از GDDR7 بهره میبرد، به طور خاص برای مرحله پردازشسنگینِ بافتار/پیشپر کردن بهینه شده بود، در حالی که پردازندههای گرافیکی معمولی Rubin که به HBM مجهز هستند، مرحله تولیدِ مقید به پهنای باند حافظه را مدیریت میکنند.
در مقابل، پلتفرم AMD و Cerebras از همان اصل تفکیک پیروی میکند، اما تخصص آن معکوس شده است: پلتفرم Helios شرکت AMD به همراه پردازندههای گرافیکی Instinct، مرحله پیشپر کردن را مدیریت کرده و پرامپتها و پنجرههای بافتار بزرگ را پردازش میکند، در حالی که Cerebras WSE مرحله رمزگشایی را به عهده میگیرد و تولید توکن حساس به تأخیر را مدیریت میکند.
دسترسیپذیری و یکپارچگی در مراکز داده

Cerebras قصد دارد سیستمهای AMD Helios را در مراکز داده خود نصب کرده و آنها را با رکهای WSE خود یکپارچه کند. بر اساس اعلام این دو شرکت، پیشبینی میشود که این راهکار ترکیبی در ابتدا در نیمه دوم سال 2026 از طریق Cerebras Cloud در دسترس قرار گیرد.
این همکاری میتواند نقطه عطفی در رقابت سختافزاری برای استنتاج هوش مصنوعی باشد و نشاندهنده گرایش صنعت به سمت تفکیک تخصصی وظایف در مقیاس رک است.





