اتحاد AMD و Cerebras برای پلتفرم استنتاج هوش مصنوعی کم‌تأخیر

شرکت‌های AMD و Cerebras Systems اعلام کرده‌اند که برای توسعه یک پلتفرم مشترک همکاری می‌کنند که پردازنده‌های EPYC را در زیرساخت رکی Helios با راهکارهای Wafer-Scale Engine (WSE) شرکت Cerebras ترکیب می‌کند. هدف این اتحاد، ارائه سیستمی برای استنتاج هوش مصنوعی است که تأخیر پایین پردازنده‌های CPU و GPUهای Instinct AMD را با توان پردازشی بالای پردازنده‌های WSE پیوند دهد.

رک‌های AMD Helios و Cerebras WSE در یک پلتفرم مشترک

تفکیک بارکاری استنتاج برای بازدهی بیشتر

در این پلتفرم جدید، بخش‌های مختلف از یک بارکاری استنتاج به معماری‌های بهینه‌شده برای آن‌ها اختصاص می‌یابد. رک AMD Helios که به پردازنده‌های EPYC و شتاب‌دهنده‌های سری Instinct MI400 مجهز است، وظیفه پردازش پرامپت و مدیریت پنجره‌های بافتار بزرگ را بر عهده دارد. در سمت دیگر، پردازنده‌های WSE شرکت Cerebras که پهنای باند حافظه بالایی ارائه می‌کنند، مرحله تولید توکنِ نیازمندِ پهنای باند بالا را مدیریت خواهند کرد.

AMD و Cerebras انتظار دارند پلتفرم استنتاج تفکیک‌شده آن‌ها با این روش، تا 5 برابر توکن بیشتر در ثانیه به ازای هر وات (T/s/W) ارائه دهد. در این معماری، AMD Helios ظرفیت پردازشی در مقیاس رک و حجم زیادی از درخواست‌های پیچیده را فراهم می‌کند، در حالی که Cerebras WSE تولید توکن حساس به تأخیر را بر عهده می‌گیرد. این دو پلتفرم پردازشی در یک گردش کار استنتاج واحد عمل خواهند کرد، هرچند شرکت‌ها جزئیات بیشتری از عملکرد یا نحوه اتصال این سیستم‌ها را فاش نکرده‌اند.

رویکردی معکوس در برابر Nvidia

مقایسه معماری تفکیک‌شده استنتاج AMD+Cerebras با Nvidia

ایده اساسی پلتفرم AMD + Cerebras تا حدودی شبیه به مفهوم CPX شرکت Nvidia است، با این تفاوت که AMD و Cerebras سخت‌افزار تخصصی را به مرحله مخالف استنتاج اختصاص می‌دهند. طراحی تفکیک‌شده Nvidia، استنتاج را به دو مرحله بافتار/پیش‌پر کردن (context/prefill) و تولید/رمزگشایی (generation/decode) تقسیم می‌کند. پردازنده گرافیکی Rubin CPX که لغو شد و از GDDR7 بهره می‌برد، به طور خاص برای مرحله پردازش‌سنگینِ بافتار/پیش‌پر کردن بهینه شده بود، در حالی که پردازنده‌های گرافیکی معمولی Rubin که به HBM مجهز هستند، مرحله تولیدِ مقید به پهنای باند حافظه را مدیریت می‌کنند.

در مقابل، پلتفرم AMD و Cerebras از همان اصل تفکیک پیروی می‌کند، اما تخصص آن معکوس شده است: پلتفرم Helios شرکت AMD به همراه پردازنده‌های گرافیکی Instinct، مرحله پیش‌پر کردن را مدیریت کرده و پرامپت‌ها و پنجره‌های بافتار بزرگ را پردازش می‌کند، در حالی که Cerebras WSE مرحله رمزگشایی را به عهده می‌گیرد و تولید توکن حساس به تأخیر را مدیریت می‌کند.

دسترسی‌پذیری و یکپارچگی در مراکز داده

جدول زمانی عرضه پلتفرم استنتاج مشترک

Cerebras قصد دارد سیستم‌های AMD Helios را در مراکز داده خود نصب کرده و آن‌ها را با رک‌های WSE خود یکپارچه کند. بر اساس اعلام این دو شرکت، پیش‌بینی می‌شود که این راهکار ترکیبی در ابتدا در نیمه دوم سال 2026 از طریق Cerebras Cloud در دسترس قرار گیرد.

این همکاری می‌تواند نقطه عطفی در رقابت سخت‌افزاری برای استنتاج هوش مصنوعی باشد و نشان‌دهنده گرایش صنعت به سمت تفکیک تخصصی وظایف در مقیاس رک است.