اوپن‌ای‌آی در مدت ۹ ماه تراشهٔ سفارشی استنتاج خود به نام Jalapeño را طراحی و تولید و سپس اجازه داد مدل‌های داخلی‌اش برخی پیاده‌سازی‌های کد را بازنویسی و بهینه‌سازی کنند. نتایج بنچمارک‌های عمومی اخیر نشان می‌دهد این ترکیب از طراحی سخت‌افزار و بهینه‌سازی نرم‌افزاری منجر به بهبودهای قابل‌توجه در توان عملیاتی، بهره‌وری انرژی و زمان پاسخ شده است.

طراحی متمرکز بر توان عملیاتی بالا و تأخیر پایین

اوپن‌ای‌آی همراه با Broadcom تراشه را از پایه برای استنتاج مدل‌های زبان بزرگ طراحی کرد. معماری Jalapeño طوری تنظیم شده که انتقال بین محاسبه و حافظه و زمان‌های انتظار به حداقل برسد؛ نگهداری حالت مدل و کش KV به‌صورت محلی و پیاده‌سازی شبکه‌بندی داخلی باعث می‌شود بخش‌های مختلف سیستم کمتر منتظر داده باشند و پاسخ‌ها سریع‌تر تولید شوند.

اهمیت کاهش تأخیر برای agentها و بارهای تعاملی

سامانه‌های عاملی (agentها) و برنامه‌های تعاملی پیوسته نیازمند فراخوانی‌های متوالی به مدل‌اند. تأخیری که در یک فراخوانی کوچک محسوس نباشد، در توالی بلندمدت انباشته شده و تجربه کاربری را تحت‌تأثیر قرار می‌دهد. Jalapeño مخصوص این نوع بارها طراحی شده تا هم توان عملیاتی افزایش یابد و هم تأخیر انتها-به-انتها کاهش یابد.

نتایج بنچمارک‌های عمومی

اوپن‌ای‌آی تراشه را با معیار InferenceX از SemiAnalysis روی مدل‌های GPT-OSS 120B، DeepSeek R1 670B و Kimi K2.5 1T آزمایش کرد. نکات برجسته:

  • بهبود توان عملیاتی به ازای هر وات: بین 1.5 تا 1.9 برابر.
  • کاهش تأخیر انتها-به-انتها: بین 1.7 تا 3.6 برابر سریع‌تر.
  • در بارهای بسیار تعاملی: بین 2.1 تا 4.1 برابر عملکرد بهتر نسبت به سیستم‌های مرجع.
  • در نقطه‌هایی که پیش‌تر بهینه‌ترین مصرف انرژی بود، بهره‌وری انرژی بین 8.6 تا 104.3 برابر بهبود یافته است (بستگی به مدل و سناریو دارد).

اوپن‌ای‌آی مقایسه‌های مصرف توان را براساس درجه‌بندی توان هر شتاب‌دهنده انجام داده؛ درجه‌بندی کاغذی Jalapeño برابر 700 وات اعلام شده اما گزارش شده در آزمایش‌ها مصرف واقعی هرگز بیش از 550 وات نبوده است.

نمایی از تراشه Jalapeño اوپن‌ای‌آی در آزمایشگاه

هوش مصنوعی در حلقهٔ طراحی: بازنویسی کد و افزایش سرعت اجرا

اوپن‌ای‌آی از مدل‌ها و ابزارهای خود برای کمک به تیم سخت‌افزار در طول چرخه طراحی استفاده کرد. پیاده‌سازی‌های تولیدشده توسط هوش مصنوعی برای بلوک‌های انتخابی مانند attention و mixture-of-experts روی مدل GPT-OSS سرعت اجرا را بین 1.5 تا 1.8 برابر نسبت به پیاده‌سازی‌های دستی افزایش داده‌اند. این افزایش به‌معنی سرعت کلی همان نسبت برای کل مدل نیست، اما نشان می‌دهد بهینه‌سازی کد در سطح بلاک‌های بحرانی نقش مهمی در بهره‌وری نهایی سیستم دارد.

انتخاب‌های طراحی کلیدی

  • نگهداری حالت مدل و کش‌ها به‌صورت محلی برای کاهش تبادل داده بین هسته‌ها.
  • معماری شبکه‌ای که اجازه می‌دهد بار کاری بیشتری در همان سیستم متصل باقی بماند و از انتقال‌های پرهزینه جلوگیری شود.
  • تعادل بین محاسبات سنگین در فازهای اولیه و پهنای باند مورد نیاز تولید توکن‌به‌توکن.

پیامدها برای آیندهٔ استنتاج

تراشه‌هایی مانند Jalapeño نشان می‌دهند امکان هم‌افزایی میان طراحی سخت‌افزار و تولید کد خودکار وجود دارد؛ نتیجه افزایش بهره‌وری انرژی و کاهش تأخیر برای بارهای تعاملی است. به‌کارگیری هوش مصنوعی در حلقهٔ طراحی می‌تواند زمان عرضه را کوتاه‌تر و روند بهبود را سریع‌تر کند، که در نهایت به مراکز داده و APIهایی با هزینه کمتر و پاسخ‌دهی بهتر منتهی خواهد شد.

منابع مرتبط

آشنایی بیشتر: OpenAI، Broadcom و SemiAnalysis.

تکنیک‌های پیاده‌سازی و بهینه‌سازی مورد استفاده در Jalapeño احتمالاً در نسل‌های آیندهٔ شتاب‌دهنده‌ها و مراکز داده نقشی پررنگ‌تر خواهند داشت؛ جایی که هم مصرف انرژی و هم تجربهٔ پاسخ سریع برای بارهای تعاملی اهمیت می‌یابند.