اوپنایآی در مدت ۹ ماه تراشهٔ سفارشی استنتاج خود به نام Jalapeño را طراحی و تولید و سپس اجازه داد مدلهای داخلیاش برخی پیادهسازیهای کد را بازنویسی و بهینهسازی کنند. نتایج بنچمارکهای عمومی اخیر نشان میدهد این ترکیب از طراحی سختافزار و بهینهسازی نرمافزاری منجر به بهبودهای قابلتوجه در توان عملیاتی، بهرهوری انرژی و زمان پاسخ شده است.
طراحی متمرکز بر توان عملیاتی بالا و تأخیر پایین
اوپنایآی همراه با Broadcom تراشه را از پایه برای استنتاج مدلهای زبان بزرگ طراحی کرد. معماری Jalapeño طوری تنظیم شده که انتقال بین محاسبه و حافظه و زمانهای انتظار به حداقل برسد؛ نگهداری حالت مدل و کش KV بهصورت محلی و پیادهسازی شبکهبندی داخلی باعث میشود بخشهای مختلف سیستم کمتر منتظر داده باشند و پاسخها سریعتر تولید شوند.
اهمیت کاهش تأخیر برای agentها و بارهای تعاملی
سامانههای عاملی (agentها) و برنامههای تعاملی پیوسته نیازمند فراخوانیهای متوالی به مدلاند. تأخیری که در یک فراخوانی کوچک محسوس نباشد، در توالی بلندمدت انباشته شده و تجربه کاربری را تحتتأثیر قرار میدهد. Jalapeño مخصوص این نوع بارها طراحی شده تا هم توان عملیاتی افزایش یابد و هم تأخیر انتها-به-انتها کاهش یابد.
نتایج بنچمارکهای عمومی
اوپنایآی تراشه را با معیار InferenceX از SemiAnalysis روی مدلهای GPT-OSS 120B، DeepSeek R1 670B و Kimi K2.5 1T آزمایش کرد. نکات برجسته:
- بهبود توان عملیاتی به ازای هر وات: بین 1.5 تا 1.9 برابر.
- کاهش تأخیر انتها-به-انتها: بین 1.7 تا 3.6 برابر سریعتر.
- در بارهای بسیار تعاملی: بین 2.1 تا 4.1 برابر عملکرد بهتر نسبت به سیستمهای مرجع.
- در نقطههایی که پیشتر بهینهترین مصرف انرژی بود، بهرهوری انرژی بین 8.6 تا 104.3 برابر بهبود یافته است (بستگی به مدل و سناریو دارد).
اوپنایآی مقایسههای مصرف توان را براساس درجهبندی توان هر شتابدهنده انجام داده؛ درجهبندی کاغذی Jalapeño برابر 700 وات اعلام شده اما گزارش شده در آزمایشها مصرف واقعی هرگز بیش از 550 وات نبوده است.
هوش مصنوعی در حلقهٔ طراحی: بازنویسی کد و افزایش سرعت اجرا
اوپنایآی از مدلها و ابزارهای خود برای کمک به تیم سختافزار در طول چرخه طراحی استفاده کرد. پیادهسازیهای تولیدشده توسط هوش مصنوعی برای بلوکهای انتخابی مانند attention و mixture-of-experts روی مدل GPT-OSS سرعت اجرا را بین 1.5 تا 1.8 برابر نسبت به پیادهسازیهای دستی افزایش دادهاند. این افزایش بهمعنی سرعت کلی همان نسبت برای کل مدل نیست، اما نشان میدهد بهینهسازی کد در سطح بلاکهای بحرانی نقش مهمی در بهرهوری نهایی سیستم دارد.
انتخابهای طراحی کلیدی
- نگهداری حالت مدل و کشها بهصورت محلی برای کاهش تبادل داده بین هستهها.
- معماری شبکهای که اجازه میدهد بار کاری بیشتری در همان سیستم متصل باقی بماند و از انتقالهای پرهزینه جلوگیری شود.
- تعادل بین محاسبات سنگین در فازهای اولیه و پهنای باند مورد نیاز تولید توکنبهتوکن.
پیامدها برای آیندهٔ استنتاج
تراشههایی مانند Jalapeño نشان میدهند امکان همافزایی میان طراحی سختافزار و تولید کد خودکار وجود دارد؛ نتیجه افزایش بهرهوری انرژی و کاهش تأخیر برای بارهای تعاملی است. بهکارگیری هوش مصنوعی در حلقهٔ طراحی میتواند زمان عرضه را کوتاهتر و روند بهبود را سریعتر کند، که در نهایت به مراکز داده و APIهایی با هزینه کمتر و پاسخدهی بهتر منتهی خواهد شد.
منابع مرتبط
آشنایی بیشتر: OpenAI، Broadcom و SemiAnalysis.
تکنیکهای پیادهسازی و بهینهسازی مورد استفاده در Jalapeño احتمالاً در نسلهای آیندهٔ شتابدهندهها و مراکز داده نقشی پررنگتر خواهند داشت؛ جایی که هم مصرف انرژی و هم تجربهٔ پاسخ سریع برای بارهای تعاملی اهمیت مییابند.





