رقابت برای کاهش هزینه‌های استنتاج هوش مصنوعی، طراحی تراشه را از شتاب‌دهنده‌های همه‌منظور فراتر برده و به سمت سیلیکونی اختصاصی برای مدل‌های خاص سوق می‌دهد. پروژه جدید و گزارش‌شده گوگل با نام «Frozen v2» نشان می‌دهد که مدل جمینای نیز به این موج پیوسته است.

بر اساس گزارش The Information، این تراشه که هنوز رسماً معرفی نشده، بخش‌هایی از معماری جمینای را به صورت سخت‌افزاری پیاده‌سازی می‌کند، اما وزن‌های مدل همچنان قابل به‌روزرسانی باقی می‌مانند. این راهکار میانی به گوگل امکان می‌دهد تا کارایی بالای سیلیکون اختصاصی را داشته باشد، بدون آنکه سخت‌افزار با هر تغییر در جمینای منسوخ شود.

یک سخنگوی گوگل در این باره به The New Stack گفت: «تیم‌های ما دائماً در حال تحقیق و آزمایش نوآوری‌های جدید برای ارائه حداکثر عملکرد و کارایی به کاربران و مشتریان خود هستند. اگرچه هر پروژه‌ای به مرحله تولید نمی‌رسد، اما این بررسی دقیق، هسته مرکزی رویکرد پشته کامل ماست. با طراحی مشترک سخت‌افزار و نرم‌افزار از پایه، اطمینان حاصل می‌کنیم که سیستم‌هایمان برای بارهای کاری واقعی یکپارچه و بهینه هستند.»

بازی با آتش کارایی و هزینه

بر اساس گزارش‌ها، گوگل امیدوار است این تراشه بحران کمبود توان محاسباتی هوش مصنوعی را کاهش دهد که ارائه‌دهندگان ابر را برای همگام‌شدن با تقاضا تحت فشار گذاشته است. علاوه بر این، سرویس‌دهی به جمینای را بسیار ارزان‌تر و کارآمدتر خواهد کرد. برآوردهای داخلی نشان می‌دهد این طراحی می‌تواند شش تا ده برابر توکن در هر وات بیشتر از نسل فعلی تراشه‌های هوش مصنوعی گوگل ارائه دهد.

اگر این پروژه به مرحله اجرا برسد، نمایانگر یک تغییر رویکرد اساسی در زیرساخت هوش مصنوعی خواهد بود: گوگل سخت‌افزاری را specifically برای جمینای می‌سازد. برای توسعه‌دهندگان، این یک سیگنال اولیه است که سیستم‌های هوش مصنوعی آینده با یکپارچگی بسیار تنگاتنگ‌تری بین مدل و سخت‌افزار طراحی خواهند شد.

تخصصی‌سازی جایگزین انعطاف‌پذیری

در حال حاضر، اکثریت قریب به اتفاق استنتاج‌های هوش مصنوعی روی GPUهای انویدیا یا TPUهای خود گوگل اجرا می‌شوند. این تراشه‌ها برای پشتیبانی از طیف وسیعی از مدل‌ها طراحی شده‌اند و بنابراین بار پردازشی بالایی دارند.

این تغییر بی‌سابقه نیست. استخراج بیت‌کوین مسیری مشابه را طی کرد: از CPU به GPU و نهایتاً به ASICها. استنتاج هوش مصنوعی هم ممکن است به همان مسیر برود. آموزش همچنان از انعطاف‌پذیری GPUها بهره می‌برد، اما وقتی مدلی به مرحله تولید می‌رسد، اولویت به سرویس‌دهی حداکثری درخواست‌ها با کمترین مصرف انرژی تغییر می‌کند.

رقبا هم دست به کار شده‌اند

گوگل تنها شرکتی نیست که به دنبال جایگزینی برای GPUهای همه‌منظوره می‌گردد. با افزایش سهم استنتاج از بار کاری هوش مصنوعی، شرکت‌های بیشتری در حال آزمایش سخت‌افزار تخصصی برای بهبود عملکرد و کاهش مصرف انرژی هستند. حتی انویدیا که GPUهایش بازار را در دست دارند، سال گذشته معامله‌ای ۲۰ میلیارد دلاری با Groq برای مجوز فناوری این استارتاپ انجام داد.

از جاه‌طلبانه‌ترین پروژه‌ها می‌توان به استارتاپ کانادایی Taalas اشاره کرد. این شرکت تراشه‌ای ساخته که یک مدل کامل Llama با ۸ میلیارد پارامتر مستقیماً درون سیلیکون آن تعبیه شده است. با نگه‌داشتن مدل روی تراشه به جای جابجایی مداوم داده بین حافظه خارجی، Taalas بازدهی حدود ۱۷ هزار توکن در ثانیه را گزارش می‌کند.

در همین حال، d-Matrix با پلتفرم Corsair از معماری محاسبه درون حافظه مبتنی بر SRAM به جای HBM استاندارد استفاده می‌کند. SambaNova هم فناوری جریان داده سفارشی را با معماری حافظه سه لایه به کار می‌گیرد.

تراشه اختصاصی برای مدل جمینای گوگل

همه این نشانه‌ها حاکی از آن است که دوران تراشه‌های همه‌منظوره برای استنتاج رو به پایان است و آینده از آنِ سیلیکونی است که دقیقاً برای یک مدل خاص طراحی شده است. سوال اصلی این است: آیا این مسیر به کارایی انقلابی منجر می‌شود یا انعطاف‌پذیری را قربانی خواهد کرد؟