شرکت‌های SK hynix و TetraMem به همراه محققان دانشگاه کالیفرنیای جنوبی (USC) یک سیستم روی تراشه (SoC) آزمایشی مبتنی بر مموریستور برای دستگاه‌های هوش مصنوعی لبه توسعه داده‌اند. این تراشه که با هدف تسریع استنتاج شبکه‌های عصبی سبک طراحی شده، توان مصرفی بسیار کمی دارد و می‌تواند تحولی در حوزه محاسبات لبه ایجاد کند.

همکاری برای آینده هوش مصنوعی لبه

این SoC که یک نمونه اثبات مفهوم است، از معماری محاسبات درون‌حافظه (IMC) بهره می‌برد. در این روش، محاسبات آنالوگ مستقیماً درون آرایه‌های حافظه انجام می‌شود که جابجایی داده‌ها و مصرف توان را به شدت کاهش می‌دهد. با این حال، یکی از چالش‌های اصلی، عملیات کانولوشن عمق‌وار (DWC) است که در شبکه‌های سبکی مانند MobileNet کاربرد دارد و روی آرایه‌های متقاطع معمولی به خوبی پیاده‌سازی نمی‌شود.

نمودار معماری SoC مبتنی بر مموریستور

معماری IMC بهینه‌سازی شده برای کانولوشن عمق‌وار

محققان برای حل این مشکل، یک معماری IMC اختصاصی برای DWC توسعه داده‌اند. SoC جدید بر پایه یک پردازنده RISC-V جاسازی‌شده ساخته شده که وظیفه زمان‌بندی بارهای کاری را بر عهده دارد. این تراشه شامل ۱۰ واحد پردازش عصبی (NPU) است:

  • یک NPU اختصاصی برای کانولوشن عمق‌وار با هشت بلوک آرایه متقاطع زیگزاگ ۲۵۲×۲۸
  • نه NPU دیگر با آرایه‌های متقاطع ۱T1R معمولی ۲۵۶×۲۵۶ برای عملیات نقطه‌ای و متراکم

جزئیات فنی SoC

در NPUهای معمولی، هر واحد شامل یک آرایه متقاطع ۲۵۶×۲۵۶ مموریستور، ۲۵۶ مبدل آنالوگ به دیجیتال (DAC) ۸ بیتی و ۲۵۶ مبدل دیجیتال به آنالوگ (ADC) ۸ بیتی است. در NPU بهینه‌سازی شده برای DWC، خطوط انتخاب مستقیم با یک توپولوژی زیگزاگ جایگزین شده‌اند تا ۲۸ کانولوشن مستقل ۳×۳ به صورت موازی اجرا شوند. SK hynix این دستگاه‌ها را با فرآیند CMOS 65 نانومتری ساخته است.

تصویر تراشه آزمایشی SK hynix و TetraMem

بهره‌وری انرژی بالا، عملکرد محدود

برای نمایش قابلیت‌ها، محققان شبکه MobileNetV1Small را با حدود ۳۶٬۰۰۰ پارامتر روی این SoC اجرا کردند. عملکرد تئوری این تراشه در بهترین حالت به ۲.۵۴ TOPS می‌رسد که ۱۶ برابر کمتر از الزامات Microsoft Copilot+ است. با این حال، بهره‌وری انرژی آن بسیار بالاست و مصرف توان بسیار کمی دارد. هر دستگاه مموریستور با دقت مؤثر حدود ۲ بیت برنامه‌ریزی می‌شود، اما با تکنیک جبران دو زیرآرایه، دقت وزن به حدود ۴ بیت افزایش یافته است.

این رویکرد از نظر مفهومی مشابه فلسفه NVFP4 انویدیا است، اما پیاده‌سازی آن متفاوت است.

این SoC در مرحله آزمایشی قرار دارد و هنوز سوالاتی در مورد عملکرد نهایی آن باقی است. اما اگر این فناوری به بلوغ برسد، می‌تواند تحولی در دستگاه‌های هوش مصنوعی لبه مانند گوشی‌های هوشمند، حسگرها و گجت‌های پوشیدنی ایجاد کند.