چرا پردازنده‌های گرافیکی موتور محرک هوش مصنوعی شدند؟

امروزه وجود هوش مصنوعی مدرن نتیجه الگوریتم‌های پیچیده نیست، بلکه مدیون یک قطعه سخت‌افزاری است که در دهه ۹۰ میلادی صرفاً برای رندر کردن گرافیک بازی‌های ویدئویی طراحی شده بود. مسیر تبدیل واحد پردازش گرافیکی (GPU) به قلب تپنده محاسبات علمی از دو نقطه عطف کلیدی می‌گذرد: معرفی پلتفرم برنامه‌نویسی CUDA توسط انویدیا در سال 2007 و پیروزی تاریخی شبکه عصبی AlexNet در مسابقه بین‌المللی ایمیج‌نت (ImageNet) در سال 2012. این دو رویداد، محاسبات هوش مصنوعی را از فرآیندی که روزی دهه‌ها زمان می‌برد، به یک فرآیند چندروزه تبدیل کردند و بستر لازم برای پیدایش خوشه‌های عظیم گرافیکی امروزی را فراهم نمودند.

معماری پردازشی؛ تفاوت بنیادین CPU و GPU

درک این دگرگونی مستلزم شناخت گلوگاهی است که شکسته شد. واحدهای پردازش مرکزی (CPU) ذاتاً برای کلی‌نگری و اجرای چندوظیفگی طراحی شده‌اند. آن‌ها با هسته‌هایی قدرتمند که به صورت متوالی عملیات منطقی پیچیده، شاخه‌بندی‌های شرطی و مدیریت حافظه را انجام می‌دهند، سرعت را در پردازش‌های سریال بهینه کرده‌اند. در مقابل، فلسفه طراحی GPUs کاملاً متفاوت است. از آنجا که رندر کردن تصویر نیازمند محاسبه همزمان میلیون‌ها پیکسل است، معماری شتاب‌دهنده‌های گرافیکی بر پایه پردازش موازی استوار است. تا سال 2006، نمونه‌های برتر این تراشه‌ها صدها هسته ساده‌تر در اختیار داشتند که همزمان عملیات را پردازش می‌کردند.

سازگاری ذاتی یادگیری عمیق با شتاب‌دهنده‌های گرافیکی

هسته اصلی محاسبات در شبکه‌های یادگیری عمیق، ضرب ماتریسی است. این فرآیند شامل ضرب و جمع میلیون‌ها وزن و پارامتر با داده‌های ورودی است که بارها تکرار می‌شود. دو ویژگی کلیدی این بار محاسباتی آن را برای GPUs ایده‌آل می‌سازد:

  • سادگی: عملیات اصلی تنها به جمع و ضرب محدود است و پیچیدگی منطقی چندانی ندارد.
  • مقیاس عظیم: تعداد عملیات به گونه‌ای است که در مدل‌های پیشرفته به تریلیون‌ها محاسبه می‌رسد.

به بیان ساده، هوش مصنوعی به تعداد بسیار زیادی محاسبات ساده نیاز دارد، نه چند محاسبه سنگین و پیچیده. محققان آن دوران باور داشتند اجرای این حجم از داده روی CPUs خالص ممکن است دهه‌ها طول بکشد؛ اما شواهد نشان داد همین بار کاری عظیم در GPUs به چند روز یا حتی ساعت کاهش می‌یابد.

از گرافیک بازی تا محاسبات علمی؛ یک کشف تصادفی

تلاش‌هایی برای استفاده از شتاب‌دهنده‌های گرافیکی پیش از ورود رسمی CUDA در جریان بود. محققان دانشگاه‌های معتبر از جمله تیم‌های جفری هینتون و یان لکان، با دور زدن محدودیت‌های APIهای گرافیکی و استفاده از زبان‌های شیدر، شروع به شبیه‌سازی عملیات ماتریسی روی GPUs کردند. سرعت این روش‌های ناهموار ده‌ها برابر CPUs بود، اما پیاده‌سازی آن نیازمند تقلب در سخت‌افزار و مهندسی معکوس دستورات گرافیکی بود. نیاز به یک ابزار استاندارد و در دسترس به وضوح حس می‌شد.

CUDA (2007): طراحی اکوسیستم نرم‌افزاری

انویدیا در سال 2007 پلتفرم CUDA (Compute Unified Device Architecture) را عرضه کرد تا شکاف بین سخت‌افزار و نرم‌افزار را پر کند. این پلتفرم نخستین محیطی بود که به توسعه‌دهندگان اجازه داد با استفاده از توابع مبتنی بر زبان C، مستقیماً روی هسته‌های گرافیکی محاسبات دلخواه اجرا کنند. CUDA فراتر از یک ابزار تکنیکال، یک استراتژی اکوسیستم‌سازی بود. انویدیا با ارائه لایه نرم‌افزاری یکپارچه، به محققان و شرکت‌ها اطمینان داد که می‌توانند از ظرفیت واقعی سخت‌افزار بدون دردسرهای برنامه‌نویسی گرافیکی بهره ببرند. این تصمیم جسورانه، انویدیا را به رهبر بی‌رقیب زیرساخت‌های پردازشی هوش مصنوعی در دهه بعد تبدیل کرد. پس از عرضه CUDA، محققان برای اولین بار توانستند الگوریتم‌های پیچیده یادگیری ماشین را بدون محدودیت‌های سخت‌افزاری آزمایش و توسعه دهند.

پیروزی الکس‌نت (2012): لحظه‌ای که هوش مصنوعی از خواب بیدار شد

اگر CUDA بستر را فراهم کرد، الکس‌نت جرقه نهایی بود. این شبکه عصبی عمیق با بهره‌گیری مستقیم از GPUs و معماری نوین هوش مصنوعی، در رقابت ImageNet عملکردی خیره‌کننده از خود نشان داد و خطای طبقه‌بندی تصاویر را تا حد چشمگیری کاهش داد. این موفقیت، پارادایم تحقیقاتی را برای همیشه تغییر داد. آزمایشگاه‌ها و شرکت‌های فناوری به سرعت به سمت معماری‌های مبتنی بر GPU مهاجرت کردند. ترافیک داده و نیاز به شتاب محاسباتی به گونه‌ای افزایش یافت که امروزه مدل‌های زبانی بزرگ با میلیاردها پارامتر، تنها در خوشه‌های عظیم گرافیکی قابل آموزش و بهینه‌سازی هستند.

ادامه این مسیر نشان می‌دهد که مرز بین سخت‌افزارهای اختصاصی هوش مصنوعی و پردازنده‌های گرافیکی عمومی هر روز باریک‌تر می‌شود. نسل‌های جدید چیپ‌های اختصاصی به گونه‌ای طراحی می‌شوند که نه‌تنها محاسبات ماتریسی، بلکه بهینه‌سازی گرادیانت و مدیریت حافظه‌های هیبریدی را با کمترین اتلاف انرژی انجام دهند. آینده پردازش داده‌های کلان و مدل‌های چندوجهی به شدت به همین همگراری سخت‌افزار و الگوریتم وابسته خواهد بود و انتظار می‌رود بازیگران کلان فناوری با تمرکز بر مهندسی تراشه‌های نسل بعد، رقابت برای تسخیر ابررایانه‌های عصبی را شتاب بخشند.