تکامل از کنترل‌کننده ویدئو تا موتور محاسباتی

کارت گرافیک سال‌هاست که تکلیفش فقط ترسیم فریم‌ها و اجرای بازی‌ها مشخص نیست. این قطعهٔ سخت‌افزاری به موتور محاسباتی تبدیل شده که پشت صحنهٔ هوش مصنوعی، شبیه‌سازی‌های علمی و رندرهای سنگین را مدیریت می‌کند. واحد پردازش گرافیکی یا GPU، قلب تپندهٔ محاسبات موازی در دنیای دیجیتال امروزی است. این تراشه‌ها از کنترل‌کننده‌های سادهٔ نمایش ویدئو قدم‌به‌قدم به پردازنده‌های برنامه‌پذیر پیچیده تبدیل شده‌اند که نه تنها خروجی تصویری تولید می‌کنند، بلکه محاسبات سنگینی مانند چرخش، مقیاس‌دهی تصاویر سه‌بعدی و اجرای کدهای سفارشی به نام سایه‌زن‌ها (Shaders) را نیز بر عهده دارند.

معماری این سخت‌افزار در دههٔ ۹۰ میلادی شکل گرفت؛ زمانی که سازندگان مجبور شدند برای کاهش فشار روی پردازنده‌های مرکزی، محاسبات گرافیکی را به روی تراشه منتقل کنند. با اضافه شدن قابلیت‌های سه‌بعدی و برنامه‌پذیری سایه‌زن‌ها، GPUs به استاندارد اصلی تبدیل شدند و سهم بازار آن‌ها با ظهور کنسول‌های بازی و سیستم‌های رندرینگ به‌سرعت گسترش یافت.

عوامل تعیین‌کنندهٔ عملکرد سخت‌افزاری

سرعت و قدرت یک GPU تنها با تعداد هسته‌ها سنجیده نمی‌شود. چندین فاکتور معماری روی خروجی واقعی دستگاه تاثیر می‌گذارند:

  • گرهٔ ساخت نیمه‌هادی: فرآیند لیتوگرافی و کوچک‌سازی مسیرهای اتصال روی تراشه (مثلاً ۷ نانومتر یا ۴ نانومتر) مستقیماً بر مصرف انرژی و تراکم هسته‌ها اثر می‌گذارد.
  • فرکانس سیگنال ساعت: سرعت کلاک هسته و حافظه تعیین می‌کند که هر واحد محاسباتی در ثانیه چند عملیات را پردازش می‌کند.
  • حافظهٔ کش داخلی: سلسله‌مراتب کش‌های روی‌تراشه لایهٔ اول تا سوم، گلوگاه‌های دسترسی به داده را کاهش می‌دهند و پهنای باند موثر را بالا می‌برند.
  • واحدهای محاسبهٔ موازی: تعداد واحدهای پردازشی روی سیلیکون حیاتی است. انویدیا این واحدها را SM، ای‌ام‌دی CU و اینتل Xe Core نامیده است.

صنعت معمولاً عملکرد را بر حسب عملیات ممیز شناور در ثانیه یا FLOPS بیان می‌کند. اعدادی که با پیشوند ترافلاپس (TFLOPS) می‌شنوید، حداکثر توان تئوری هستند و در دنیای واقعی تحت تأثیر کشینگ، گلوگاه‌های حافظه و بهینه‌سازی درایورها نوسان می‌کنند.

اختصاصی در برابر یکپارچه: تفاوت حافظه و کاربرد

در اکوسیستم رایانه‌ای شخصی، GPUs دو مسیر کاملاً متفاوت را طی کرده‌اند که انتخاب بین آن‌ها به نوع بار کاری بستگی دارد.

GPUهای اختصاصی (مجزا)

این کارت‌ها از حافظهٔ گرافیکی اختصاصی (VRAM) با تکنولوژی‌هایی مثل GDDR6 استفاده می‌کنند که پهنای باند بسیار بالاتری نسبت به رم سیستم ارائه می‌دهد. وقتی داده‌های کاری از ظرفیت VRAM فراتر می‌رود، انتقال اطلاعات به رم اصلی باعث افت شدید فریم‌ریت یا قفل شدن سیستم می‌شود. در گذشته فناوری‌هایی مثل SLI و CrossFire اجازه می‌داد چندین کارت گرافیک به‌صورت همزمان تصویر تولید کنند، اما این روش در گیمینگ معمولی تقریباً منسوخ شده است. همین پیکربندی‌های چندگانه هنوز در ابررایانه‌ها، استودیوهای جلوه‌های ویژهٔ بصری و زیرساخت‌های آموزش مدل‌های زبانی و بینایی ماشین به‌طور گسترده فعال هستند.

GPUهای یکپارچه (iGPU)

در لپ‌تاپ‌های اقتصادی، اولترابوک‌ها و برخی سیستم‌های اداری، GPU بخشی از چیپ‌ست اصلی یا کلاک هسته‌های پردازندهٔ مرکزی است. این معماری به‌جای داشتن VRAM مجزا، مقدار مشخصی از رم اصلی سیستم را تقسیم می‌کند. مزیت اصلی این راهکار، کاهش هزینهٔ تولید و مصرف برق ناچیز است. اگرچه این واحدها برای تماشای ویدئو، کارهای روزمره و بازی‌های سبک مناسب‌اند، اما در مواجهه با بارهای کاری سه‌بعدی سنگین یا هوش مصنوعی، با محدودیت شدید حافظه مواجه می‌شوند.

بلوک‌های سخت‌افزاری تخصصی و عصر هوش مصنوعی

گذار از گرافیک‌سازی به محاسبات علمی با اضافه شدن بلوک‌های اختصاصی روی تراشه‌ها سرعت گرفت. امروزه GPUs علاوه بر رندرینگ معمولی، از بلوک‌های سخت‌افزاری تخصصی برای ردیابی پرتو (Ray Tracing)، رمزگذاری سخت‌افزاری ویدئو (مانند NVENC) و شتاب‌دهی هوش مصنوعی (مانند Tensor Cores) بهره می‌برند. این بلوک‌ها محاسبات ماتریسی و برداری را که پایهٔ آموزش شبکه‌های عصبی هستند، هزاران بار سریع‌تر از پردازنده‌های متمرکز اجرا می‌کنند.

چون بسیاری از مسائل محاسباتی کلان به تکه‌های «به‌شدت موازی» تقسیم می‌شوند، این معماری ذاتاً برای تربیت مدل‌های زبانی بزرگ، فشرده‌سازی داده‌ها و حتی استخراج رمزارزها ایده‌آل است. توسعه‌دهندگان نرم‌افزار و متخصصان داده با استفاده از فریم‌ورک‌هایی مثل CUDA یا ROCm، کنترل مستقیمی روی هزاران هستهٔ موازیٔ GPU دارند.

آیندهٔ پردازش گرافیکی

مرز بین CPU و GPU از همیشه باریک‌تر شده است. سازندگان اصلی با افزودن هسته‌های گرافیکی قدرتمند به پردازنده‌های متمرکز و توسعهٔ چیپ‌ست‌های اختصاصی برای کاربردهای تخصصی، در حال تغییر تعریف رایانه‌های شخصی هستند. با افزایش تقاضا برای رندرینگ بلادرنگ، موتورهای فیزیک پیشرفته و مدل‌های مولد چندوجهی، نسل بعدی GPUs احتمالاً بر پایهٔ اتصالات پهنای باند فوق‌سریع و معماری‌های هیبریدی شکل می‌گیرند که مرزهای سخت‌افزار و نرم‌افزار را کاملاً محو می‌کنند. دنبال کردن این مسیر نشان می‌دهد که واحد پردازش گرافیکی دیگر یک قطعهٔ فرعی نیست، بلکه معمار اصلی عصر محاسبات است.