برای اجرای مدل‌های زبانی بزرگ (LLM) در خانه، بزرگ‌ترین مانع پیش‌روی کاربران، کمبود حافظه ویدیویی (VRAM) است. با این حال، یک علاقه‌مند به هوش مصنوعی موفق شده با صرف تنها 266 دلار، یک کارت گرافیک سازمانی قدیمی و به شدت پر سر و صدا را به سیستم گیمینگ خود اضافه کند و ظرفیت حافظه‌ای دستگاه را به 32 گیگابایت برساند.

اسکار مولنار (Oscar Molnar)، علاقه‌مند به علوم رایانه، برای دور زدن هزینه‌های سنگین ارتقای سخت‌افزار، از یک کارت گرافیک Nvidia Tesla V100 SXM2 با 16 گیگابایت حافظه HBM2 استفاده کرده است. این گرافیک‌های سازمانی در حال حاضر در پلتفرم‌هایی مانند eBay با قیمت‌هایی زیر 140 دلار به فروش می‌رسند؛ اما استفاده از آن‌ها در سیستم‌های شخصی، چالش‌های فنی و سخت‌افزاری متعددی به همراه دارد که مولنار برای حل آن‌ها دست به ابتکار زده است.

نمایشی از کارت گرافیک انویدیا تسلا V100 اضافه شده به کیس کامپیوتر

تبدیل رابط SXM2 به PCIe و دست و پنجه نرم کردن با صدای 82 دسی‌بلی

کارت‌های گرافیک Tesla V100 دارای رابط SXM2 هستند و به‌سادگی روی مادربرد‌های استاندارد نصب نمی‌شوند. مولنار برای رفع این مشکل، حدود 66 دلار برای خرید یک مبدل SXM2 به PCIe هزینه کرد تا بتواند گرافیک سازمانی را به سیستم شخصی خود متصل کند.

چالش بزرگتر از نصب فیزیکی، سیستم خنک‌کننده این قطعه بود. فن استاندارد این گرافیک با تولید 82 دسی‌بل صدا، عملکردی شبیه به دستگاه خردکن زباله یا ماشین چمن‌زنی داشت. مولنار برای رفع این صدای آزاردهنده، یک اصلاح PWM روی خنک‌کننده انجام داد. با تغییر مسیر سیم‌های فن و اتصال آن‌ها به هدر مادربرد، این کارت گرافیک تنها با 10 درصد سرعت فن، در حالت تمام‌بار (Full Load) زیر 50 درجه سانتی‌گراد باقی می‌ماند.

مبدل PCIe برای اتصال کارت گرافیک تسلا V100 به مادربرد

پیکربندی نرم‌افزاری و معماری دوتایی آدا و ولترا

با تکمیل فرآیند نصب و کالیبراسیون سخت‌افزار، مولنار اکنون به سیستمی مجهز به 32 گیگابایت حافظه ویدیویی دسترسی داشت. این پیکربندی شامل یک کارت RTX 4080 با معماری Ada و 16 گیگابایت حافظه، در کنار Tesla V100 با معماری Volta و 16 گیگابایت حافظه است.

قابل ذکر است که وادار کردن سیستم‌عامل برای استفاده هم‌زمان از این دو معماری کاملاً متفاوت، کار ساده‌ای نیست. این کاربر خوش‌ساز از سیستم‌عامل NixOS به همراه یک درایور قدیمی انویدیا بهره برد که توانایی پشتیبانی هم‌زمان از هر دو معماری آدا و ولترا را داشت.

تست اجرای مدل 27 میلیارد پارامتری LLM روی سیستم ترکیبی

اجرای مدل 27 میلیارد پارامتری با سرعتی باورنکردنی

آزمایش‌های انجام شده روی این سیستم ترکیبی نتایج شگفت‌انگیزی به همراه داشته است. مولنار توانست یک مدل زبانی محلی 27 میلیارد پارامتری را با سرعت خیره‌کننده 32 توکن در ثانیه اجرا کند. این سرعت پردازش برای کاربری‌های تعاملی کاملاً روان محسوب می‌شود و حتی عملکرد سریع‌تری نسبت به بسیاری از سرویس‌های API ابری از خود نشان می‌دهد.

تجربه مولنار نشان می‌دهد که اگرچه رفتار مسیر توسعه‌دهندگان و هک‌های سخت‌افزاری برای دستیابی به قدرت پردازشی مقرون‌به‌صرفه پر از چالش‌های عجیب است، اما خروجی نهایی می‌تواند راه‌حلی بی‌بدیل برای عبور از محدودیت‌های سخت‌افزاری در روزهای اوج قیمت قطعات باشد.