تست‌های هوش مصنوعی محلی در سال 2026 عمدتاً بر روی مدل‌های زبانی بزرگ متمرکز بوده‌اند که به طور کامل در حافظه یکپارچه 128 گیگابایتی سیستم‌های مبتنی بر Nvidia GB10 و AMD Strix Halo جای می‌گیرند. با وجود کاربردی بودن این مدل‌های متن‌باز و نسبتاً کوچک‌تر، گاهی جایگزینی برای ظرفیت حافظه بالاتر وجود ندارد. اتصال دو سیستم Nvidia GB10 یا همان Dell Pro Max به یکدیگر، محیطی با 256 گیگابایت حافظه رم برای اجرای مدل‌های بزرگ‌تر فراهم می‌کند.

چالش حافظه در اجرای مدل‌های بزرگ

کوانتیزه کردن (Quantization) یک مدل هوش مصنوعی از انواع داده با دقت بالا به دقت پایین‌تر، همواره با موازنه میان عملکرد و دقت همراه است. حتی در حالت کوانتیزه، برخی از مدل‌های پیشرفته متن‌باز برای جای‌گرفتن در 128 گیگابایت حافظه بیش از حد بزرگ هستند. این مدل‌ها می‌توانند مشابه دیتاسنترها، در چندین سیستم محلی توزیع شوند و از شبکه به عنوان ستون فقرات مقیاس‌پذیری استفاده کنند.

ساخت یک سیستم محلی با حافظه VRAM زیاد از طریق GPUهای مجزا، به سرعت بسیار گران‌تر می‌شود. مقیاس‌پذیر کردن حافظه حتی به 128 گیگابایت، نیازمند یک سیستم میزبان گران‌قیمت با اسلات‌ها و پهنای باند PCI Express کافی است. فراتر رفتن از این ظرفیت به معنای خرج کردن حداقل 20 هزار دلار برای GPUهای انویدیا است، حتی با استفاده از کارت‌های قدیمی Ada با 48 گیگابایت حافظه.

راه‌اندازی‌های مرسوم معمولاً شامل پلتفرم AMD Epyc یا Threadripper Pro هستند که پیش از اضافه کردن کارت‌های گرافیک، به پردازنده، مادربرد و حافظه DDR5 گران‌قیمی نیاز دارند. مصرف برق چنین سیستمی به سرعت از توان یک مدار استاندارد 15 آمپری در آمریکا (حداکثر 1800 وات) فراتر می‌رود. علاوه بر این، داشتن چهار GPU مجزا با فن‌های بلوور در حالت بار بالا، تجربه چندان خوشایندی برای کسانی که در یک فضای مشترک قرار دارند، ایجاد نمی‌کند.

نمای نزدیک از پنل‌ها و اتصالات Dell Pro Max GB10

راهکار انویدیا برای خوشه‌بندی محلی

هزینه‌های بالا و چالش‌های پلتفرمی باعث شده تا علاقه‌مندان به هوش مصنوعی محلی، راه‌های دیگری برای دستیابی به حافظه‌های بزرگ با عملکرد قابل قبول در استنتاج LLM بیابند. انویدیا سیستم‌های DGX Spark را با رابط‌های شبکه داخلی ConnectX 7 با سرعت 200 گیگابیت بر ثانیه مجهز کرده است. این رابط‌های سطح بالا از فناوری RoCE (دسترسی مستقیم حافظه از راه دور از طریق اترنت همگرا) پشتیبانی می‌کنند. این ویژگی به دو یا چند دستگاه GB10 اجازه می‌دهد تا یک خوشه محاسباتی هوش مصنوعی توزیع‌شده بسازند و به مقیاس‌پذیری محاسبات هوش مصنوعی در خانه دست یابند.

اتصال کابل‌های QSFP به دو سیستم Dell Pro Max

بررسی Dell Pro Max با پردازنده GB10

دل یک جفت سیستم Dell Pro Max GB10 را به همراه کابل‌های QSFP لازم برای اتصال آن‌ها ارسال کرده است. این سیستم‌ها با قیمت 6332 دلار برای هر واحد (در پیکربندی با SSD 4 ترابایتی) ارزان نیستند، اما ساخت یک خوشه آماده به کار با 256 گیگابایت حافظه با آن‌ها، هزینه‌ای کمتر از خرید چهار کارت گرافیک 48 یا 72 گیگابایتی برای سرورهای مشابه دارد. اگر بتوان از عملکرد مطلق چشم‌پوشی کرد، این روش اقتصادی‌ترین راه برای اجرای مدل‌های بزرگ محلی محسوب می‌شود.

طراحی Dell Pro Max با GB10 الگوی DGX Spark را دنبال می‌کند، اما بهبودهای مفیدی دارد. این سیستم دارای یک LED نشانگر برق در پنل جلویی است که در DGX Spark وجود ندارد. همچنین شبکه‌های شش‌ضلعی روی پنل‌های جلو و عقب، برخلاف فوم‌های فلزی Spark، به لباس‌ها یا پارچه‌های میکروفایبر گیر نمی‌کنند. دل همچنین یک آداپتور برق USB-C با ظرفیت 280 وات برای هر سیستم ارائه می‌دهد که 40 وات بیشتر از آداپتور استاندارد است.

نمای کلی سیستم Dell Pro Max و آداپتور برق آن

آینده هوش مصنوعی محلی

خوشه‌بندی سیستم‌های کوچک اما قدرتمند مانند Pro Max، رویکردی هوشمندانه برای دور زدن موانع سخت‌افزاری و مالی است. این رویکرد نشان می‌دهد که چگونه فناوری‌های سطح دیتاسنتر در حال ورود به فضاهای کاری خانگی و دفتری هستند و آینده‌ای را رقم می‌زنند که در آن استنتاج مدل‌های عظیم زبانی نیازی به زیرساخت‌های گسترده سازمانی نخواهد داشت.