استارتاپ فرانسوی کُگ با تمرکز بر استنتاج GPU مدعی است می‌تواند از طریق بهینه‌سازی سطح پایین نرم‌افزاری، کارایی GPUهای مرسوم دیتاسنتر را به‌طور چشمگیری افزایش دهد — بدون نیاز به تراشه‌های اختصاصی. دموی این شرکت روی GPUهای AMD MI300X و NVIDIA H200 اجرا شد و توجه جامعهٔ فناوری را جلب کرد؛ گزارشی از آن روی صفحهٔ اول Hacker News منتشر شد.

دمو و ارقام

کُگ در پیش‌نمایش فنی خود نرخ «3,000 توکن بر درخواست در ثانیه (TPS)» را نشان داد. این عدد برای مدل کوچک اختصاصی متن‌باز شده‌ای به‌نام Laneformer 2B با حدود 2 میلیارد پارامتر به‌دست آمده است. وعدهٔ شرکت افزایش تا 30 برابر سرعت استنتاج LLMها است؛ اما اثبات این ادعا نیازمند تکرار همان بهینه‌سازی روی مدل‌های بزرگ‌تر و جریان‌های کاری تولیدی است.

چرا کُگ روی GPUهای معمولی سرمایه‌گذاری می‌کند

گائل دلالو، مدیرعامل کُگ، معتقد است که محدودیت‌های شناخته‌شده برای استنتاج LLM روی GPUها تا حدی ناشی از فرصت‌های از دست‌رفته در مهندسی نرم‌افزاری سطح پایین است. او اشاره می‌کند که پهنای‌باند حافظهٔ نسل‌های جدید GPU قابل بهره‌برداری است و با مهندسی دقیق نرم‌افزار می‌توان بهره‌وری را افزایش داد؛ ترکیبی از درک معماری سخت‌افزار و مهارت در بهینه‌سازی کرنل‌ها.

روش‌ها و تکنیک‌های کلی بهینه‌سازی

  • بهبود مدیریت حافظه و حرکت داده برای کاهش گلوگاه‌های پهنای‌باند.
  • فشرده‌سازی و کم‌دقت‌سازی کنترل‌شده برای کاهش مصرف محاسباتی.
  • بهینه‌سازی کرنل‌ها و ادغام عملیات برای کم کردن سربار فراخوانی‌ها.
  • سفارشی‌سازی برای هر معماری GPU به‌جای یک راهکار عام.

رقابت و هم‌جهت‌ها

چند گروه و پروژه مستقل نیز روی بهینه‌سازی نرم‌افزاری برای شتاب استنتاج کار می‌کنند. کُگ خود را نزدیک به آزمایشگاه‌هایی مثل Hazy Research می‌داند که تمرکزشان بر شتاب‌دهی روی GPU تا سطح پیاده‌سازی موتور استنتاج است. مزیت رقابتی کُگ در ترکیب پژوهش سطح پایین و محصول موتور استنتاج (KIE) است.

تمایز کُگ

  • تمرکز روی موتور استنتاج (KIE): توسعهٔ موتور اختصاصی که با GPUهای مرسوم کارآمدتر عمل کند.
  • تقاضای بازار: پس از معرفی اولیه، شرکت حدود 200 سرنخ تجاری دریافت کرد که نشان‌دهندهٔ تقاضای واقعی است.
  • متدولوژی دستی و دقیق: برای هر معماری GPU، پژوهش سطح پایین و زمان‌بر لازم است؛ روندی دقیق اما با مقیاس‌پذیری محدود.

چالش‌ها و مسیر پیش‌رو

مهم‌ترین موانع پیش روی کُگ عبارت‌اند از:

  • دموی فعلی روی مدل‌های کوچک انجام شده و انتقال همان کارایی به LLMهای بزرگ یک چالش فنی قابل‌توجه است.
  • روش دستی بهینه‌سازی مقیاس‌پذیری را محدود می‌کند؛ تیم کُگ فعلاً کوچک است و هر معماری GPU نیاز به زمان پژوهشی جداگانه دارد.
  • بسیاری از مشتریان کوتاه‌مدت تمایل به فاین‌تیون مدل‌های کوچک ندارند؛ بنابراین تمرکز بازار به سمت تسریع مدل‌های بزرگ‌تر سوق یافته است.

چه زمانی می‌توان انتظار کاربرد عملی داشت؟

دلالو اعلام کرده که نمونه‌ای از «سرعت 10 برابری» روی یک مدل بزرگ ممکن است تا سپتامبر محقق شود؛ نقطه‌ای که می‌تواند در جذب سرمایهٔ سری A مؤثر باشد. تا آن زمان کُگ باید ثابت کند روشش در جریان‌های کاری تولیدی —مثل تولید محتوا برای بازی‌ها و اپلیکیشن‌ها— پایدار و اقتصادی است.

پیامدها برای بازار و زیرساخت

اگر روش‌های کُگ روی LLMهای بزرگ نیز اثبات شود، پیامدها فراتر از یک محصول خواهند بود: شرکت‌ها می‌توانند با سخت‌افزار موجود هزینه‌ها را کاهش دهند و تجربهٔ کاربری سریع‌تری برای سرویس‌های مبتنی بر هوش مصنوعی ارائه کنند. این تغییر برای صنایعی که به پاسخ‌های فوری وابسته‌اند، اهمیت ویژه‌ای دارد و می‌تواند توزیع هزینه‌های زیرساخت را دگرگون کند.

کُگ تاکنون از حمایت‌هایی مانند Bpifrance و برنامهٔ French Tech 2030 بهره برده و از Scaleway نیز پشتیبانی دریافت کرده است؛ اما برای گسترش پشتیبانی از مدل‌ها و معماری‌های بیشتر، نیاز به جذب سرمایه و اثبات فنی گسترده‌تر دارد.

نگاه رو به جلو

آیندهٔ موفقیت‌آمیز کُگ بستگی به توانایی نشان دادن مقیاس‌پذیری روش‌ها روی مدل‌های تولیدی و معماری‌های مختلف GPU دارد. اگر این اتفاق بیفتد، نقش GPUهای مرسوم در اکوسیستم استنتاج تقویت خواهد شد؛ در غیر این صورت گرایش به تراشه‌های اختصاصی ادامه خواهد یافت — اما رقابت فعلی نشان می‌دهد هنوز ظرفیت‌های فنی بزرگی برای بهبود نرم‌افزاری روی سخت‌افزار موجود وجود دارد.

منابع مرتبط: معرفی کلی GPU: Wikipedia - GPU. تحولات اکوسیستم استارتاپ‌ها و گزارش‌های مرتبط: TechCrunch.