استارتاپ فرانسوی کُگ با تمرکز بر استنتاج GPU مدعی است میتواند از طریق بهینهسازی سطح پایین نرمافزاری، کارایی GPUهای مرسوم دیتاسنتر را بهطور چشمگیری افزایش دهد — بدون نیاز به تراشههای اختصاصی. دموی این شرکت روی GPUهای AMD MI300X و NVIDIA H200 اجرا شد و توجه جامعهٔ فناوری را جلب کرد؛ گزارشی از آن روی صفحهٔ اول Hacker News منتشر شد.
دمو و ارقام
کُگ در پیشنمایش فنی خود نرخ «3,000 توکن بر درخواست در ثانیه (TPS)» را نشان داد. این عدد برای مدل کوچک اختصاصی متنباز شدهای بهنام Laneformer 2B با حدود 2 میلیارد پارامتر بهدست آمده است. وعدهٔ شرکت افزایش تا 30 برابر سرعت استنتاج LLMها است؛ اما اثبات این ادعا نیازمند تکرار همان بهینهسازی روی مدلهای بزرگتر و جریانهای کاری تولیدی است.
چرا کُگ روی GPUهای معمولی سرمایهگذاری میکند
گائل دلالو، مدیرعامل کُگ، معتقد است که محدودیتهای شناختهشده برای استنتاج LLM روی GPUها تا حدی ناشی از فرصتهای از دسترفته در مهندسی نرمافزاری سطح پایین است. او اشاره میکند که پهنایباند حافظهٔ نسلهای جدید GPU قابل بهرهبرداری است و با مهندسی دقیق نرمافزار میتوان بهرهوری را افزایش داد؛ ترکیبی از درک معماری سختافزار و مهارت در بهینهسازی کرنلها.
روشها و تکنیکهای کلی بهینهسازی
- بهبود مدیریت حافظه و حرکت داده برای کاهش گلوگاههای پهنایباند.
- فشردهسازی و کمدقتسازی کنترلشده برای کاهش مصرف محاسباتی.
- بهینهسازی کرنلها و ادغام عملیات برای کم کردن سربار فراخوانیها.
- سفارشیسازی برای هر معماری GPU بهجای یک راهکار عام.
رقابت و همجهتها
چند گروه و پروژه مستقل نیز روی بهینهسازی نرمافزاری برای شتاب استنتاج کار میکنند. کُگ خود را نزدیک به آزمایشگاههایی مثل Hazy Research میداند که تمرکزشان بر شتابدهی روی GPU تا سطح پیادهسازی موتور استنتاج است. مزیت رقابتی کُگ در ترکیب پژوهش سطح پایین و محصول موتور استنتاج (KIE) است.
تمایز کُگ
- تمرکز روی موتور استنتاج (KIE): توسعهٔ موتور اختصاصی که با GPUهای مرسوم کارآمدتر عمل کند.
- تقاضای بازار: پس از معرفی اولیه، شرکت حدود 200 سرنخ تجاری دریافت کرد که نشاندهندهٔ تقاضای واقعی است.
- متدولوژی دستی و دقیق: برای هر معماری GPU، پژوهش سطح پایین و زمانبر لازم است؛ روندی دقیق اما با مقیاسپذیری محدود.
چالشها و مسیر پیشرو
مهمترین موانع پیش روی کُگ عبارتاند از:
- دموی فعلی روی مدلهای کوچک انجام شده و انتقال همان کارایی به LLMهای بزرگ یک چالش فنی قابلتوجه است.
- روش دستی بهینهسازی مقیاسپذیری را محدود میکند؛ تیم کُگ فعلاً کوچک است و هر معماری GPU نیاز به زمان پژوهشی جداگانه دارد.
- بسیاری از مشتریان کوتاهمدت تمایل به فاینتیون مدلهای کوچک ندارند؛ بنابراین تمرکز بازار به سمت تسریع مدلهای بزرگتر سوق یافته است.
چه زمانی میتوان انتظار کاربرد عملی داشت؟
دلالو اعلام کرده که نمونهای از «سرعت 10 برابری» روی یک مدل بزرگ ممکن است تا سپتامبر محقق شود؛ نقطهای که میتواند در جذب سرمایهٔ سری A مؤثر باشد. تا آن زمان کُگ باید ثابت کند روشش در جریانهای کاری تولیدی —مثل تولید محتوا برای بازیها و اپلیکیشنها— پایدار و اقتصادی است.
پیامدها برای بازار و زیرساخت
اگر روشهای کُگ روی LLMهای بزرگ نیز اثبات شود، پیامدها فراتر از یک محصول خواهند بود: شرکتها میتوانند با سختافزار موجود هزینهها را کاهش دهند و تجربهٔ کاربری سریعتری برای سرویسهای مبتنی بر هوش مصنوعی ارائه کنند. این تغییر برای صنایعی که به پاسخهای فوری وابستهاند، اهمیت ویژهای دارد و میتواند توزیع هزینههای زیرساخت را دگرگون کند.
کُگ تاکنون از حمایتهایی مانند Bpifrance و برنامهٔ French Tech 2030 بهره برده و از Scaleway نیز پشتیبانی دریافت کرده است؛ اما برای گسترش پشتیبانی از مدلها و معماریهای بیشتر، نیاز به جذب سرمایه و اثبات فنی گستردهتر دارد.
نگاه رو به جلو
آیندهٔ موفقیتآمیز کُگ بستگی به توانایی نشان دادن مقیاسپذیری روشها روی مدلهای تولیدی و معماریهای مختلف GPU دارد. اگر این اتفاق بیفتد، نقش GPUهای مرسوم در اکوسیستم استنتاج تقویت خواهد شد؛ در غیر این صورت گرایش به تراشههای اختصاصی ادامه خواهد یافت — اما رقابت فعلی نشان میدهد هنوز ظرفیتهای فنی بزرگی برای بهبود نرمافزاری روی سختافزار موجود وجود دارد.
منابع مرتبط: معرفی کلی GPU: Wikipedia - GPU. تحولات اکوسیستم استارتاپها و گزارشهای مرتبط: TechCrunch.




