انویدیا Nemotron 3.5 Lightning را معرفی کرد؛ مدلی مبتنی بر معماری Mixture-of-Experts با حدود ۳۰ میلیارد پارامتر که همراه با کتابخانه متن‌باز جدید NeMo Switchyard برای مسیریابی بین مدل‌ها عرضه می‌شود.

ویژگی‌های کلیدی Nemotron 3.5 Lightning

  • معماری Mixture-of-Experts (MoE) با تخصیص دینامیک منابع برای هر درخواست.
  • حدود 30 میلیارد پارامتر و تمرکز بر سرعت پاسخ‌دهی و قابلیت پس‌آموزش روی جریان‌های کاری خاص.
  • تا 4 برابر خروجی سریع‌تر در برخی سناریوها نسبت به نسخه‌های پیشین.
  • قابلیت استقرار به‌عنوان یک میکروسرویس Nvidia NIM در پلتفرم‌های عمومی.

سرعت و سفارشی‌سازی محور طراحی

Lightning به‌طور مشخص برای افزایش سرعت پاسخ‌ها و ساده‌سازی سفارشی‌سازی توسعه یافته است. این مدل با پس‌آموزش روی جریان‌های کاری تخصصی—مانند امنیت، تولید کد یا تحلیل متون—می‌تواند به دقتی نزدیک یا برابر با مدل‌های بزرگ‌تر برسد. معماری MoE امکان فعال‌سازی بخش‌های خاص مدل برای وظایف مشخص را فراهم می‌کند که نتیجه آن اجرای بهینه‌تر و مصرف منابع کمتر است. برای کلیت معماری Mixture-of-Experts می‌توانید مروری در ویکی‌پدیا ببینید: Mixture-of-Experts.

نمای گرافیکی Nemotron 3.5 Lightning در محیط کاری

چرا مدل‌های کوچک‌تر می‌توانند عملکرد بهتری ارائه دهند

معیارهای عمومی بنچمارک نقطه شروع مفیدی هستند، اما در محیط‌های تولیدی ملاک اصلی دقت در وظیفهٔ مشخص است. تیم‌های توسعه با پس‌آموزش Lightning روی داده‌ها و جریان‌های کاری اختصاصی، به بهبود قابل توجه دقت دست یافته‌اند. همکاری‌هایی با شرکت‌هایی مانند CrowdStrike و CodeRabbit گزارش شده که نشان می‌دهد Lightning پس‌آموزش‌شده در برخی کاربردها با مدل‌های اختصاصی بزرگ برابری یا برتری داشته است.

مزیت اقتصادی برای سازمان‌ها

  • اجرای مدل‌های بسیار بزرگ هزینه‌بر است؛ مدل‌های متن‌باز کوچک‌تر و قابل پس‌آموزش می‌توانند تعادل هزینه-دقت مناسبی فراهم کنند.
  • انویدیا مجموعه‌ابزار NeMo را برای ساده‌سازی فرایند پس‌آموزش و استقرار عرضه کرده و مجموعه‌داده‌هایی برای آموزش عامل‌های برنامه‌نویس منتشر نموده است.
نمودار عملکرد و هزینه در سیستم‌های مسیریابی مدل

NeMo Switchyard؛ روتر متن‌باز برای مجموعه‌ای از مدل‌ها

در معماری‌های چندمدلی، لایهٔ مسیریابی تعیین می‌کند کدام مدل یا ترکیب مدل‌ها برای هر درخواست مناسب‌تر است. NeMo Switchyard این لایهٔ تصمیم‌گیری را به‌صورت یک کتابخانهٔ متن‌باز پیاده‌سازی می‌کند. Switchyard با زبان Rust نوشته شده و از طریق API قابل ادغام با پشته‌های توسعه موجود است. توسعه‌دهندگان می‌توانند مجموعهٔ مدل‌ها، معیارهای مسیریابی و سیاست‌ها را تعریف کنند و الگوریتم‌ها را برای اولویت‌بندی کیفیت، تأخیر یا هزینه تنظیم نمایند.

یکپارچگی و سازگاری با اکوسیستم

انویدیا اعلام کرده که Switchyard به سرعت با دروازه‌ها و روترهای موجود مانند OpenRouter، Kong و LiteLLM ادغام خواهد شد تا نیاز به بازنویسی گستردهٔ پیاده‌سازی‌ها کاهش یابد.

نمایی از معماری مسیریابی مدل‌ها با NeMo Switchyard

نتایج بنچمارک‌ها و گزارش‌های اولیه شرکا

آزمایش‌های داخلی انویدیا و گزارش‌های شرکا نشان می‌دهد که ترکیب مدل‌های متن‌باز با مدل پیشرویی مانند Anthropic Opus 4.8 تحت کنترل Switchyard می‌تواند دقت سطح پیشرو را حفظ کند و در عین حال هزینهٔ تکمیل وظایف را به طور چشمگیری کاهش دهد. نمونهٔ نتایج شریک‌ها:

  • LangChain گزارش کرده که با مسیریابی، تنها ۷٪ فراخوان‌ها به مدل پیشرو ارسال شده و در 145 وظیفهٔ چندنوبتی (Deep Agents) هزینه‌ها حدود ۷۴٪ کاهش یافته است؛ افت دقت گزارش‌شده حدود ۶٪ بوده است.
  • Ramp اعلام کرده در معیار داخلی SWE-Bench عملکردی مشابه مدل پیشرو به‌دست آورده و هزینه‌ها را ۵۸٪ و زمان اجرا را ۳۳٪ کاهش داده است.

دسترسی و نحوه عرضه

Nemotron 3.5 Lightning به‌عنوان یک میکروسرویس Nvidia NIM روی پلتفرم‌هایی مانند Hugging Face، ModelScope، OpenRouter و build.nvidia.com در دسترس است. کتابخانهٔ NeMo Switchyard نیز روی GitHub منتشر شده و ادغام‌های بیشتر با شرکا به زودی عرضه خواهد شد.

چشم‌انداز معماری‌های چندمدلی

با رشد استفاده از مجموعهٔ مدل‌های تخصصی و عامل‌های متعدد، لایهٔ مسیریابی به عنصری تعیین‌کننده در تصمیم‌گیری دربارهٔ هزینه، تأخیر و دقت تبدیل می‌شود. ترکیب مدل‌های متن‌باز سریع و قابل پس‌آموزش با ابزارهایی مانند NeMo Switchyard می‌تواند پیاده‌سازی هوش مصنوعی مقیاس‌پذیر در سازمان‌ها را ساده‌تر و اقتصادی‌تر کند و نقش این لایه را در سامانه‌های تولیدی تقویت نماید.