انویدیا Nemotron 3.5 Lightning را معرفی کرد؛ مدلی مبتنی بر معماری Mixture-of-Experts با حدود ۳۰ میلیارد پارامتر که همراه با کتابخانه متنباز جدید NeMo Switchyard برای مسیریابی بین مدلها عرضه میشود.
ویژگیهای کلیدی Nemotron 3.5 Lightning
- معماری Mixture-of-Experts (MoE) با تخصیص دینامیک منابع برای هر درخواست.
- حدود 30 میلیارد پارامتر و تمرکز بر سرعت پاسخدهی و قابلیت پسآموزش روی جریانهای کاری خاص.
- تا 4 برابر خروجی سریعتر در برخی سناریوها نسبت به نسخههای پیشین.
- قابلیت استقرار بهعنوان یک میکروسرویس Nvidia NIM در پلتفرمهای عمومی.
سرعت و سفارشیسازی محور طراحی
Lightning بهطور مشخص برای افزایش سرعت پاسخها و سادهسازی سفارشیسازی توسعه یافته است. این مدل با پسآموزش روی جریانهای کاری تخصصی—مانند امنیت، تولید کد یا تحلیل متون—میتواند به دقتی نزدیک یا برابر با مدلهای بزرگتر برسد. معماری MoE امکان فعالسازی بخشهای خاص مدل برای وظایف مشخص را فراهم میکند که نتیجه آن اجرای بهینهتر و مصرف منابع کمتر است. برای کلیت معماری Mixture-of-Experts میتوانید مروری در ویکیپدیا ببینید: Mixture-of-Experts.
چرا مدلهای کوچکتر میتوانند عملکرد بهتری ارائه دهند
معیارهای عمومی بنچمارک نقطه شروع مفیدی هستند، اما در محیطهای تولیدی ملاک اصلی دقت در وظیفهٔ مشخص است. تیمهای توسعه با پسآموزش Lightning روی دادهها و جریانهای کاری اختصاصی، به بهبود قابل توجه دقت دست یافتهاند. همکاریهایی با شرکتهایی مانند CrowdStrike و CodeRabbit گزارش شده که نشان میدهد Lightning پسآموزششده در برخی کاربردها با مدلهای اختصاصی بزرگ برابری یا برتری داشته است.
مزیت اقتصادی برای سازمانها
- اجرای مدلهای بسیار بزرگ هزینهبر است؛ مدلهای متنباز کوچکتر و قابل پسآموزش میتوانند تعادل هزینه-دقت مناسبی فراهم کنند.
- انویدیا مجموعهابزار NeMo را برای سادهسازی فرایند پسآموزش و استقرار عرضه کرده و مجموعهدادههایی برای آموزش عاملهای برنامهنویس منتشر نموده است.
NeMo Switchyard؛ روتر متنباز برای مجموعهای از مدلها
در معماریهای چندمدلی، لایهٔ مسیریابی تعیین میکند کدام مدل یا ترکیب مدلها برای هر درخواست مناسبتر است. NeMo Switchyard این لایهٔ تصمیمگیری را بهصورت یک کتابخانهٔ متنباز پیادهسازی میکند. Switchyard با زبان Rust نوشته شده و از طریق API قابل ادغام با پشتههای توسعه موجود است. توسعهدهندگان میتوانند مجموعهٔ مدلها، معیارهای مسیریابی و سیاستها را تعریف کنند و الگوریتمها را برای اولویتبندی کیفیت، تأخیر یا هزینه تنظیم نمایند.
یکپارچگی و سازگاری با اکوسیستم
انویدیا اعلام کرده که Switchyard به سرعت با دروازهها و روترهای موجود مانند OpenRouter، Kong و LiteLLM ادغام خواهد شد تا نیاز به بازنویسی گستردهٔ پیادهسازیها کاهش یابد.
نتایج بنچمارکها و گزارشهای اولیه شرکا
آزمایشهای داخلی انویدیا و گزارشهای شرکا نشان میدهد که ترکیب مدلهای متنباز با مدل پیشرویی مانند Anthropic Opus 4.8 تحت کنترل Switchyard میتواند دقت سطح پیشرو را حفظ کند و در عین حال هزینهٔ تکمیل وظایف را به طور چشمگیری کاهش دهد. نمونهٔ نتایج شریکها:
- LangChain گزارش کرده که با مسیریابی، تنها ۷٪ فراخوانها به مدل پیشرو ارسال شده و در 145 وظیفهٔ چندنوبتی (Deep Agents) هزینهها حدود ۷۴٪ کاهش یافته است؛ افت دقت گزارششده حدود ۶٪ بوده است.
- Ramp اعلام کرده در معیار داخلی SWE-Bench عملکردی مشابه مدل پیشرو بهدست آورده و هزینهها را ۵۸٪ و زمان اجرا را ۳۳٪ کاهش داده است.
دسترسی و نحوه عرضه
Nemotron 3.5 Lightning بهعنوان یک میکروسرویس Nvidia NIM روی پلتفرمهایی مانند Hugging Face، ModelScope، OpenRouter و build.nvidia.com در دسترس است. کتابخانهٔ NeMo Switchyard نیز روی GitHub منتشر شده و ادغامهای بیشتر با شرکا به زودی عرضه خواهد شد.
چشمانداز معماریهای چندمدلی
با رشد استفاده از مجموعهٔ مدلهای تخصصی و عاملهای متعدد، لایهٔ مسیریابی به عنصری تعیینکننده در تصمیمگیری دربارهٔ هزینه، تأخیر و دقت تبدیل میشود. ترکیب مدلهای متنباز سریع و قابل پسآموزش با ابزارهایی مانند NeMo Switchyard میتواند پیادهسازی هوش مصنوعی مقیاسپذیر در سازمانها را سادهتر و اقتصادیتر کند و نقش این لایه را در سامانههای تولیدی تقویت نماید.





