Nvidia publie Nemotron 3.5 Lightning et le routeur NeMo Switchyard
TL;DR
- Nemotron 3.5 Lightning activates only 3B of its 30B parameters per token, hitting 86% on PinchBench and 4x the inference speed of comparable dense models.
- NeMo Switchyard cuts per-task cost to roughly one-third of Anthropic Opus 4.8 per Nvidia benchmarks; Cognition's Devin Desktop measured 28% mean-cost reduction post-integration.
- Named partner results across sources: Ramp cut costs 58% with 33% runtime reduction; LangChain cut multi-turn agent costs 74%; CodeRabbit fine-tuned a custom agent in 2 hours for $85.
Nvidia continue de découper son offre agentique en briques distinctes. Le 11 août, le fabricant a publié Nemotron 3.5 Lightning, un modèle Mixture-of-Experts de 30 milliards de paramètres dont 3 milliards actifs par requête, et NeMo Switchyard, une bibliothèque open-source de routage entre modèles. SiliconANGLE rapporte que Lightning revendique jusqu'à quatre fois le débit et 30 % de tâches agentiques accomplies plus vite que les modèles de même classe.
L'architecture est hybride : couches Mamba-2, couches MoE et quelques couches d'attention, avec une fenêtre de contexte d'un million de tokens et des poids publiés sur Hugging Face à la fois en BF16 et en quantification maison NVFP4. Nvidia précise que le modèle tient sur un seul H100 ou un poste DGX Spark. Kari Briski, VP Generative AI chez Nvidia, insiste sur la facilité de personnalisation, citant CodeRabbit qui aurait entraîné un agent routeur pour 85 dollars en environ deux heures avec les recettes standard.
Switchyard, lui, tranche un problème que connaissent tous ceux qui font tourner des agents en production : la majorité des appels ne mérite pas un modèle frontière. La bibliothèque route chaque étape vers le modèle le plus adapté (ouvert, maison ou payant) selon la latence, la qualité ou le prix. VentureBeat rapporte que dans les tests internes de Nvidia, le coût d'une tâche tombe à environ un tiers de ce qu'il coûterait en passant tout par Opus 4.8, avec une précision proche des frontières. LangChain, l'un des partenaires cités aux côtés de Boomi, Cadence, Cognition AI, Kong, Nous Research et Siemens, dit avoir mesuré 74 % d'économie sur 145 tâches Deep Agents multi-tours en n'envoyant que 7 % des appels vers un modèle frontière.
Les chiffres de vitesse et de précision viennent des propres benchmarks du fabricant, sans reproduction publique à ce stade, et la comparaison 'un tiers' est ancrée à un modèle frontière précis choisi par Nvidia. Aucune des sources retrouvées ne publie les scores de Lightning sur les jeux d'évaluation ouverts habituels, ni le corpus exact utilisé pour la mesure de coût.
Le mouvement s'inscrit dans une série de sorties où le routage devient un produit à part entière : Sapiom levait récemment 35 M$ pour router les requêtes IA au moindre coût. Pour les éditeurs qui paient chaque appel à un modèle frontière, l'équation change si un MoE ouvert peut avaler la plus grande partie du trafic sur un seul GPU.
Ce qu'en disent les autres médias
-
NVIDIA Blog Lire →
First-party announcement with named partner deployment numbers: Boomi routed 59% of traffic to a faster fine-tuned model, Ramp cut costs 58%, LangChain cut multi-turn costs 74%.
The model delivers up to 4x faster output speed, leading to 30% faster agentic task completion compared with other models in its class.
-
NVIDIA Developer Blog Lire →
Technical layer: 3B active params per token, DFlash and DSpark speculative-decoding draft models, NVFP4 kernels across three GPU generations, Pareto frontier on Artificial Analysis Intelligence Index.
Nemotron 3.5 Lightning combines strong intelligence with up to 4x output speed of similar-sized models.
-
Techstrong.ai Lire →
Analyst skepticism layer: Futurum Group flags hardware-layer lock-in risk, and places the release in context of Huang defending open models before US policymakers amid Kimi K3 competition concerns.
Free AI should be great for hardware. Free AI should be great for chips. - Jensen Huang
Article original publié par siliconangle.com
Lire l'article original →Titre original : Nvidia publie Nemotron 3.5 Lightning, MoE 30B open source, et le routeur NeMo Switchyard