siliconangle.com détecté sur le web

Nvidia publie Nemotron 3.5 Lightning et le routeur NeMo Switchyard

5 médias qui couvrent ce sujet

TL;DR

  • Nemotron 3.5 Lightning activates 3B of 30B parameters per inference step, reaching roughly 670 tok/s on NVFP4 Blackwell endpoints, reframing cost math for high-throughput agentic pipelines.
  • NeMo Switchyard reduces agentic task cost to about one-third of Opus 4.8 while preserving frontier accuracy, per Nvidia's published production benchmarks.
  • Three enterprise customers reported concrete results: Cognition cut mean cost 28%, Ramp cut cost 58% and runtime 33%, and Boomi hit 100% domain-routing accuracy after integrating Switchyard.

Nvidia continue de découper son offre agentique en briques distinctes. Le 11 août, le fabricant a publié Nemotron 3.5 Lightning, un modèle Mixture-of-Experts de 30 milliards de paramètres dont 3 milliards actifs par requête, et NeMo Switchyard, une bibliothèque open-source de routage entre modèles. SiliconANGLE rapporte que Lightning revendique jusqu'à quatre fois le débit et 30 % de tâches agentiques accomplies plus vite que les modèles de même classe.

L'architecture est hybride : couches Mamba-2, couches MoE et quelques couches d'attention, avec une fenêtre de contexte d'un million de tokens et des poids publiés sur Hugging Face à la fois en BF16 et en quantification maison NVFP4. Nvidia précise que le modèle tient sur un seul H100 ou un poste DGX Spark. Kari Briski, VP Generative AI chez Nvidia, insiste sur la facilité de personnalisation, citant CodeRabbit qui aurait entraîné un agent routeur pour 85 dollars en environ deux heures avec les recettes standard.

Switchyard, lui, tranche un problème que connaissent tous ceux qui font tourner des agents en production : la majorité des appels ne mérite pas un modèle frontière. La bibliothèque route chaque étape vers le modèle le plus adapté (ouvert, maison ou payant) selon la latence, la qualité ou le prix. VentureBeat rapporte que dans les tests internes de Nvidia, le coût d'une tâche tombe à environ un tiers de ce qu'il coûterait en passant tout par Opus 4.8, avec une précision proche des frontières. LangChain, l'un des partenaires cités aux côtés de Boomi, Cadence, Cognition AI, Kong, Nous Research et Siemens, dit avoir mesuré 74 % d'économie sur 145 tâches Deep Agents multi-tours en n'envoyant que 7 % des appels vers un modèle frontière.

Les chiffres de vitesse et de précision viennent des propres benchmarks du fabricant, sans reproduction publique à ce stade, et la comparaison 'un tiers' est ancrée à un modèle frontière précis choisi par Nvidia. Aucune des sources retrouvées ne publie les scores de Lightning sur les jeux d'évaluation ouverts habituels, ni le corpus exact utilisé pour la mesure de coût.

Le mouvement s'inscrit dans une série de sorties où le routage devient un produit à part entière : Sapiom levait récemment 35 M$ pour router les requêtes IA au moindre coût. Pour les éditeurs qui paient chaque appel à un modèle frontière, l'équation change si un MoE ouvert peut avaler la plus grande partie du trafic sur un seul GPU.

Ce qu'en disent les autres médias

Couverture consolidée 2h après publication

  1. NVIDIA Blog Lire →

    Official launch post names six early enterprise integrators and publishes the Nemotron-RL-Agentic-Terminal-Pivot training dataset, adding reproducibility and adoption breadth missing from news coverage.

    The model delivers up to 4x faster output speed, leading to 30% faster agentic task completion compared with other models in its class.
  2. NVIDIA Technical Blog Lire →

    Technical blog details multi-token prediction speculative decoding, NVFP4 checkpoints on Blackwell/Hopper/Ampere, and PinchBench task-completion benchmarks rather than raw token-per-second figures.

    Nemotron 3.5 Lightning delivers up to 4x output speed compared to similar-sized models, placing it on the accuracy-speed Pareto frontier.
  3. Techstrong.ai Lire →

    Frames open weights as CUDA lock-in by another name; analyst Mitch Ashley (Futurum Group) warns dependency shifts to silicon, not away from it, and ties the move to geopolitical pressure from Chinese open models.

    Free AI should be great for hardware. Free AI should be great for chips.
  4. CryptoBriefing Lire →

    Positions this as the first open-source release since Jensen Huang's public pivot on open AI, framing it as a deliberate market-expansion play to widen GPU software adoption rather than a pure product drop.

    The new 30-billion-parameter model and open-source routing library let companies stop choosing between smart AI and affordable AI.