Accéder au contenu principal

NVIDIA Nemotron 3.5 Lightning : fonctionnalités, benchmarks et accès

NVIDIA Nemotron 3.5 Lightning est un modèle MoE ouvert de 30B avec 3B de paramètres actifs, conçu pour une exécution d’agents rapide et à grand volume. Fonctionnalités, benchmarks et tarifs.
Actualisé 23 sept. 2026  · 10 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

La plupart des discussions sur l’IA agentique se concentrent sur les modèles de raisonnement de pointe qui gèrent la planification.

L’argument de NVIDIA avec Nemotron 3.5 Lightning est que le modèle de pointe n’est pas l’outil adapté à la majorité de ce que fait réellement un agent.

Les agents longue durée consomment l’essentiel de leur budget de tokens en appels d’outils, en validation des sorties et en délégation à des sous-agents ; exécuter un modèle de pointe à chaque étape est coûteux et lent.

Nemotron 3.5 Lightning, publié le 11 août 2026, est un modèle ouvert mixture-of-experts (MoE) de 30B avec 3B de paramètres actifs, pensé précisément pour cette couche d’exécution.

NVIDIA affirme qu’il se situe sur la frontière de Pareto précision-vitesse de l’Artificial Analysis Intelligence Index, et annonce jusqu’à 4× la vitesse de génération par rapport à des modèles de taille comparable. Il est fourni sous la licence permissive OpenMDW-1.1 avec poids, données d’entraînement et recettes publiés.

Dans cet article, je passe en revue les nouveautés de Nemotron 3.5 Lightning, ses fonctionnalités et ses benchmarks. Pour voir comment se comporte en pratique un modèle MoE de taille similaire, notre tutoriel sur l’affinage de Qwen3.6 sur un jeu de données de Q&R médicales détaille le flux de bout en bout.

Nemotron 3.5 Lightning en bref

  • Nemotron 3.5 Lightning est un modèle MoE ouvert de 30B avec 3B de paramètres actifs, publié le 11 août 2026, conçu pour la couche d’exécution à grand volume des agents toujours actifs.
  • NVIDIA annonce jusqu’à 4× la vitesse de sortie face à des modèles de taille similaire et 10 000 tâches réalisées 30 % plus vite que Qwen3.6-35B à précision équivalente.
  • Benchmarks clés (BF16) : SWE-bench Verified 51,56, PinchBench 85,37, GPQA Diamond 75,44, MMLU Pro 81,94.
  • Livré sous OpenMDW-1.1 avec poids, données et recettes, et exécutable sur du matériel allant de Jetson à DGX Spark jusqu’aux data centers.
  • NeMo Switchyard oriente l’exécution vers Lightning et la planification vers des modèles de pointe comme Nemotron 3 Ultra.

Qu’est-ce que Nemotron 3.5 Lightning ?

Nemotron 3.5 Lightning est le plus petit membre de la famille de modèles ouverts Nemotron 3 de NVIDIA, conçu spécifiquement pour une exécution à grand volume et faible latence dans des agents autonomes.

Il utilise une architecture hybride Mamba-2 + MoE + attention avec 30B de paramètres au total et 3B actifs par token, et prend en charge un contexte allant jusqu’à 1 million de tokens.

Le design MoE est ce qui le rend rapide.

Un routeur envoie chaque token à seulement quelques-uns de ses nombreux experts, de sorte qu’une fraction des paramètres s’exécute par token.

Vous obtenez la capacité d’un grand modèle dense au coût de calcul d’un petit, le même compromis que propose Qwen3.6-35B-A3B avec ses 3B de paramètres actifs.

La grande promesse de NVIDIA est davantage positionnelle qu’un score unique : sur l’Artificial Analysis Intelligence Index, qui combine 9 évaluations couvrant tâches agentiques, code, raisonnement scientifique et intelligence générale, Lightning se situe sur la frontière de Pareto précision-vitesse pour les petits modèles ouverts.

En clair, rien dans sa catégorie de taille n’est à la fois plus précis et plus rapide.

Quoi de neuf avec Nemotron 3.5 Lightning ?

Toutes les fonctionnalités servent un objectif : exécuter rapidement le travail routinier d’un agent sans sacrifier la précision.

Voici ce que vous pouvez concrètement en faire.

Exécuter des agents performants en local

Comme le modèle est suffisamment compact pour être déployé sur un NVIDIA DGX Spark, une GeForce RTX 5090 ou un Jetson, vous pouvez exécuter des charges agentiques sur un poste de travail, sans data center.

NVIDIA a collaboré avec EXO Labs pour profiler Lightning sur DGX Spark, et indique qu’il se situe sur la frontière de Pareto des petits modèles ouverts sur le leaderboard local.ai d’EXO Labs.

Pour les praticiens, cela signifie qu’un agent toujours actif, gérant appels d’outils et validation des résultats, peut tourner sur du matériel que vous possédez déjà.

Vous pouvez aussi le servir via LM Studio, llama.cpp, Ollama et Unsloth ; l’écosystème local est donc déjà mûr au lancement.

Orienter l’exécution vers le bas et la planification vers le haut avec NeMo Switchyard

NVIDIA publie NeMo Switchyard en parallèle du modèle, une bibliothèque qui dirige chaque requête vers le modèle le plus efficace capable de la traiter.

Switchyard expose Nemotron 3.5 Lightning comme cible de routage aux côtés de vos modèles ouverts et fermés ; la planification monte vers un modèle de pointe comme Nemotron 3 Ultra, tandis que l’exécution descend vers Lightning.

Le gain pratique, c’est l’efficacité en tokens.

Au lieu de payer le tarif d’un modèle de pointe pour exécuter un git pull, valider la sortie d’un outil ou formater un résultat, ces appels aboutissent sur le modèle économique, et le modèle coûteux est réservé aux étapes de planification difficiles qui déterminent la qualité mais pas le volume.

Le personnaliser dès la sortie de boîte

Les petits modèles s’affinent plus vite, à moindre coût et sur du matériel plus modeste que les grands, et Lightning est conçu pour être adapté à un poste précis.

NVIDIA a publié les poids, les données d’entraînement et les recettes sous OpenMDW-1.1 ; vous pouvez affiner avec LoRA ou en SFT complet via NeMo Automodel et NeMo Megatron Bridge, ou exécuter de l’apprentissage par renforcement avec NeMo RL et NeMo Gym.

La publication inclut aussi Nemotron-RL Agentic Terminal Pivot, un jeu de données RL agentique ouvert utilisé pour entraîner certains comportements d’agent de code.

Un point côté communauté qui mérite d’être souligné.

MindStudio indique des affinages partenaires réalisés en moins de 3 heures pour environ 100 $, un niveau de coût d’adaptation qui n’a de sens qu’avec un modèle de cette taille.

Décodage spéculatif pour un débit supérieur

Lightning génère plusieurs tokens par étape grâce au décodage spéculatif, où un modèle brouillon propose des tokens ensuite validés efficacement.

Il a bénéficié d’une phase de pré-entraînement dédiée pour intégrer la prédiction multi-tokens (MTP), suivie d’une phase de renforcement MTP, la même approche que dans Nemotron 3 Super et Ultra.

Au-delà du MTP, NVIDIA fournit deux modèles brouillons.

DSpark est recommandé pour DGX Spark et les charges data center à faible concurrence, tandis que MTP convient aux concurrences moyennes à élevées, et un modèle brouillon DFlash est aussi proposé pour comparer celui qui correspond le mieux à votre mode de service.

Benchmarks de Nemotron 3.5 Lightning

NVIDIA publie des scores pour les checkpoints BF16 et NVFP4, et les deux se suivent de près sur la plupart des tâches, ce qui importe car NVFP4 est le checkpoint quantifié réellement déployé. Les chiffres ci-dessous proviennent de la model card et du billet de lancement de NVIDIA. Aucune reproduction indépendante n’était disponible au moment d’écrire ; à considérer comme des résultats éditeur.

SWE-bench Verified

Lightning obtient 51,56 (BF16) et 52,80 (NVFP4) sur SWE-bench Verified, un benchmark qui mesure la capacité à résoudre de vrais tickets GitHub en produisant un patch fonctionnel. Pour un MoE 30B avec 3B actifs, dépasser 50 % est un bon résultat et soutient directement l’usage agent de code.

SWE-bench Multilingual arrive plus bas à 39,33 (BF16), attendu vu la difficulté accrue sur des bases de code multilingues.

PinchBench et efficacité des tâches

Sur PinchBench, Lightning atteint 85,37 (BF16) et 83,43 (NVFP4), et OpenRouter indique qu’il réalise 10 000 tâches 30 % plus vite que Qwen3.6-35B à précision comparable. 

C’est le benchmark qui reflète le mieux le positionnement du modèle : l’efficacité d’un agent se joue sur la rapidité à terminer un travail utile, pas seulement sur la vitesse brute de génération de tokens.

La comparaison avec Qwen3.6 mérite l’attention. Lors de notre revue de Qwen3.6-35B-A3B, nous avions noté ses 3B de paramètres actifs et ses bons résultats sur SWE-bench et Terminal-Bench ; NVIDIA en fait donc un point de référence pertinent dans la même catégorie de taille.

GPQA Diamond et raisonnement

Lightning atteint 75,44 (BF16) sur GPQA Diamond sans outils, un ensemble de questions de sciences niveau master conçues pour être difficiles même avec accès web.

Un excellent score pour un petit modèle, bien que la model card précise que Lightning n’est pas positionné comme moteur de raisonnement.

Humanity’s Last Exam (texte seul, sans outils) montre l’autre facette à 11,72 (BF16), et SciCode à 32,60.

Ces scores plus bas sont cohérents avec le cadrage de NVIDIA : c’est un modèle d’exécution, et le raisonnement ouvert difficile doit être délégué à un modèle de pointe.

Agentique et suivi d’instructions

Terminal-Bench 2.1 atteint 24,58 (BF16) et BrowseComp 36,97, tandis que IFBench (loose) arrive à 71,88, montrant que le modèle suit correctement des instructions structurées.

Les connaissances générales tiennent aussi la route, avec MMLU Pro à 81,94 (BF16) et 81,62 (NVFP4), un écart négligeable qui confirme que le checkpoint quantifié est prêt pour la production.

Nemotron 3.5 Lightning vs Qwen3.6-35B-A3B

Les deux sont des modèles MoE avec 3B de paramètres actifs ciblant le code et les charges agentiques ; une comparaison côte à côte est la plus claire pour situer Lightning.

Attribut Nemotron 3.5 Lightning Qwen3.6-35B-A3B
Paramètres totaux / actifs 30B / 3B 35B / 3B
Fenêtre de contexte Jusqu’à 1 M de tokens 262 K tokens
SWE-bench Verified 51,56 (BF16) Solide (cf. notre revue)
Licence OpenMDW-1.1 (ouvert) Ouverte
Positionnement Couche d’exécution des agents Code, raisonnement, long contexte

Tarifs et disponibilité de Nemotron 3.5 Lightning

Vous pouvez essayer Nemotron 3.5 Lightning sur build.nvidia.com ou via OpenRouter, et télécharger les poids depuis Hugging Face et ModelScope. Le modèle propose des endpoints compatibles OpenAI via NVIDIA NIM, dont /v1/chat/completions, /v1/completions et /v1/responses, ce qui permet de l’intégrer à des pipelines agentiques existants sans réécriture.

Les tarifs hébergés varient selon le fournisseur :

  • DeepInfra : 0,05 $ par 1 M de tokens en entrée et 0,20 $ par 1 M de tokens en sortie, disponible dès le jour 1 sans provisionnement GPU.
  • OpenRouter : une formule gratuite à 0 $ en entrée et 0 $ en sortie, mais notez que, même si la route prend en charge la fenêtre de contexte 1 M de tokens, elle impose un plafond de 65 536 tokens sur la génération de sortie.
  • Auto-hébergement : gratuit sous OpenMDW-1.1, déployable via vLLM, SGLang et TensorRT-LLM.

Ce plafond OpenRouter est à garder en tête. La longueur de contexte 1 M est une capacité du modèle, mais la limite pratique dépend du prestataire et de la route ; vérifiez l’endpoint avant de supposer disposer de toute la fenêtre.

Conclusion

Nemotron 3.5 Lightning traduit un pari clair de NVIDIA : l’avenir des agents en production repose sur un système de modèles, où un modèle d’exécution économique traite le volume et un modèle de pointe gère la planification. La sortie concomitante de NeMo Switchyard en est la preuve, car le modèle n’a de sens que si l’on sait lui router le travail intelligemment.

Ce que je trouve le plus utile, c’est la clarté sur le périmètre. NVIDIA ne prétend pas qu’il s’agit d’un modèle de raisonnement, et les benchmarks le confirment : solide sur SWE-bench Verified (51,56) et PinchBench (85,37), modeste sur Humanity’s Last Exam (11,72). Si votre charge consiste en appels d’outils, validation et formatage dans des agents toujours actifs, ce compromis est pertinent.

La publication ouverte sous OpenMDW-1.1 avec poids, données et recettes, plus un checkpoint assez compact pour tourner sur un DGX Spark, en fait une option réellement utile pour les équipes qui veulent affiner et auto-héberger plutôt que payer au token. La réserve principale : tous les chiffres actuels proviennent de l’éditeur ; mieux vaut attendre des reproductions indépendantes avant d’entériner les promesses de 4× plus vite et 30 % de tâches réalisées plus rapidement.

Si vous souhaitez développer les compétences d’affinage pour adapter un tel modèle à votre charge, notre tutoriel sur l’affinage de Qwen3.6 sur un jeu de données de Q&R médicales couvre pas à pas le flux QLoRA sur un modèle MoE comparable.

FAQs

Comment Nemotron 3.5 Lightning se compare-t-il aux autres modèles Nemotron ?

Nemotron 3.5 Lightning est le plus petit membre de la famille Nemotron 3 de NVIDIA, conçu pour une exécution à grand volume et faible latence plutôt que pour une planification complexe. Les modèles de pointe comme Nemotron 3 Ultra gèrent l’orchestration et le raisonnement difficile, tandis que Lightning s’occupe de l’exécution courante : appels d’outils, validation et formatage. NeMo Switchyard répartit le travail entre eux : la planification monte, l’exécution descend.

Où puis-je accéder à Nemotron 3.5 Lightning ?

Vous pouvez l’essayer sur build.nvidia.com ou via OpenRouter, et télécharger les poids depuis Hugging Face et ModelScope. Il est disponible dès le jour 1 chez des hébergeurs comme DeepInfra, et auto-hébergeable via vLLM, SGLang et TensorRT-LLM. Les outils locaux tels que LM Studio, llama.cpp, Ollama et Unsloth sont également pris en charge.

Quels sont les tarifs de Nemotron 3.5 Lightning ?

DeepInfra l’affiche à 0,05 $ par 1 M de tokens en entrée et 0,20 $ par 1 M de tokens en sortie. OpenRouter propose une formule gratuite à 0 $ en entrée et 0 $ en sortie, plafonnée à 65 536 tokens maximum sur cette route. Le modèle est aussi gratuit en auto-hébergement sous la licence OpenMDW-1.1.

À quoi sert le mieux Nemotron 3.5 Lightning ?

Il est conçu pour la couche d’exécution des agents autonomes longue durée : appels d’outils, validation de résultats, retrieval, formatage, synthèse et classification. NVIDIA et ses partenaires précisent qu’il n’est pas destiné au chat ouvert ou au raisonnement approfondi, qui doivent être routés vers un modèle de pointe.

Nemotron 3.5 Lightning est-il open source ?

Oui. NVIDIA a publié les poids, les données d’entraînement et les recettes sous la licence OpenMDW-1.1, présentée comme permissive et prête pour un usage commercial. Il est fourni avec un checkpoint BF16 et un checkpoint quantifié NVFP4, ainsi qu’un jeu de données RL agentique ouvert nommé Nemotron-RL Agentic Terminal Pivot.


Matt Crabtree's photo
Author
Matt Crabtree
LinkedIn

Rédacteur et éditeur de contenu dans le domaine des technologies de l'information et de la communication. Vous êtes déterminé à explorer les tendances en matière de données et enthousiaste à l'idée d'apprendre la science des données.

Sujets
Intelligence artificielle
Grands modèles linguistiques

Meilleurs cours DataCamp

Cursus

Deploy Production-Ready Agents

2 h
Deploy AI agents to production using Google's ADK, Vertex AI Agent Engine, Cloud Run, and Memory Bank for persistent cross-session state.
Afficher les détailsRight Arrow
Commencer Le Cours
Voir plusRight Arrow