NVIDIA Nemotron 3.5 Lightning (30B-A3B)

2026-08-11 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle

NVIDIA publie Nemotron 3.5 Lightning, un MoE ouvert de 30 milliards de paramètres dont 3 milliards actifs, pensé pour l'exécution rapide d'agents et pour être spécialisé par post-entraînement, sous licence OpenMDW-1.1.

Ce qui change

  • Un débit annoncé jusqu'à 4 fois celui de modèles de taille comparable et 10 000 tâches PinchBench exécutées 30 % plus vite que Qwen3.6 35B à précision comparable.
  • La prédiction multi-tokens intégrée dès le préentraînement, avec brouillons de décodage spéculatif DFlash et DSpark fournis.
  • Un préentraînement sur plus de 20 000 milliards de tokens, en quatre étapes : préentraînement NVFP4, poursuite pour la prédiction multi-tokens, affinage supervisé sur données synthétiques et renforcement GRPO multi-environnements.
  • Des jeux ouverts, dont la collection Nemotron-CC-v2.1 (9 100 milliards de tokens de web) et le jeu Nemotron-RL Agentic Terminal Pivot.
  • Un contexte jusqu'à 1 million de tokens et une exécution possible sur un GPU unique.

NVIDIA publie Nemotron 3.5 Lightning, un MoE ouvert de 30 milliards de paramètres dont 3 milliards actifs, pensé pour l'exécution rapide d'agents et pour être spécialisé par post-entraînement, sous licence OpenMDW-1.1. ### Contexte Nemotron 3 Nano date de décembre 2025. NVIDIA propose ici une version 3.5 qui met l'accent sur la rapidité d'exécution et la possibilité, pour une entreprise, de régénérer ses données et de spécialiser le modèle à faible coût. Le lancement s'accompagne de NeMo Switchyard. ### Ce que le modèle apporte - Un débit annoncé jusqu'à 4 fois celui de modèles de taille comparable et 10 000 tâches PinchBench exécutées 30 % plus vite que Qwen3.6 35B à précision comparable. - La prédiction multi-tokens intégrée dès le préentraînement, avec brouillons de décodage spéculatif DFlash et DSpark fournis. - Un préentraînement sur plus de 20 000 milliards de tokens, en quatre étapes : préentraînement NVFP4, poursuite pour la prédiction multi-tokens, affinage supervisé sur données synthétiques et renforcement GRPO multi-environnements. - Des jeux ouverts, dont la collection Nemotron-CC-v2.1 (9 100 milliards de tokens de web) et le jeu Nemotron-RL Agentic Terminal Pivot. - Un contexte jusqu'à 1 million de tokens et une exécution possible sur un GPU unique. ### Architecture et caractéristiques 30 milliards de paramètres au total, 3 milliards actifs, Mamba-2, MoE et attention, contexte jusqu'à 1 million de tokens. Licence : OpenMDW-1.1 (poids, données d'entraînement et recettes publiés « aussi permissivement que possible » selon NVIDIA). Formats : BF16, NVFP4, base BF16. Ouverture : poids, données de préentraînement et de post-entraînement, environnements RL et recettes (NeMo Automodel, NeMo RL, NeMo Gym) ; le corpus complet n'est pas garanti publié. Compatible vLLM, SGLang, TensorRT-LLM, Ollama et llama.cpp. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Non communiqué (plusieurs hébergeurs) | | Matériel | 1 x H100 pour 256K de contexte, jusqu'à 8 x H100 pour 1M ; GB200 et B200 avec décodage spéculatif ; DGX Spark, Jetson, RTX 5090 (billet NVIDIA) | | Poids | BF16, NVFP4, base et brouillons DFlash/DSpark sur Hugging Face (1er au 5 août 2026) | ### Benchmarks | Benchmark (fiche HF, NVIDIA) | Lightning | Qwen 3.6 35B A3B | Gemma 4 26B A4B | Nemotron 3 Nano | Nemotron 3 Super | |---|---|---|---|---|---| | MMLU-Pro | 81,94 | 85,63 | 85,20 | 78,46 | 83,89 | | GPQA Diamond | 75,44 | 83,40 | 79,61 | 74,05 | 78,60 | | SWE-bench Verified | 51,56 | 70,12 | 57,40 | 34,08 | 63,08 | | Terminal-Bench 2.1 | 24,58 | 44,38 | 37,22 | 8,29 | 39,61 | | IFBench (loose) | 71,88 | 63,71 | 77,25 | 72,17 | 71,92 | | AA-LCR | 52,00 | 61,06 | 57,56 | 32,75 | 58,44 | Source : fiche Hugging Face nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16, mesures NVIDIA ; tous les comparateurs sont ouverts. ### Face aux modèles fermés Aucun modèle fermé ne figure dans le tableau de NVIDIA. Sur ces tests, Lightning est en retrait de Qwen 3.6 35B A3B, notamment sur SWE-bench Verified (51,56 contre 70,12) et Terminal-Bench 2.1 (24,58 contre 44,38), et devant lui seulement sur IFBench (71,88 contre 63,71). Sa valeur revendiquée est la vitesse (jusqu'à 4 fois) et le coût de spécialisation, pas le plus haut niveau de précision. NVIDIA affirme que le modèle définit la frontière précision-vitesse sur l'Artificial Analysis Intelligence Index, affirmation non vérifiée à la source. Aucune comparaison avec un modèle fermé contemporain n'est établie ici. ### À retenir Lightning cible les agents rapides et la spécialisation reproductible, avec une licence plus permissive que celle de la génération Nano. Ses scores sur les tâches de code agentique restent inférieurs à ceux d'un concurrent ouvert de même taille selon NVIDIA.

Liens

Tags : LLM, Open Source, MoE, NVIDIA, Nemotron 3.5, OpenMDW-1.1, Poids, données et recettes ouverts