NVIDIA Nemotron 3 Ultra (550B-A55B)
2026-06-04 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle
NVIDIA publie Nemotron 3 Ultra, un MoE de 550 milliards de paramètres dont 55 milliards actifs pour les agents de longue durée, avec poids, données et recettes sous licence OpenMDW-1.1.
Ce qui change
- Une distillation sur politique multi-enseignants (MOPD) avec plus de 10 modèles enseignants spécialisés, en plus de l'affinage supervisé et du renforcement.
- Un débit annoncé jusqu'à 5 fois supérieur à des modèles ouverts comparables, et 5,9 fois celui de GLM-5.1, 4,8 fois celui de Kimi K2.6 et 1,6 fois celui de Qwen-3.5 (entrée 8k, sortie 64k).
- Un coût de réalisation des tâches jusqu'à 30 % plus bas sur SWE-bench et Terminal-Bench 2.0 selon NVIDIA.
- Des ajouts de données de préentraînement (212 milliards de tokens dont 173 milliards de code GitHub jusqu'au 30 septembre 2025) et, en post-entraînement, 10 millions d'échantillons SFT, 1 million de tâches RL et 15 environnements RL.
- Une licence OpenMDW-1.1 de la Linux Foundation, présentée comme permissive.
NVIDIA publie Nemotron 3 Ultra, un MoE de 550 milliards de paramètres dont 55 milliards actifs pour les agents de longue durée, avec poids, données et recettes sous licence OpenMDW-1.1. ### Contexte Ultra était annoncé en décembre 2025 à environ 500 milliards de paramètres ; le modèle livré atteint 550 milliards. Il vise le raisonnement et l'orchestration d'agents de longue durée. NVIDIA le compare à GLM 5.1, Kimi K2.6 et Qwen 3.5, des modèles ouverts. ### Ce que le modèle apporte - Une distillation sur politique multi-enseignants (MOPD) avec plus de 10 modèles enseignants spécialisés, en plus de l'affinage supervisé et du renforcement. - Un débit annoncé jusqu'à 5 fois supérieur à des modèles ouverts comparables, et 5,9 fois celui de GLM-5.1, 4,8 fois celui de Kimi K2.6 et 1,6 fois celui de Qwen-3.5 (entrée 8k, sortie 64k). - Un coût de réalisation des tâches jusqu'à 30 % plus bas sur SWE-bench et Terminal-Bench 2.0 selon NVIDIA. - Des ajouts de données de préentraînement (212 milliards de tokens dont 173 milliards de code GitHub jusqu'au 30 septembre 2025) et, en post-entraînement, 10 millions d'échantillons SFT, 1 million de tâches RL et 15 environnements RL. - Une licence OpenMDW-1.1 de la Linux Foundation, présentée comme permissive. ### Architecture et caractéristiques 550 milliards de paramètres au total, 55 milliards actifs, Mamba-2 Transformer avec LatentMoE et MTP, précision NVFP4 (Hopper, Blackwell, Ampere). Contexte jusqu'à 1 million de tokens. Préentraînement d'environ 20 000 milliards de tokens (date limite septembre 2025), post-entraînement jusqu'en mai 2026. Langues : anglais, français, espagnol, italien, allemand, japonais, hindi, coréen, portugais brésilien, chinois. Licence : OpenMDW-1.1 (architecture, paramètres, documentation et logiciel), différente de la NVIDIA Nemotron Open Model License de Nano et Super. Ouverture : poids (base, BF16, NVFP4, GenRM), quatre collections de données, recettes NeMo (SFT LoRA, SFT complet via Megatron Bridge, GRPO, Dynamo) et rapport technique ; le corpus complet n'est pas publié, seule une part significative l'est. ### Coût et accès | Élément | Détail | |---|---| | API officielle | build.nvidia.com, Perplexity, OpenRouter, plus de 20 plateformes dont Amazon SageMaker, Google Cloud et Microsoft Azure ; aucun tarif communiqué | | Matériel minimal | 8 x B200/GB200/GB300 ou 16 x H100 (fiche HF) | | Poids | Base, BF16 et NVFP4 le 3 juin 2026 sur Hugging Face | ### Benchmarks | Benchmark (mesuré par NVIDIA) | Ultra | GLM 5.1 | Kimi K2.6 | Qwen 3.5 | |---|---|---|---|---| | PinchBench | 91 % | 84 % | 91 % | 89 % | | EnterpriseOps-Gym | 33 % | 40 % | 29 % | 30 % | | Terminal-Bench 2.0 | 54 % | 64 % | 67 % | 53 % | | IFBench | 82 % | 77 % | 74 % | 78 % | | GDPVal-AA | 1 448 | 1 594 | 1 508 | 1 192 | | ProfBench | 56 % | 46 % | 56 % | 53 % | | RULER 1M | 95 % | non testé (256K) | non testé (256K) | 90 % | Source : billet technique NVIDIA du 4 juin 2026, mesures NVIDIA. Fiche HF, autres scores : MMLU-Pro 86,8, SWE-Bench Verified 70,7, LiveCodeBench 89,0, IOI 2025 570,0. Les comparateurs sont des modèles ouverts. ### Face aux modèles fermés Le tableau de NVIDIA ne contient aucun modèle fermé, et aucune comparaison avec un modèle fermé de juin 2026 n'a été trouvée dans les sources consultées. Face aux modèles ouverts, Ultra mène sur IFBench (82 % contre 74 à 78 %) et sur le long contexte (RULER 1M à 95 %), mais est nettement en retrait sur Terminal-Bench 2.0 (54 % contre 64 % pour GLM 5.1 et 67 % pour Kimi K2.6) et sur GDPVal-AA. NVIDIA met surtout en avant le débit et le coût par tâche. L'ouverture des poids sous OpenMDW-1.1 permet l'auto-hébergement, à condition de disposer de 8 GPU Blackwell ou de 16 H100. Toute affirmation de parité avec les modèles fermés relève de NVIDIA et n'est pas étayée ici. ### À retenir Nemotron 3 Ultra place NVIDIA parmi les grands modèles ouverts, avec une licence permissive et des données publiées. Il exige un cluster GPU important.
Liens
Tags : LLM, Open Source, MoE, NVIDIA, Nemotron 3, OpenMDW-1.1, Poids, données et recettes ouverts