NVIDIA Nemotron 3 Super (120B-A12B)

2026-03-11 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle

NVIDIA publie Nemotron 3 Super, un modèle ouvert de 120 milliards de paramètres dont 12 milliards actifs, hybride Mamba-Transformer LatentMoE, conçu pour le raisonnement agentique avec un contexte d'un million de tokens.

Ce qui change

  • LatentMoE : les tokens sont compressés avant d'atteindre les experts, ce qui permet, selon NVIDIA, 4 fois plus d'experts pour un coût d'inférence identique.
  • Prédiction multi-tokens (MTP) : jusqu'à 3 fois d'accélération en temps réel sur les générations structurées, selon le blog technique.
  • Préentraînement natif en NVFP4 (4 bits) optimisé pour Blackwell.
  • Apprentissage par renforcement sur 21 configurations d'environnements, avec plus de 1,2 million de trajectoires.
  • Publication des jeux de données (10 000 milliards de tokens uniques de préentraînement curés, 15 millions de problèmes de code, environ 40 millions d'échantillons de post-entraînement) et du pipeline complet sur GitHub.

NVIDIA publie Nemotron 3 Super, un modèle ouvert de 120 milliards de paramètres dont 12 milliards actifs, hybride Mamba-Transformer LatentMoE, conçu pour le raisonnement agentique avec un contexte d'un million de tokens. ### Contexte Trois mois après Nemotron 3 Nano, Super est le palier annoncé pour les systèmes multi-agents. NVIDIA le présente comme apportant plus de 5 fois le débit de la génération Super précédente. Il est comparé par NVIDIA à Qwen3.5-122B et à GPT-OSS-120B, deux modèles ouverts. ### Ce que le modèle apporte - LatentMoE : les tokens sont compressés avant d'atteindre les experts, ce qui permet, selon NVIDIA, 4 fois plus d'experts pour un coût d'inférence identique. - Prédiction multi-tokens (MTP) : jusqu'à 3 fois d'accélération en temps réel sur les générations structurées, selon le blog technique. - Préentraînement natif en NVFP4 (4 bits) optimisé pour Blackwell. - Apprentissage par renforcement sur 21 configurations d'environnements, avec plus de 1,2 million de trajectoires. - Publication des jeux de données (10 000 milliards de tokens uniques de préentraînement curés, 15 millions de problèmes de code, environ 40 millions d'échantillons de post-entraînement) et du pipeline complet sur GitHub. ### Architecture et caractéristiques 120 milliards de paramètres (12 milliards actifs), architecture Mamba-2, MoE et attention avec MTP, contexte jusqu'à 1 million de tokens. Préentraînement sur plus de 25 000 milliards de tokens (date limite juin 2025), post-entraînement jusqu'à février 2026. Langues : anglais, français, allemand, italien, japonais, espagnol, chinois. Licence : NVIDIA Nemotron Open Model License. Ouverture : poids (base, BF16, FP8, NVFP4), une grande partie des données et les recettes (LoRA SFT, GRPO, DAPO, cookbooks vLLM, SGLang, TensorRT-LLM) ; environ 10 des 37 jeux RL sont publiés selon le blog, donc ouverture partielle des données. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Disponible sur build.nvidia.com, Perplexity, OpenRouter et plusieurs hébergeurs ; tarif NVIDIA par million de tokens non communiqué | | Matériel minimal | 8 x H100 80 Go (fiche HF) ; 2 x B200 ou B300 pour la version BF16 | | Poids | Base, BF16, FP8 et NVFP4 le 10 mars 2026 (Hugging Face) | ### Benchmarks | Benchmark (publié par NVIDIA) | Nemotron 3 Super | Qwen3.5-122B-A10B | GPT-OSS-120B | |---|---|---|---| | MMLU-Pro | 83,73 | 86,70 | 81,00 | | AIME25 | 90,21 | 90,36 | 92,50 | | GPQA | 79,23 | 86,60 | 80,10 | | LiveCodeBench | 81,19 | 78,93 | 88,00 | | SWE-Bench (OpenHands) | 60,47 | 66,40 | 41,9 | | Arena-Hard-V2 | 73,88 | 75,15 | 90,26 | Source : fiche Hugging Face nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, mesures NVIDIA. Les deux comparateurs sont des modèles ouverts. NVIDIA cite en outre 85,6 % sur PinchBench (agents OpenClaw), sans détail des comparaisons dans l'extrait consulté. ### Face aux modèles fermés Le tableau de l'éditeur ne comporte aucun modèle fermé, et aucune comparaison avec un modèle fermé n'a été trouvée dans les sources consultées. Face à Qwen3.5-122B, Super est en retrait sur MMLU-Pro (83,73 contre 86,70), GPQA (79,23 contre 86,60) et SWE-Bench (60,47 contre 66,40), mais devant sur LiveCodeBench (81,19 contre 78,93). Face à GPT-OSS-120B, il est devant sur SWE-Bench (60,47 contre 41,9) et en retrait sur Arena-Hard-V2 (73,88 contre 90,26). Le contexte d'un million de tokens est un axe distinctif : sur RULER à 1 million, la fiche donne 91,75 pour Super contre 91,33 pour Qwen3.5-122B et 22,30 pour GPT-OSS-120B. L'atout principal reste l'ouverture des poids et des données, avec une licence permettant l'usage commercial. ### À retenir Nemotron 3 Super apporte un modèle de 120B à 12B actifs, long contexte, avec poids, données et recettes publiés. Il n'est pas le leader de sa catégorie sur tous les tests, mais son ouverture et son débit ciblent l'auto-hébergement d'agents.

Liens

Tags : LLM, Open Source, MoE, NVIDIA, Nemotron 3, Poids, données et recettes ouverts, NVIDIA Nemotron Open Model License