NVIDIA Nemotron Nano 2 et Nemotron-Pretraining v1

2025-08-18 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle

NVIDIA publie Nemotron Nano 2 (9B et 12B), un modèle de raisonnement hybride Mamba-Transformer, avec la majeure partie de son corpus de préentraînement (6 600 milliards de tokens).

Ce qui change

  • Un modèle de 9B paramètres obtenu par élagage d'un modèle de 12B préentraîné sur 20 000 milliards de tokens en FP8.
  • Un débit annoncé jusqu'à 6 fois supérieur à Qwen3-8B, mesuré sur un GPU A10G unique en bfloat16, pour une précision comparable ou meilleure.
  • Un contexte de 128K tokens qui tient sur un A10G (22 Gio de mémoire) selon NVIDIA.
  • Un budget de réflexion réglable à l'inférence : environ 5 % des données de post-entraînement contiennent des traces de raisonnement tronquées.
  • La publication de Nemotron-CC-v2, Nemotron-CC-Math-v1 (133 milliards de tokens), Nemotron-Pretraining-Code-v1 (747,4 milliards) et Nemotron-Pretraining-SFT-v1, soit 6 600 milliards de tokens au total.

NVIDIA publie Nemotron Nano 2 (9B et 12B), un modèle de raisonnement hybride Mamba-Transformer, avec la majeure partie de son corpus de préentraînement (6 600 milliards de tokens). ### Contexte Après Nemotron-H et les modèles Llama Nemotron, NVIDIA veut un petit modèle de raisonnement rapide sur un seul GPU d'entrée de gamme et commence à publier ses données de préentraînement. La sortie survient alors que Qwen3-8B est la référence ouverte de taille comparable, avec laquelle NVIDIA se mesure. ### Ce que le modèle apporte - Un modèle de 9B paramètres obtenu par élagage d'un modèle de 12B préentraîné sur 20 000 milliards de tokens en FP8. - Un débit annoncé jusqu'à 6 fois supérieur à Qwen3-8B, mesuré sur un GPU A10G unique en bfloat16, pour une précision comparable ou meilleure. - Un contexte de 128K tokens qui tient sur un A10G (22 Gio de mémoire) selon NVIDIA. - Un budget de réflexion réglable à l'inférence : environ 5 % des données de post-entraînement contiennent des traces de raisonnement tronquées. - La publication de Nemotron-CC-v2, Nemotron-CC-Math-v1 (133 milliards de tokens), Nemotron-Pretraining-Code-v1 (747,4 milliards) et Nemotron-Pretraining-SFT-v1, soit 6 600 milliards de tokens au total. ### Architecture et caractéristiques Trois modèles : NVIDIA-Nemotron-Nano-9B-v2 (aligné, élagué), 9B-v2-Base et 12B-v2-Base. Architecture hybride Mamba-2 et MLP avec quatre couches d'attention, contexte 128K, date limite des données septembre 2024. Langues (fiche HF) : anglais, allemand, espagnol, français, italien, japonais, coréen, portugais, russe, chinois, arabe. Licence : NVIDIA Open Model License. Ouverture : poids et grande partie du corpus de préentraînement publiés, rapport technique arXiv 2508.14444 ; le code de préentraînement complet n'a pas été vérifié, donc famille à poids et données ouverts sans qualification « entièrement ouvert ». ### Coût et accès | Élément | Détail | |---|---| | API officielle | Non communiqué (essai sur build.nvidia.com non vérifié pour ce modèle) | | Matériel | GPU A10G (22 Gio) en bfloat16, H100 80 Go, A100, Jetson AGX Thor (fiche HF) ; variantes FP8 (22 septembre 2025) et NVFP4 (7 octobre 2025) publiées ensuite | ### Benchmarks | Benchmark (raisonnement activé, publié par NVIDIA) | Nano 9B v2 | Qwen3-8B | |---|---|---| | AIME25 | 72,1 | 69,3 | | MATH500 | 97,8 | 96,3 | | GPQA | 64,0 | 59,6 | | LiveCodeBench | 71,1 | 59,5 | | BFCL v3 | 66,9 | 66,3 | | IFEval (strict) | 90,3 | 89,4 | | RULER (128K) | 78,9 | 74,1 | Source : fiche Hugging Face nvidia/NVIDIA-Nemotron-Nano-9B-v2, mesures NVIDIA. Le comparateur est un modèle ouvert. ### Face aux modèles fermés La comparaison publiée porte sur un modèle ouvert de taille voisine, pas sur un modèle fermé, et aucun classement indépendant ni comparaison avec un modèle fermé n'a été consulté. Le seul écart chiffré est donc celui de NVIDIA face à Qwen3-8B : de 0,6 à 11,6 points d'avance selon le test et un débit jusqu'à 6 fois supérieur. Le modèle vise l'auto-hébergement peu coûteux, pas la parité avec les grands modèles fermés. La disponibilité du corpus permet de reproduire ou d'adapter le préentraînement, un atout de souveraineté que les modèles fermés n'offrent pas. ### À retenir Nano 2 combine efficacité d'inférence, budget de réflexion réglable et données de préentraînement ouvertes. Il sert de base à la génération suivante, Nemotron 3.

Liens

Tags : LLM, Open Source, NVIDIA, Nemotron Nano, Mamba, Raisonnement, NVIDIA Open Model License