NVIDIA Nemotron 3 (Nano 30B-A3B)

2025-12-15 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle

NVIDIA présente la famille Nemotron 3 (Nano, Super, Ultra) et publie Nano, un MoE hybride de 30 milliards de paramètres dont 3 milliards actifs, avec poids, jeux de données et recettes d'entraînement.

Ce qui change

  • Un débit annoncé 4 fois supérieur à Nemotron 2 Nano et jusqu'à 60 % de tokens de raisonnement en moins, selon NVIDIA.
  • Un contexte natif de 1 million de tokens (256K par défaut dans la configuration Hugging Face).
  • Un MoE hybride : 23 couches Mamba-2 et MoE plus 6 couches d'attention, avec 128 experts routés et 1 expert partagé, 6 experts actifs par token.
  • Un apprentissage par renforcement multi-environnements avec la bibliothèque NeMo Gym, publiée avec NeMo RL et NeMo Evaluator.
  • Des jeux de données ouverts (collections Nemotron pré-entraînement et Nemotron post-entraînement v3), avec 13 millions d'échantillons de post-entraînement selon le blog technique.

NVIDIA présente la famille Nemotron 3 (Nano, Super, Ultra) et publie Nano, un MoE hybride de 30 milliards de paramètres dont 3 milliards actifs, avec poids, jeux de données et recettes d'entraînement. ### Contexte Après Nano 2, NVIDIA passe à une architecture Mamba-Transformer combinée à un mélange d'experts, et annonce trois tailles : Nano (30B), Super (environ 100B) et Ultra (environ 500B). Seul Nano est disponible à l'annonce ; Super et Ultra sont annoncés pour le premier semestre 2026. L'enjeu affiché est l'IA agentique multi-agents, avec un coût par token réduit. ### Ce que le modèle apporte - Un débit annoncé 4 fois supérieur à Nemotron 2 Nano et jusqu'à 60 % de tokens de raisonnement en moins, selon NVIDIA. - Un contexte natif de 1 million de tokens (256K par défaut dans la configuration Hugging Face). - Un MoE hybride : 23 couches Mamba-2 et MoE plus 6 couches d'attention, avec 128 experts routés et 1 expert partagé, 6 experts actifs par token. - Un apprentissage par renforcement multi-environnements avec la bibliothèque NeMo Gym, publiée avec NeMo RL et NeMo Evaluator. - Des jeux de données ouverts (collections Nemotron pré-entraînement et Nemotron post-entraînement v3), avec 13 millions d'échantillons de post-entraînement selon le blog technique. ### Architecture et caractéristiques 30 milliards de paramètres au total, environ 3 milliards actifs (3,5 milliards selon la fiche HF). Préentraînement sur environ 25 000 milliards de tokens, date limite des données de préentraînement 25 juin 2025, post-entraînement 28 novembre 2025. Langues : anglais, allemand, espagnol, français, italien, japonais (plus de 20 langues et 43 langages de programmation vus à l'entraînement). Licence : NVIDIA Nemotron Open Model License (usage commercial autorisé sous conditions). Ouverture : poids, une part des données de préentraînement, données de post-entraînement, environnements RL et recettes ; NVIDIA indique 3 000 milliards de tokens de jeux de données publiés sur un corpus de préentraînement d'environ 25 000 milliards, donc données partielles. Nano est aussi disponible sur AWS Bedrock et chez plusieurs hébergeurs (Baseten, DeepInfra, Fireworks et d'autres). ### Coût et accès | Élément | Détail | |---|---| | API officielle | NIM et build.nvidia.com ; tarif par million de tokens non communiqué à l'annonce | | Matériel | A100 80 Go, H100 80 Go, B200 192 Go, RTX PRO 6000 96 Go, Jetson Thor, DGX Spark (fiche HF) | | Mémoire des poids | Environ 63 Go en BF16 (31,6 milliards de paramètres safetensors, calcul), variantes FP8 (6 décembre) et NVFP4 (20 décembre) | ### Benchmarks | Benchmark Nemotron 3 Nano (publié par NVIDIA) | Score | |---|---| | MMLU-Pro | 78,3 | | AIME25 (avec outils) | 99,2 | | LiveCodeBench | 68,3 | | Arena-Hard-V2 (moyenne) | 67,7 | | RULER-100@1M | 86,3 | Source : fiche Hugging Face nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16, mesures NVIDIA, sans colonne de comparaison dans l'extrait consulté. ### Face aux modèles fermés Aucun tableau comparatif avec des modèles fermés n'a été consulté pour ce modèle : la fiche donne des scores absolus et le communiqué NVIDIA se limite à des comparaisons de débit avec sa génération précédente (4 fois) et à un classement d'efficacité par Artificial Analysis, dont le détail n'a pas été relevé. Le positionnement est celui d'un petit modèle rapide pour agents, pas celui d'un concurrent direct des grands modèles fermés. Les avantages mis en avant sont la transparence (données, recettes) et l'auto-hébergement sur un seul GPU. Un score de 99,2 sur AIME25 est obtenu avec outils, ce qui n'est pas comparable aux scores sans outils d'autres annonces. ### À retenir Nemotron 3 Nano marque le passage de NVIDIA à un modèle ouvert dont l'ensemble de la chaîne (données, environnements RL, bibliothèques) est publié. Il annonce Super et Ultra, livrés en mars et juin 2026.

Liens

Tags : LLM, Open Source, MoE, NVIDIA, Nemotron 3, Poids, données et recettes ouverts, NVIDIA Nemotron Open Model License