Llama Nemotron (Nano, Super, Ultra)
2025-03-18 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle
NVIDIA lance à GTC la famille Llama Nemotron, des modèles de raisonnement dérivés de Llama en trois tailles (8B, 49B, 253B), publiés avec leurs poids, leur jeu de post-entraînement et leur code.
Ce qui change
- Trois paliers : Nano (PC et périphérie), Super (meilleur compromis précision et débit sur un seul GPU de centre de données) et Ultra (précision maximale sur plusieurs GPU), selon le communiqué NVIDIA.
- Une bascule de raisonnement à l'inférence : le mode raisonnement s'active ou se désactive à la demande, ce que le rapport technique présente comme une première pour des modèles ouverts.
- Une architecture allégée par recherche d'architecture neuronale : blocs d'attention remplacés par des couches linéaires, largeurs de couches feed-forward variables, fusion de couches feed-forward (FFN Fusion) sur Ultra.
- Un entraînement en trois temps sur Ultra : distillation de connaissances (65 milliards de tokens), préentraînement continu (88 milliards de tokens), puis affinage supervisé et apprentissage par renforcement (GRPO).
- Le jeu Llama-Nemotron-Post-Training-Dataset et les cadres NeMo, NeMo-Aligner et Megatron-LM sont publiés avec les poids.
NVIDIA lance à GTC la famille Llama Nemotron, des modèles de raisonnement dérivés de Llama en trois tailles (8B, 49B, 253B), publiés avec leurs poids, leur jeu de post-entraînement et leur code. ### Contexte Au début de 2025, les modèles de raisonnement ouverts se multiplient après DeepSeek-R1, avec lequel le rapport technique de NVIDIA se compare. NVIDIA choisit de partir de modèles Llama existants et de les reprendre par recherche d'architecture, distillation et post-entraînement, plutôt que de préentraîner de zéro. Les modèles Nano et Super sont disponibles à l'annonce, Ultra suit le 7 avril 2025. ### Ce que le modèle apporte - Trois paliers : Nano (PC et périphérie), Super (meilleur compromis précision et débit sur un seul GPU de centre de données) et Ultra (précision maximale sur plusieurs GPU), selon le communiqué NVIDIA. - Une bascule de raisonnement à l'inférence : le mode raisonnement s'active ou se désactive à la demande, ce que le rapport technique présente comme une première pour des modèles ouverts. - Une architecture allégée par recherche d'architecture neuronale : blocs d'attention remplacés par des couches linéaires, largeurs de couches feed-forward variables, fusion de couches feed-forward (FFN Fusion) sur Ultra. - Un entraînement en trois temps sur Ultra : distillation de connaissances (65 milliards de tokens), préentraînement continu (88 milliards de tokens), puis affinage supervisé et apprentissage par renforcement (GRPO). - Le jeu Llama-Nemotron-Post-Training-Dataset et les cadres NeMo, NeMo-Aligner et Megatron-LM sont publiés avec les poids. ### Architecture et caractéristiques Nano 8B et Super 49B (respectivement 8,03 et 49,87 milliards de paramètres selon les métadonnées Hugging Face) sont des modèles denses. Ultra-253B est un décodeur dense dérivé de Llama-3.1-405B-Instruct, contexte 128K tokens. Langues d'Ultra : anglais, code, allemand, français, italien, portugais, hindi, espagnol, thaï. Licence : NVIDIA Open Model License (usage commercial autorisé selon les fiches). Comme les modèles dérivent de Llama, les conditions de la licence Llama s'appliquent probablement aussi (point non vérifié dans les fiches consultées). Ouverture : poids, jeu de post-entraînement et code d'entraînement ouverts ; le corpus de préentraînement de Llama n'est pas ouvert, donc famille à poids ouverts et post-entraînement ouvert, pas entièrement ouverte. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Essai sur build.nvidia.com ; usage gratuit pour développement, test et recherche pour les membres du NVIDIA Developer Program ; production via NVIDIA AI Enterprise (communiqué NVIDIA). Tarif par million de tokens non communiqué. | | Auto-hébergement Ultra | Un nœud 8 x H100 (fiche Hugging Face) ; variante FP8 publiée le 30 avril 2025 | | Auto-hébergement Nano/Super | Nano pour PC et périphérie, Super pour un GPU de centre de données (positionnement NVIDIA, matériel exact non repris ici) | ### Benchmarks | Benchmark (Ultra-253B, publié par NVIDIA) | Raisonnement désactivé | Raisonnement activé | |---|---|---| | GPQA | 56,60 | 76,01 | | AIME25 | 16,67 | 72,50 | | MATH500 | 80,40 | 97,00 | | LiveCodeBench | 29,03 | 66,31 | Source : fiche Hugging Face nvidia/Llama-3_1-Nemotron-Ultra-253B-v1, scores mesurés par NVIDIA. Le rapport technique (arXiv 2505.00949) indique des performances comparables à DeepSeek-R1, un modèle ouvert. ### Face aux modèles fermés Les sources consultées ne contiennent aucune comparaison chiffrée avec un modèle fermé, et aucune comparaison temporelle avec le meilleur modèle fermé de mars-avril 2025 n'a été établie sur source. NVIDIA annonce jusqu'à 20 % de précision en plus par rapport au modèle de base et un débit jusqu'à cinq fois supérieur à d'autres modèles de raisonnement ouverts, sans détail chiffré dans le communiqué. L'écart avec les modèles fermés ne peut donc pas être quantifié ici. L'intérêt tient à l'auto-hébergement sur un nœud 8 x H100 (Ultra) et à la possibilité de désactiver le raisonnement pour économiser des tokens. La licence NVIDIA autorise l'usage commercial, sous réserve des conditions de la licence Llama sous-jacente. ### À retenir Llama Nemotron ouvre la voie des modèles de raisonnement NVIDIA avec un jeu de données et un code d'entraînement publiés. La bascule raisonnement activé ou non devient un critère de choix pour maîtriser le coût en tokens.
Liens
Tags : LLM, Open Source, NVIDIA, Llama Nemotron, Raisonnement, NVIDIA Open Model License