Nemotron-H
2025-03-21 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle
NVIDIA publie Nemotron-H, une famille de modèles hybrides Mamba-2 et Transformer (8B, 47B et 56B) qui remplace la majorité de l'attention par des couches Mamba pour accélérer l'inférence.
Ce qui change
- Remplacement de la plupart des couches d'attention par des couches Mamba-2, qui demandent une mémoire constante par token généré.
- Un débit annoncé jusqu'à 2,9 fois supérieur pour le 47B face à Qwen-2.5-72B et Llama-3.1-70B sur contexte long (65 536 tokens), et 1,8 et 3 fois pour le 8B face à Qwen-2.5-7B et Llama-3.1-8B.
- Un préentraînement en FP8 avec mise à l'échelle par tenseur, présenté comme l'une des plus grandes démonstrations publiques de ce format : 56B sur 20 000 milliards de tokens avec 6 144 GPU H100.
- Un modèle 47B obtenu par compression du 56B, pour un compromis précision et vitesse.
- Des poids publiés au format Hugging Face et NeMo, avec prise en charge du FP8 dans le framework NeMo.
NVIDIA publie Nemotron-H, une famille de modèles hybrides Mamba-2 et Transformer (8B, 47B et 56B) qui remplace la majorité de l'attention par des couches Mamba pour accélérer l'inférence. ### Contexte Les Transformers standards voient leur coût d'inférence croître avec la longueur du contexte. NVIDIA publie ici une famille hybride entraînée à grande échelle, dont l'architecture est reprise ensuite dans Nemotron Nano 2 puis Nemotron 3. Seuls des modèles de base sont disponibles à l'annonce ; les variantes Instruct et raisonnement sont annoncées pour plus tard. ### Ce que le modèle apporte - Remplacement de la plupart des couches d'attention par des couches Mamba-2, qui demandent une mémoire constante par token généré. - Un débit annoncé jusqu'à 2,9 fois supérieur pour le 47B face à Qwen-2.5-72B et Llama-3.1-70B sur contexte long (65 536 tokens), et 1,8 et 3 fois pour le 8B face à Qwen-2.5-7B et Llama-3.1-8B. - Un préentraînement en FP8 avec mise à l'échelle par tenseur, présenté comme l'une des plus grandes démonstrations publiques de ce format : 56B sur 20 000 milliards de tokens avec 6 144 GPU H100. - Un modèle 47B obtenu par compression du 56B, pour un compromis précision et vitesse. - Des poids publiés au format Hugging Face et NeMo, avec prise en charge du FP8 dans le framework NeMo. ### Architecture et caractéristiques Modèles : 8B (15 000 milliards de tokens), 47B et 56B (20 000 milliards). Le 56B combine essentiellement des couches Mamba-2 et MLP avec dix couches d'attention (fiche HF), contexte 8K pour les modèles de base, date limite des données septembre 2024, langues : anglais, allemand, espagnol, français, italien, coréen, portugais, russe, japonais, chinois. Licence : NVIDIA Internal Scientific Research and Development Model License, limitée à la recherche et au développement, donc pas d'usage commercial libre. Données d'entraînement non publiées avec l'annonce dans les pages consultées. La fiche mentionne l'usage de données synthétiques générées avec Qwen. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Non communiqué | | Matériel | Optimisé pour H100 80 Go et A100 (fiche HF du 56B) ; exigences mémoire non détaillées | | Poids | Base 8B, 47B et 56B sur Hugging Face et NGC ; date de mise en ligne du 56B sur HF : 14 avril 2025 | ### Benchmarks | Benchmark (publié par NVIDIA) | Nemotron-H 47B | Qwen-2.5 (72B) | Llama-3.1 (70B) | |---|---|---|---| | MMLU-Pro (page projet) | 61,8 | 58,8 | 51,3 | Complément, fiche du 56B : MMLU 84,21 (5-shot), GSM8K 93,71 (8-shot CoT), HumanEval 60,37, ARC Challenge 94,97 (25-shot). Source : page projet NVIDIA ADLR (research.nvidia.com/labs/adlr/nemotronh/) et fiche Hugging Face nvidia/Nemotron-H-56B-Base-8K, mesures NVIDIA. Rapport : arXiv 2504.03624. ### Face aux modèles fermés Nemotron-H est comparé par NVIDIA à des modèles ouverts (Qwen-2.5, Llama-3.1), pas à des modèles fermés, et aucune comparaison avec un modèle fermé n'a été trouvée dans les sources consultées. Son apport est l'efficacité d'inférence : le débit annoncé sur contexte long est de 2,9 fois celui des modèles ouverts de taille supérieure. La licence de recherche est plus restrictive que celle des modèles fermés accessibles par API pour un usage commercial, ce qui limite l'intérêt pratique en entreprise pour cette génération. Le jalon est d'abord architectural. ### À retenir Nemotron-H valide à grande échelle l'hybride Mamba-Transformer et le préentraînement FP8, deux choix repris ensuite dans Nano 2 et Nemotron 3. En entreprise, la licence de recherche exclut un usage productif.
Liens
Tags : LLM, Open Source, NVIDIA, Nemotron-H, Mamba, Licence recherche