NVIDIA Nemotron 3 Nano Omni (30B-A3B)

2026-04-28 · Éditeur : NVIDIA · Domaine : Intelligence Artificielle

NVIDIA lance Nemotron 3 Nano Omni, un modèle ouvert de 30 milliards de paramètres dont environ 3 milliards actifs, qui unifie vision, audio et langage pour des agents, avec un débit annoncé 9 fois supérieur.

Ce qui change

  • Entrées : texte, images, audio, vidéo, documents, graphiques et interfaces graphiques ; sortie texte avec raisonnement, JSON et appels d'outils.
  • Un débit annoncé jusqu'à 9 fois supérieur à d'autres modèles omni ouverts à interactivité égale.
  • Des résultats de tête sur six classements de compréhension de documents, de vidéo et d'audio, selon NVIDIA.
  • Une amélioration face à Nemotron Nano VL V2 : OCRBenchV2 67,04 (+18,26 %), OSWorld 47,4 (+76,58 %), raisonnement sur graphiques 63,6 (+35,06 %).
  • Un raisonnement activé par défaut, désactivable par le paramètre enable_thinking.

NVIDIA lance Nemotron 3 Nano Omni, un modèle ouvert de 30 milliards de paramètres dont environ 3 milliards actifs, qui unifie vision, audio et langage pour des agents, avec un débit annoncé 9 fois supérieur. ### Contexte Les agents qui utilisent un ordinateur ou lisent des documents enchaînent souvent plusieurs modèles séparés pour la vue, l'audio et le texte. NVIDIA propose un modèle unique conçu pour servir de sous-agent de perception dans des systèmes plus larges, avec sa propre licence, distincte de celle des modèles textuels. ### Ce que le modèle apporte - Entrées : texte, images, audio, vidéo, documents, graphiques et interfaces graphiques ; sortie texte avec raisonnement, JSON et appels d'outils. - Un débit annoncé jusqu'à 9 fois supérieur à d'autres modèles omni ouverts à interactivité égale. - Des résultats de tête sur six classements de compréhension de documents, de vidéo et d'audio, selon NVIDIA. - Une amélioration face à Nemotron Nano VL V2 : OCRBenchV2 67,04 (+18,26 %), OSWorld 47,4 (+76,58 %), raisonnement sur graphiques 63,6 (+35,06 %). - Un raisonnement activé par défaut, désactivable par le paramètre enable_thinking. ### Architecture et caractéristiques Backbone hybride Mamba-2 Transformer MoE d'environ 31 milliards de paramètres (30B-A3B, environ 3 milliards actifs), encodeur visuel CRADIO v4-H et encodeur audio Parakeet. Contexte maximal 256K tokens. Entraînement : 354,6 millions d'échantillons (environ 717 milliards de tokens), issus de jeux publics, de données sous licence, de collections internes NVIDIA et d'annotations synthétiques. Licence : NVIDIA Open Model Agreement (métadonnées HF), à distinguer de la Nemotron Open Model License des modèles textuels. Ouverture : poids, jeux de données et techniques annoncés comme ouverts ; l'étendue des données publiées n'a pas été détaillée. ### Coût et accès | Élément | Détail | |---|---| | API officielle | build.nvidia.com (microservice NIM), OpenRouter, plus de 25 plateformes partenaires ; tarif non communiqué | | Taille des poids | 62 Go en BF16, 33 Go en FP8, 21 Go en NVFP4 (fiche HF) | | Matériel | 1 x H100 80 Go minimum en BF16 ; H200, B200, RTX Pro 6000 recommandés ; Jetson Thor compatible | ### Benchmarks | Benchmark (publié par NVIDIA) | Nano Omni | Écart vs Nemotron Nano VL V2 | |---|---|---| | OCRBenchV2 | 67,04 | +18,26 % | | OSWorld (usage d'ordinateur) | 47,4 | +76,58 % | | Raisonnement sur graphiques | 63,6 | +35,06 % | Source : fiche Hugging Face nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 et billet NVIDIA Blog. Comparaison avec le modèle précédent de NVIDIA, pas avec des modèles fermés. ### Face aux modèles fermés Les sources consultées ne comparent pas Nano Omni à des modèles multimodaux fermés. Les seuls écarts chiffrés sont face à Nemotron Nano VL V2, un modèle ouvert précédent. NVIDIA revendique la première place sur six classements sans détailler les concurrents dans l'extrait consulté, et un débit 9 fois supérieur à d'autres modèles omni ouverts. La proposition repose sur l'auto-hébergement avec un seul GPU H100 pour la perception d'agents, alors que les modèles fermés multimodaux s'utilisent par API. Le choix ouvert ou fermé dépend donc du besoin de contrôle des données audio et vidéo. ### À retenir Nano Omni apporte à la famille Nemotron une perception audio, vidéo et documentaire sous forme d'un seul modèle ouvert. Sa licence propre est à vérifier avant tout usage commercial.

Liens

Tags : LLM, Multimodal, Open Source, MoE, NVIDIA, Nemotron 3, NVIDIA Open Model Agreement