MiniMax-M3

2026-06-01 · Éditeur : MiniMax · Domaine : Intelligence Artificielle

MiniMax publie M3, un MoE multimodal d'environ 428 milliards de paramètres (23 milliards actifs) avec un million de tokens de contexte grâce à une attention parcimonieuse, et des poids sous licence communautaire.

Ce qui change

  • Multimodalité native : le pipeline de données a été reconstruit avec un entraînement multimodal dès le premier pas, pour le texte, l'image et la vidéo.
  • MiniMax Sparse Attention (MSA) : attention parcimonieuse par blocs, avec une branche d'indexation qui sélectionne un sous-ensemble de blocs clé-valeur ; la model card annonce 9 fois plus de vitesse en préremplissage et 15 fois plus en décodage que M2 à 1 million de tokens.
  • Contexte : jusqu'à 1 million de tokens via l'API, avec 512 000 tokens garantis au minimum selon la page produit.
  • Trois modes de raisonnement : activé, adaptatif ou désactivé.
  • Tâches longues autonomes : réplication d'un article ICLR en près de 12 heures et optimisation d'un noyau FP8 GEMM avec un gain de 9,4 fois, selon l'éditeur.

MiniMax publie M3, un MoE multimodal d'environ 428 milliards de paramètres (23 milliards actifs) avec un million de tokens de contexte grâce à une attention parcimonieuse, et des poids sous licence communautaire. ### Contexte La série M2 (octobre 2025 à mars 2026) était limitée à environ 200 000 tokens et au texte, et sa licence s'est durcie avec M2.7. En juin 2026, les références fermées citées par MiniMax sont Claude Opus 4.7 et GPT-5.5. L'éditeur revendique le premier modèle ouvert à réunir codage de haut niveau, contexte d'un million de tokens et multimodalité native. ### Ce que le modèle apporte - Multimodalité native : le pipeline de données a été reconstruit avec un entraînement multimodal dès le premier pas, pour le texte, l'image et la vidéo. - MiniMax Sparse Attention (MSA) : attention parcimonieuse par blocs, avec une branche d'indexation qui sélectionne un sous-ensemble de blocs clé-valeur ; la model card annonce 9 fois plus de vitesse en préremplissage et 15 fois plus en décodage que M2 à 1 million de tokens. - Contexte : jusqu'à 1 million de tokens via l'API, avec 512 000 tokens garantis au minimum selon la page produit. - Trois modes de raisonnement : activé, adaptatif ou désactivé. - Tâches longues autonomes : réplication d'un article ICLR en près de 12 heures et optimisation d'un noyau FP8 GEMM avec un gain de 9,4 fois, selon l'éditeur. ### Architecture et caractéristiques - Paramètres : environ 428 milliards au total, environ 23 milliards actifs ; 60 couches, 128 experts routés dont 4 actifs par token (config.json). - Contexte : 1 048 576 positions (config.json). Modalités : texte, image et vidéo en entrée. - Données d'entraînement et date de coupure : non communiquées. - Licence : minimax-community (droit d'auteur 2026). Usage non commercial libre. Usage commercial : notification unique à api@minimax.io sous 20 millions de dollars de revenu annuel, autorisation écrite préalable au-delà, et mention « Built with MiniMax M3 » affichée. Une politique d'usages interdits s'applique (contenus illégaux, usage militaire, mineurs, désinformation, discrimination). - Poids : https://huggingface.co/MiniMaxAI/MiniMax-M3 (version MXFP8 également publiée), avec SGLang, vLLM, Transformers et KTransformers. ### Coût et accès | Élément | Valeur | |---|---| | Standard, entrée (512 000 tokens ou moins) | 0,30 $ par million de tokens | | Standard, sortie (512 000 tokens ou moins) | 1,20 $ par million de tokens | | Standard, au-delà de 512 000 tokens | 0,60 $ en entrée, 2,40 $ en sortie | | Lecture de cache | 0,06 $ (0,12 $ au-delà de 512 000) | | Niveau prioritaire | 1,5 fois le tarif standard | | Auto-hébergement | matériel non communiqué dans les sources consultées | Tarifs de la page tarifs officielle, qui affiche une remise permanente de 50 %. ### Benchmarks Chiffres publiés par l'éditeur (page produit et model card). | Test | MiniMax-M3 | Modèle fermé cité | |---|---|---| | BrowseComp | 83,5 | Claude Opus 4.7 : 79,3 | | PostTrainBench | 37,1 (3e rang) | Opus 4.7 : 42,4 ; GPT-5.5 : 39,3 | | SWE-bench Verified | 80,5 | non comparé dans les sources primaires lues | | SWE-Bench Pro | 59,0 | non comparé dans les sources primaires lues | | MMMU-Pro | 78,1 | non comparé dans les sources primaires lues | Source : page produit MiniMax M3 et model card (fichier .eval_results), mesures de l'éditeur. Le tableau comparatif complet de la model card est une image non exploitée. ### Face aux modèles fermés Au moment de sa sortie, l'éditeur situe M3 face à Claude Opus 4.7 et GPT-5.5. Sur BrowseComp, il annonce 83,5 contre 79,3 pour Opus 4.7. Sur PostTrainBench (entraînement autonome de modèles), M3 obtient 37,1, soit la troisième place derrière Opus 4.7 (42,4) et GPT-5.5 (39,3), et loin devant les autres modèles selon l'éditeur. Le prix standard de 0,30 $ en entrée et 1,20 $ en sortie n'est pas comparé chiffre à chiffre aux tarifs fermés dans les sources primaires lues. Pour le choix ouvert ou fermé, la licence autorise l'auto-hébergement et l'usage commercial avec notification sous 20 millions de dollars de revenu, ce qui est plus permissif que M2.7 et moins que l'Apache 2.0 de M1 ; au-delà du seuil, une autorisation est requise. ### À retenir M3 est le jalon multimodal et long contexte de MiniMax, avec un rapport technique sur l'attention parcimonieuse. Les comparaisons chiffrées face aux modèles fermés sont limitées aux chiffres de l'éditeur et à quelques tests, ce qui invite à des mesures indépendantes avant un choix de production.

Liens

Tags : LLM, Open Source, MiniMax, MoE, Multimodal, Contexte long, minimax-community