MiniMax-M2.1
2025-12-23 · Éditeur : MiniMax · Domaine : Intelligence Artificielle
MiniMax publie M2.1, mise à jour de M2 axée sur la programmation multilingue (Rust, Java, Go, C++, Kotlin), le développement mobile et la réflexion entrelacée, avec 74,0 sur SWE-bench Verified.
Ce qui change
- Programmation multilingue : gains ciblés sur Rust, Java, Go, C++, Kotlin, Objective-C, TypeScript et JavaScript. SWE-bench Multilingual passe de 56,5 (M2) à 72,5.
- Développement web et mobile : renforcement du développement Android et iOS natif, avec un score VIBE moyen de 88,6 contre 67,5 pour M2.
- Interleaved Thinking : l'éditeur présente M2.1 comme l'une des premières familles ouvertes à l'introduire de façon systématique, pour mieux gérer des consignes composites.
- Réponses plus concises et chaînes de réflexion plus courtes, avec moins de tokens consommés.
- Compatibilité avec les outils Claude Code, Droid, Cline, Kilo Code, Roo Code et BlackBox, et avec les mécanismes de contexte Skill.md, Claude.md et slash commands.
MiniMax publie M2.1, mise à jour de M2 axée sur la programmation multilingue (Rust, Java, Go, C++, Kotlin), le développement mobile et la réflexion entrelacée, avec 74,0 sur SWE-bench Verified. ### Contexte M2 avait surtout résolu, selon MiniMax, la question du coût et de l'accessibilité. Fin décembre 2025, les références fermées étaient Claude Opus 4.5 (80,9 sur SWE-bench Verified), GPT-5.2 et Gemini 3 Pro, et les modèles ouverts progressaient vite avec DeepSeek V3.2. M2.1 vise la robustesse en conditions réelles plutôt qu'un nouveau palier de taille. ### Ce que le modèle apporte - Programmation multilingue : gains ciblés sur Rust, Java, Go, C++, Kotlin, Objective-C, TypeScript et JavaScript. SWE-bench Multilingual passe de 56,5 (M2) à 72,5. - Développement web et mobile : renforcement du développement Android et iOS natif, avec un score VIBE moyen de 88,6 contre 67,5 pour M2. - Interleaved Thinking : l'éditeur présente M2.1 comme l'une des premières familles ouvertes à l'introduire de façon systématique, pour mieux gérer des consignes composites. - Réponses plus concises et chaînes de réflexion plus courtes, avec moins de tokens consommés. - Compatibilité avec les outils Claude Code, Droid, Cline, Kilo Code, Roo Code et BlackBox, et avec les mécanismes de contexte Skill.md, Claude.md et slash commands. ### Architecture et caractéristiques - Paramètres : environ 229 milliards au total (nombre de paramètres des safetensors), 10 milliards actifs comme M2 ; 256 experts dont 8 actifs. - Contexte : 196 608 positions (config.json). - Modalités : texte. Données d'entraînement et date de coupure : non communiquées. - Licence : MIT modifiée. Contrairement à M2, la clause du dépôt impose d'afficher « MiniMax M2.1 » dans l'interface pour tout produit ou service commercial, sans seuil d'utilisateurs ou de revenu. - Poids : https://huggingface.co/MiniMaxAI/MiniMax-M2.1 ### Coût et accès | Élément | Valeur | |---|---| | API officielle, entrée | 0,30 $ par million de tokens | | API officielle, sortie | 1,20 $ par million de tokens | | Lecture de cache | 0,03 $ par million de tokens | | Auto-hébergement | matériel non communiqué dans les sources consultées | Tarifs de la page tarifs actuelle, classée « legacy » ; le tarif de lancement n'a pas été relevé séparément. Les variantes rapides facturent le double. ### Benchmarks Scores publiés par l'éditeur dans la model card de M2.1. | Test | MiniMax-M2.1 | Claude Opus 4.5 | GPT-5.2 (thinking) | Gemini 3 Pro | |---|---|---|---|---| | SWE-bench Verified | 74,0 | 80,9 | 80,0 | 78,0 | | Multi-SWE-bench | 49,4 | 50,0 | non mesuré | 42,7 | | SWE-bench Multilingual | 72,5 | 77,5 | 72,0 | 65,0 | | Terminal-bench 2.0 | 47,9 | 57,8 | 54,0 | 54,2 | | BrowseComp (gestion du contexte) | 62,0 | 57,8 | 70,0 | 59,2 | | Toolathlon | 43,5 | 43,5 | 41,7 | 36,4 | Source : model card MiniMax-M2.1 (Hugging Face), mesures de l'éditeur. ### Face aux modèles fermés Au moment de sa sortie, le meilleur modèle fermé du tableau sur SWE-bench Verified était Claude Opus 4.5 (80,9), soit 6,9 points au-dessus de M2.1 (74,0). L'écart est plus faible sur Multi-SWE-bench (49,4 contre 50,0) et SWE-bench Multilingual (72,5 contre 77,5 pour Opus 4.5, avec un dépassement de Gemini 3 Pro à 65,0 et de GPT-5.2 à 72,0 de justesse). M2.1 égale Claude Opus 4.5 sur Toolathlon (43,5) et le dépasse sur BrowseComp avec gestion du contexte (62,0 contre 57,8), mais reste en retrait sur Terminal-bench 2.0 (47,9 contre 57,8). Le prix reste celui de M2 (0,30 $ et 1,20 $), très inférieur aux tarifs des modèles fermés cités, dont les tarifs ne sont pas repris ici. Pour un choix ouvert ou fermé, M2.1 devient une option crédible pour du code multilingue, avec une clause d'attribution à respecter pour tout usage commercial. ### À retenir M2.1 consolide M2 sur le code multilingue, le mobile et l'usage d'outils, avec un écart réduit face aux modèles fermés de décembre 2025. La licence change de nature par rapport à M2 : l'attribution devient obligatoire pour tout usage commercial.
Liens
Tags : LLM, Open Source, MiniMax, MoE, Code, Agents, MIT modifiée