MiniMax-M2.5
2026-02-12 · Éditeur : MiniMax · Domaine : Intelligence Artificielle
MiniMax publie M2.5, entraîné par apprentissage par renforcement dans des centaines de milliers d'environnements, avec 80,2 sur SWE-bench Verified et une vitesse de 100 tokens par seconde en version Lightning.
Ce qui change
- Code : 80,2 % sur SWE-bench Verified, 51,3 % sur Multi-SWE-bench, entraînement sur plus de 200 000 environnements réels et plus de dix langages.
- Recherche et outils : 76,3 % sur BrowseComp avec gestion du contexte, et environ 20 % de tours de recherche en moins que M2.1.
- Vitesse : 37 % de temps en moins que M2.1 sur SWE-bench Verified (22,8 minutes en moyenne contre 31,3), soit le niveau de Claude Opus 4.6 (22,9 minutes) selon l'éditeur.
- Bureautique : taux de victoire moyen de 59,0 % sur l'évaluation interne GDPval-MM, en collaboration avec des professionnels de la finance et du droit.
- Cadre d'entraînement Forge et poursuite de l'algorithme CISPO, avec un mécanisme de récompense de processus pour les longues trajectoires d'agent.
MiniMax publie M2.5, entraîné par apprentissage par renforcement dans des centaines de milliers d'environnements, avec 80,2 sur SWE-bench Verified et une vitesse de 100 tokens par seconde en version Lightning. ### Contexte Trois mois et demi après M2, M2.5 arrive alors que Claude Opus 4.6 vient de sortir et que Opus 4.5, Gemini 3 Pro et GPT-5.2 tiennent le haut des classements fermés. Sur SWE-bench Verified, l'éditeur affirme que ses modèles M2 progressent plus vite que ceux de Claude, GPT et Gemini. L'objectif affiché est un agent utilisable en continu sans souci de coût. ### Ce que le modèle apporte - Code : 80,2 % sur SWE-bench Verified, 51,3 % sur Multi-SWE-bench, entraînement sur plus de 200 000 environnements réels et plus de dix langages. - Recherche et outils : 76,3 % sur BrowseComp avec gestion du contexte, et environ 20 % de tours de recherche en moins que M2.1. - Vitesse : 37 % de temps en moins que M2.1 sur SWE-bench Verified (22,8 minutes en moyenne contre 31,3), soit le niveau de Claude Opus 4.6 (22,9 minutes) selon l'éditeur. - Bureautique : taux de victoire moyen de 59,0 % sur l'évaluation interne GDPval-MM, en collaboration avec des professionnels de la finance et du droit. - Cadre d'entraînement Forge et poursuite de l'algorithme CISPO, avec un mécanisme de récompense de processus pour les longues trajectoires d'agent. ### Architecture et caractéristiques - Paramètres : environ 229 milliards au total, 10 milliards actifs comme M2 (nombre de paramètres des safetensors) ; 256 experts dont 8 actifs, 62 couches. - Contexte : 196 608 positions (config.json). Modalités : texte. - Données d'entraînement et date de coupure : non communiquées. - Licence : MiniMax Model License (version du 13 février 2026), licence propre à l'éditeur qui accorde un droit mondial, gratuit et non exclusif d'utiliser, copier, modifier et distribuer, avec une politique d'usages interdits (usage militaire, mineurs, désinformation, décisions entièrement automatisées à effet juridique, discrimination). Les métadonnées Hugging Face la désignent comme « modified-mit ». - Poids : https://huggingface.co/MiniMaxAI/MiniMax-M2.5, avec vLLM, SGLang, Transformers et KTransformers. ### Coût et accès | Élément | Valeur | |---|---| | M2.5-Lightning (100 tokens/s), entrée | 0,3 $ par million de tokens | | M2.5-Lightning, sortie | 2,4 $ par million de tokens | | M2.5 (50 tokens/s) | la moitié du tarif Lightning selon le billet | | Page tarifs actuelle (M2.5, legacy) | 0,30 $ en entrée, 1,20 $ en sortie, 0,03 $ en lecture de cache | | Auto-hébergement | matériel non communiqué dans les sources consultées | L'éditeur annonce un coût d'environ 1 $ par heure d'exécution continue à 100 tokens par seconde. ### Benchmarks Scores de l'annexe de la model card, obtenus par l'éditeur sur la base des jeux publics de l'indice Artificial Analysis. | Test | MiniMax-M2.5 | Claude Opus 4.5 | Claude Opus 4.6 | Gemini 3 Pro | GPT-5.2 (thinking) | |---|---|---|---|---|---| | AIME25 | 86,3 | 91,0 | 95,6 | 96,0 | 98,0 | | GPQA Diamond | 85,2 | 87,0 | 90,0 | 91,0 | 90,0 | | Humanity's Last Exam (sans outils) | 19,4 | 28,4 | 30,7 | 37,2 | 31,4 | | SciCode | 44,4 | 50,0 | 52,0 | 56,0 | 52,0 | | AA-LCR | 69,5 | 74,0 | 71,0 | 71,0 | 73,0 | Source : model card MiniMax-M2.5, annexe, mesures internes de l'éditeur. Dans le texte du billet, l'éditeur donne aussi SWE-bench Verified avec les outils Droid (79,7 contre 78,9 pour Opus 4.6) et OpenCode (76,1 contre 75,9). ### Face aux modèles fermés Au moment de sa sortie, les meilleurs modèles fermés étaient Claude Opus 4.6, Gemini 3 Pro et GPT-5.2. Sur les tests de connaissances et de raisonnement du tableau, M2.5 reste en retrait : 19,4 contre 30,7 pour Opus 4.6 sur Humanity's Last Exam et 86,3 contre 95,6 sur AIME25. C'est sur le code agentique que l'éditeur revendique la parité : 79,7 contre 78,9 pour Opus 4.6 avec l'outil Droid et 76,1 contre 75,9 avec OpenCode. Ces chiffres sont des mesures internes de l'éditeur. Sur le prix, l'éditeur affirme que le coût de sortie est d'un dixième à un vingtième de celui d'Opus, Gemini 3 Pro et GPT-5. Pour un arbitrage ouvert ou fermé, M2.5 offre l'auto-hébergement d'un modèle proche des références fermées en code, sous une licence à lire avant tout usage commercial. ### À retenir M2.5 est le jalon où un modèle ouvert de 10 milliards de paramètres actifs est présenté à parité avec les meilleurs modèles fermés en code agentique, à un prix bien inférieur. Les gains sont moins nets sur le raisonnement scientifique et les connaissances.
Liens
Tags : LLM, Open Source, MiniMax, MoE, Agents, Code, MiniMax Model License