MiniMax-M1
2025-06-16 · Éditeur : MiniMax · Domaine : Intelligence Artificielle
MiniMax publie MiniMax-M1, présenté comme le premier modèle de raisonnement ouvert à grande échelle à attention hybride : 456 milliards de paramètres, 1 million de tokens de contexte, licence Apache 2.0.
Ce qui change
- Raisonnement à contexte long : le modèle prend en charge 1 million de tokens en entrée et jusqu'à 80 000 tokens de raisonnement, soit 8 fois le contexte de DeepSeek-R1 selon la model card.
- Efficacité de calcul : grâce à la Lightning Attention, la model card indique que M1 consomme 25 % des FLOPs de DeepSeek-R1 pour une génération de 100 000 tokens.
- CISPO : nouvel algorithme d'apprentissage par renforcement qui écrête les poids d'échantillonnage d'importance plutôt que les mises à jour par token, avec un entraînement plus stable sur ce type de MoE.
- Coût d'entraînement documenté : la phase d'apprentissage par renforcement a utilisé 512 GPU H800 pendant trois semaines, pour 534 700 $ de location selon le rapport technique.
- Deux variantes : M1-40k et M1-80k (budget de réflexion), le 40k étant un point de contrôle intermédiaire.
MiniMax publie MiniMax-M1, présenté comme le premier modèle de raisonnement ouvert à grande échelle à attention hybride : 456 milliards de paramètres, 1 million de tokens de contexte, licence Apache 2.0. ### Contexte En juin 2025, le raisonnement long, popularisé par o1 puis par DeepSeek-R1 (poids ouverts en janvier 2025), restait limité à des contextes de 128 000 tokens côté ouvert. Côté fermé, Gemini 2.5 Pro offrait déjà un million de tokens et o3 dominait les tests de raisonnement. MiniMax réutilise son architecture de janvier 2025 (MiniMax-Text-01) et y ajoute un entraînement par apprentissage par renforcement. ### Ce que le modèle apporte - Raisonnement à contexte long : le modèle prend en charge 1 million de tokens en entrée et jusqu'à 80 000 tokens de raisonnement, soit 8 fois le contexte de DeepSeek-R1 selon la model card. - Efficacité de calcul : grâce à la Lightning Attention, la model card indique que M1 consomme 25 % des FLOPs de DeepSeek-R1 pour une génération de 100 000 tokens. - CISPO : nouvel algorithme d'apprentissage par renforcement qui écrête les poids d'échantillonnage d'importance plutôt que les mises à jour par token, avec un entraînement plus stable sur ce type de MoE. - Coût d'entraînement documenté : la phase d'apprentissage par renforcement a utilisé 512 GPU H800 pendant trois semaines, pour 534 700 $ de location selon le rapport technique. - Deux variantes : M1-40k et M1-80k (budget de réflexion), le 40k étant un point de contrôle intermédiaire. ### Architecture et caractéristiques - Paramètres : 456 milliards au total, 45,9 milliards actifs par token (même base que MiniMax-Text-01). - Contexte : 1 million de tokens natifs ; budget de réflexion de 40 000 ou 80 000 tokens. - Modalités : texte. Langues et date de coupure : non communiquées dans les sources consultées. - Licence : Apache 2.0 (texte lu dans le dépôt GitHub), sans restriction d'usage commercial ni seuil d'utilisateurs. - Poids : https://huggingface.co/MiniMaxAI/MiniMax-M1-80k ### Coût et accès | Élément | Valeur | |---|---| | API, entrée 0 à 200 000 tokens | 0,4 $ par million de tokens | | API, sortie (0 à 200 000 tokens) | 2,2 $ par million de tokens | | API, entrée 200 000 à 1 million de tokens | 1,3 $ par million de tokens | | API, sortie (200 000 à 1 million) | 2,2 $ par million de tokens | | Auto-hébergement | matériel non communiqué dans les sources consultées | Tarifs du billet du 16 juin 2025. Le billet précise que le premier palier est moins cher que DeepSeek-R1 et que le second n'existe pas chez DeepSeek. ### Benchmarks Scores publiés par l'éditeur dans la model card de MiniMax-M1-80k ; les limites de réflexion varient (80k pour M1, 64k pour Claude 4 Opus et Gemini 2.5 Pro, 100k pour o3). | Test | MiniMax-M1-80k | OpenAI o3 | Gemini 2.5 Pro (06-05) | Claude 4 Opus | |---|---|---|---|---| | AIME 2024 | 86,0 | 91,6 | 92,0 | 76,0 | | GPQA Diamond | 70,0 | 83,3 | 86,4 | 79,6 | | LiveCodeBench | 65,0 | 75,8 | 77,1 | 56,6 | | SWE-bench Verified | 56,0 | 69,1 | 67,2 | 72,5 | | OpenAI-MRCR (128k) | 73,4 | 56,5 | 76,8 | 48,9 | | OpenAI-MRCR (1M) | 56,2 | non mesuré | 58,8 | non mesuré | | TAU-bench (airline) | 62,0 | 52,0 | 50,0 | 59,6 | Source : model card MiniMax-M1-80k (Hugging Face), mesures de l'éditeur. ### Face aux modèles fermés Au moment de sa sortie, les meilleurs modèles fermés de raisonnement étaient o3 et Gemini 2.5 Pro. M1 reste derrière eux en mathématiques (AIME 2024 : 86,0 contre 91,6 et 92,0), en raisonnement scientifique (GPQA Diamond : 70,0 contre 83,3 et 86,4) et en génie logiciel (SWE-bench Verified : 56,0 contre 69,1 et 67,2). Il se rapproche de Gemini 2.5 Pro sur le contexte long (OpenAI-MRCR à 1 million : 56,2 contre 58,8) et devance les trois modèles fermés cités sur l'usage d'outils TAU-bench airline (62,0 contre 52,0, 50,0 et 59,6). Sur le prix, aucune comparaison chiffrée avec les tarifs des modèles fermés n'est fournie par l'éditeur, qui se compare à DeepSeek-R1. Pour le choix ouvert ou fermé, la licence Apache 2.0 rend l'auto-hébergement et la redistribution possibles sans autorisation, mais un modèle de 456 milliards de paramètres suppose une infrastructure GPU importante. ### À retenir M1 apporte au monde ouvert un raisonnement sur un million de tokens sous licence permissive, avec un coût d'entraînement par apprentissage par renforcement publié. Il ne rattrape pas o3 ni Gemini 2.5 Pro sur les tests de raisonnement et de code, mais il est utilisable pour le raisonnement sur de très longs documents en auto-hébergement.
Liens
Tags : LLM, Open Source, MiniMax, Raisonnement, MoE, Apache 2.0, Lightning Attention