MiniMax-Text-01 (et MiniMax-VL-01)
2025-01-15 · Éditeur : MiniMax · Domaine : Intelligence Artificielle
MiniMax publie en poids ouverts MiniMax-Text-01, un MoE de 456 milliards de paramètres qui combine attention linéaire Lightning et attention softmax, avec un contexte de 4 millions de tokens en inférence.
Ce qui change
- Architecture hybride : selon le billet officiel, sur chaque bloc de 8 couches, 7 utilisent la Lightning Attention (attention linéaire) et 1 utilise l'attention softmax classique. Le coût de calcul croît alors beaucoup moins vite avec la longueur du texte.
- Contexte : 1 million de tokens à l'entraînement, extrapolé jusqu'à 4 millions à l'inférence (rapport technique), soit 20 à 32 fois plus que les modèles concurrents cités par l'éditeur.
- Récupération en contexte long : l'éditeur annonce 100 % de réussite sur un test d'aiguille dans une botte de foin de 4 millions de tokens.
- MoE de 32 experts avec un routage sur 2 experts par token, et des stratégies de parallélisme et de recouvrement calcul/communication conçues pour l'entraînement et l'inférence à cette échelle.
- Une déclinaison vision-langage, MiniMax-VL-01, publiée le même jour.
MiniMax publie en poids ouverts MiniMax-Text-01, un MoE de 456 milliards de paramètres qui combine attention linéaire Lightning et attention softmax, avec un contexte de 4 millions de tokens en inférence. ### Contexte En janvier 2025, les modèles ouverts les plus utilisés (Llama 3.1 405B, DeepSeek-V3, Qwen2.5-72B) plafonnaient à 128 000 tokens de contexte environ, alors que Gemini 1.5 Pro proposait déjà un contexte très long côté fermé. MiniMax, laboratoire chinois jusque-là surtout connu pour ses applications grand public, ouvre ici sa première famille de modèles fondation, avec une variante vision-langage, MiniMax-VL-01. L'enjeu est de rendre le contexte long abordable sans dépendre d'une attention quadratique sur toutes les couches. ### Ce que le modèle apporte - Architecture hybride : selon le billet officiel, sur chaque bloc de 8 couches, 7 utilisent la Lightning Attention (attention linéaire) et 1 utilise l'attention softmax classique. Le coût de calcul croît alors beaucoup moins vite avec la longueur du texte. - Contexte : 1 million de tokens à l'entraînement, extrapolé jusqu'à 4 millions à l'inférence (rapport technique), soit 20 à 32 fois plus que les modèles concurrents cités par l'éditeur. - Récupération en contexte long : l'éditeur annonce 100 % de réussite sur un test d'aiguille dans une botte de foin de 4 millions de tokens. - MoE de 32 experts avec un routage sur 2 experts par token, et des stratégies de parallélisme et de recouvrement calcul/communication conçues pour l'entraînement et l'inférence à cette échelle. - Une déclinaison vision-langage, MiniMax-VL-01, publiée le même jour. ### Architecture et caractéristiques - Paramètres : 456 milliards au total, 45,9 milliards actifs par token, 80 couches, 32 experts (configuration publiée sur Hugging Face). - Contexte : 1 million de tokens d'entraînement, jusqu'à 4 millions en inférence. - Modalités : texte pour Text-01, image et texte pour VL-01. - Données d'entraînement et date de coupure : non communiquées dans les sources consultées. - Licence : MiniMax Model License (licence propre à l'éditeur, et non une licence OSI). D'après le texte relu, elle accorde un droit mondial, non exclusif et gratuit d'utilisation, de copie et de modification, y compris commerciale, sans seuil d'utilisateurs, avec une politique d'usages interdits (usage militaire, contenus illégaux, atteintes aux mineurs, décisions entièrement automatisées à effet juridique) et une obligation de mention de la licence. Droit de Singapour, arbitrage SIAC. - Poids : https://huggingface.co/MiniMaxAI/MiniMax-Text-01 ### Coût et accès | Élément | Valeur | |---|---| | API officielle, entrée | 0,2 $ par million de tokens | | API officielle, sortie | 1,1 $ par million de tokens | | Auto-hébergement | matériel non communiqué dans les sources consultées (456 milliards de paramètres au total) | Tarifs relevés dans le billet du 15 janvier 2025. ### Benchmarks Scores publiés par l'éditeur dans la model card (mêmes conditions d'évaluation pour tous les modèles du tableau). | Test | GPT-4o (11-20) | Claude 3.5 Sonnet (10-22) | Gemini 1.5 Pro (002) | MiniMax-Text-01 | |---|---|---|---|---| | MMLU | 85,7 | 88,3 | 86,8 | 88,5 | | MMLU-Pro | 74,4 | 78,0 | 75,8 | 75,7 | | GPQA Diamond | 46,0 | 65,0 | 59,1 | 54,4 | | HumanEval | 90,2 | 93,7 | 86,6 | 86,9 | | MATH | 76,6 | 74,1 | 84,6 | 77,4 | Source : model card MiniMax-Text-01 sur Hugging Face, chiffres mesurés par l'éditeur. Sur la tâche d'aiguille dans une botte de foin à 1 million de tokens, la même page donne 0,910 pour MiniMax-Text-01 et 0,850 pour Gemini 1.5 Pro, les deux autres modèles étant absents à cette longueur. ### Face aux modèles fermés Au moment de sa sortie, les références fermées étaient GPT-4o et Claude 3.5 Sonnet, tous deux évalués dans le tableau de l'éditeur. Le modèle est proche d'eux sur les connaissances générales (MMLU 88,5 contre 88,3 pour Claude 3.5 Sonnet) et en retrait sur le raisonnement scientifique (GPQA Diamond 54,4 contre 65,0) et le code (HumanEval 86,9 contre 93,7). Son avantage porte sur le contexte long : 1 million de tokens à 0,910 de score de récupération contre 0,850 pour Gemini 1.5 Pro, alors que GPT-4o et Claude 3.5 Sonnet ne sont pas mesurés à cette longueur. L'API à 0,2 $ en entrée et 1,1 $ en sortie est annoncée par l'éditeur comme très inférieure aux offres concurrentes, mais le billet ne fournit pas de comparaison chiffrée de prix. Pour un choix ouvert ou fermé, la licence permet l'auto-hébergement et l'usage commercial, à condition de disposer du matériel adapté à un modèle de 456 milliards de paramètres. ### À retenir MiniMax-Text-01 est le premier modèle ouvert de cette taille à parier sur une attention linéaire hybride pour le contexte long. Il n'égale pas les meilleurs modèles fermés sur le raisonnement et le code, mais il ouvre les usages sur des documents de plusieurs centaines de milliers de tokens avec des poids téléchargeables.
Liens
Tags : LLM, Open Source, MiniMax, MoE, Lightning Attention, Contexte long, Licence MiniMax Model License