MiMo-V2-Flash
2025-12-16 · Éditeur : Xiaomi · Domaine : Intelligence Artificielle
Xiaomi publie MiMo-V2-Flash, un modèle à poids ouverts (MIT) de 309 milliards de paramètres dont 15 actifs, conçu pour les agents et le code, avec une attention hybride qui réduit le cache d'environ six fois.
Ce qui change
- Attention hybride : cinq couches à fenêtre glissante (128 tokens) pour une couche d'attention globale, avec un biais d'attention apprenable ; Xiaomi annonce un cache clé-valeur réduit d'environ six fois pour un contexte long préservé.
- Prédiction multi-tokens (MTP) native : un module léger de 0,33 milliard de paramètres par bloc, dont trois couches sont publiées ; l'éditeur indique une vitesse de génération multipliée par trois.
- Post-entraînement par distillation multi-enseignants sur politique (MOPD) : des modèles experts par domaine guident l'élève à chaque token, ce qui remplace la récompense éparse par un signal dense.
- Apprentissage par renforcement d'agents à grande échelle : plus de 100 000 tâches vérifiables issues de tickets GitHub réels, un cluster Kubernetes de plus de 10 000 pods simultanés et un vérificateur multimodal pour le développement web.
- Poids de base et poids post-entraînés publiés, avec le code d'inférence.
Xiaomi publie MiMo-V2-Flash, un modèle à poids ouverts (MIT) de 309 milliards de paramètres dont 15 actifs, conçu pour les agents et le code, avec une attention hybride qui réduit le cache d'environ six fois. ### Contexte Fin 2025, la course aux modèles ouverts se joue sur les agents de code et les tâches longues : Kimi K2 Thinking et DeepSeek-V3.2 fixent la référence côté ouvert, Gemini 3 Pro, Claude Sonnet 4.5 et GPT-5 celle côté fermé. Xiaomi avait ouvert en avril 2025 un modèle de 7 milliards de paramètres ; MiMo-V2-Flash change d'échelle et vise le rapport vitesse/coût plutôt que la taille brute. ### Ce que le modèle apporte - Attention hybride : cinq couches à fenêtre glissante (128 tokens) pour une couche d'attention globale, avec un biais d'attention apprenable ; Xiaomi annonce un cache clé-valeur réduit d'environ six fois pour un contexte long préservé. - Prédiction multi-tokens (MTP) native : un module léger de 0,33 milliard de paramètres par bloc, dont trois couches sont publiées ; l'éditeur indique une vitesse de génération multipliée par trois. - Post-entraînement par distillation multi-enseignants sur politique (MOPD) : des modèles experts par domaine guident l'élève à chaque token, ce qui remplace la récompense éparse par un signal dense. - Apprentissage par renforcement d'agents à grande échelle : plus de 100 000 tâches vérifiables issues de tickets GitHub réels, un cluster Kubernetes de plus de 10 000 pods simultanés et un vérificateur multimodal pour le développement web. - Poids de base et poids post-entraînés publiés, avec le code d'inférence. ### Architecture et caractéristiques - Architecture : MoE, 309 milliards de paramètres au total, 15 milliards actifs ; 8 blocs hybrides de 5 couches à fenêtre glissante et 1 couche globale. - Entraînement : 27 000 milliards de tokens, précision mixte FP8, séquences natives de 32 000 tokens. - Contexte : jusqu'à 256 000 tokens. Modalités : texte. - Licence : MIT (usage commercial libre). Poids : MiMo-V2-Flash et MiMo-V2-Flash-Base sur Hugging Face. - Coupure des connaissances : non communiquée. ### Coût et accès Tarif de l'API officielle de Xiaomi au lancement : 0,1 dollar par million de tokens en entrée et 0,3 dollar en sortie. Pour l'auto-hébergement, l'éditeur recommande SGLang en précision FP8 ; l'exemple de la fiche lance le serveur avec tp-size 8 et dp-size 2, sans préciser le modèle de GPU. | Poste | Prix (USD par million de tokens) | | --- | --- | | Entrée | 0,1 | | Sortie | 0,3 | | Cache et batch | Non communiqué | ### Benchmarks | Benchmark | MiMo-V2-Flash | Gemini 3.0 Pro | Claude Sonnet 4.5 | GPT-5 High | | --- | --- | --- | --- | --- | | MMLU-Pro | 84,9 | 90,1 | 88,2 | 87,5 | | GPQA-Diamond | 83,7 | 91,9 | 83,4 | 85,7 | | Humanity's Last Exam (sans outils) | 22,1 | 37,5 | 13,7 | 26,3 | | AIME 2025 | 94,1 | 95,0 | 87,0 | 94,6 | | LiveCodeBench v6 | 80,6 | 90,7 | 64,0 | 84,5 | | SWE-Bench Verified | 73,4 | 76,2 | 77,2 | 74,9 | | SWE-Bench Multilingual | 71,7 | - | 68,0 | 55,3 | | Terminal-Bench 2.0 | 38,5 | 54,2 | 42,8 | 35,2 | | BrowseComp | 45,4 | - | 24,1 | 54,9 | | τ²-Bench | 80,3 | 85,4 | 84,7 | 80,2 | Source : fiche Hugging Face de MiMo-V2-Flash, tableau de post-entraînement. Scores publiés et mesurés par Xiaomi ; le même tableau inclut Kimi K2 Thinking et DeepSeek-V3.2 Thinking (ouverts). ### Face aux modèles fermés Sur le code d'agent, MiMo-V2-Flash se situe dans la fourchette des modèles fermés cités : 73,4 à SWE-Bench Verified contre 74,9 pour GPT-5 High et 77,2 pour Claude Sonnet 4.5, et 71,7 à SWE-Bench Multilingual, devant Claude Sonnet 4.5 (68,0) et GPT-5 High (55,3). Il reste nettement derrière Gemini 3.0 Pro sur les connaissances (GPQA-Diamond 83,7 contre 91,9), le code compétitif (LiveCodeBench 80,6 contre 90,7) et Terminal-Bench 2.0 (38,5 contre 54,2). La navigation web est un point faible : 45,4 à BrowseComp contre 54,9 pour GPT-5 High. Côté prix, Xiaomi communique 0,1 et 0,3 dollar par million de tokens ; l'éditeur écrit que ce coût représente environ 3,5 % de celui de Claude Sonnet 4.5 (annonce de l'éditeur, non vérifiée par un tiers). Pour le choix ouvert ou fermé, le modèle offre la souveraineté d'un déploiement interne sous licence MIT avec un niveau proche des modèles fermés de milieu de gamme sur le code d'agent, au prix d'un retard sur les tâches de connaissances pointues. ### À retenir MiMo-V2-Flash place un MoE de 15 milliards de paramètres actifs au niveau des modèles fermés de milieu de gamme sur SWE-Bench, à un tarif très bas et sous licence MIT. Son attention hybride à fenêtre glissante et son MTP sont les innovations à suivre pour réduire le coût des contextes longs.
Liens
Tags : LLM, Open Source, Xiaomi, MiMo, MIT, MoE, Agents