MiMo-7B

2025-04-30 · Éditeur : Xiaomi · Domaine : Intelligence Artificielle

Xiaomi publie MiMo-7B, sa première famille de modèles de langage à poids ouverts (MIT) : un 7 milliards de paramètres entraîné pour le raisonnement, au niveau d'o1-mini en mathématiques et en code.

Ce qui change

  • Un modèle pensé pour le raisonnement dès le pré-entraînement : pipeline de données amélioré pour augmenter la densité de motifs de raisonnement, plus données synthétiques de raisonnement, sur environ 25 000 milliards de tokens en trois étapes de mélange.
  • Prédiction de plusieurs tokens (MTP) ajoutée comme objectif d'entraînement, avec une couche MTP qui sert aussi au décodage spéculatif : Xiaomi indique un taux d'acceptation d'environ 90 %.
  • Apprentissage par renforcement sur 130 000 problèmes de mathématiques et de code vérifiables par des règles, avec uniquement des récompenses de justesse pour éviter le détournement de récompense, et une récompense de code pondérée par la difficulté des tests.
  • Infrastructure d'entraînement dédiée (Seamless Rollout Engine) : Xiaomi annonce un entraînement 2,29 fois plus rapide et une validation 1,96 fois plus rapide.
  • Quatre points de contrôle publiés : Base, SFT, RL-Zero (RL depuis la base) et RL (RL depuis le SFT), utiles pour la recherche.
  • Mise à jour du 30 mai 2025 (MiMo-7B-RL-0530) : jeu SFT porté d'environ 500 000 à 6 millions d'exemples et fenêtre de RL étendue de 32 000 à 48 000 tokens ; AIME 2024 passe de 68,2 à 80,1 selon la fiche.

Xiaomi publie MiMo-7B, sa première famille de modèles de langage à poids ouverts (MIT) : un 7 milliards de paramètres entraîné pour le raisonnement, au niveau d'o1-mini en mathématiques et en code. ### Contexte Début 2025, les modèles de raisonnement ouverts qui réussissaient l'apprentissage par renforcement en code et en mathématiques reposaient le plus souvent sur des bases de grande taille, autour de 32 milliards de paramètres, selon le rapport de Xiaomi. DeepSeek-R1 venait de montrer qu'un modèle ouvert pouvait rivaliser avec les modèles de raisonnement fermés d'OpenAI. Xiaomi, connu pour ses smartphones, entre avec ce modèle sur le terrain des modèles de langage ouverts et cherche à prouver qu'un petit modèle peut raisonner aussi bien qu'un plus grand. ### Ce que le modèle apporte - Un modèle pensé pour le raisonnement dès le pré-entraînement : pipeline de données amélioré pour augmenter la densité de motifs de raisonnement, plus données synthétiques de raisonnement, sur environ 25 000 milliards de tokens en trois étapes de mélange. - Prédiction de plusieurs tokens (MTP) ajoutée comme objectif d'entraînement, avec une couche MTP qui sert aussi au décodage spéculatif : Xiaomi indique un taux d'acceptation d'environ 90 %. - Apprentissage par renforcement sur 130 000 problèmes de mathématiques et de code vérifiables par des règles, avec uniquement des récompenses de justesse pour éviter le détournement de récompense, et une récompense de code pondérée par la difficulté des tests. - Infrastructure d'entraînement dédiée (Seamless Rollout Engine) : Xiaomi annonce un entraînement 2,29 fois plus rapide et une validation 1,96 fois plus rapide. - Quatre points de contrôle publiés : Base, SFT, RL-Zero (RL depuis la base) et RL (RL depuis le SFT), utiles pour la recherche. - Mise à jour du 30 mai 2025 (MiMo-7B-RL-0530) : jeu SFT porté d'environ 500 000 à 6 millions d'exemples et fenêtre de RL étendue de 32 000 à 48 000 tokens ; AIME 2024 passe de 68,2 à 80,1 selon la fiche. ### Architecture et caractéristiques - Taille : 7 milliards de paramètres, modèle dense ; pré-entraînement sur environ 25 000 milliards de tokens. - Modalités : texte. Langues, date de coupure des connaissances et longueur de contexte : non communiqués dans la fiche consultée. - Licence : MIT (usage commercial autorisé, sans seuil ni restriction géographique). - Poids : MiMo-7B-Base, MiMo-7B-SFT, MiMo-7B-RL-Zero, MiMo-7B-RL sur Hugging Face et ModelScope. ### Coût et accès Aucune tarification d'API n'est publiée dans les sources consultées pour ce modèle. Le modèle est destiné à l'auto-hébergement ; le matériel minimal n'est pas précisé par l'éditeur. | Élément | Information | | --- | --- | | API officielle | Tarif non communiqué | | Auto-hébergement | Modèle de 7 milliards de paramètres ; matériel requis non communiqué | | Licence | MIT | ### Benchmarks | Benchmark | MiMo-7B-RL | OpenAI o1-mini | GPT-4o-0513 | Claude 3.5 Sonnet 1022 | QwQ-32B-Preview (ouvert) | | --- | --- | --- | --- | --- | --- | | MATH-500 (Pass@1) | 95,8 | 90,0 | 74,6 | 78,3 | 90,6 | | AIME 2024 (Pass@1) | 68,2 | 63,6 | 9,3 | 16,0 | 50,0 | | AIME 2025 (Pass@1) | 55,4 | 50,7 | 11,6 | 7,4 | 32,4 | | LiveCodeBench v5 (Pass@1) | 57,8 | 53,8 | 32,9 | 38,9 | 41,9 | | GPQA Diamond (Pass@1) | 54,4 | 60,0 | 49,9 | 65,0 | 54,5 | | MMLU-Pro (EM) | 58,6 | 80,3 | 72,6 | 78,0 | 52,0 | | IF-Eval (Prompt Strict) | 61,0 | 84,8 | 84,3 | 86,5 | 40,4 | Source : fiche Hugging Face de MiMo-7B-RL. Scores mesurés par Xiaomi, les scores des modèles fermés étant repris dans le même tableau de la fiche ; aucune mesure tierce. ### Face aux modèles fermés Sur les épreuves de mathématiques et de code du tableau, MiMo-7B-RL dépasse o1-mini : 68,2 contre 63,6 à l'AIME 2024, 55,4 contre 50,7 à l'AIME 2025 et 57,8 contre 53,8 à LiveCodeBench v5. Il est nettement devant GPT-4o et Claude 3.5 Sonnet, qui ne sont pas des modèles de raisonnement, sur les mathématiques (par exemple 68,2 contre 9,3 et 16,0 à l'AIME 2024). En revanche, il reste en retrait sur les connaissances générales et le suivi d'instructions : 58,6 à MMLU-Pro contre 80,3 pour o1-mini, et 61,0 à IF-Eval contre 84,8 ; l'écart à GPQA Diamond est plus modeste (54,4 contre 60,0). Les modèles fermés comparés dans la fiche datent de 2024 ; ce n'est pas la génération de raisonnement la plus récente d'OpenAI à cette date. Pour une entreprise, l'intérêt tient à la taille : un modèle de 7 milliards de paramètres sous licence MIT peut être hébergé en interne pour des tâches de raisonnement ciblées, à condition d'accepter une couverture de connaissances plus faible. ### À retenir MiMo-7B montre, chiffres de l'éditeur à l'appui, qu'un petit modèle bien entraîné peut égaler o1-mini sur les mathématiques et le code. C'est un jalon de démonstration : la licence MIT et les quatre points de contrôle en font une base de recherche et de spécialisation, pas un modèle généraliste.

Liens

Tags : LLM, Open Source, Xiaomi, MiMo, MIT, Raisonnement, 7B