Moonlight (Muon à grande échelle)
2025-02-22 · Éditeur : Moonshot AI · Domaine : Intelligence Artificielle
Moonshot AI publie Moonlight, un MoE de 16 milliards de paramètres (3 milliards actifs) entraîné avec l'optimiseur Muon, avec code, checkpoints et rapport technique sous licence MIT.
Ce qui change
- Deux ajustements pour passer Muon à l'échelle : un weight decay (décroissance des poids) et une amplitude de mise à jour (RMS) alignée entre matrices et autres paramètres.
- Selon les lois d'échelle de l'éditeur, Muon atteint la performance d'AdamW avec environ 52 % des FLOPs d'entraînement (environ 2 fois plus efficace en échantillons).
- Implémentation distribuée de Muon, économe en mémoire et en communication (style ZeRO-1), publiée en open source.
- Publication des checkpoints pré-entraînés, instruction-tuned et intermédiaires.
Moonshot AI publie Moonlight, un MoE de 16 milliards de paramètres (3 milliards actifs) entraîné avec l'optimiseur Muon, avec code, checkpoints et rapport technique sous licence MIT. ### Contexte En février 2025, l'optimiseur AdamW domine l'entraînement des grands modèles, et Muon n'a été validé que sur de petits modèles. Moonshot AI cherche à prouver qu'il passe à l'échelle. Moonlight applique cette idée à un MoE ouvert, et Kimi K2 est décrit par l'éditeur comme une mise à l'échelle de Moonlight. ### Ce que le modèle apporte - Deux ajustements pour passer Muon à l'échelle : un weight decay (décroissance des poids) et une amplitude de mise à jour (RMS) alignée entre matrices et autres paramètres. - Selon les lois d'échelle de l'éditeur, Muon atteint la performance d'AdamW avec environ 52 % des FLOPs d'entraînement (environ 2 fois plus efficace en échantillons). - Implémentation distribuée de Muon, économe en mémoire et en communication (style ZeRO-1), publiée en open source. - Publication des checkpoints pré-entraînés, instruction-tuned et intermédiaires. ### Architecture et caractéristiques MoE de 15,29 milliards de paramètres au total et 2,24 milliards actifs (hors embeddings, chiffres de la carte du modèle), entraîné sur 5,7 T tokens, contexte de 8K. Deux checkpoints : Moonlight-16B-A3B et Moonlight-16B-A3B-Instruct. Licence : MIT (usage commercial libre). Poids : huggingface.co/moonshotai/Moonlight-16B-A3B. Rapport : arXiv 2502.16982 (soumis le 2025-02-24). ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune | | Auto-hébergement | Modèle de 16 B au total ; matériel requis non communiqué | | Licence | MIT | ### Benchmarks La carte du modèle compare Moonlight uniquement à des modèles ouverts de taille similaire (scores publiés par l'éditeur). | Benchmark | Llama3.2-3B | Qwen2.5-3B | DeepSeek-V2-Lite | Moonlight | |---|---|---|---|---| | MMLU | 54,75 | 65,6 | 58,3 | 70,0 | | MMLU-Pro | 25,0 | 34,6 | 25,5 | 42,4 | | HumanEval | 28,0 | 42,1 | 29,9 | 48,1 | | MATH | 8,5 | 42,6 | 17,1 | 45,3 | | Tokens d'entraînement | 9T | 18T | 5,7T | 5,7T | Source : carte Hugging Face de Moonlight. Aucune comparaison avec un modèle fermé n'est publiée : tableau limité aux modèles ouverts. ### Face aux modèles fermés Moonlight n'est pas positionné contre les modèles fermés : sa taille (3 B actifs) le place dans la catégorie des petits modèles, et aucun tableau de la source ne le compare à GPT-4o ou à Claude. Son intérêt est méthodologique. À nombre de tokens égal (5,7T) avec DeepSeek-V2-Lite, il obtient de meilleurs scores selon l'éditeur, ce qui étaye l'idée d'un gain de Muon sur AdamW. Le choix ouvert ou fermé ne se pose pas ici : ce modèle sert de base de recherche et de validation d'un optimiseur. ### À retenir Moonlight est le maillon qui valide Muon pour la suite de la famille (MuonClip dans Kimi K2). Il intéresse surtout la recherche et l'entraînement, pas un déploiement en production. Les chiffres de la carte concernent des modèles ouverts de même taille, et le code de l'optimiseur est publié, ce qui permet de reproduire l'expérience.
Liens
Tags : LLM, Open Source, Moonshot AI, Kimi, MIT, MoE, Muon