Kimi Linear (48B-A3B)
2025-10-30 · Éditeur : Moonshot AI · Domaine : Intelligence Artificielle
Moonshot AI publie Kimi Linear, un MoE de 48 milliards de paramètres (3 milliards actifs) à attention hybride linéaire (Kimi Delta Attention), qui réduit le cache KV jusqu'à 75 % et accélère le décodage jusqu'à 6 fois.
Ce qui change
- Kimi Delta Attention (KDA) : raffinement du Gated DeltaNet avec un mécanisme de gating plus fin pour mieux exploiter la mémoire d'état finie.
- Architecture hybride avec 3 couches KDA pour 1 couche d'attention globale MLA.
- Selon l'éditeur, réduction du cache KV jusqu'à 75 % et débit de décodage jusqu'à 6 fois supérieur pour des contextes jusqu'à 1 million de tokens.
- Noyau KDA publié en open source dans la bibliothèque FLA.
- Cette brique devient la base de l'architecture de Kimi K3.
Moonshot AI publie Kimi Linear, un MoE de 48 milliards de paramètres (3 milliards actifs) à attention hybride linéaire (Kimi Delta Attention), qui réduit le cache KV jusqu'à 75 % et accélère le décodage jusqu'à 6 fois. ### Contexte L'attention complète coûte cher en mémoire (cache KV) et en temps de décodage quand le contexte grandit. Les architectures à attention linéaire promettent mieux, mais perdaient jusque-là en qualité face à l'attention complète. Moonshot AI publie fin octobre 2025 une architecture hybride qui prétend la dépasser à conditions égales d'entraînement. ### Ce que le modèle apporte - Kimi Delta Attention (KDA) : raffinement du Gated DeltaNet avec un mécanisme de gating plus fin pour mieux exploiter la mémoire d'état finie. - Architecture hybride avec 3 couches KDA pour 1 couche d'attention globale MLA. - Selon l'éditeur, réduction du cache KV jusqu'à 75 % et débit de décodage jusqu'à 6 fois supérieur pour des contextes jusqu'à 1 million de tokens. - Noyau KDA publié en open source dans la bibliothèque FLA. - Cette brique devient la base de l'architecture de Kimi K3. ### Architecture et caractéristiques 48B de paramètres au total, 3B actifs, contexte de 1M tokens, deux checkpoints (Base et Instruct) entraînés sur 5,7 T tokens. Texte uniquement. Licence : MIT. Poids : huggingface.co/moonshotai/Kimi-Linear-48B-A3B-Instruct. Rapport : arXiv 2510.26692. Environnement recommandé : Python 3.10 ou plus, PyTorch 2.6 ou plus, fla-core 0.4.0 ou plus. ### Coût et accès | Élément | Détail | |---|---| | API officielle | Aucune dans les sources consultées | | Auto-hébergement | Modèle de 48 B au total ; matériel requis non communiqué | | Licence | MIT | ### Benchmarks La carte du modèle et le rapport comparent Kimi Linear à une attention complète (MLA) de même taille, pas à des modèles fermés. Chiffres cités par l'éditeur : 51,0 à MMLU-Pro (4K de contexte) à vitesse comparable à l'attention complète ; 84,3 à RULER (128K) avec un gain de vitesse de 3,98 fois ; 6,3 fois plus rapide sur le temps par token de sortie (TPOT) à 1 M de tokens. | Mesure | Résultat annoncé (éditeur) | |---|---| | MMLU-Pro (4K) | 51,0 | | RULER (128K) | 84,3 (accélération 3,98x) | | TPOT à 1M de tokens | 6,3x plus rapide que MLA | | Cache KV | jusqu'à 75 % en moins | Source : carte Hugging Face de Kimi-Linear-48B-A3B-Instruct (mesures de l'éditeur). Aucun tableau comparatif avec un modèle fermé n'est publié. ### Face aux modèles fermés Cette fiche ne peut pas situer le modèle face aux modèles fermés : la source ne publie aucune comparaison de ce type, et à 3B de paramètres actifs il ne vise pas la même catégorie. Son intérêt est ailleurs, dans le coût de l'inférence à long contexte. Les gains de cache KV et de vitesse sont des annonces de l'éditeur mesurées contre l'attention complète de même taille. Pour un choix ouvert ou fermé, l'apport est indirect : l'architecture réapparaît dans Kimi K3, modèle beaucoup plus grand, où l'éditeur la cite comme fondement du prix compétitif de l'API. ### À retenir Kimi Linear est un jalon d'architecture : il valide une attention hybride linéaire à grande échelle et ouvre la voie à K3. Il s'adresse aux équipes qui travaillent sur les contextes très longs et l'efficacité d'inférence.
Liens
Tags : LLM, Open Source, Moonshot AI, Kimi, MIT, MoE, Attention linéaire