Kimi K3
2026-07-16 · Éditeur : Moonshot AI · Domaine : Intelligence Artificielle
Moonshot AI lance Kimi K3, un MoE de 2,8 billions de paramètres (104 milliards actifs) à contexte d'un million de tokens, présenté comme le premier modèle ouvert de classe 3T, avec poids publiés le 27 juillet 2026.
Ce qui change
- Changement d'architecture : Kimi Delta Attention (KDA) et Attention Residuals (AttnRes), avec un MoE de 896 experts dont 16 actifs (Stable LatentMoE). Environ 2,5 fois plus d'efficacité d'échelle que K2, selon l'éditeur.
- Contexte de 1 048 576 tokens, entrée texte, image et vidéo, raisonnement toujours actif (effort low, high ou max, max par défaut).
- Entraînement avec quantification MXFP4 (poids) et MXFP8 (activations) dès le fine-tuning supervisé.
- Cas de démonstration de l'éditeur : optimisation de noyaux GPU, compilateur type Triton (MiniTriton), conception d'une puce en 48 heures.
- Limites indiquées par l'éditeur : sensibilité à l'historique de réflexion (à renvoyer intégralement), tendance à trop d'initiative, écart d'expérience utilisateur avec Fable 5 et GPT 5.6 Sol.
Moonshot AI lance Kimi K3, un MoE de 2,8 billions de paramètres (104 milliards actifs) à contexte d'un million de tokens, présenté comme le premier modèle ouvert de classe 3T, avec poids publiés le 27 juillet 2026. ### Contexte En juillet 2026, les références fermées sont Claude Fable 5 et GPT 5.6 Sol, que Moonshot AI reconnaît elle-même comme plus puissants dans l'ensemble. K3 succède à K2.7 Code et K2.6 en changeant d'architecture : elle s'appuie sur Kimi Delta Attention (issue de Kimi Linear) et sur Attention Residuals. ### Ce que le modèle apporte - Changement d'architecture : Kimi Delta Attention (KDA) et Attention Residuals (AttnRes), avec un MoE de 896 experts dont 16 actifs (Stable LatentMoE). Environ 2,5 fois plus d'efficacité d'échelle que K2, selon l'éditeur. - Contexte de 1 048 576 tokens, entrée texte, image et vidéo, raisonnement toujours actif (effort low, high ou max, max par défaut). - Entraînement avec quantification MXFP4 (poids) et MXFP8 (activations) dès le fine-tuning supervisé. - Cas de démonstration de l'éditeur : optimisation de noyaux GPU, compilateur type Triton (MiniTriton), conception d'une puce en 48 heures. - Limites indiquées par l'éditeur : sensibilité à l'historique de réflexion (à renvoyer intégralement), tendance à trop d'initiative, écart d'expérience utilisateur avec Fable 5 et GPT 5.6 Sol. ### Architecture et caractéristiques 2,8T paramètres au total, 104B actifs, 93 couches (69 KDA et 24 MLA à gating), 896 experts, 16 sélectionnés, 2 partagés, dimension cachée 7168, vocabulaire de 160K, encodeur visuel MoonViT-V2 (401 M). Licence : « Kimi K3 License », permissive avec conditions : si le licencié ou ses affiliés exploitent une activité de modèle en service (Model as a Service) avec plus de 20 millions de dollars de revenu sur 12 mois, un accord séparé avec Moonshot AI est requis pour un usage commercial ; « Kimi K3 » doit être affiché au-delà de 100 millions d'utilisateurs mensuels ou 20 millions de dollars de revenu mensuel ; l'usage interne est exclu de ces contraintes. Poids : huggingface.co/moonshotai/Kimi-K3. Rapport technique dans le dépôt GitHub. Moteurs recommandés : vLLM, SGLang, TokenSpeed ; l'éditeur recommande des configurations de 64 accélérateurs ou plus. ### Coût et accès | Élément | Tarif (USD par million de tokens) | |---|---| | Entrée (cache manqué) | 3,00 | | Entrée (cache touché) | 0,30 | | Sortie | 15,00 | | Écriture de cache, 5 minutes | 3,00 | | Écriture de cache, 1 heure | 6,00 | Identifiant API : kimi-k3, compatible OpenAI et Anthropic. Matériel : supernœud de 64 accélérateurs ou plus recommandé par l'éditeur. ### Benchmarks Scores publiés par l'éditeur (carte Hugging Face, K3 en effort max), avec des harnais différents selon les benchmarks (Kimi Code, Claude Code, Codex). | Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | |---|---|---|---|---| | GPQA Diamond | 93,5 | 92,6 | 94,1 | 91,0 | | DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 | | Terminal-Bench 2.1 | 88,3 | 88,0 | 88,8 | 84,6 | | BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 | | OSWorld-Verified | 84,8 | 85,0 | 83,0 | 83,4 | | GDPval-AA v2 (Elo) | 1686 | 1747 | 1736 | 1593 | Source : carte Hugging Face de Kimi-K3 ; les chiffres des concurrents proviennent de leurs publications ou de classements tiers cités par l'éditeur. Fable 5 est signalé avec repli (fallback) sur certaines tâches. ### Face aux modèles fermés L'éditeur écrit lui-même que K3 reste derrière Claude Fable 5 et GPT 5.6 Sol dans l'ensemble. Le tableau le confirme sur DeepSWE (67,5 contre 70,0 et 73,0) et GDPval-AA (1686 contre 1747 et 1736), mais K3 est devant sur BrowseComp (91,2) et au niveau sur GPQA Diamond, Terminal-Bench 2.1 et OSWorld-Verified (écarts de moins de 1 point). Il dépasse nettement Claude Opus 4.8 sur presque toutes les lignes. Le tarif (3 et 15 USD) est publié ; aucun tarif de Fable 5 ni de GPT 5.6 Sol n'a été consulté ici, l'écart de prix n'est donc pas chiffré. La licence impose un accord au-delà de 20 millions de dollars de revenu pour un service de type API, ce qui limite la revente en modèle en service mais autorise l'usage interne. ### À retenir Kimi K3 est le plus grand modèle ouvert publié à cette date et se situe à quelques points des meilleurs modèles fermés sur plusieurs benchmarks d'agent, selon l'éditeur. La licence et le besoin d'un supernœud comptent autant que le niveau pour un déploiement en entreprise.
Liens
Tags : LLM, Open Source, Moonshot AI, Kimi, MoE, Licence Kimi K3, Multimodal, Agentique