Kimi K2 Thinking
2025-11-06 · Éditeur : Moonshot AI · Domaine : Intelligence Artificielle
Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement agentique ouvert de 1000 milliards de paramètres, capable de 200 à 300 appels d'outils enchaînés et quantifié nativement en INT4.
Ce qui change
- Raisonnement pas à pas entrelacé avec des outils, stable sur 200 à 300 appels séquentiels sans intervention humaine.
- Quantification INT4 native (QAT, quantization-aware training) appliquée aux composants MoE en post-entraînement : environ 2 fois plus rapide en génération, résultats publiés en INT4.
- 44,9 % à Humanity's Last Exam (HLE) avec outils, 60,2 % à BrowseComp, 71,3 % à SWE-bench Verified selon l'éditeur.
- Mode « heavy » (agrégation de trajectoires) : 51,0 à HLE, 100 à AIME25.
- Baisse des prix d'entrée annoncée par la plateforme (jusqu'à 75 %) au moment de la sortie.
Moonshot AI publie Kimi K2 Thinking, un modèle de raisonnement agentique ouvert de 1000 milliards de paramètres, capable de 200 à 300 appels d'outils enchaînés et quantifié nativement en INT4. ### Contexte En novembre 2025, GPT-5 et Claude Sonnet 4.5 dominent le raisonnement avec outils, et les modèles ouverts de raisonnement sont encore en retrait. Kimi K2 Thinking prolonge Kimi K2 (juillet 2025) en mettant à l'échelle à la fois les tokens de réflexion et les appels d'outils. ### Ce que le modèle apporte - Raisonnement pas à pas entrelacé avec des outils, stable sur 200 à 300 appels séquentiels sans intervention humaine. - Quantification INT4 native (QAT, quantization-aware training) appliquée aux composants MoE en post-entraînement : environ 2 fois plus rapide en génération, résultats publiés en INT4. - 44,9 % à Humanity's Last Exam (HLE) avec outils, 60,2 % à BrowseComp, 71,3 % à SWE-bench Verified selon l'éditeur. - Mode « heavy » (agrégation de trajectoires) : 51,0 à HLE, 100 à AIME25. - Baisse des prix d'entrée annoncée par la plateforme (jusqu'à 75 %) au moment de la sortie. ### Architecture et caractéristiques MoE de 1T paramètres, 32B actifs, 61 couches, 384 experts dont 8 sélectionnés et 1 partagé, attention MLA, contexte de 256K, texte uniquement. Checkpoints au format compressed-tensors (INT4). Licence : MIT modifiée (mention « Kimi K2 » à afficher au-delà de 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenu mensuel). Poids : huggingface.co/moonshotai/Kimi-K2-Thinking. ### Coût et accès | Élément | Tarif (USD par million de tokens) | |---|---| | Entrée | 0,60 | | Entrée (cache touché) | 0,15 | | Sortie | 2,50 | Tarifs issus d'une source secondaire (OpenRouter, prix du fournisseur) : la plateforme officielle indique seulement une baisse de jusqu'à 75 % des prix d'entrée, et la page tarifs actuelle ne liste plus ce modèle (arrêté). Matériel : non communiqué. ### Benchmarks Scores publiés par l'éditeur (carte Hugging Face), avec réglages précisés dans les notes de la carte. Les valeurs marquées d'un astérisque dans la source sont des relectures de l'éditeur. | Benchmark | K2 Thinking | GPT-5 (High) | Claude Sonnet 4.5 (Thinking) | |---|---|---|---| | HLE, avec outils | 44,9 | 41,7 | 32,0 | | BrowseComp | 60,2 | 54,9 | 24,1 | | GPQA | 84,5 | 85,7 | 83,4 | | AIME25 sans outils | 94,5 | 94,6 | 87,0 | | SWE-bench Verified | 71,3 | 74,9 | 77,2 | | LiveCodeBench v6 | 83,1 | 87,0 | 64,0 | | Terminal-Bench (outils simulés) | 47,1 | 43,8 | 51,0 | Source : carte Hugging Face de Kimi-K2-Thinking (mesures de l'éditeur). ### Face aux modèles fermés Sur la recherche agentique et HLE avec outils, K2 Thinking devance GPT-5 (High) et Claude Sonnet 4.5 dans ce tableau (par exemple 60,2 contre 54,9 et 24,1 à BrowseComp). Il reste derrière sur le codage : 71,3 à SWE-bench Verified contre 74,9 et 77,2, et sur LiveCodeBench face à GPT-5. Sur GPQA et AIME25, il est proche de GPT-5. L'éditeur revendique un état de l'art sur HLE et BrowseComp ; aucun tiers n'est cité pour confirmer ces chiffres dans les sources consultées. Les poids ouverts et l'INT4 natif rendent l'auto-hébergement plus réaliste qu'un modèle de 1T en précision complète, sans que le matériel requis soit publié. ### À retenir Kimi K2 Thinking est un modèle ouvert affiché devant GPT-5 et Claude Sonnet 4.5 sur la recherche agentique, selon l'éditeur. Il met en avant l'INT4 natif comme moyen de rendre un trillion de paramètres exploitable.
Liens
Tags : LLM, Open Source, Moonshot AI, Kimi, MoE, MIT modifiée, Raisonnement, INT4