Kimi-VL (A3B Instruct et Thinking)

2025-04-10 · Éditeur : Moonshot AI · Domaine : Intelligence Artificielle

Moonshot AI publie Kimi-VL, un modèle vision-langage MoE de 16 milliards de paramètres (2,8 milliards actifs dans le décodeur), avec une variante de raisonnement, sous licence MIT et contexte de 128K.

Ce qui change

  • Encodeur visuel MoonViT à résolution native, qui traite les images très haute résolution sans les découper à taille fixe.
  • Décodeur MoE avec seulement 2,8 milliards de paramètres actifs, pour un coût d'inférence réduit.
  • Contexte de 128K tokens pour documents et vidéos longs (64,5 à LongVideoBench et 35,1 à MMLongBench-Doc, selon la carte).
  • Variante Thinking obtenue par fine-tuning à chaîne de pensée longue puis RL, avec 61,7 à MMMU, 36,8 à MathVision et 71,3 à MathVista.
  • Version 2506 : 56,9 à MathVision, 80,1 à MathVista, images jusqu'à 3,2 millions de pixels et environ 20 % de réflexion en moins (selon l'éditeur).

Moonshot AI publie Kimi-VL, un modèle vision-langage MoE de 16 milliards de paramètres (2,8 milliards actifs dans le décodeur), avec une variante de raisonnement, sous licence MIT et contexte de 128K. ### Contexte Au printemps 2025, les modèles vision-langage ouverts les plus capables (Qwen2.5-VL 72B, Gemma 3) sont denses et lourds à déployer. Moonshot AI propose une alternative MoE légère, alignée sur la piste initiée par Kimi k1.5 (raisonnement multimodal). Une version améliorée, Kimi-VL-A3B-Thinking-2506, suivra en juin 2025 : elle est regroupée dans cette fiche. ### Ce que le modèle apporte - Encodeur visuel MoonViT à résolution native, qui traite les images très haute résolution sans les découper à taille fixe. - Décodeur MoE avec seulement 2,8 milliards de paramètres actifs, pour un coût d'inférence réduit. - Contexte de 128K tokens pour documents et vidéos longs (64,5 à LongVideoBench et 35,1 à MMLongBench-Doc, selon la carte). - Variante Thinking obtenue par fine-tuning à chaîne de pensée longue puis RL, avec 61,7 à MMMU, 36,8 à MathVision et 71,3 à MathVista. - Version 2506 : 56,9 à MathVision, 80,1 à MathVista, images jusqu'à 3,2 millions de pixels et environ 20 % de réflexion en moins (selon l'éditeur). ### Architecture et caractéristiques 16 milliards de paramètres au total et 3 milliards activés (2,8 B dans le décodeur), encodeur MoonViT, contexte de 128K. Variantes : Kimi-VL-A3B-Instruct et Kimi-VL-A3B-Thinking (puis Thinking-2506). Licence : MIT. Poids : huggingface.co/moonshotai/Kimi-VL-A3B-Thinking. Rapport : arXiv 2504.07491. ### Coût et accès | Élément | Détail | |---|---| | API officielle à l'annonce | Non communiquée dans les sources consultées | | Auto-hébergement | Modèle de 16 B au total ; matériel requis non communiqué | | Licence | MIT | ### Benchmarks Variante Thinking, scores publiés par l'éditeur (carte du modèle), avec modèles fermés en référence. | Benchmark (Pass@1) | GPT-4o | OpenAI o1-1217 | Kimi-k1.5 | Kimi-VL-Thinking | |---|---|---|---|---| | MathVision (full) | 30,4 | non communiqué | 38,6 | 36,8 | | MathVista (mini) | 63,8 | 71,0 | 74,9 | 71,3 | | MMMU (val) | 69,1 | 77,3 | 70,0 | 61,7 | Source : carte Hugging Face de Kimi-VL-A3B-Thinking, mesures de l'éditeur. ### Face aux modèles fermés Sur MathVision et MathVista, la variante Thinking dépasse GPT-4o selon les chiffres de l'éditeur (36,8 contre 30,4 ; 71,3 contre 63,8), et se rapproche d'o1-1217 sur MathVista (71,3 contre 71,0). Elle reste en retrait sur MMMU (61,7 contre 69,1 pour GPT-4o et 77,3 pour o1-1217), un benchmark de connaissances générales où sa taille active pèse. Aucun tarif d'API n'étant communiqué, l'écart de coût ne peut pas être chiffré. Son intérêt pour l'entreprise est un VLM auto-hébergeable sous licence MIT, utile quand les images ne doivent pas quitter l'infrastructure. ### À retenir Kimi-VL est le VLM MoE ouvert de la famille, léger et sous licence MIT. Il montre que le raisonnement multimodal peut tenir dans un modèle à environ 3 milliards de paramètres actifs, avec des limites sur les connaissances générales. Les deux variantes (Instruct et Thinking) permettent de choisir entre perception rapide et raisonnement long.

Liens

Tags : LLM, Vision, Open Source, Moonshot AI, Kimi, MIT, MoE