DeepSeek V4.1 Flash

2026-09-10 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle

DeepSeek publie V4.1-Flash, un MoE multimodal de 552 milliards de paramètres à architecture encodeur-décodeur causale, avec 8 milliards de paramètres actifs en lecture, 16 en génération, sous licence MIT.

Ce qui change

  • Une architecture encodeur-décodeur causale de 40 couches : le cache KV du décodeur est dérivé de l'état final de l'encodeur, ce qui limite l'activation à 8 milliards de paramètres à la lecture et 16 à la génération.
  • Une attention CSA2 avec trois modes par couche (Full, Reindex, Reuse), qui mutualise les indices d'attention éparse entre couches.
  • Une réduction du cache KV : environ 4 fois moins de cache global par token que V4-Flash (fiche), soit un quart de la mémoire HBM et un huitième du stockage SSD (billet).
  • Une vision native : un encodeur visuel DeepSeek-ViT et un projecteur traitent images et texte dès le pré-entraînement.
  • Un effort de raisonnement réglable en continu de 1 à 100.
  • Des composants annexes : mémoire conditionnelle Engram (196 milliards de paramètres), décodage spéculatif DSpark, mHC à passe unique.

DeepSeek publie V4.1-Flash, un MoE multimodal de 552 milliards de paramètres à architecture encodeur-décodeur causale, avec 8 milliards de paramètres actifs en lecture, 16 en génération, sous licence MIT. ### Contexte V4-Pro avait fixé le niveau de référence de la lignée. V4.1-Flash est présenté comme le plus petit modèle d'une nouvelle famille d'architecture, conçue pour un plafond de capacité plus élevé, une inférence plus rapide et un passage à des modèles plus grands. Il absorbe aussi V4-Flash et le modèle expérimental de vision V4-Flash-Vision-Exp (21 août 2026). Le 14 septembre 2026, les requêtes vers V4-Pro sont redirigées vers V4.1-Flash jusqu'au lancement de V4.1-Pro. ### Ce que le modèle apporte - Une architecture encodeur-décodeur causale de 40 couches : le cache KV du décodeur est dérivé de l'état final de l'encodeur, ce qui limite l'activation à 8 milliards de paramètres à la lecture et 16 à la génération. - Une attention CSA2 avec trois modes par couche (Full, Reindex, Reuse), qui mutualise les indices d'attention éparse entre couches. - Une réduction du cache KV : environ 4 fois moins de cache global par token que V4-Flash (fiche), soit un quart de la mémoire HBM et un huitième du stockage SSD (billet). - Une vision native : un encodeur visuel DeepSeek-ViT et un projecteur traitent images et texte dès le pré-entraînement. - Un effort de raisonnement réglable en continu de 1 à 100. - Des composants annexes : mémoire conditionnelle Engram (196 milliards de paramètres), décodage spéculatif DSpark, mHC à passe unique. ### Architecture et caractéristiques - Type : MoE multimodal, 552 milliards de paramètres de dorsale (Hugging Face affiche un total plus élevé avec les modules annexes), 1 expert partagé et 384 experts routés par couche, 6 actifs par token. - Contexte : 1 M tokens ; sortie maximale de 384K (page des tarifs). - Entrée : images et texte ; sortie : texte. - Pré-entraînement : 45 billions de tokens multimodaux, séquences de 64K puis extension à 1 M. - Licence : MIT (code et poids), usage commercial autorisé. - Poids : huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash. Rapport technique publié dans le dépôt. - Réglages : température 1,0, top_p 0,95 ou 1,0, sortie d'au moins 256K tokens. Matériel d'auto-hébergement : non communiqué. ### Coût et accès | API `deepseek-flash` (USD par million de tokens) | Entrée, cache présent | Entrée, cache absent | Sortie | |---|---|---|---| | Hors pointe | 0,003 | 0,15 | 0,6 | | Pointe | 0,006 | 0,3 | 1,2 | Effectif le 10 septembre 2026 à 04 h UTC ; pointe de 01 h à 04 h et de 06 h à 10 h UTC en semaine. Les identifiants `deepseek-v4-flash` et `deepseek-v4-flash-vision-exp` sont temporairement redirigés vers ce modèle. ### Benchmarks | Benchmark (effort max) | Opus-5.0 | GPT-5.6 Sol | Kimi K3 | V4-Pro | V4.1-Flash | |---|---|---|---|---|---| | GPQA Diamond | 93,4 | 94,1 | 92,9 | 92,4 | 90,9 | | Humanity's Last Exam | 56,3 | 44,5 | 43,5 | 42,7 | 36,8 | | Terminal-Bench 2.1 | 89,1 | 88,8 | 88,3 | 87,9 | 90,6 | | Terminal-Bench 3.0 | 43,3 | 34,4 | 17,7 | 11,8 | 30,0 | | DeepSWE v1.1 | 74,0 | 73,0 | 67,5 | 62,7 | 74,2 | | CyberGym | non publié | 84,5 | 80,0 | 83,3 | 88,1 | | HLE avec outils | 63,6 | non publié | 59,8 | 60,0 | 63,9 | | AutomationBench | 50,3 | 45,8 | 46,7 | 43,2 | 54,8 | Source : fiche du modèle DeepSeek-V4.1-Flash sur Hugging Face, scores mesurés et publiés par l'éditeur. ### Face aux modèles fermés Au moment de sa sortie, les modèles fermés comparés par l'éditeur sont Opus 5.0 et GPT-5.6 Sol. Sur les agents, V4.1-Flash est devant les deux sur Terminal-Bench 2.1 (90,6 contre 89,1 et 88,8), DeepSWE v1.1 (74,2 contre 74,0 et 73,0), CyberGym (88,1 contre 84,5) et AutomationBench (54,8 contre 50,3 et 45,8). Il reste derrière sur GPQA Diamond (90,9 contre 93,4 et 94,1), sur Humanity's Last Exam (36,8 contre 56,3 pour Opus 5.0) et nettement sur Terminal-Bench 3.0 (30,0 contre 43,3). L'écart de prix n'est pas chiffré, les tarifs des modèles fermés n'étant pas dans la source ; l'éditeur affiche 0,6 dollar par million de tokens de sortie hors pointe. L'éditeur affirme aussi que des tests de plusieurs parties placent V4.1-Flash devant V4-Pro en performance, coût, vitesse et durée totale. ### À retenir V4.1-Flash montre qu'un modèle ouvert plus petit et moins cher peut égaler ou dépasser les modèles fermés du moment sur plusieurs benchmarks d'agent. La réduction du cache KV cible directement le coût des agents, où le cache domine la facture.

Liens

Tags : LLM, Open Source, DeepSeek, MIT, MoE, Multimodal, Agents