DeepSeek V4 Pro et V4 Flash

2026-04-24 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle

DeepSeek publie en préversion V4-Pro (1,6 billion de paramètres, 49 milliards actifs) et V4-Flash (284 milliards, 13 milliards actifs), tous deux avec un contexte d'un million de tokens, sous licence MIT.

Ce qui change

  • Une attention hybride associant Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA) : à 1 million de tokens, V4-Pro n'exige que 27 % des FLOPs par token et 10 % du cache KV de V3.2, selon la fiche du modèle.
  • Des connexions résiduelles renforcées (Manifold-Constrained Hyper-Connections, mHC) pour stabiliser la propagation du signal entre couches.
  • L'optimiseur Muon, choisi pour une convergence plus rapide et un entraînement plus stable.
  • Un post-entraînement en deux temps : experts par domaine (SFT et RL avec GRPO), puis fusion par distillation sur politique.
  • Trois modes de raisonnement (sans réflexion, réflexion élevée, réflexion maximale) sur les deux modèles.
  • Un contexte de 1 million de tokens désormais par défaut sur tous les services officiels.

DeepSeek publie en préversion V4-Pro (1,6 billion de paramètres, 49 milliards actifs) et V4-Flash (284 milliards, 13 milliards actifs), tous deux avec un contexte d'un million de tokens, sous licence MIT. ### Contexte V3.2 (décembre 2025) avait porté la lignée V3 au niveau annoncé des modèles fermés de l'époque. V4 change d'échelle et d'architecture. Au 24 avril 2026, les modèles fermés comparés par l'éditeur sont Claude Opus 4.6, GPT-5.4 et Gemini 3.1 Pro. L'enjeu est un contexte d'un million de tokens à un coût de calcul supportable, et un modèle ouvert capable d'agir en agent de code. ### Ce que le modèle apporte - Une attention hybride associant Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA) : à 1 million de tokens, V4-Pro n'exige que 27 % des FLOPs par token et 10 % du cache KV de V3.2, selon la fiche du modèle. - Des connexions résiduelles renforcées (Manifold-Constrained Hyper-Connections, mHC) pour stabiliser la propagation du signal entre couches. - L'optimiseur Muon, choisi pour une convergence plus rapide et un entraînement plus stable. - Un post-entraînement en deux temps : experts par domaine (SFT et RL avec GRPO), puis fusion par distillation sur politique. - Trois modes de raisonnement (sans réflexion, réflexion élevée, réflexion maximale) sur les deux modèles. - Un contexte de 1 million de tokens désormais par défaut sur tous les services officiels. ### Architecture et caractéristiques | | V4-Pro | V4-Flash | |---|---|---| | Paramètres totaux | 1,6 T | 284 B | | Paramètres actifs | 49 B | 13 B | | Tokens de pré-entraînement | 33 T (billet) | 32 T (billet) | | Contexte | 1 M | 1 M | | Précision | FP4 (experts MoE) + FP8 | FP4 (experts MoE) + FP8 | - Modalités : texte. Nombre d'experts et coupure : non communiqués dans les sources consultées. - Licence : MIT (code et poids), usage commercial autorisé. Versions de base (Base) également publiées. - Poids : collection huggingface.co/deepseek-ai/deepseek-v4. Rapport technique : arXiv 2606.19348. - Réglages : température 1,0, top_p 1,0 ; contexte d'au moins 384K conseillé pour le mode maximal. ### Coût et accès | API (USD par million de tokens) | Entrée, cache présent | Entrée, cache absent | Sortie | |---|---|---|---| | deepseek-v4-pro | 0,145 | 1,74 | 3,48 | | deepseek-v4-flash | 0,028 | 0,14 | 0,28 | Grille de lancement, remplacée le 16 août 2026 par une grille avec tarifs de pointe et hors pointe (voir la fiche de V4-Pro-0813). Les anciens identifiants `deepseek-chat` et `deepseek-reasoner` devaient être retirés trois mois plus tard (24 juillet 2026). Matériel d'auto-hébergement : non communiqué à l'exception d'un contexte conseillé de 384K. ### Benchmarks | Benchmark | Opus-4.6 Max | GPT-5.4 xHigh | Gemini-3.1-Pro High | V4-Pro Max | |---|---|---|---|---| | MMLU-Pro | 89,1 | 87,5 | 91,0 | 87,5 | | GPQA Diamond | 91,3 | 93,0 | 94,3 | 90,1 | | Humanity's Last Exam | 40,0 | 39,8 | 44,4 | 37,7 | | LiveCodeBench | 88,8 | non publié | 91,7 | 93,5 | | Codeforces (rating) | non publié | 3168 | 3052 | 3206 | | Terminal Bench 2.0 | 65,4 | 75,1 | 68,5 | 67,9 | | SWE Verified | 80,8 | non publié | 80,6 | 80,6 | | SWE Pro | 57,3 | 57,7 | 54,2 | 55,4 | | BrowseComp | 83,7 | 82,7 | 85,9 | 83,4 | | MRCR 1M | 92,9 | non publié | 76,3 | 83,5 | Source : fiche du modèle DeepSeek-V4-Pro sur Hugging Face, scores mesurés et publiés par l'éditeur. ### Face aux modèles fermés Au moment de sa sortie, l'éditeur compare V4-Pro Max à Claude Opus 4.6 Max, GPT-5.4 xHigh et Gemini 3.1 Pro High. V4-Pro est devant sur LiveCodeBench (93,5 contre 88,8 et 91,7) et Codeforces (3206 contre 3168 et 3052). Il est à égalité de niveau avec Gemini 3.1 Pro sur SWE Verified (80,6 des deux côtés) et proche d'Opus 4.6 (80,8). Il reste en retrait sur les connaissances (MMLU-Pro 87,5 contre 91,0 pour Gemini), sur GPQA Diamond (90,1 contre 94,3) et sur le contexte long (MRCR 1M à 83,5 contre 92,9 pour Opus 4.6). Le billet précise que V4-Pro ne suit que Gemini 3.1 Pro en connaissance du monde parmi les modèles comparés. Sur le prix, la sortie est facturée 3,48 dollars par million de tokens à l'annonce ; les tarifs des modèles fermés ne figurant pas dans les sources, l'écart n'est pas chiffré ici. ### À retenir V4 fait passer l'open source à l'ère du million de tokens par défaut et à des scores d'agent de code proches des meilleurs modèles fermés du moment. V4-Flash, environ douze fois moins cher en sortie que V4-Pro à l'annonce (0,28 contre 3,48 dollars), sert de modèle d'usage courant.

Liens

Tags : LLM, Open Source, DeepSeek, MIT, MoE, Contexte 1M, Agents