DeepSeek V4 Pro (version finale)
2026-08-13 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle
DeepSeek publie la version finale de V4-Pro (V4-Pro-0813), avec des capacités d'agent nettement renforcées, trois niveaux d'effort de réflexion et une grille tarifaire avec tarifs de pointe et hors pointe.
Ce qui change
- Des capacités d'agent fortement accrues, avec des gains marqués en environnement de production selon l'éditeur.
- Trois niveaux d'effort de réflexion (low, high, max), applicables à V4-Pro et V4-Flash.
- La prise en charge native de l'API Responses d'OpenAI, adaptée à Codex avec un script de configuration en un clic.
- Un module de décodage spéculatif DSpark intégré, avec support vLLM et SGLang, pour accélérer la génération.
- Une disponibilité sur l'application et le site (« Mode Expert ») et par l'API, sous le même identifiant deepseek-v4-pro.
DeepSeek publie la version finale de V4-Pro (V4-Pro-0813), avec des capacités d'agent nettement renforcées, trois niveaux d'effort de réflexion et une grille tarifaire avec tarifs de pointe et hors pointe. ### Contexte La préversion d'avril avait placé V4-Pro près des modèles fermés sur le raisonnement, mais en retrait sur les tâches d'agent longues. Entre-temps, V4-Flash avait reçu une version post-entraînée le 31 juillet (V4-Flash-0731). V4-Pro-0813 remplace la préversion et vise les usages en production : agents de code, appels d'outils, automatisation. ### Ce que le modèle apporte - Des capacités d'agent fortement accrues, avec des gains marqués en environnement de production selon l'éditeur. - Trois niveaux d'effort de réflexion (low, high, max), applicables à V4-Pro et V4-Flash. - La prise en charge native de l'API Responses d'OpenAI, adaptée à Codex avec un script de configuration en un clic. - Un module de décodage spéculatif DSpark intégré, avec support vLLM et SGLang, pour accélérer la génération. - Une disponibilité sur l'application et le site (« Mode Expert ») et par l'API, sous le même identifiant `deepseek-v4-pro`. ### Architecture et caractéristiques - Type : Mixture-of-Experts, même structure que V4-Pro (1,6 billion de paramètres au total, 49 milliards actifs, contexte d'un million de tokens) ; Hugging Face affiche 1,7 T avec le module DSpark. - Contexte : 1 M ; sortie maximale de 384K tokens (page des tarifs). - Licence : MIT (code et poids), usage commercial autorisé. - Poids : huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813. - Déploiement : la fiche cite un nœud unique de 4 GPU GB300 avec vLLM. Réglages : température 1,0, top_p 0,95 pour les agents, sortie maximale de 384K pour les niveaux high et max. ### Coût et accès | API (USD par million de tokens) | Entrée, cache présent | Entrée, cache absent | Sortie | |---|---|---|---| | V4-Pro, hors pointe | 0,022 | 0,66 | 1,98 | | V4-Pro, pointe | 0,044 | 1,32 | 3,96 | | V4-Flash, hors pointe | 0,007 | 0,22 | 0,66 | | V4-Flash, pointe | 0,014 | 0,44 | 1,32 | Tarifs effectifs le 16 août 2026 à 16 h UTC ; heures de pointe de 01 h à 04 h et de 06 h à 10 h UTC en semaine, le reste étant hors pointe. Le billet annonce des tarifs hors pointe inférieurs de moitié à ceux de pointe. ### Benchmarks | Benchmark | V4-Pro-0813 | V4-Pro préversion | GLM-5.2 | Kimi K3 | Opus-4.8 | Fable-5 (avec repli) | |---|---|---|---|---|---|---| | HLE sans / avec outils | 42,7 / 60,0 | 37,7 / 48,2 | 40,5 / 54,7 | 43,5 / 56,0 | 49,8 / 57,9 | 53,3 / 63,0 | | Terminal Bench 2.1 | 87,9 | 72,1 | 81,0 | 88,3 | 85,0 | 88,0 | | NL2Repo | 61,5 | 38,5 | 48,9 | non publié | 69,7 | non publié | | CyberGym | 83,3 | 52,7 | non publié | 80,0 | 78,3 | 83,1 | | DeepSWE | 62,7 | 12,8 | 46,2 | 67,5 | 58,0 | 70,0 | | Toolathlon-Verified | 74,1 | 55,9 | 59,9 | 76,5 | 76,2 | 77,9 | Source : fiche du modèle DeepSeek-V4-Pro-0813 sur Hugging Face, scores mesurés par l'éditeur (cadre DeepSeek Harness, effort max). ### Face aux modèles fermés Les modèles fermés comparés par l'éditeur sont Opus 4.8 et Fable 5 (avec repli). V4-Pro-0813 dépasse Opus 4.8 sur Terminal Bench 2.1 (87,9 contre 85,0), CyberGym (83,3 contre 78,3) et DeepSWE (62,7 contre 58,0). Il reste derrière Opus 4.8 sur Humanity's Last Exam sans outils (42,7 contre 49,8) et sur NL2Repo (61,5 contre 69,7), et derrière Fable 5 sur DeepSWE (62,7 contre 70,0). Le progrès par rapport à la préversion est considérable sur l'agent : DeepSWE passe de 12,8 à 62,7 et Terminal Bench de 72,1 à 87,9. Les tarifs des modèles fermés n'étant pas dans la source, l'écart de prix n'est pas chiffré ; l'éditeur affiche 1,98 dollar par million de tokens de sortie hors pointe. ### À retenir Cette version finale corrige le principal point faible de V4-Pro : l'agent en conditions réelles. Elle introduit aussi un tarif variable selon l'heure, qui change la façon de planifier les charges de travail.
Liens
Tags : LLM, Open Source, DeepSeek, MIT, MoE, Agents, Contexte 1M