DeepSeek V3.1
2025-08-21 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle
DeepSeek publie V3.1, un modèle de 671 milliards de paramètres qui réunit en un seul jeu de poids un mode réflexion et un mode sans réflexion, avec de nettes avancées pour les agents de code et de recherche.
Ce qui change
- Une inférence hybride : la même architecture répond en mode réflexion ou sans réflexion selon le gabarit de conversation, et le bouton DeepThink bascule entre les deux.
- Une réflexion plus rapide : V3.1 en mode réflexion atteint ses réponses en moins de temps que R1-0528, selon le billet.
- De meilleures compétences d'agent : SWE-bench Verified en mode agent à 66,0 (contre 45,4 pour V3-0324) et Terminal-bench à 31,3 (contre 13,3).
- Une extension du contexte long sur la base V3 : 630 milliards de tokens pour la phase 32K (multipliée par 10) et 209 milliards pour la phase 128K (multipliée par 3,3), soit 840 milliards de tokens au total.
- Le format numérique UE8M0 FP8 pour les poids et les activations, présenté par l'éditeur comme compatible avec le format « microscaling » (détails dans DeepGEMM).
- Une prise en charge de l'API au format Anthropic et des appels de fonctions stricts en bêta.
DeepSeek publie V3.1, un modèle de 671 milliards de paramètres qui réunit en un seul jeu de poids un mode réflexion et un mode sans réflexion, avec de nettes avancées pour les agents de code et de recherche. ### Contexte Jusqu'alors, DeepSeek maintenait deux lignes distinctes : V3 pour le généraliste et R1 pour le raisonnement. V3.1 les fusionne. L'enjeu est d'éviter aux utilisateurs de choisir entre deux modèles et de préparer ce que l'éditeur appelle « l'ère des agents ». R1-0528 et V3-0324 servent de références internes pour mesurer le progrès. ### Ce que le modèle apporte - Une inférence hybride : la même architecture répond en mode réflexion ou sans réflexion selon le gabarit de conversation, et le bouton DeepThink bascule entre les deux. - Une réflexion plus rapide : V3.1 en mode réflexion atteint ses réponses en moins de temps que R1-0528, selon le billet. - De meilleures compétences d'agent : SWE-bench Verified en mode agent à 66,0 (contre 45,4 pour V3-0324) et Terminal-bench à 31,3 (contre 13,3). - Une extension du contexte long sur la base V3 : 630 milliards de tokens pour la phase 32K (multipliée par 10) et 209 milliards pour la phase 128K (multipliée par 3,3), soit 840 milliards de tokens au total. - Le format numérique UE8M0 FP8 pour les poids et les activations, présenté par l'éditeur comme compatible avec le format « microscaling » (détails dans DeepGEMM). - Une prise en charge de l'API au format Anthropic et des appels de fonctions stricts en bêta. ### Architecture et caractéristiques - Type : Mixture-of-Experts, 671 milliards de paramètres au total, 37 milliards activés par token. - Contexte : 128K tokens pour les deux modes. - Modalités : texte. Nombre d'experts, données de base et date de coupure : non communiqués dans les sources consultées. - Licence : MIT (code et poids), usage commercial autorisé. - Poids : huggingface.co/deepseek-ai/DeepSeek-V3.1 et DeepSeek-V3.1-Base. - Identifiants API : `deepseek-chat` (sans réflexion) et `deepseek-reasoner` (réflexion). ### Coût et accès | API (USD par million de tokens) | Prix à partir du 5 septembre 2025, 16 h UTC | |---|---| | Entrée, cache présent | 0,07 | | Entrée, cache absent | 0,56 | | Sortie | 1,68 | Le billet précise que la nouvelle grille remplace les tarifs et remises hors pointe précédents à cette date ; le tarif antérieur n'y est pas chiffré. Matériel d'auto-hébergement : non communiqué. ### Benchmarks | Benchmark | V3.1 sans réflexion | V3-0324 | V3.1 réflexion | R1-0528 | |---|---|---|---|---| | MMLU-Pro (EM) | 83,7 | 81,2 | 84,8 | 85,0 | | GPQA Diamond (Pass@1) | 74,9 | 68,4 | 80,1 | 81,0 | | LiveCodeBench (Pass@1) | 56,4 | 43,0 | 74,8 | 73,3 | | SWE Verified (mode agent) | 66,0 | 45,4 | non publié | 44,6 | | Terminal-bench | 31,3 | 13,3 | non publié | 5,7 | | AIME 2024 (Pass@1) | 66,3 | 59,4 | 93,1 | 91,4 | | BrowseComp | non publié | non publié | 30,0 | 8,9 | Source : fiche du modèle DeepSeek-V3.1 sur Hugging Face, scores publiés par l'éditeur. Ce tableau ne compare que des modèles DeepSeek. ### Face aux modèles fermés La source primaire ne contient aucun tableau comparatif avec un modèle fermé pour V3.1 : aucun écart chiffré ne peut donc être établi ici. Le billet se positionne plutôt par rapport aux propres modèles de l'éditeur : en mode réflexion, V3.1 égale ou dépasse R1-0528 sur LiveCodeBench (74,8 contre 73,3) et AIME 2024 (93,1 contre 91,4), tout en réfléchissant plus vite. Sur le prix, la grille du 5 septembre 2025 fixe la sortie à 1,68 dollar par million de tokens. Le choix ouvert prend ici la forme d'un seul modèle à déployer pour deux usages, sous licence MIT. ### À retenir V3.1 supprime la séparation entre modèle généraliste et modèle de raisonnement, ce qui simplifie l'hébergement et l'intégration. Ses gains sur les tâches d'agent en font le premier jalon agentique de la lignée DeepSeek.
Liens
Tags : LLM, Open Source, DeepSeek, MIT, MoE, Modèle hybride, Agents