DeepSeek V3.2-Exp

2025-09-29 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle

DeepSeek publie V3.2-Exp, version expérimentale qui introduit l'attention éparse DSA pour rendre le contexte long moins coûteux, à qualité équivalente à V3.1-Terminus, avec des prix API divisés par plus de deux.

Ce qui change

  • DeepSeek Sparse Attention : d'après l'éditeur, première attention éparse à granularité fine, avec des gains substantiels en entraînement et en inférence sur contexte long, pour une qualité de sortie « virtuellement identique ».
  • Une comparaison contrôlée : la configuration d'entraînement est alignée sur V3.1-Terminus pour isoler l'effet de l'attention éparse.
  • Des noyaux publiés en open source : TileLang pour la lisibilité, CUDA (DeepGEMM, FlashMLA) pour la performance.
  • Un support immédiat par vLLM dès le premier jour et des images Docker SGLang (H200, MI350, NPU).
  • Une baisse des prix de l'API de plus de 50 %, effective immédiatement.

DeepSeek publie V3.2-Exp, version expérimentale qui introduit l'attention éparse DSA pour rendre le contexte long moins coûteux, à qualité équivalente à V3.1-Terminus, avec des prix API divisés par plus de deux. ### Contexte V3.1-Terminus (22 septembre 2025) venait de stabiliser la lignée V3.1. V3.2-Exp est présenté comme une étape intermédiaire vers l'architecture de nouvelle génération : l'éditeur y teste des optimisations d'entraînement et d'inférence pour les longs contextes. L'enjeu est le coût de l'attention, qui croît avec la longueur de la séquence. ### Ce que le modèle apporte - DeepSeek Sparse Attention : d'après l'éditeur, première attention éparse à granularité fine, avec des gains substantiels en entraînement et en inférence sur contexte long, pour une qualité de sortie « virtuellement identique ». - Une comparaison contrôlée : la configuration d'entraînement est alignée sur V3.1-Terminus pour isoler l'effet de l'attention éparse. - Des noyaux publiés en open source : TileLang pour la lisibilité, CUDA (DeepGEMM, FlashMLA) pour la performance. - Un support immédiat par vLLM dès le premier jour et des images Docker SGLang (H200, MI350, NPU). - Une baisse des prix de l'API de plus de 50 %, effective immédiatement. ### Architecture et caractéristiques - Type : Mixture-of-Experts, 685 milliards de paramètres au total sur Hugging Face (base V3.1-Terminus, 671 milliards de paramètres dans la configuration d'inférence, 256 experts). - Innovation : DSA, sélection éparse des tokens à consulter par un indexeur. - Contexte : non repris dans la fiche consultée. Données d'entraînement, paramètres actifs et coupure : non communiqués. - Licence : MIT (code et poids), usage commercial autorisé. - Poids : huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp. - Correctif signalé le 17 novembre 2025 : une erreur de RoPE dans le module d'indexation du code de démonstration, corrigée dans le code d'inférence. ### Coût et accès | API (USD par million de tokens) | Avant | Depuis le 29 septembre 2025, 10 h UTC | |---|---|---| | Entrée, cache présent | 0,07 | 0,028 | | Entrée, cache absent | 0,56 | 0,28 | | Sortie | 1,68 | 0,42 | V3.1-Terminus est resté disponible via une API temporaire jusqu'au 15 octobre 2025, 15 h 59 UTC. Auto-hébergement : les commandes de référence utilisent 8 GPU (tp 8) ; mémoire exacte non communiquée. ### Benchmarks | Benchmark | V3.1-Terminus | V3.2-Exp | |---|---|---| | MMLU-Pro | 85,0 | 85,0 | | GPQA Diamond | 80,7 | 79,9 | | Humanity's Last Exam | 21,7 | 19,8 | | LiveCodeBench | 74,9 | 74,1 | | AIME 2025 | 88,4 | 89,3 | | Codeforces (rating) | 2046 | 2121 | | BrowseComp | 38,5 | 40,1 | | SWE Verified | 68,4 | 67,8 | | Terminal-bench | 36,7 | 37,7 | Source : fiche du modèle DeepSeek-V3.2-Exp sur Hugging Face, scores publiés par l'éditeur. Aucun modèle fermé n'y figure. ### Face aux modèles fermés La source ne contient aucune comparaison avec un modèle fermé, et aucune ne peut donc être chiffrée ici. Le message de l'éditeur porte sur l'efficacité : à scores quasi identiques à V3.1-Terminus (écarts de moins d'un point sur la plupart des lignes), le prix de sortie passe de 1,68 à 0,42 dollar par million de tokens, soit une division par quatre. Sur l'axe ouvert contre fermé, l'apport est donc économique : un contexte long moins coûteux à servir, y compris en auto-hébergement grâce aux noyaux publiés. L'éditeur présente lui-même la version comme expérimentale. ### À retenir V3.2-Exp est un jalon technique plus que de capacité : DSA est la brique reprise ensuite dans V3.2. La baisse de prix de plus de 50 % accompagne cette efficacité accrue.

Liens

Tags : LLM, Open Source, DeepSeek, MIT, MoE, Attention éparse, Contexte long