DeepSeek V3.2

2025-12-01 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle

DeepSeek publie V3.2 et V3.2-Speciale : le premier atteint le niveau de GPT-5 selon l'éditeur, la seconde rivalise avec Gemini 3 Pro et décroche l'or à l'IMO et à l'IOI 2025.

Ce qui change

  • Un modèle « quotidien » qui équilibre longueur de raisonnement et qualité, présenté au niveau de GPT-5 par l'éditeur.
  • V3.2-Speciale, variante à raisonnement maximal, annoncée au niveau de Gemini 3.0 Pro, avec des résultats de niveau or à l'IMO, aux CMO, à l'ICPC World Finals et à l'IOI 2025.
  • La réflexion directement intégrée à l'appel d'outils, utilisable en mode réflexion comme sans réflexion.
  • Une synthèse de données d'agents à grande échelle : plus de 1 800 environnements et plus de 85 000 instructions complexes.
  • Un cadre d'apprentissage par renforcement scalable et DSA repris de V3.2-Exp.
  • Publication des soumissions finales aux olympiades pour vérification par la communauté.

DeepSeek publie V3.2 et V3.2-Speciale : le premier atteint le niveau de GPT-5 selon l'éditeur, la seconde rivalise avec Gemini 3 Pro et décroche l'or à l'IMO et à l'IOI 2025. ### Contexte V3.2-Exp avait validé l'attention éparse DSA en septembre. V3.2 en est le successeur officiel, publié quelques jours après Gemini 3 Pro (novembre 2025) et après GPT-5 (août 2025), qui étaient alors les références fermées. L'enjeu est de montrer qu'un modèle ouvert peut tenir le rang de ces modèles en raisonnement et en usage d'outils. ### Ce que le modèle apporte - Un modèle « quotidien » qui équilibre longueur de raisonnement et qualité, présenté au niveau de GPT-5 par l'éditeur. - V3.2-Speciale, variante à raisonnement maximal, annoncée au niveau de Gemini 3.0 Pro, avec des résultats de niveau or à l'IMO, aux CMO, à l'ICPC World Finals et à l'IOI 2025. - La réflexion directement intégrée à l'appel d'outils, utilisable en mode réflexion comme sans réflexion. - Une synthèse de données d'agents à grande échelle : plus de 1 800 environnements et plus de 85 000 instructions complexes. - Un cadre d'apprentissage par renforcement scalable et DSA repris de V3.2-Exp. - Publication des soumissions finales aux olympiades pour vérification par la communauté. ### Architecture et caractéristiques - Type : Mixture-of-Experts, 685 milliards de paramètres au total (Hugging Face), même structure que V3.2-Exp. - Contexte : non repris dans les sources consultées. Données, coupure : non communiquées. - Licence : MIT (code et poids), usage commercial autorisé. - Nouveauté de format : pas de gabarit Jinja, mais un dossier d'encodage Python ; nouveau rôle `developer` réservé aux agents de recherche. - Speciale : raisonnement uniquement, sans appel d'outils. - Poids : huggingface.co/deepseek-ai/DeepSeek-V3.2 et DeepSeek-V3.2-Speciale. Réglages conseillés : température 1,0, top_p 0,95. ### Coût et accès | Élément | Détail | |---|---| | V3.2 (API) | Même usage que V3.2-Exp ; grille V3.2-Exp : 0,028 / 0,28 / 0,42 USD par million de tokens (cache présent / absent / sortie) | | V3.2-Speciale (API) | Point d'accès temporaire jusqu'au 15 décembre 2025, 15 h 59 UTC, « même tarif que V3.2 », sans appel d'outils | | Matériel | Non communiqué (voir dépôt V3.2-Exp) | ### Benchmarks | Benchmark | GPT-5 High | Gemini-3.0 Pro | Kimi-K2 Thinking | V3.2 Thinking | V3.2 Speciale | |---|---|---|---|---|---| | AIME 2025 | 94,6 | 95,0 | 94,5 | 93,1 | 96,0 | | HMMT Fév. 2025 | 88,3 | 97,5 | 89,4 | 92,5 | 99,2 | | IMOAnswerBench | 76,0 | 83,3 | 78,6 | 78,3 | 84,5 | | LiveCodeBench | 84,5 | 90,7 | 82,6 | 83,3 | 88,7 | | Codeforces (rating) | 2537 | 2708 | non publié | 2386 | 2701 | | GPQA Diamond | 85,7 | 91,9 | 84,5 | 82,4 | 85,7 | | Humanity's Last Exam | 26,3 | 37,7 | 23,9 | 25,1 | 30,6 | Source : tableau du billet officiel du 1er décembre 2025, scores mesurés et publiés par l'éditeur. ### Face aux modèles fermés Au moment de sa sortie, les modèles fermés de référence comparés par l'éditeur étaient GPT-5 High et Gemini 3.0 Pro. V3.2 Thinking est légèrement derrière GPT-5 High sur AIME 2025 (93,1 contre 94,6), LiveCodeBench (83,3 contre 84,5) et GPQA Diamond (82,4 contre 85,7). Speciale dépasse GPT-5 High sur AIME 2025 (96,0 contre 94,6), HMMT (99,2 contre 88,3), IMOAnswerBench (84,5 contre 76,0) et Humanity's Last Exam (30,6 contre 26,3). Face à Gemini 3.0 Pro, Speciale est devant sur AIME (96,0 contre 95,0) et HMMT (99,2 contre 97,5), derrière sur Codeforces (2701 contre 2708), GPQA (85,7 contre 91,9) et Humanity's Last Exam (30,6 contre 37,7). Le coût est le contrepoint : Speciale consomme davantage de tokens (par exemple 45k contre 18k pour Gemini sur IMOAnswerBench, indiqués dans le tableau de l'éditeur). Pour un choix ouvert, V3.2 offre un niveau annoncé proche de GPT-5 avec licence MIT. ### À retenir V3.2 est le premier modèle ouvert de la période à afficher, dans un tableau d'éditeur, des scores comparables à ceux des deux modèles fermés majeurs du moment. Les poids de Speciale publiés sur Hugging Face sont réservés au raisonnement pur, sans outils.

Liens

Tags : LLM, Open Source, DeepSeek, MIT, MoE, Raisonnement, Agents