DeepSeek R1-0528

2025-05-28 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle

DeepSeek publie R1-0528, une mise à niveau de R1 qui double la profondeur de raisonnement et fait passer AIME 2025 de 70,0 à 87,5, avec une version distillée dans Qwen3 8B.

Ce qui change

  • Une réflexion plus profonde : environ 23K tokens par question à AIME contre 12K pour la version précédente (fiche du modèle).
  • Des gains nets : GPQA Diamond de 71,5 à 81,0, LiveCodeBench de 63,5 à 73,3, SWE Verified de 49,2 à 57,6, HMMT 2025 de 41,7 à 79,4.
  • Un taux d'hallucination réduit, un appel de fonctions et une sortie JSON pris en charge, et une meilleure expérience pour le « vibe coding ».
  • Le message système est désormais accepté, et le forçage de la balise de réflexion n'est plus nécessaire.
  • Un modèle distillé, DeepSeek-R1-0528-Qwen3-8B, annoncé au meilleur niveau des modèles ouverts sur AIME 2024.

DeepSeek publie R1-0528, une mise à niveau de R1 qui double la profondeur de raisonnement et fait passer AIME 2025 de 70,0 à 87,5, avec une version distillée dans Qwen3 8B. ### Contexte Quatre mois après R1, le marché fermé avait avancé avec OpenAI o3 et Gemini 2.5 Pro. DeepSeek a répondu par une mise à jour de R1 plutôt que par un nouveau nom : même architecture, mais davantage de calcul en post-entraînement et de nouveaux mécanismes d'optimisation. L'enjeu est de maintenir un modèle ouvert au niveau des meilleurs modèles de raisonnement fermés. ### Ce que le modèle apporte - Une réflexion plus profonde : environ 23K tokens par question à AIME contre 12K pour la version précédente (fiche du modèle). - Des gains nets : GPQA Diamond de 71,5 à 81,0, LiveCodeBench de 63,5 à 73,3, SWE Verified de 49,2 à 57,6, HMMT 2025 de 41,7 à 79,4. - Un taux d'hallucination réduit, un appel de fonctions et une sortie JSON pris en charge, et une meilleure expérience pour le « vibe coding ». - Le message système est désormais accepté, et le forçage de la balise de réflexion n'est plus nécessaire. - Un modèle distillé, DeepSeek-R1-0528-Qwen3-8B, annoncé au meilleur niveau des modèles ouverts sur AIME 2024. ### Architecture et caractéristiques - Type : Mixture-of-Experts, 685 milliards de paramètres au total (valeur Hugging Face). Paramètres actifs et nombre d'experts : non repris dans la fiche consultée, qui indique l'architecture de R1. - Contexte : non communiqué ; la longueur maximale de génération utilisée pour les évaluations est de 64K tokens. - Modalités : texte. Données et date de coupure : non communiquées. - Licence : MIT, usage commercial et distillation expressément autorisés. - Poids : huggingface.co/deepseek-ai/DeepSeek-R1-0528, et DeepSeek-R1-0528-Qwen3-8B pour la version distillée. ### Coût et accès | Élément | Détail | |---|---| | API | Identifiant `deepseek-reasoner`, « aucun changement d'usage » | | Tarif à l'annonce | Non communiqué dans le billet (le tarif de R1 était de 0,14 / 0,55 / 2,19 USD par million de tokens) | | Matériel d'auto-hébergement | Non communiqué | ### Benchmarks | Benchmark | R1 (janvier) | R1-0528 | |---|---|---| | MMLU-Pro (EM) | 84,0 | 85,0 | | GPQA Diamond (Pass@1) | 71,5 | 81,0 | | Humanity's Last Exam (Pass@1) | 8,5 | 17,7 | | LiveCodeBench (Pass@1) | 63,5 | 73,3 | | SWE Verified | 49,2 | 57,6 | | AIME 2024 / 2025 | 79,8 / 70,0 | 91,4 / 87,5 | | HMMT 2025 | 41,7 | 79,4 | Pour la variante distillée (Qwen3-8B), la même fiche compare à des modèles fermés : | Modèle | AIME 24 | AIME 25 | HMMT Feb 25 | GPQA Diamond | LiveCodeBench | |---|---|---|---|---|---| | R1-0528-Qwen3-8B | 86,0 | 76,3 | 61,5 | 61,1 | 60,5 | | Gemini-2.5-Flash-Thinking-0520 | 82,3 | 72,0 | 64,2 | 82,8 | 62,3 | | o3-mini (medium) | 79,6 | 76,7 | 53,3 | 76,8 | 65,9 | Source : fiche du modèle DeepSeek-R1-0528 sur Hugging Face, scores publiés par l'éditeur. ### Face aux modèles fermés L'éditeur écrit que les performances de R1-0528 « approchent » celles d'o3 et de Gemini 2.5 Pro, sans que le tableau textuel de la fiche donne les scores de ces deux modèles (la comparaison est dans un graphique image). Les chiffres vérifiables portent sur la variante distillée de 8 milliards de paramètres : elle dépasse o3-mini (medium) sur AIME 2024 (86,0 contre 79,6) et Gemini 2.5 Flash Thinking sur AIME 2024 (86,0 contre 82,3). Elle reste en retrait sur GPQA Diamond (61,1 contre 76,8 pour o3-mini et 82,8 pour Gemini Flash). Le modèle complet gagne près de dix points sur GPQA en quatre mois. Cette profondeur se paie en tokens de sortie : 23K par question à AIME contre 12K auparavant. ### À retenir R1-0528 prouve qu'une mise à jour de post-entraînement peut faire passer un modèle ouvert d'un niveau à l'autre sans changer l'architecture. La version Qwen3 8B porte une partie de ce raisonnement vers un modèle de petite taille.

Liens

Tags : LLM, Open Source, DeepSeek, MIT, MoE, Raisonnement, Distillation