DeepSeek R1
2025-01-20 · Éditeur : DeepSeek · Domaine : Intelligence Artificielle
DeepSeek publie R1, un modèle de raisonnement de 671 milliards de paramètres (37 milliards actifs) sous licence MIT, dont les scores annoncés rejoignent ceux d'OpenAI o1, avec six modèles distillés.
Ce qui change
- Des performances annoncées par l'éditeur « on par with OpenAI-o1 » (au niveau d'OpenAI o1) sur les mathématiques, le code et le raisonnement, obtenues par apprentissage par renforcement à grande échelle en post-entraînement.
- Des poids et un rapport technique entièrement publiés, sous licence MIT : usage commercial, modification et distillation autorisés.
- Un changement de licence explicite : les sorties du modèle peuvent être exploitées pour entraîner d'autres modèles.
- Six modèles distillés (Qwen 1,5B, 7B, 14B, 32B et Llama 8B, 70B), dont les variantes 32B et 70B sont annoncées au niveau d'OpenAI o1-mini.
- Un accès immédiat sur le site (bouton DeepThink) et par l'API sous l'identifiant deepseek-reasoner.
DeepSeek publie R1, un modèle de raisonnement de 671 milliards de paramètres (37 milliards actifs) sous licence MIT, dont les scores annoncés rejoignent ceux d'OpenAI o1, avec six modèles distillés. ### Contexte Fin 2024, les modèles de raisonnement à longue chaîne de pensée étaient l'apanage de l'offre fermée, avec OpenAI o1 comme référence. DeepSeek venait de publier V3 (décembre 2024), un modèle généraliste ouvert, et R1 en est la déclinaison spécialisée dans le raisonnement. L'enjeu de cette sortie est double : rapprocher un modèle ouvert des performances d'o1 et permettre à tous de réutiliser le modèle et ses sorties, y compris pour distiller de plus petits modèles. ### Ce que le modèle apporte - Des performances annoncées par l'éditeur « on par with OpenAI-o1 » (au niveau d'OpenAI o1) sur les mathématiques, le code et le raisonnement, obtenues par apprentissage par renforcement à grande échelle en post-entraînement. - Des poids et un rapport technique entièrement publiés, sous licence MIT : usage commercial, modification et distillation autorisés. - Un changement de licence explicite : les sorties du modèle peuvent être exploitées pour entraîner d'autres modèles. - Six modèles distillés (Qwen 1,5B, 7B, 14B, 32B et Llama 8B, 70B), dont les variantes 32B et 70B sont annoncées au niveau d'OpenAI o1-mini. - Un accès immédiat sur le site (bouton DeepThink) et par l'API sous l'identifiant `deepseek-reasoner`. ### Architecture et caractéristiques - Type : Mixture-of-Experts, 671 milliards de paramètres au total, 37 milliards activés par token. - Contexte : 128K tokens (fiche du modèle sur Hugging Face). - Modalités : texte. Nombre d'experts, données d'entraînement et date de coupure : non communiqués dans les sources consultées. - Licence : MIT pour le code et les poids, usage commercial autorisé. Les modèles distillés héritent des licences de leurs bases (Apache 2.0 pour les bases Qwen2.5, licences Llama pour les bases Llama). - Réglages recommandés par l'éditeur : température entre 0,5 et 0,7 (0,6 conseillé), pas de message système, instructions placées dans le message utilisateur. - Poids : huggingface.co/deepseek-ai/DeepSeek-R1. ### Coût et accès | API `deepseek-reasoner` (USD par million de tokens) | Prix | |---|---| | Entrée, cache présent | 0,14 | | Entrée, cache absent | 0,55 | | Sortie | 2,19 | Matériel requis pour l'auto-hébergement : non communiqué dans les sources consultées. ### Benchmarks | Benchmark | Claude-3.5-Sonnet | GPT-4o 0513 | OpenAI o1-mini | OpenAI o1-1217 | DeepSeek-R1 | |---|---|---|---|---|---| | MMLU (Pass@1) | 88,3 | 87,2 | 85,2 | 91,8 | 90,8 | | MMLU-Pro (EM) | 78,0 | 72,6 | 80,3 | non publié | 84,0 | | GPQA Diamond (Pass@1) | 65,0 | 49,9 | 60,0 | 75,7 | 71,5 | | AIME 2024 (Pass@1) | 16,0 | 9,3 | 63,6 | 79,2 | 79,8 | | MATH-500 (Pass@1) | 78,3 | 74,6 | 90,0 | 96,4 | 97,3 | | Codeforces (rating) | 717 | 759 | 1820 | 2061 | 2029 | | LiveCodeBench (Pass@1) | 33,8 | 34,2 | 53,8 | 63,4 | 65,9 | Source : fiche du modèle DeepSeek-R1 sur Hugging Face, scores mesurés et publiés par l'éditeur. ### Face aux modèles fermés Au moment de sa sortie, le modèle fermé de référence comparé par l'éditeur était OpenAI o1-1217. Dans le tableau, R1 est devant o1-1217 sur AIME 2024 (79,8 contre 79,2), MATH-500 (97,3 contre 96,4) et LiveCodeBench (65,9 contre 63,4). Il reste derrière sur MMLU (90,8 contre 91,8), GPQA Diamond (71,5 contre 75,7) et Codeforces (2029 contre 2061). Il devance nettement GPT-4o et Claude 3.5 Sonnet sur les tâches de raisonnement mathématique. Sur le prix, l'éditeur affiche 2,19 dollars par million de tokens de sortie, un tarif de l'API ouverte que le billet met en regard de l'offre d'OpenAI dans un visuel non repris ici. Le choix ouvert devient donc crédible pour du raisonnement : poids téléchargeables, licence MIT et possibilité de distillation. ### À retenir R1 est le premier modèle de raisonnement à poids ouverts présenté au niveau d'o1, avec une licence sans restriction commerciale. Il s'accompagne de six modèles distillés utilisables sur du matériel bien plus modeste que le modèle complet.
Liens
Tags : LLM, Open Source, DeepSeek, MIT, MoE, Raisonnement, Distillation