QwQ-32B

2025-03-06 · Éditeur : Alibaba · Domaine : Intelligence Artificielle

Alibaba Qwen publie QwQ-32B, un modèle de raisonnement de 32 milliards de paramètres sous Apache 2.0, entraîné par apprentissage par renforcement et présenté comme comparable à DeepSeek-R1 (671 milliards de paramètres).

Ce qui change

  • Entraînement en deux étapes de renforcement à partir d'un point de départ à froid : d'abord mathématiques et code avec récompenses vérifiables (vérificateur de précision, serveur d'exécution de code), puis capacités générales avec un modèle de récompense et des vérificateurs à règles.
  • Parité annoncée avec DeepSeek-R1 (671 milliards de paramètres, dont 37 milliards actifs) pour 32 milliards de paramètres.
  • Capacités d'agent intégrées : appel d'outils et adaptation du raisonnement selon le retour de l'environnement.
  • Poids ouverts sous Apache 2.0, accessible aussi via Qwen Chat.

Alibaba Qwen publie QwQ-32B, un modèle de raisonnement de 32 milliards de paramètres sous Apache 2.0, entraîné par apprentissage par renforcement et présenté comme comparable à DeepSeek-R1 (671 milliards de paramètres). ### Contexte Début 2025, DeepSeek-R1 a montré qu'un raisonnement long obtenu par renforcement pouvait rivaliser avec les modèles fermés de raisonnement d'OpenAI. QwQ-32B répond avec un modèle bien plus petit, exécutable sur peu de GPU. Le blog cite o1-mini et les versions distillées de DeepSeek-R1 comme références. ### Ce que le modèle apporte - Entraînement en deux étapes de renforcement à partir d'un point de départ à froid : d'abord mathématiques et code avec récompenses vérifiables (vérificateur de précision, serveur d'exécution de code), puis capacités générales avec un modèle de récompense et des vérificateurs à règles. - Parité annoncée avec DeepSeek-R1 (671 milliards de paramètres, dont 37 milliards actifs) pour 32 milliards de paramètres. - Capacités d'agent intégrées : appel d'outils et adaptation du raisonnement selon le retour de l'environnement. - Poids ouverts sous Apache 2.0, accessible aussi via Qwen Chat. ### Architecture et caractéristiques Modèle dense de 32,5 milliards de paramètres, 64 couches, contexte de 131 072 tokens (fiche Hugging Face), architecture Qwen2.5 (RoPE, SwiGLU, RMSNorm, biais QKV). Langues et date de coupure : non communiquées dans les sources consultées. Licence Apache 2.0, usage commercial autorisé. Poids sur Hugging Face et ModelScope. ### Coût et accès | Élément | Valeur | |---|---| | Poids | Gratuits, Apache 2.0 | | API Alibaba Cloud (qwq-plus, tarif actuel consulté via la page de tarification, non celui du lancement) | 0,8 $ entrée / 2,4 $ sortie par million de tokens | | Matériel requis | Non communiqué par l'éditeur | ### Benchmarks Le blog présente les comparaisons (AIME24, LiveCodeBench, LiveBench, IFEval, BFCL) uniquement sous forme de graphique image, sans valeurs textuelles ; la fiche Hugging Face n'en donne pas non plus. Aucun tableau chiffré n'est donc reproduit ici. Les modèles comparés par l'éditeur sont DeepSeek-R1, ses versions distillées Qwen-32B et Llama-70B, et o1-mini. ### Face aux modèles fermés Le seul modèle fermé cité dans la comparaison de l'éditeur est o1-mini d'OpenAI ; l'éditeur annonce que QwQ-32B le dépasse ou l'égale sur la série de tests présentée, sans que les chiffres soient disponibles en texte. La revendication centrale est de parité avec DeepSeek-R1 avec environ vingt fois moins de paramètres totaux. Pour un choix ouvert ou fermé, cela signifie qu'un modèle de raisonnement peut tourner sur un ou quelques GPU, sous licence permissive. Faute de chiffres textuels vérifiés, l'ampleur exacte de l'écart avec les modèles fermés de raisonnement de mars 2025 n'est pas documentée ici. ### À retenir Le blog précise que les deux étapes de renforcement ont été menées sur un modèle de base déjà riche en connaissances du monde, ce qui explique selon l'éditeur l'efficacité de la méthode. Pour une entreprise, le point pratique est la combinaison licence Apache 2.0, taille de 32 milliards de paramètres et capacité d'agent. QwQ-32B est le jalon où Qwen démontre que le renforcement à grande échelle sur un modèle de base solide compense la taille. C'est un modèle de raisonnement déployable en interne pour un coût matériel modeste.

Liens

Tags : LLM, Open Source, Alibaba, Qwen, Raisonnement, Apache 2.0