Qwen3
2025-04-29 · Éditeur : Alibaba · Domaine : Intelligence Artificielle
Alibaba Qwen publie Qwen3, huit modèles à poids ouverts sous Apache 2.0 (deux MoE, 235B-A22B et 30B-A3B, et six denses de 0,6B à 32B) qui combinent mode de réflexion et mode direct dans un même modèle.
Ce qui change
- Modes hybrides : un mode de réflexion (raisonnement pas à pas) et un mode non-réflexion (réponse rapide), commutables par enable_thinking ou par les balises /think et /no_think, avec un budget de réflexion réglable.
- Pré-entraînement sur environ 36 000 milliards de tokens dans 119 langues et dialectes, contre 18 000 milliards pour Qwen2.5 ; les PDF sont extraits avec Qwen2.5-VL et des données synthétiques mathématiques et code sont produites avec Qwen2.5-Math et Qwen2.5-Coder.
- Trois étapes de pré-entraînement : plus de 30 000 milliards de tokens à 4 000 tokens de contexte, 5 000 milliards de tokens plus riches en STEM et code, puis extension du contexte à 32 000 tokens.
- Post-entraînement en quatre étapes : démarrage à froid en longue chaîne de raisonnement, renforcement sur le raisonnement, fusion des modes, renforcement général sur plus de 20 tâches.
- Efficacité : les modèles de base MoE égalent des modèles denses Qwen2.5 avec 10 % des paramètres actifs, et Qwen3-4B est annoncé au niveau de Qwen2.5-72B-Instruct.
Alibaba Qwen publie Qwen3, huit modèles à poids ouverts sous Apache 2.0 (deux MoE, 235B-A22B et 30B-A3B, et six denses de 0,6B à 32B) qui combinent mode de réflexion et mode direct dans un même modèle. ### Contexte Qwen2.5 (septembre 2024) alignait des modèles denses et un modèle de raisonnement séparé, QwQ. Au printemps 2025, les modèles de raisonnement (o1, DeepSeek-R1, Gemini 2.5 Pro) imposaient deux familles de modèles distinctes selon l'usage. Qwen3 vise à les unifier et à ouvrir toute la gamme, du modèle de 0,6 milliard de paramètres au MoE de 235 milliards. ### Ce que le modèle apporte - Modes hybrides : un mode de réflexion (raisonnement pas à pas) et un mode non-réflexion (réponse rapide), commutables par `enable_thinking` ou par les balises /think et /no_think, avec un budget de réflexion réglable. - Pré-entraînement sur environ 36 000 milliards de tokens dans 119 langues et dialectes, contre 18 000 milliards pour Qwen2.5 ; les PDF sont extraits avec Qwen2.5-VL et des données synthétiques mathématiques et code sont produites avec Qwen2.5-Math et Qwen2.5-Coder. - Trois étapes de pré-entraînement : plus de 30 000 milliards de tokens à 4 000 tokens de contexte, 5 000 milliards de tokens plus riches en STEM et code, puis extension du contexte à 32 000 tokens. - Post-entraînement en quatre étapes : démarrage à froid en longue chaîne de raisonnement, renforcement sur le raisonnement, fusion des modes, renforcement général sur plus de 20 tâches. - Efficacité : les modèles de base MoE égalent des modèles denses Qwen2.5 avec 10 % des paramètres actifs, et Qwen3-4B est annoncé au niveau de Qwen2.5-72B-Instruct. ### Architecture et caractéristiques | Modèle | Type | Contexte | |---|---|---| | Qwen3-235B-A22B | MoE, 235 Md total, 22 Md actifs, 128 experts (8 actifs), 94 couches | 128 K | | Qwen3-30B-A3B | MoE, 30 Md total, 3 Md actifs, 128 experts (8 actifs), 48 couches | 128 K | | Qwen3-32B, 14B, 8B | Denses | 128 K | | Qwen3-4B, 1.7B, 0.6B | Denses | 32 K | Licence Apache 2.0 (usage commercial autorisé, sans seuil). Poids sur Hugging Face, ModelScope et Kaggle ; rapport technique arXiv 2505.09388. Date de coupure : non communiquée. ### Coût et accès | Élément | Valeur | |---|---| | Poids | Gratuits, Apache 2.0 | | API Alibaba Cloud qwen3-235b-a22b (tarif actuel consulté, non celui du lancement) | 0,7 $ entrée / 2,8 $ sortie (non-réflexion), 8,4 $ sortie (réflexion) par million de tokens | | Matériel requis | Non communiqué par le blog | ### Benchmarks Qwen3-235B-A22B en mode réflexion, tableau du rapport technique (mesures de l'éditeur). | Benchmark | OpenAI-o1 | Grok-3 Beta | Gemini 2.5 Pro | Qwen3-235B-A22B | |---|---|---|---|---| | AIME'24 | 74,3 | 83,9 | 92,0 | 85,7 | | AIME'25 | 79,2 | 77,3 | 86,7 | 81,5 | | LiveCodeBench v5 | 63,9 | 70,6 | 70,4 | 70,7 | | CodeForces (Elo) | 1891 | non publié | 2001 | 2056 | | GPQA-Diamond | 78,0 | 80,2 | 84,0 | 71,1 | | BFCL v3 | 67,8 | non publié | 62,9 | 70,8 | | Arena-Hard | 92,1 | non publié | 96,4 | 95,6 | Source : rapport technique Qwen3 (arXiv 2505.09388), mesures de l'éditeur. En mode non-réflexion, le même rapport donne Arena-Hard à 96,1 pour Qwen3-235B-A22B contre 85,3 pour GPT-4o-2024-11-20. ### Face aux modèles fermés Face à Gemini 2.5 Pro, Qwen3-235B-A22B est derrière sur AIME'24 (85,7 contre 92,0), GPQA-Diamond (71,1 contre 84,0) et Arena-Hard (95,6 contre 96,4), mais devant sur LiveCodeBench v5 (70,7 contre 70,4), CodeForces (2056 contre 2001) et BFCL v3 (70,8 contre 62,9). Face à OpenAI-o1, il est devant sur AIME'24, AIME'25, le code et les appels d'outils, et en retrait sur GPQA-Diamond (71,1 contre 78,0). En mode direct, il dépasse GPT-4o-2024-11-20 sur les quatre tests mathématiques et code du tableau du rapport (par exemple LiveCodeBench v5, 35,3 contre 32,7). Ces chiffres sont ceux de l'éditeur. Le principal apport pratique est la licence Apache 2.0 sur toute la gamme, qui permet l'auto-hébergement sans redevance. ### À retenir Qwen3 est le jalon qui unifie réflexion et réponse directe dans un modèle ouvert et étend l'ouverture à toute la gamme de tailles. Un choix par tâche du mode de réflexion permet d'arbitrer coût et qualité sans changer de modèle.
Liens
Tags : LLM, Open Source, Alibaba, Qwen, MoE, Apache 2.0, Raisonnement