Qwen3-2507 (Qwen3-235B-A22B Instruct et Thinking)
2025-07-21 · Éditeur : Alibaba · Domaine : Intelligence Artificielle
Alibaba Qwen publie Qwen3-235B-A22B-Instruct-2507 (21 juillet) puis Qwen3-235B-A22B-Thinking-2507 (25 juillet) : deux mises à jour du MoE 235B, avec contexte natif de 262 144 tokens, sous Apache 2.0.
Ce qui change
- Instruct-2507 accepte uniquement le mode direct et progresse en instruction, logique, mathématiques, sciences, code et outils.
- Thinking-2507 accepte uniquement le mode réflexion, avec une longueur de réflexion accrue ; l'éditeur le décrit comme état de l'art parmi les modèles de réflexion ouverts.
- Contexte natif de 262 144 tokens, extensible jusqu'à 1 010 000 tokens (mise à jour du 8 août 2025 selon le dépôt GitHub).
- Couverture de connaissances rares en plusieurs langues et alignement renforcé sur les tâches subjectives.
- La déclinaison 2507 a ensuite été étendue au 30B-A3B (30 et 31 juillet) et au 4B (6 août).
Alibaba Qwen publie Qwen3-235B-A22B-Instruct-2507 (21 juillet) puis Qwen3-235B-A22B-Thinking-2507 (25 juillet) : deux mises à jour du MoE 235B, avec contexte natif de 262 144 tokens, sous Apache 2.0. ### Contexte Trois mois après Qwen3, Qwen abandonne le mode hybride au profit de deux modèles spécialisés, l'un pour les réponses directes, l'autre pour le raisonnement long. La comparaison porte alors sur Claude Opus 4, GPT-4o, DeepSeek-V3-0324, Kimi K2, OpenAI o3 et o4-mini, Gemini 2.5 Pro et DeepSeek-R1-0528. ### Ce que le modèle apporte - Instruct-2507 accepte uniquement le mode direct et progresse en instruction, logique, mathématiques, sciences, code et outils. - Thinking-2507 accepte uniquement le mode réflexion, avec une longueur de réflexion accrue ; l'éditeur le décrit comme état de l'art parmi les modèles de réflexion ouverts. - Contexte natif de 262 144 tokens, extensible jusqu'à 1 010 000 tokens (mise à jour du 8 août 2025 selon le dépôt GitHub). - Couverture de connaissances rares en plusieurs langues et alignement renforcé sur les tâches subjectives. - La déclinaison 2507 a ensuite été étendue au 30B-A3B (30 et 31 juillet) et au 4B (6 août). ### Architecture et caractéristiques MoE de 235 milliards de paramètres au total, 22 milliards actifs, 94 couches, 128 experts dont 8 actifs, attention GQA 64 têtes de requête pour 4 de clé-valeur. Licence Apache 2.0. Date de coupure : non communiquée. Les deux modèles ont été mis en ligne sur Hugging Face les 21 et 25 juillet 2025. ### Coût et accès | Élément | Valeur | |---|---| | Poids | Gratuits, Apache 2.0 | | API Alibaba Cloud Instruct-2507 (tarif actuel consulté) | 0,23 $ entrée / 0,92 $ sortie par million de tokens | | API Alibaba Cloud Thinking-2507 (tarif actuel consulté) | 0,23 $ entrée / 2,3 $ sortie par million de tokens | ### Benchmarks Instruct-2507, fiche Hugging Face (mesures de l'éditeur). | Benchmark | GPT-4o-0327 | Claude Opus 4 (sans réflexion) | Qwen3-235B-A22B (ancien mode direct) | Instruct-2507 | |---|---|---|---|---| | GPQA | 66,9 | 74,9 | 62,9 | 77,5 | | AIME25 | 26,7 | 33,9 | 24,7 | 70,3 | | LiveCodeBench v6 | 35,8 | 44,6 | 32,9 | 51,8 | | Arena-Hard v2 | 61,9 | 51,5 | 52,0 | 79,2 | | MMLU-Pro | 79,8 | 86,6 | 75,2 | 83,0 | Thinking-2507, fiche Hugging Face (mesures de l'éditeur). | Benchmark | OpenAI o3 | Gemini 2.5 Pro | Claude Opus 4 (réflexion) | Thinking-2507 | |---|---|---|---|---| | GPQA | 83,3 | 86,4 | 79,6 | 81,1 | | AIME25 | 88,9 | 88,0 | 75,5 | 92,3 | | HMMT25 | 77,5 | 82,5 | 58,3 | 83,9 | | LiveCodeBench v6 | 58,6 | 72,5 | 48,9 | 74,1 | | Arena-Hard v2 | 80,8 | 72,5 | 59,1 | 79,7 | ### Face aux modèles fermés En mode direct, Instruct-2507 dépasse GPT-4o-0327 sur chaque ligne du tableau et dépasse Claude Opus 4 sans réflexion sur GPQA (77,5 contre 74,9), AIME25 et LiveCodeBench v6, mais reste derrière sur MMLU-Pro (83,0 contre 86,6). En mode réflexion, le modèle ouvert est devant o3 et Gemini 2.5 Pro sur AIME25 (92,3 contre 88,9 et 88,0) et sur LiveCodeBench v6 (74,1 contre 72,5 pour Gemini), mais en retrait sur GPQA (81,1 contre 86,4 pour Gemini). Ces chiffres sont publiés par l'éditeur avec ses propres protocoles ; la fiche signale que certains scores de concurrents proviennent de ses propres évaluations. Le tarif de l'API d'Alibaba est indiqué plus haut ; aucune comparaison de prix sourcée avec les API fermées n'est établie ici. ### À retenir Qwen3-2507 montre le gain obtenu en spécialisant chaque mode. Le MoE 235B devient un modèle ouvert au niveau des meilleurs modèles fermés de l'été 2025 sur le raisonnement mathématique et le code.
Liens
Tags : LLM, Open Source, Alibaba, Qwen, MoE, Apache 2.0, Raisonnement