Qwen3-Coder-Next
2026-02-03 · Éditeur : Alibaba · Domaine : Intelligence Artificielle
Alibaba (équipe Qwen) publie Qwen3-Coder-Next, un modèle de code à poids ouverts de 80 milliards de paramètres dont 3 milliards actifs, pensé pour les agents de code, sous Apache 2.0.
Ce qui change
- Rapport paramètres actifs / capacité : 80B au total pour 3B activés par token, ce qui vise des performances comparables à celles de modèles ayant 10 à 20 fois plus de paramètres actifs (affirmation de l'éditeur).
- Entraînement agentique : selon la model card, une recette dédiée (synthèse de tâches exécutables, interaction avec des environnements, apprentissage par renforcement) vise le raisonnement long, l'usage d'outils et la reprise après échec d'exécution.
- Intégration IDE / CLI : contexte de 256k tokens et adaptation à plusieurs gabarits d'outils (Claude Code, Qwen Code, Qoder, Kilo, Trae, Cline cités par l'éditeur).
- Mode sans réflexion uniquement : le modèle ne produit pas de blocs de raisonnement (<think>), ce qui simplifie l'usage en boucle d'agent.
- Un rapport technique a suivi sur arXiv (2603.00729, soumis le 28 février 2026), avec les versions Base et instruction en poids ouverts.
Alibaba (équipe Qwen) publie Qwen3-Coder-Next, un modèle de code à poids ouverts de 80 milliards de paramètres dont 3 milliards actifs, pensé pour les agents de code, sous Apache 2.0. ### Contexte Les modèles de code de la génération précédente (famille Qwen3-Coder) reposaient sur de grands MoE à attention classique. Début 2026, le marché des agents de code (Claude Code, Qwen Code, Cline, etc.) réclame des modèles capables de tourner à coût réduit sur des dépôts entiers. Qwen3-Coder-Next reprend l'architecture expérimentale Qwen3-Next (attention linéaire hybride) et l'oriente vers l'agentique. ### Ce que le modèle apporte - Rapport paramètres actifs / capacité : 80B au total pour 3B activés par token, ce qui vise des performances comparables à celles de modèles ayant 10 à 20 fois plus de paramètres actifs (affirmation de l'éditeur). - Entraînement agentique : selon la model card, une recette dédiée (synthèse de tâches exécutables, interaction avec des environnements, apprentissage par renforcement) vise le raisonnement long, l'usage d'outils et la reprise après échec d'exécution. - Intégration IDE / CLI : contexte de 256k tokens et adaptation à plusieurs gabarits d'outils (Claude Code, Qwen Code, Qoder, Kilo, Trae, Cline cités par l'éditeur). - Mode sans réflexion uniquement : le modèle ne produit pas de blocs de raisonnement (`<think>`), ce qui simplifie l'usage en boucle d'agent. - Un rapport technique a suivi sur arXiv (2603.00729, soumis le 28 février 2026), avec les versions Base et instruction en poids ouverts. ### Architecture et caractéristiques - Paramètres : 80B au total, 3B activés (79B hors embeddings) ; 48 couches ; disposition 12 x (3 x (Gated DeltaNet puis MoE) puis 1 x (Gated Attention puis MoE)). - MoE : 512 experts, 10 activés plus 1 partagé, dimension intermédiaire d'expert de 512. - Contexte : 262 144 tokens en natif. Texte uniquement. - Licence : Apache 2.0 (usage commercial libre, sans seuil d'utilisateurs). - Poids : Hugging Face, Qwen/Qwen3-Coder-Next (versions Base, FP8 et GGUF publiées). Date de coupure des connaissances : non communiquée. ### Coût et accès | Élément | Valeur | |---|---| | Tarif API officielle (entrée / sortie, USD par million de tokens) | Non consulté à la source primaire, non communiqué ici | | Auto-hébergement | vLLM 0.15.0 ou plus ; l'exemple de la model card lance le service en parallélisme tensoriel sur 2 GPU avec 256k de contexte | | Matériel minimal | Non communiqué par l'éditeur | ### Benchmarks Les scores chiffrés de la model card sont fournis sous forme d'images (SWE-bench Pro, graphique comparatif) et non sous forme de tableau texte. Je n'ai donc pas pu les vérifier ligne à ligne à la source primaire, et aucun tableau comparatif à des modèles fermés n'est reproduit ici. Des sites tiers citent environ 74 % sur SWE-bench Verified, chiffre non vérifié à la source primaire. ### Face aux modèles fermés L'éditeur présente le modèle comme comparable à des modèles ayant 10 à 20 fois plus de paramètres actifs, sans que le tableau puisse être reproduit ici. Faute de comparaison chiffrée vérifiée avec un modèle fermé contemporain, aucune conclusion d'écart n'est avancée. Ce qui est établi : la licence Apache 2.0, les 3B actifs et le mode d'usage local rendent le modèle auto-hébergeable, ce qui répond à des exigences de souveraineté et de coût que les API fermées ne couvrent pas. Le choix ouvert ou fermé se joue ici sur le contrôle du déploiement plus que sur un écart de score démontré. ### À retenir Qwen3-Coder-Next fixe l'orientation de 2026 pour Qwen : des modèles ouverts petits en paramètres actifs, taillés pour l'agentique. Sa force pour l'entreprise tient à l'auto-hébergement d'un assistant de code sous Apache 2.0.
Liens
Tags : LLM, Open Source, Alibaba, Qwen, Apache 2.0, MoE, Code