Qwen3-Next

2025-09-11 · Éditeur : Alibaba · Domaine : Intelligence Artificielle

Alibaba Qwen présente Qwen3-Next-80B-A3B, un MoE ultra-parcimonieux de 80 milliards de paramètres (3 milliards actifs) à attention hybride, publié en versions Instruct et Thinking sous Apache 2.0.

Ce qui change

  • Attention hybride : trois couches Gated DeltaNet (attention linéaire) pour une couche d'attention à portes classique, ce qui accélère le traitement du long contexte.
  • MoE à très forte parcimonie : 512 experts, 10 actifs plus 1 expert partagé, pour 3 milliards de paramètres activés sur 80.
  • Prédiction multi-tokens (MTP) et optimisations de stabilité (normalisation centrée sur zéro avec décroissance de poids).
  • Le modèle de base dépasse Qwen3-32B-Base avec 10 % du coût d'entraînement et 10 fois le débit d'inférence au-delà de 32 000 tokens, selon l'éditeur.
  • Apprentissage par renforcement stabilisé avec GSPO, méthode décrite dans un billet dédié de l'équipe Qwen.

Alibaba Qwen présente Qwen3-Next-80B-A3B, un MoE ultra-parcimonieux de 80 milliards de paramètres (3 milliards actifs) à attention hybride, publié en versions Instruct et Thinking sous Apache 2.0. ### Contexte Avec Qwen3 et Qwen3-2507, la famille grossit vers des MoE de plus en plus gros et des contextes plus longs. Qwen3-Next cherche l'inverse : réduire le coût par token à qualité comparable, en changeant d'architecture. Le Thinking est comparé à Gemini 2.5 Flash Thinking. ### Ce que le modèle apporte - Attention hybride : trois couches Gated DeltaNet (attention linéaire) pour une couche d'attention à portes classique, ce qui accélère le traitement du long contexte. - MoE à très forte parcimonie : 512 experts, 10 actifs plus 1 expert partagé, pour 3 milliards de paramètres activés sur 80. - Prédiction multi-tokens (MTP) et optimisations de stabilité (normalisation centrée sur zéro avec décroissance de poids). - Le modèle de base dépasse Qwen3-32B-Base avec 10 % du coût d'entraînement et 10 fois le débit d'inférence au-delà de 32 000 tokens, selon l'éditeur. - Apprentissage par renforcement stabilisé avec GSPO, méthode décrite dans un billet dédié de l'équipe Qwen. ### Architecture et caractéristiques 80 milliards de paramètres au total, 3 milliards actifs, 48 couches (12 blocs de 3 couches Gated DeltaNet + MoE puis 1 couche Gated Attention + MoE), dimension cachée 2048, pré-entraînement sur 15 000 milliards de tokens. Contexte natif 262 144 tokens, extensible à 1 010 000. Deux variantes : Instruct (mode direct) et Thinking (réflexion seule). Licence Apache 2.0. Date de coupure : non communiquée. ### Coût et accès | Élément | Valeur | |---|---| | Poids | Gratuits, Apache 2.0 | | API Alibaba Cloud, Instruct et Thinking (tarif actuel consulté) | 0,15 $ entrée / 1,2 $ sortie par million de tokens | | Matériel requis | Non communiqué (support transformers, vLLM, SGLang) | ### Benchmarks Thinking, fiche Hugging Face (mesures de l'éditeur). | Benchmark | Gemini 2.5 Flash Thinking | Qwen3-32B Thinking | Qwen3-235B-A22B-Thinking-2507 | Qwen3-Next-80B-A3B-Thinking | |---|---|---|---|---| | AIME25 | 72,0 | 72,9 | 92,3 | 87,8 | | HMMT25 | 64,2 | 51,5 | 83,9 | 73,9 | | LiveCodeBench v6 | 61,2 | 60,6 | 74,1 | 68,7 | | GPQA | 82,8 | 68,4 | 81,1 | 77,2 | | Arena-Hard v2 | 56,7 | 48,4 | 79,7 | 62,3 | | BFCL-v3 | 68,6 | 70,3 | 71,9 | 72,0 | Source : fiche Hugging Face Qwen3-Next-80B-A3B-Thinking, mesures de l'éditeur. Pour Instruct, la fiche compare uniquement des modèles Qwen : Arena-Hard v2 à 82,7 contre 79,2 pour Qwen3-235B-A22B-Instruct-2507. ### Face aux modèles fermés Le seul modèle fermé de la comparaison de l'éditeur est Gemini 2.5 Flash Thinking. Qwen3-Next-Thinking le dépasse sur AIME25 (87,8 contre 72,0), HMMT25, LiveCodeBench v6 (68,7 contre 61,2), Arena-Hard v2 et BFCL-v3, et reste derrière sur GPQA (77,2 contre 82,8). Le modèle n'est pas comparé à des modèles fermés de premier rang (o3, Gemini 2.5 Pro) dans la fiche. Son intérêt est surtout économique : 3 milliards de paramètres actifs et un débit annoncé 10 fois supérieur au-delà de 32 000 tokens, avec un tarif d'API à 0,15 $ en entrée. Ces gains de débit sont des annonces de l'éditeur, non vérifiées de façon indépendante. ### À retenir Qwen3-Next est un jalon technique : une architecture hybride et ultra-parcimonieuse, première étape de la série Qwen3-Next selon l'éditeur. Elle vise à rendre le long contexte moins coûteux à servir.

Liens

Tags : LLM, Open Source, Alibaba, Qwen, MoE, Apache 2.0, Architecture