Qwen3.8-Flash-Next

2026-08-26 · Éditeur : Alibaba · Domaine : Intelligence Artificielle

Alibaba publie Qwen3.8-Flash-Next, modèle multimodal à poids ouverts de 125 milliards de paramètres dont 6 milliards actifs, présenté comme la préversion expérimentale de l'architecture de la future génération Qwen4.

Ce qui change

  • Qwen Sparse Attention (QSA) : à la place de la Gated Attention, une attention éparse qui opère par micro-blocs et non token par token, pour réduire la latence en long contexte.
  • Gated Residual : flux résiduels élargis modulés par une porte de lecture dépendant des données et une porte d'écriture scalaire par branche.
  • N-gram Embedding : 51B de paramètres d'embedding indexés par bigrammes et trigrammes (20 millions d'entrées), facile à décharger de la mémoire GPU.
  • Entraînement : optimiseurs Muon et AdamW selon les poids, sans montée progressive de la taille de lot (annonce de l'éditeur).
  • Un rapport technique est publié dans le dépôt GitHub QwenLM/Qwen3.8-Flash-Next.

Alibaba publie Qwen3.8-Flash-Next, modèle multimodal à poids ouverts de 125 milliards de paramètres dont 6 milliards actifs, présenté comme la préversion expérimentale de l'architecture de la future génération Qwen4. ### Contexte Après Qwen3.5 et Qwen3.6, toutes bâties sur l'alliance Gated DeltaNet et Gated Attention, l'équipe Qwen publie pour la première fois une architecture nouvelle avant le modèle final. L'éditeur pose la question du passage à l'échelle par l'efficacité plutôt que par la seule taille. ### Ce que le modèle apporte - Qwen Sparse Attention (QSA) : à la place de la Gated Attention, une attention éparse qui opère par micro-blocs et non token par token, pour réduire la latence en long contexte. - Gated Residual : flux résiduels élargis modulés par une porte de lecture dépendant des données et une porte d'écriture scalaire par branche. - N-gram Embedding : 51B de paramètres d'embedding indexés par bigrammes et trigrammes (20 millions d'entrées), facile à décharger de la mémoire GPU. - Entraînement : optimiseurs Muon et AdamW selon les poids, sans montée progressive de la taille de lot (annonce de l'éditeur). - Un rapport technique est publié dans le dépôt GitHub QwenLM/Qwen3.8-Flash-Next. ### Architecture et caractéristiques - 125B de paramètres principaux, 6B activés, plus 51B d'embedding n-gram et 4B de tête MTP ; 48 couches ; disposition 12 x (3 x (Gated DeltaNet puis MoE) puis 1 x (QSA puis MoE)) ; dimension cachée 2560. - 512 experts, 10 routés plus 1 partagé (sources tierces) ; contexte 262 144 tokens en natif, jusqu'à 1M. - Modalités : texte, image, vidéo. - Licence : Qwen Community License 1.0, de type MIT avec conditions. Usage commercial libre avec affichage du nom du modèle au-delà de 100 M d'utilisateurs mensuels ou 20 M USD de revenu mensuel, et licence séparée requise auprès de Qwen pour tout service d'inférence (Model as a Service) ou assistant de travail IA, sans seuil de revenu ; usage interne exempté. - Poids : Hugging Face, Qwen/Qwen3.8-Flash-Next (et FP8). Date de coupure : non communiquée. ### Coût et accès | Élément | Valeur | |---|---| | Version hébergée Qwen3.8-Flash | 1M de contexte par défaut, outils intégrés ; tarif non communiqué à la source consultée | | Auto-hébergement | Compatible Transformers, vLLM, SGLang ; matériel minimal non communiqué | ### Benchmarks | Test | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus (fermé) | DeepSeek-V4-Flash-0731 | Opus 4.6 Max (fermé) | |---|---|---|---|---|---| | SWE-bench Pro | 62,5 | 61,7 | 55,8 | 56,0 | 53,4 | | DeepSWE 1.1 | 58,7 | 42,2 | 16,5 | 54,4 | -- | | GPQA Diamond | 91,7 | 89,2 | 90,3 | 90,8 | 91,3 | | HLE | 35,9 | 30,8 | 34,7 | 33,8 | 40,0 | | LiveCodeBench v6 | 91,9 | 90,3 | 89,6 | 90,6 | 88,8 | | IFBench | 81,3 | 79,5 | 79,1 | 79,2 | 62,5 | Source : model card Hugging Face de Qwen3.8-Flash-Next, scores publiés par l'éditeur. ### Face aux modèles fermés Face à Opus 4.6 Max et Qwen3.7-Plus, tous deux fermés, Qwen3.8-Flash-Next devance sur SWE-bench Pro (62,5 contre 53,4 et 55,8), LiveCodeBench v6 (91,9 contre 88,8 et 89,6) et GPQA Diamond face à Qwen3.7-Plus (91,7 contre 90,3), et légèrement face à Opus 4.6 Max (91,3). Il reste derrière Opus 4.6 Max sur HLE (35,9 contre 40,0). Avec 6B de paramètres actifs, il annonce des performances supérieures au 27B dense de la même famille sur les tests du tableau, ce qui est le message de l'éditeur sur l'efficacité. Les tarifs d'API ne sont pas communiqués, donc aucun écart de prix n'est chiffré. La licence Community 1.0 limite plus que l'Apache 2.0 de Qwen3.8-27B : à retenir avant toute offre d'inférence. ### À retenir Le modèle sert à examiner en public l'architecture de Qwen4 avant sa sortie, avec des résultats déjà compétitifs face à des modèles fermés de la génération précédente. Il n'est pas sous Apache 2.0.

Liens

Tags : LLM, Poids ouverts, Alibaba, Qwen, MoE, Qwen Community License 1.0, Architecture