Qwen3-VL

2025-09-23 · Éditeur : Alibaba · Domaine : Intelligence Artificielle

Alibaba Qwen publie Qwen3-VL-235B-A22B en versions Instruct et Thinking sous Apache 2.0, puis une famille de tailles denses et MoE (2B à 32B, 30B-A3B) ; contexte natif de 256 000 tokens et agent visuel.

Ce qui change

  • Agent visuel : pilotage d'interfaces PC et mobiles (reconnaissance d'éléments, appel d'outils, exécution de tâches).
  • Génération de code visuel (Draw.io, HTML, CSS, JavaScript) à partir d'images et de vidéos.
  • Perception spatiale renforcée : positions, points de vue, occlusions, ancrage 2D et 3D.
  • Contexte natif de 256 000 tokens, extensible à 1 million, et compréhension de vidéos de plusieurs heures avec indexation à la seconde.
  • OCR étendu à 32 langues (contre 19) et texte au niveau des modèles de langage purs.
  • Trois innovations d'architecture : Interleaved-MRoPE (allocation de toutes les fréquences au temps, à la largeur et à la hauteur), DeepStack (fusion de caractéristiques visuelles multi-niveaux) et alignement texte-horodatage pour la vidéo.

Alibaba Qwen publie Qwen3-VL-235B-A22B en versions Instruct et Thinking sous Apache 2.0, puis une famille de tailles denses et MoE (2B à 32B, 30B-A3B) ; contexte natif de 256 000 tokens et agent visuel. ### Contexte Qwen2.5-VL (janvier 2025) était le dernier modèle vision-langage ouvert majeur de la famille. Qwen3-VL s'appuie sur Qwen3 et se compare à Gemini 2.5 Pro, GPT-5 et Claude Opus 4.1 selon le rapport technique. ### Ce que le modèle apporte - Agent visuel : pilotage d'interfaces PC et mobiles (reconnaissance d'éléments, appel d'outils, exécution de tâches). - Génération de code visuel (Draw.io, HTML, CSS, JavaScript) à partir d'images et de vidéos. - Perception spatiale renforcée : positions, points de vue, occlusions, ancrage 2D et 3D. - Contexte natif de 256 000 tokens, extensible à 1 million, et compréhension de vidéos de plusieurs heures avec indexation à la seconde. - OCR étendu à 32 langues (contre 19) et texte au niveau des modèles de langage purs. - Trois innovations d'architecture : Interleaved-MRoPE (allocation de toutes les fréquences au temps, à la largeur et à la hauteur), DeepStack (fusion de caractéristiques visuelles multi-niveaux) et alignement texte-horodatage pour la vidéo. ### Architecture et caractéristiques Rapport technique (arXiv 2511.21631) : quatre modèles denses (2B, 4B, 8B, 32B) et deux MoE (30B-A3B, 235B-A22B), entraînés jusqu'à 256 000 tokens de contexte en quatre phases (alignement, puis contextes de 8 K, 32 K et 256 K). Sortie échelonnée : 235B-A22B le 23 septembre 2025, 30B-A3B le 4 octobre, 4B et 8B le 15 octobre, 2B et 32B le 21 octobre. Licence Apache 2.0. Poids sur Hugging Face et ModelScope, versions FP8 disponibles. Date de coupure : non communiquée. ### Coût et accès | Élément | Valeur | |---|---| | Poids | Gratuits, Apache 2.0 | | API qwen3-vl-235b-a22b Instruct (tarif actuel consulté) | 0,4 $ entrée / 1,6 $ sortie par million de tokens | | API qwen3-vl-235b-a22b Thinking (tarif actuel consulté) | 0,4 $ entrée / 4 $ sortie | ### Benchmarks Les tableaux multimodaux du billet et de la fiche sont des images. Le rapport technique publie en texte la comparaison sur les capacités textuelles de Qwen3-VL-235B-A22B-Thinking (mesures de l'éditeur). | Benchmark | OpenAI o3 | Claude Opus 4 (réflexion) | Qwen3-VL-235B-A22B-Thinking | |---|---|---|---| | MMLU-Pro | 85,9 | non publié | 83,8 | | GPQA | 83,3 | 79,6 | 77,1 | | AIME-25 | 88,9 | 75,5 | 89,7 | | LiveCodeBench v6 | 58,6 | 48,9 | 70,1 | | BFCL-v3 | 72,4 | 61,8 | 71,8 | | Arena-Hard V2 | 80,8 | 59,1 | 74,8 | Source : rapport technique Qwen3-VL (arXiv 2511.21631), tableau 3. Sur les tâches visuelles, le rapport indique que la version Thinking obtient 78,7 sur MMStar, le meilleur score parmi les modèles à raisonnement comparés, Gemini 2.5 Pro Thinking étant globalement le meilleur. ### Face aux modèles fermés Sur les capacités textuelles, la version Thinking dépasse o3 sur AIME-25 (89,7 contre 88,9) et LiveCodeBench v6 (70,1 contre 58,6) et reste derrière sur GPQA (77,1 contre 83,3) et Arena-Hard V2 (74,8 contre 80,8). Sur la vision, le rapport reconnaît que Gemini 2.5 Pro en mode réflexion offre les meilleurs résultats d'ensemble, Qwen3-VL-235B-A22B-Thinking étant « pas très loin » selon les auteurs, et décrit des gains sur HallusionBench face à Gemini 2.5 Pro, GPT-5 et Claude Opus 4.1. Les valeurs visuelles détaillées n'ont pas été transcrites faute de tableau textuel. Le modèle de 32 milliards de paramètres est annoncé au-dessus de Gemini 2.5 Flash et GPT-5 mini sur la plupart des tests du rapport. Pour un usage en entreprise, cela ouvre l'analyse de documents, de vidéos et d'écrans en auto-hébergement. ### À retenir Qwen3-VL est le jalon vision-langage de Qwen pour 2025 : une famille complète, du modèle de 2 milliards au MoE de 235 milliards, avec agent visuel et long contexte. Les comparaisons visuelles fines sont à consulter dans le rapport technique.

Liens

Tags : LLM, Open Source, Alibaba, Qwen, MoE, Vision, Apache 2.0, Multimodal