Qwen3-Omni
2025-09-22 · Éditeur : Alibaba · Domaine : Intelligence Artificielle
Alibaba Qwen publie Qwen3-Omni-30B-A3B, un modèle omni-modal MoE à poids ouverts (Instruct, Thinking et Captioner) qui traite texte, image, audio et vidéo et répond en texte ou en parole en flux continu.
Ce qui change
- Architecture MoE Thinker-Talker avec préentraînement d'encodeur audio « AuT » et conception multi-codebook pour réduire la latence de la parole.
- Annonce de l'éditeur : état de l'art sur 22 des 36 benchmarks audio et audiovisuels, et état de l'art ouvert sur 32 sur 36 ; reconnaissance vocale, compréhension audio et conversation vocale comparables à Gemini 2.5 Pro.
- Multilingue : 119 langues de texte, 19 langues d'entrée vocale, 10 langues de sortie vocale.
- Pas de régression sur le texte et l'image par rapport aux modèles Qwen de même taille, grâce à un préentraînement multimodal mixte commençant par le texte.
- Contrôle du comportement par prompt système, et modèle Captioner ouvert pour la description audio détaillée.
Alibaba Qwen publie Qwen3-Omni-30B-A3B, un modèle omni-modal MoE à poids ouverts (Instruct, Thinking et Captioner) qui traite texte, image, audio et vidéo et répond en texte ou en parole en flux continu. ### Contexte Qwen2.5-Omni (mars 2025) avait ouvert la catégorie des modèles omni de bout en bout. Qwen3-Omni reprend l'idée sur la base MoE de Qwen3 et se compare à Gemini 2.5 Pro, Gemini 2.5 Flash, GPT-4o et GPT-4o-Transcribe sur l'audio et la vidéo. ### Ce que le modèle apporte - Architecture MoE Thinker-Talker avec préentraînement d'encodeur audio « AuT » et conception multi-codebook pour réduire la latence de la parole. - Annonce de l'éditeur : état de l'art sur 22 des 36 benchmarks audio et audiovisuels, et état de l'art ouvert sur 32 sur 36 ; reconnaissance vocale, compréhension audio et conversation vocale comparables à Gemini 2.5 Pro. - Multilingue : 119 langues de texte, 19 langues d'entrée vocale, 10 langues de sortie vocale. - Pas de régression sur le texte et l'image par rapport aux modèles Qwen de même taille, grâce à un préentraînement multimodal mixte commençant par le texte. - Contrôle du comportement par prompt système, et modèle Captioner ouvert pour la description audio détaillée. ### Architecture et caractéristiques Modèle nommé 30B-A3B (environ 35 milliards de paramètres au total sur Hugging Face, Thinker et Talker inclus). Variantes Instruct (Thinker et Talker), Thinking et Captioner. Licence Apache 2.0 (déclarée sur la fiche Hugging Face). Mémoire GPU minimale théorique en BF16 pour Instruct : 78,85 Go (vidéo de 15 s) à 144,81 Go (120 s) ; pour Thinking : 68,74 Go à 131,65 Go. Désactiver le Talker économise environ 10 Go. Date de coupure : non communiquée. ### Coût et accès | Élément | Valeur | |---|---| | Poids | Gratuits, Apache 2.0 | | API qwen3-omni-flash (tarif actuel consulté), texte | 0,43 $ entrée / 1,66 $ sortie par million de tokens | | API qwen3-omni-flash, audio en entrée | 3,81 $ par million de tokens (sortie audio 3,06 $) | | API qwen3-omni-flash, image ou vidéo en entrée | 0,78 $ par million de tokens (sortie 15,11 $) | ### Benchmarks Texte, Instruct, fiche Hugging Face (mesures de l'éditeur). | Benchmark | GPT-4o-0327 | Qwen3-Omni-30B-A3B-Instruct | |---|---|---| | MMLU-Redux | 91,3 | 86,6 | | GPQA | 66,9 | 69,6 | | AIME25 | 26,7 | 65,0 | | MultiPL-E | 82,7 | 81,4 | | IFEval | 83,9 | 81,0 | Reconnaissance vocale LibriSpeech (taux d'erreur de mots, test clean puis other, plus bas est meilleur), même fiche : GPT-4o-Transcribe 1,39 puis 3,75 ; Gemini 2.5 Pro 2,89 puis 3,56 ; Qwen3-Omni-30B-A3B-Instruct 1,22 puis 2,48. ### Face aux modèles fermés Sur la reconnaissance vocale LibriSpeech, le modèle affiche les taux d'erreur les plus bas de la ligne (1,22 puis 2,48), devant GPT-4o-Transcribe et Gemini 2.5 Pro. Sur le texte, il est devant GPT-4o-0327 sur GPQA (69,6 contre 66,9) et surtout AIME25 (65,0 contre 26,7), et derrière sur MMLU-Redux (86,6 contre 91,3) et IFEval. L'éditeur annonce une parité avec Gemini 2.5 Pro sur la reconnaissance vocale, la compréhension audio et la conversation vocale, ainsi qu'un dépassement de GPT-4o sur certains tests audio, sans détailler ici la totalité des 36 tests. La comparaison utilise des modèles fermés de la même période, mais choisis par l'éditeur et mesurés par lui. L'auto-hébergement demande au minimum environ 80 à 145 Go de mémoire GPU selon la durée vidéo. ### À retenir Qwen3-Omni fait passer les modèles omni ouverts à une architecture MoE avec parole en flux et large couverture linguistique. Les résultats les plus solides portent sur l'audio, où l'éditeur revendique la parité avec les meilleurs modèles fermés.
Liens
Tags : LLM, Open Source, Alibaba, Qwen, MoE, Multimodal, Audio, Apache 2.0