Qwen2.5-Omni
2025-03-27 · Éditeur : Alibaba · Domaine : Intelligence Artificielle
Alibaba Qwen publie Qwen2.5-Omni-7B, un modèle multimodal de bout en bout à poids ouverts : il perçoit texte, images, audio et vidéo et répond en texte ou en parole synthétisée en flux continu.
Ce qui change
- Architecture Thinker-Talker : le Thinker (décodeur Transformer avec encodeurs audio et image) comprend et produit le texte, le Talker (décodeur autorégressif à double piste) génère la parole en flux.
- TMRoPE (Time-aligned Multimodal RoPE), un encodage de position qui synchronise les horodatages vidéo et audio.
- Interaction en temps réel avec entrée par blocs et sortie immédiate.
- Suivi d'instructions vocales de bout en bout, proche de celui par texte selon l'éditeur (MMLU, GSM8K).
- Performance revendiquée à l'état de l'art sur OmniBench.
Alibaba Qwen publie Qwen2.5-Omni-7B, un modèle multimodal de bout en bout à poids ouverts : il perçoit texte, images, audio et vidéo et répond en texte ou en parole synthétisée en flux continu. ### Contexte Les assistants vocaux et vidéo reposaient jusque-là sur des chaînes d'outils séparées (reconnaissance vocale, LLM, synthèse). Le blog compare Qwen2.5-Omni aux modèles Qwen2.5-VL-7B, Qwen2-Audio et à Gemini 1.5 Pro. ### Ce que le modèle apporte - Architecture Thinker-Talker : le Thinker (décodeur Transformer avec encodeurs audio et image) comprend et produit le texte, le Talker (décodeur autorégressif à double piste) génère la parole en flux. - TMRoPE (Time-aligned Multimodal RoPE), un encodage de position qui synchronise les horodatages vidéo et audio. - Interaction en temps réel avec entrée par blocs et sortie immédiate. - Suivi d'instructions vocales de bout en bout, proche de celui par texte selon l'éditeur (MMLU, GSM8K). - Performance revendiquée à l'état de l'art sur OmniBench. ### Architecture et caractéristiques Version 7B (environ 10,7 milliards de paramètres au total sur Hugging Face, Thinker et Talker inclus) puis version 3B publiée le 30 avril 2025. Licences : Apache 2.0 pour le 7B, licence « Qwen Research » pour le 3B. Mémoire GPU minimale théorique en BF16 pour le 7B : 31,11 Go (vidéo de 15 s), 41,85 Go (30 s), 60,19 Go (60 s), à multiplier par au moins 1,2 en pratique selon la fiche. Désactiver le Talker économise environ 2 Go. Contexte et date de coupure : non vérifiés. Rapport technique disponible sur arXiv. ### Coût et accès Poids sur Hugging Face, ModelScope, DashScope et GitHub ; démonstration sur Qwen Chat. Tarif d'API non vérifié pour cette fiche. ### Benchmarks Extraits de la fiche modèle Hugging Face (mesures de l'éditeur). | Benchmark | Gemini 1.5 Pro | GPT-4o-mini | Qwen2.5-VL-7B | Qwen2.5-Omni-7B | |---|---|---|---|---| | OmniBench (moyenne) | 42,91 % | non publié | non publié | 56,13 % | | MMMU (val) | non publié | 60,0 | 58,6 | 59,2 | | MathVista (testmini) | non publié | 52,5 | 68,2 | 67,9 | | MMStar | non publié | 54,8 | 63,9 | 64,0 | Source : fiche Hugging Face Qwen2.5-Omni-7B, comparaisons choisies par l'éditeur. ### Face aux modèles fermés Les seuls modèles fermés du tableau sont Gemini 1.5 Pro (OmniBench 42,91 % contre 56,13 %) et GPT-4o-mini (MMStar 54,8 contre 64,0 ; MathVista 52,5 contre 67,9), où Qwen2.5-Omni-7B est devant. Sur MMMU, GPT-4o-mini garde un léger avantage (60,0 contre 59,2). L'éditeur revendique une performance vision proche de Qwen2.5-VL-7B, confirmée par le tableau. Les modèles fermés cités sont d'une génération antérieure à mars 2025 (Gemini 1.5 Pro) ou des petits modèles, ce qui limite la portée de la comparaison. L'intérêt principal est de disposer d'un modèle vocal et vidéo auto-hébergeable, avec une empreinte de 30 à 60 Go de GPU selon la durée vidéo. ### À retenir Qwen2.5-Omni ouvre la catégorie des modèles omni ouverts de bout en bout avec sortie vocale en flux. La comparaison publiée reste limitée à des références fermées anciennes ou légères.
Liens
Tags : LLM, Open Source, Alibaba, Qwen, Multimodal, Audio, Apache 2.0