Qwen2.5-1M

2025-01-27 · Éditeur : Alibaba · Domaine : Intelligence Artificielle

Alibaba Qwen publie Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, deux modèles à poids ouverts acceptant jusqu'à 1 million de tokens, avec un cadre d'inférence vLLM adapté et une attention parcimonieuse.

Ce qui change

  • Deux tailles, 7 milliards et 14 milliards de paramètres, en version Instruct, avec un contexte allant jusqu'à 1 million de tokens.
  • Entraînement progressif : la longueur passe de 4 000 à 256 000 tokens, puis l'extrapolation jusqu'à 1 million repose sur Dual Chunk Attention (DCA), une technique qui réutilise les positions vues à l'entraînement sans réentraînement supplémentaire.
  • Attention parcimonieuse fondée sur MInference, intégrée au cadre d'inférence vLLM des auteurs : l'éditeur annonce un préremplissage 3,2 à 6,7 fois plus rapide sur des séquences de 1 million de tokens.
  • Récupération d'information (passkey) fiable jusqu'à 1 million de tokens, avec de rares erreurs sur le modèle 7B selon le blog.
  • Performances sur tâches courtes proches de GPT-4o-mini pour le 14B, selon l'éditeur, avec un contexte huit fois plus long.

Alibaba Qwen publie Qwen2.5-7B-Instruct-1M et Qwen2.5-14B-Instruct-1M, deux modèles à poids ouverts acceptant jusqu'à 1 million de tokens, avec un cadre d'inférence vLLM adapté et une attention parcimonieuse. ### Contexte Fin 2024, les modèles ouverts de Qwen plafonnaient à 128 000 tokens (Qwen2.5-128K). Le blog officiel compare le nouveau modèle à GPT-4o-mini, dont la fenêtre est de 128 000 tokens, et à Qwen2.5-Turbo, la version accessible par API. L'enjeu est de rendre le très long contexte déployable soi-même, pas seulement via un service. ### Ce que le modèle apporte - Deux tailles, 7 milliards et 14 milliards de paramètres, en version Instruct, avec un contexte allant jusqu'à 1 million de tokens. - Entraînement progressif : la longueur passe de 4 000 à 256 000 tokens, puis l'extrapolation jusqu'à 1 million repose sur Dual Chunk Attention (DCA), une technique qui réutilise les positions vues à l'entraînement sans réentraînement supplémentaire. - Attention parcimonieuse fondée sur MInference, intégrée au cadre d'inférence vLLM des auteurs : l'éditeur annonce un préremplissage 3,2 à 6,7 fois plus rapide sur des séquences de 1 million de tokens. - Récupération d'information (passkey) fiable jusqu'à 1 million de tokens, avec de rares erreurs sur le modèle 7B selon le blog. - Performances sur tâches courtes proches de GPT-4o-mini pour le 14B, selon l'éditeur, avec un contexte huit fois plus long. ### Architecture et caractéristiques Modèles denses de type Qwen2.5 (RoPE, SwiGLU, RMSNorm, biais QKV). Le 14B compte 14,7 milliards de paramètres (13,1 milliards hors embeddings), 48 couches, GQA 40 têtes de requête pour 8 de clé-valeur. Contexte complet : 1 010 000 tokens, génération jusqu'à 8 192 tokens. Licence Apache 2.0 (déclarée sur la fiche Hugging Face des modèles 7B et 14B). Un rapport technique est publié (arXiv 2501.15383). ### Coût et accès Les poids sont téléchargeables sur Hugging Face et ModelScope. Le blog indique les besoins matériels pour 1 million de tokens : au moins 120 Go de VRAM pour le 7B et 320 Go pour le 14B (GPU Ampere ou Hopper recommandés, CUDA 12.1 ou 12.3). Tarif d'API non vérifié pour ces modèles (Qwen2.5-Turbo, distinct, est cité par l'éditeur). | Élément | Valeur (source : blog officiel) | |---|---| | VRAM minimale, 7B, 1 M tokens | 120 Go | | VRAM minimale, 14B, 1 M tokens | 320 Go | | Gain de préremplissage | 3,2x à 6,7x | ### Benchmarks Les résultats détaillés (RULER, LV-Eval, LongBench-Chat, passkey) sont fournis sous forme d'images dans le blog, sans tableau textuel exploitable. Seules des affirmations de l'éditeur sont donc reprises : le 14B-Instruct-1M dépasse Qwen2.5-Turbo et « surpasse de façon constante » GPT-4o-mini sur plusieurs jeux de données longs (scores publiés par l'éditeur, non transcrits ici faute de source textuelle). ### Face aux modèles fermés Le seul modèle fermé cité par l'éditeur est GPT-4o-mini, limité à 128 000 tokens d'après le blog, contre 1 million pour Qwen2.5-14B-Instruct-1M, soit huit fois plus. L'éditeur annonce une parité sur les tâches courtes et un avantage sur les tâches longues, sans que les chiffres soient disponibles en texte. Le coût matériel est en revanche élevé : 320 Go de VRAM pour exploiter le plein contexte du 14B, ce qui place l'auto-hébergement complet hors de portée d'un poste isolé. L'écart de prix avec l'API de GPT-4o-mini n'est pas documenté dans les sources consultées. Pour un usage de très long contexte avec exigence de souveraineté, l'option ouverte devient donc techniquement possible mais demande une infrastructure GPU multiple. ### À retenir Qwen2.5-1M est le premier jalon de Qwen sur le très long contexte en poids ouverts, avec un cadre d'inférence livré avec les modèles. Les besoins mémoire (120 à 320 Go) restent le principal frein à l'adoption.

Liens

Tags : LLM, Open Source, Alibaba, Qwen, Apache 2.0, Long contexte