Llama 4 (Scout, Maverick, Behemoth en aperçu)
2025-04-05 · Éditeur : Meta · Domaine : Intelligence Artificielle
Meta publie Llama 4 Scout et Llama 4 Maverick, ses premiers modèles à poids ouverts en mélange d'experts et nativement multimodaux, et présente Behemoth, un modèle de 2 000 milliards de paramètres encore en entraînement.
Ce qui change
- Architecture à mélange d'experts : seuls 17 milliards de paramètres sont actifs par token, quel que soit le modèle (Scout : 16 experts ; Maverick : 128 experts).
- Multimodalité native par fusion précoce : texte et images sont traités dans le même modèle (entrée texte et image, sortie texte).
- Scout annonce une fenêtre de 10 millions de tokens ; Maverick 1 million d'après sa model card.
- Scout tient sur un seul GPU H100 avec quantification int4 à la volée d'après la model card ; Maverick est publié en BF16 et FP8.
- Behemoth (288 milliards de paramètres actifs, environ 2 000 milliards au total, 16 experts) sert de modèle enseignant, sans publication des poids à l'annonce.
Meta publie Llama 4 Scout et Llama 4 Maverick, ses premiers modèles à poids ouverts en mélange d'experts et nativement multimodaux, et présente Behemoth, un modèle de 2 000 milliards de paramètres encore en entraînement. ### Contexte Llama 3.3 (70 B, décembre 2024) était le dernier jalon dense de la famille. En avril 2025, les meilleurs modèles fermés étaient GPT-4.5, Claude 3.7 Sonnet et Gemini 2.5 Pro, et les modèles ouverts chinois (DeepSeek V3) donnaient le ton côté poids ouverts. Meta voulait reprendre l'avantage avec une architecture MoE et un contexte très long. ### Ce que le modèle apporte - Architecture à mélange d'experts : seuls 17 milliards de paramètres sont actifs par token, quel que soit le modèle (Scout : 16 experts ; Maverick : 128 experts). - Multimodalité native par fusion précoce : texte et images sont traités dans le même modèle (entrée texte et image, sortie texte). - Scout annonce une fenêtre de 10 millions de tokens ; Maverick 1 million d'après sa model card. - Scout tient sur un seul GPU H100 avec quantification int4 à la volée d'après la model card ; Maverick est publié en BF16 et FP8. - Behemoth (288 milliards de paramètres actifs, environ 2 000 milliards au total, 16 experts) sert de modèle enseignant, sans publication des poids à l'annonce. ### Architecture et caractéristiques | Modèle | Actifs / total | Experts | Contexte | Statut | |---|---|---|---|---| | Scout | 17 B / 109 B | 16 | 10 M (annonce) | Poids publiés | | Maverick | 17 B / 400 B | 128 | 1 M (model card) | Poids publiés | | Behemoth | 288 B / environ 2 000 B | 16 | non communiqué | Aperçu, non publié | Langues prises en charge : 12 (dont français, anglais, allemand, espagnol, arabe, hindi). Date de coupure des connaissances : août 2024. Entraînement : environ 22 000 milliards de tokens pour Maverick (model card), plus de 30 000 milliards pour la famille d'après Meta ; Maverick a consommé 2,38 millions d'heures H100. Licence : Llama 4 Community License (non exclusive, gratuite pour usage commercial et de recherche) avec une autorisation spécifique à demander à Meta au-delà de 700 millions d'utilisateurs actifs mensuels, mention « Built with Llama » et préfixe « Llama » dans le nom des dérivés obligatoires ; le contrat relève de Meta Platforms Ireland pour les utilisateurs de l'EEE et de la Suisse. Poids sur Hugging Face (meta-llama) et llama.com. ### Coût et accès | Élément | Valeur | |---|---| | API officielle Meta à l'annonce | Tarif non communiqué à l'annonce | | Scout chez des hébergeurs tiers | 0,15 $ entrée / 0,40 $ sortie par million de tokens (relevé The Decoder, avril 2025) | | Maverick chez des hébergeurs tiers | 0,24 $ entrée / 0,77 $ sortie par million de tokens (même source) | | Auto-hébergement Scout | 1 GPU H100 en int4 (model card) | ### Benchmarks | Benchmark (modèles instruits) | Scout | Maverick | |---|---|---| | MMMU | 69,4 | 73,4 | | MMLU Pro | 74,3 | 80,5 | | GPQA Diamond | 57,2 | 69,8 | | LiveCodeBench | 32,8 | 43,4 | Source : model card Llama 4 (GitHub meta-llama/llama-models), scores publiés par l'éditeur. Les tableaux comparatifs de l'annonce face aux modèles fermés sont des images que je n'ai pas pu relire chiffre par chiffre : aucun score de GPT-4o ou Gemini 2.0 Flash n'est donc repris ici. Tiers : sur l'Artificial Analysis Intelligence Index de l'époque, Maverick obtenait 49 points (devant Claude 3.7 Sonnet, derrière DeepSeek V3) et Scout 36 (niveau GPT-4o mini) d'après The Decoder. Sur Fiction.LiveBench à 120 000 tokens, Maverick atteint 28,1 % de précision contre 90,6 % pour Gemini 2.5 Pro, et Scout 15,6 %. Behemoth, chiffres annoncés par Meta et relayés par des sources secondaires : MATH-500 95,0 (Gemini 2.0 Pro 91,8 ; Claude 3.7 Sonnet 82,2), GPQA Diamond 73,7 (GPT-4.5 71,4 ; Claude 3.7 Sonnet 68,0). ### Controverse LMArena Meta a annoncé pour Maverick un score Elo de 1417 sur LMArena pour une « version de chat expérimentale ». Le modèle testé s'appelait Llama-4-Maverick-03-26-Experimental, distinct de la version publiée (Llama-4-Maverick-17B-128E-Instruct). LMArena a précisé le 8 avril 2025 que l'interprétation de sa politique par Meta ne correspondait pas à ce qu'elle attend des fournisseurs, et a mis à jour ses règles. Meta a répondu qu'il s'agissait d'une variante optimisée pour la conversation, testée parmi d'autres. Le 11 avril, la version publique se classait 32e (TechCrunch) ; avec le contrôle de style, la version expérimentale passait de la 2e à la 5e place (The Decoder). En janvier 2026, Yann LeCun a déclaré au Financial Times que les résultats avaient été « un peu arrangés » (propos rapportés par des sources secondaires). ### Face aux modèles fermés Au lancement, Meta positionne Maverick devant GPT-4o et Gemini 2.0 Flash, et comparable à DeepSeek V3 avec moins de la moitié des paramètres actifs : ce sont des annonces de l'éditeur. Les mesures tierces sont plus nuancées : 49 points sur l'index d'Artificial Analysis, sous DeepSeek V3, et une chute nette sur le long contexte face à Gemini 2.5 Pro (28,1 % contre 90,6 % à 120 000 tokens). Le modèle fermé de référence à cette date était Gemini 2.5 Pro (annoncé le 25 mars 2025), non comparé par Meta. L'écart de prix reste l'argument principal : quelques dizaines de centimes le million de tokens chez les hébergeurs, sans facturation de licence en deçà de 700 millions d'utilisateurs. Pour un choix ouvert ou fermé, la licence n'est pas OSI : elle impose attribution et seuil d'utilisateurs. ### À retenir Llama 4 marque le passage de Meta au MoE multimodal et à un contexte long, mais la fiabilité de ses annonces (LMArena, contexte de 10 M) a été contestée. Behemoth n'a pas été publié : Meta l'a repoussé (mai 2025, presse) puis a changé de stratégie.
Liens
Tags : LLM, Open Source, Meta, Llama, MoE, Multimodal, Llama 4 Community License