GLM-5
2026-02-12 · Éditeur : Z.ai · Domaine : Intelligence Artificielle
Z.ai a publié GLM-5, modèle MoE de 744B paramètres (40B actifs) entraîné sur 28,5T tokens, avec DeepSeek Sparse Attention et un RL asynchrone, sous licence MIT, visant l'ingénierie de systèmes et les agents longs.
Ce qui change
- Un passage de 355B (32B actifs) à 744B (40B actifs) et de 23T à 28,5T tokens de pré-entraînement.
- L'intégration de DeepSeek Sparse Attention (DSA), qui réduit le coût de déploiement tout en gardant le contexte long.
- slime, une infrastructure de RL asynchrone qui découple génération et entraînement pour accélérer le post-entraînement, avec de nouveaux algorithmes de RL agentique.
- Un objectif d'ingénierie de systèmes et de tâches agentiques longues, illustré par Vending Bench 2 (Andon Labs) : solde final de 4 432 USD, au premier rang des modèles ouverts selon l'éditeur.
- Un net progrès sur GLM-4.7 : SWE-bench Verified 77,8 contre 73,8 ; Terminal-Bench 2.0 (Terminus 2) 56,2 contre 41,0.
Z.ai a publié GLM-5, modèle MoE de 744B paramètres (40B actifs) entraîné sur 28,5T tokens, avec DeepSeek Sparse Attention et un RL asynchrone, sous licence MIT, visant l'ingénierie de systèmes et les agents longs. ### Contexte Z.ai est cotée à la Bourse de Hong Kong depuis le 8 janvier 2026 (ticker 02513.HK, prix d'introduction 116,20 HKD par action selon le communiqué de presse de la société). GLM-4.7 date de décembre 2025. Début 2026, les modèles ouverts Kimi K2.5 et DeepSeek-V3.2 sont les références ouvertes, et Claude Opus 4.5, Gemini 3 Pro et GPT-5.2 les références fermées comparées par l'éditeur. ### Ce que le modèle apporte - Un passage de 355B (32B actifs) à 744B (40B actifs) et de 23T à 28,5T tokens de pré-entraînement. - L'intégration de DeepSeek Sparse Attention (DSA), qui réduit le coût de déploiement tout en gardant le contexte long. - slime, une infrastructure de RL asynchrone qui découple génération et entraînement pour accélérer le post-entraînement, avec de nouveaux algorithmes de RL agentique. - Un objectif d'ingénierie de systèmes et de tâches agentiques longues, illustré par Vending Bench 2 (Andon Labs) : solde final de 4 432 USD, au premier rang des modèles ouverts selon l'éditeur. - Un net progrès sur GLM-4.7 : SWE-bench Verified 77,8 contre 73,8 ; Terminal-Bench 2.0 (Terminus 2) 56,2 contre 41,0. ### Architecture et caractéristiques - 744B au total, 40B actifs ; environ 753,9 Md de paramètres au décompte HF (couche MTP incluse). Attention DSA. - Contexte : 200K tokens ; sortie maximale : 128K ; modalité : texte ; langues : chinois et anglais ; date de coupure : non communiquée. - Licence : MIT. Poids : zai-org/GLM-5 et GLM-5-FP8. Rapport : « GLM-5: from Vibe Coding to Agentic Engineering » (arXiv 2602.15763, soumis le 17 février 2026). - Déploiement : vLLM, SGLang, KTransformers, Transformers, xLLM (Ascend) ; matériel requis non chiffré (exemple de démarrage avec parallélisme tensoriel 8). ### Coût et accès | Modèle (API Z.ai, tarif courant) | Entrée /M | Entrée en cache /M | Sortie /M | |---|---|---|---| | GLM-5 | 1 USD | 0,2 USD | 3,2 USD | ### Benchmarks | Benchmark | GLM-5 | Claude Opus 4.5 | Gemini 3 Pro | GPT-5.2 (xhigh) | |---|---|---|---|---| | SWE-bench Verified | 77,8 | 80,9 | 76,2 | 80,0 | | SWE-bench Multilingual | 73,3 | 77,5 | 65,0 | 72,0 | | Terminal-Bench 2.0 (Terminus 2) | 56,2 | 59,3 | 54,2 | 54,0 | | HLE avec outils | 50,4 | 43,4* | 45,8* | 45,5* | | BrowseComp | 62,0 | 37,0 | 37,8 | - | | τ²-Bench | 89,7 | 91,6 | 90,7 | 85,5 | | GPQA-Diamond | 86,0 | 87,0 | 91,9 | 92,4 | | Vending Bench 2 (USD) | 4 432 | 4 967 | 5 478 | 3 591 | Source : fiche modèle Hugging Face de GLM-5 (tableau de l'annonce), scores mesurés par l'éditeur ; astérisque : résultats sur le jeu complet. Vending Bench 2 est exécuté par Andon Labs. ### Face aux modèles fermés Dans le tableau de l'éditeur, GLM-5 est proche de Claude Opus 4.5 en code (77,8 contre 80,9 sur SWE-bench Verified) et dépasse Gemini 3 Pro sur SWE-bench Verified (76,2) et sur SWE-bench Multilingual (65,0). Il devance les trois modèles fermés cités sur BrowseComp (62,0 contre 37,0, 37,8) et sur HLE avec outils (50,4 contre 43,4 à 45,8). En raisonnement scientifique, il est derrière Gemini 3 Pro et GPT-5.2 sur GPQA-Diamond (86,0 contre 91,9 et 92,4). Sur Vending Bench 2, l'écart avec Claude Opus 4.5 est de 535 USD. L'API est à 1 USD en entrée et 3,2 USD en sortie par million de tokens ; aucun tarif fermé n'a été vérifié pour chiffrer l'écart. La licence MIT permet de garder l'exécution sous contrôle, mais un modèle de 744B demande une infrastructure de plusieurs GPU en FP8. ### À retenir GLM-5 est le premier GLM à dépasser 700B de paramètres et à afficher une quasi-parité avec un modèle fermé de premier rang en code agentique. Il ouvre la série GLM-5.x, dont la cadence de publication s'accélère ensuite.
Liens
Tags : LLM, Open Source, Z.ai, Zhipu AI, GLM, MIT, MoE, Agents