GLM-5.2
2026-06-16 · Éditeur : Z.ai · Domaine : Intelligence Artificielle
Z.ai a publié GLM-5.2 sous licence MIT : un contexte de 1M tokens présenté comme solide, l'architecture IndexShare, des niveaux d'effort High et Max, et 81,0 sur Terminal-Bench 2.1 (Terminus-2).
Ce qui change
- Un contexte de 1M tokens, avec un entraînement dédié aux scénarios d'agents de code (implémentation à grande échelle, recherche automatisée, optimisation, débogage).
- IndexShare : un même indexeur est réutilisé pour quatre couches d'attention parcimonieuse, ce qui réduit de 2,9 fois les FLOPs par token à 1M de contexte (arXiv 2603.12201).
- Une couche MTP améliorée pour le décodage spéculatif : longueur d'acceptation en hausse jusqu'à 20 %.
- Des niveaux d'effort de réflexion (High et Max) pour arbitrer performance et latence.
- Un entraînement RL de long horizon avec un module anti-triche qui détecte les raccourcis (lecture d'artefacts d'évaluation protégés, récupération de solutions) par filtre à règles puis jugement par LLM.
Z.ai a publié GLM-5.2 sous licence MIT : un contexte de 1M tokens présenté comme solide, l'architecture IndexShare, des niveaux d'effort High et Max, et 81,0 sur Terminal-Bench 2.1 (Terminus-2). ### Contexte GLM-5.1 (avril 2026) plafonnait à 200K tokens de contexte. Entre-temps, les modèles fermés de référence cités par l'éditeur sont Claude Opus 4.8, GPT-5.5 et Gemini 3.1 Pro, et les modèles ouverts concurrents Qwen3.7-Max, MiniMax M3 et DeepSeek-V4-Pro. GLM-5.2 vise les tâches longues (heures à dizaines d'heures) où le contexte tient de bout en bout. ### Ce que le modèle apporte - Un contexte de 1M tokens, avec un entraînement dédié aux scénarios d'agents de code (implémentation à grande échelle, recherche automatisée, optimisation, débogage). - IndexShare : un même indexeur est réutilisé pour quatre couches d'attention parcimonieuse, ce qui réduit de 2,9 fois les FLOPs par token à 1M de contexte (arXiv 2603.12201). - Une couche MTP améliorée pour le décodage spéculatif : longueur d'acceptation en hausse jusqu'à 20 %. - Des niveaux d'effort de réflexion (High et Max) pour arbitrer performance et latence. - Un entraînement RL de long horizon avec un module anti-triche qui détecte les raccourcis (lecture d'artefacts d'évaluation protégés, récupération de solutions) par filtre à règles puis jugement par LLM. ### Architecture et caractéristiques - MoE de type glm_moe_dsa : 78 couches, 256 experts routés dont 8 actifs par jeton, 1 expert partagé (config.json HF) ; environ 753,3 Md de paramètres au décompte HF. Nombre de paramètres actifs : non repris dans la fiche. - Contexte : 1M tokens ; sortie maximale : 128K (documentation API) ; modalité : texte ; date de coupure : non communiquée. - Licence : MIT, présentée par l'éditeur comme « sans limite régionale ». Poids : zai-org/GLM-5.2 et GLM-5.2-FP8. - Déploiement : SGLang, vLLM, Transformers, KTransformers, Unsloth, Ascend NPU ; matériel requis non chiffré. ### Coût et accès | Modèle (API Z.ai, tarif courant) | Entrée /M | Entrée en cache /M | Sortie /M | |---|---|---|---| | GLM-5.2 | 1,4 USD | 0,26 USD | 4,4 USD | ### Benchmarks | Benchmark | GLM-5.2 | GLM-5.1 | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro | |---|---|---|---|---|---| | Terminal Bench 2.1 (Terminus-2) | 81,0 | 63,5 | 85 | 84 | 74 | | SWE-bench Pro | 62,1 | 58,4 | 69,2 | 58,6 | 54,2 | | NL2Repo | 48,9 | 42,7 | 69,7 | 50,7 | 33,4 | | DeepSWE | 46,2 | 18 | 58 | 70 | 10 | | HLE avec outils | 54,7 | 52,3 | 57,9* | 52,2* | 51,4* | | GPQA-Diamond | 91,2 | 86,2 | 93,6 | 93,6 | 94,3 | | MCP-Atlas (jeu public) | 76,8 | 71,8 | 77,8 | 75,3 | 69,2 | Source : fiche modèle Hugging Face de GLM-5.2 (tableau de l'annonce), scores mesurés par l'éditeur ; astérisque : jeu complet. Les résultats FrontierSWE, PostTrainBench et SWE-Marathon ont été mesurés par des tiers (Proximal, PostTrainBench, Abundant AI) selon les notes de la fiche. ### Face aux modèles fermés Sur Terminal Bench 2.1 (Terminus-2), GLM-5.2 obtient 81,0, à 4 points de Claude Opus 4.8 (85) et à 3 points de GPT-5.5 (84), et devant Gemini 3.1 Pro (74). Sur SWE-bench Pro, il devance GPT-5.5 (62,1 contre 58,6) et Gemini 3.1 Pro (54,2), mais reste à 7,1 points d'Opus 4.8 (69,2). Sur les longs projets, le billet indique que le modèle est le mieux classé des modèles ouverts sur trois benchmarks, à 13 % d'Opus 4.8 sur un benchmark de génie logiciel ultra-long (13,0 contre 26,0 sur SWE-Marathon selon la fiche). Sur DeepSWE, l'écart est net (46,2 contre 58 pour Opus 4.8 et 70 pour GPT-5.5). Le prix de 1,4 USD en entrée et 4,4 USD en sortie par million de tokens est celui de l'API de l'éditeur ; aucun tarif fermé n'a été vérifié, et le titre du média VentureBeat évoquant un sixième du coût n'est pas repris comme fait vérifié. ### À retenir GLM-5.2 fait passer la série GLM à 1M tokens de contexte utilisable pour les agents de code, avec des poids MIT. L'écart avec les meilleurs modèles fermés reste de quelques points sur les benchmarks de terminal et davantage sur les projets ultra-longs.
Liens
Tags : LLM, Open Source, Z.ai, Zhipu AI, GLM, MIT, MoE, Contexte 1M