GLM-5.1
2026-04-07 · Éditeur : Z.ai · Domaine : Intelligence Artificielle
Z.ai a ouvert GLM-5.1 sous licence MIT, modèle phare pour l'ingénierie agentique : 58,4 sur SWE-Bench Pro, et une capacité à rester efficace sur des centaines de tours et des milliers d'appels d'outils.
Ce qui change
- 58,4 sur SWE-Bench Pro, le meilleur score de la ligne du tableau publié (Opus 4.6 : 57,3 ; GPT-5.4 : 57,7 ; Gemini 3.1 Pro : 54,2).
- NL2Repo (génération de dépôt) 42,7 contre 35,9 pour GLM-5 ; Terminal-Bench 2.0 (Terminus-2) 63,5 contre 56,2.
- Une meilleure tenue sur les longues sessions : les modèles précédents atteignent un plateau, GLM-5.1 continue de progresser, selon l'éditeur.
- Exemple cité par l'éditeur et repris par Computerworld : optimisation d'une base de données vectorielle sur plus de 600 itérations et 6 000 appels d'outils, jusqu'à 21 500 requêtes par seconde.
- Les notes de version de la documentation annoncent jusqu'à 8 heures d'exécution continue et un alignement de capacité avec Claude Opus 4.6.
Z.ai a ouvert GLM-5.1 sous licence MIT, modèle phare pour l'ingénierie agentique : 58,4 sur SWE-Bench Pro, et une capacité à rester efficace sur des centaines de tours et des milliers d'appels d'outils. ### Contexte GLM-5 (février 2026) avait posé la base 744B. GLM-5.1 la conserve et modifie surtout le post-entraînement. D'après Wikipedia, une version réservée aux abonnés était sortie fin mars 2026, l'ouverture des poids intervenant le 7 avril ; l'éditeur compare alors son modèle à Claude Opus 4.6, GPT-5.4 et Gemini 3.1 Pro. ### Ce que le modèle apporte - 58,4 sur SWE-Bench Pro, le meilleur score de la ligne du tableau publié (Opus 4.6 : 57,3 ; GPT-5.4 : 57,7 ; Gemini 3.1 Pro : 54,2). - NL2Repo (génération de dépôt) 42,7 contre 35,9 pour GLM-5 ; Terminal-Bench 2.0 (Terminus-2) 63,5 contre 56,2. - Une meilleure tenue sur les longues sessions : les modèles précédents atteignent un plateau, GLM-5.1 continue de progresser, selon l'éditeur. - Exemple cité par l'éditeur et repris par Computerworld : optimisation d'une base de données vectorielle sur plus de 600 itérations et 6 000 appels d'outils, jusqu'à 21 500 requêtes par seconde. - Les notes de version de la documentation annoncent jusqu'à 8 heures d'exécution continue et un alignement de capacité avec Claude Opus 4.6. ### Architecture et caractéristiques - Même architecture que GLM-5 (MoE, DSA) : 744B annoncé pour GLM-5 ; environ 753,9 Md de paramètres au décompte HF, identique à GLM-5. Le nombre de paramètres actifs n'est pas rappelé dans la fiche 5.1. - Contexte : 200K ; sortie maximale : 128K ; modalité : texte ; date de coupure : non communiquée. - Licence : MIT. Poids : zai-org/GLM-5.1 et GLM-5.1-FP8. - Déploiement : SGLang, vLLM, xLLM, Transformers, KTransformers. ### Coût et accès | Modèle (API Z.ai, tarif courant) | Entrée /M | Entrée en cache /M | Sortie /M | |---|---|---|---| | GLM-5.1 | 1,4 USD | 0,26 USD | 4,4 USD | ### Benchmarks | Benchmark | GLM-5.1 | GLM-5 | Claude Opus 4.6 | Gemini 3.1 Pro | GPT-5.4 | |---|---|---|---|---|---| | SWE-Bench Pro | 58,4 | 55,1 | 57,3 | 54,2 | 57,7 | | NL2Repo | 42,7 | 35,9 | 49,8 | 33,4 | 41,3 | | Terminal-Bench 2.0 (Terminus-2) | 63,5 | 56,2 | 65,4 | 68,5 | - | | CyberGym | 68,7 | 48,3 | 66,6 | 38,8 | 66,3 | | GPQA-Diamond | 86,2 | 86,0 | 91,3 | 94,3 | 92,0 | | HLE (texte seul) | 31,0 | 30,5 | 36,7 | 45,0 | 39,8 | | MCP-Atlas (jeu public) | 71,8 | 69,2 | 73,8 | 69,2 | 67,2 | Source : fiche modèle Hugging Face de GLM-5.1, scores publiés et mesurés par l'éditeur. ### Face aux modèles fermés Sur SWE-Bench Pro, GLM-5.1 affiche 58,4, devant Claude Opus 4.6 (57,3), GPT-5.4 (57,7) et Gemini 3.1 Pro (54,2) dans le tableau de l'éditeur, avec des écarts d'au plus 1,1 point avec les deux premiers. Il est aussi en tête sur CyberGym (68,7 contre 66,6 pour Opus 4.6). Il reste en retrait sur le raisonnement pur : 86,2 contre 94,3 pour Gemini 3.1 Pro sur GPQA-Diamond, et 31,0 contre 45,0 sur HLE. Sur NL2Repo, Opus 4.6 est nettement devant (49,8 contre 42,7). L'API est à 1,4 USD en entrée et 4,4 USD en sortie par million de tokens (tarif courant) ; aucun tarif fermé contemporain n'a été vérifié pour chiffrer l'écart. Le choix ouvert est solide pour le code agentique de long terme, moins pour les tâches de raisonnement scientifique pur. ### À retenir GLM-5.1 déplace l'accent de la performance à froid vers l'endurance sur les longues tâches, avec un modèle ouvert en tête sur SWE-Bench Pro selon l'éditeur. Il garde la licence MIT et l'architecture de GLM-5.
Liens
Tags : LLM, Open Source, Z.ai, Zhipu AI, GLM, MIT, MoE, Agents