GLM-4.5 et GLM-4.5-Air
2025-07-28 · Éditeur : Z.ai · Domaine : Intelligence Artificielle
Z.ai (ex-Zhipu AI) a publié GLM-4.5 (355B paramètres, 32B actifs) et GLM-4.5-Air (106B, 12B actifs), deux modèles MoE à raisonnement hybride pour agents et code, sous licence MIT.
Ce qui change
- Un raisonnement hybride : un mode thinking pour le raisonnement complexe et les outils, un mode non-thinking pour les réponses immédiates.
- Une architecture MoE plus profonde que large, avec des couches MTP pour le décodage spéculatif.
- Un entraînement en plusieurs étapes sur 23T tokens (15T de corpus général puis 7T de code et de raisonnement, selon le billet), suivi d'itérations d'experts et d'apprentissage par renforcement.
- Des capacités agentiques natives : appel de fonctions, navigation web (BrowseComp), développement full-stack, génération de présentations.
- Une compatibilité annoncée avec le cadre Claude Code et des évaluations CC-Bench sur 52 tâches de code.
Z.ai (ex-Zhipu AI) a publié GLM-4.5 (355B paramètres, 32B actifs) et GLM-4.5-Air (106B, 12B actifs), deux modèles MoE à raisonnement hybride pour agents et code, sous licence MIT. ### Contexte Mi-2025, les modèles ouverts MoE chinois (DeepSeek-V3/R1, Kimi K2, Qwen3) se disputent le haut du classement ouvert, tandis que les modèles fermés dominent encore le code agentique (Claude 4, o3, Gemini 2.5). Zhipu AI vient de publier GLM-4-0414 et GLM-4.1V-Thinking. GLM-4.5 est le premier modèle de l'éditeur à viser explicitement l'ensemble raisonnement, code et agents dans un seul modèle. ### Ce que le modèle apporte - Un raisonnement hybride : un mode thinking pour le raisonnement complexe et les outils, un mode non-thinking pour les réponses immédiates. - Une architecture MoE plus profonde que large, avec des couches MTP pour le décodage spéculatif. - Un entraînement en plusieurs étapes sur 23T tokens (15T de corpus général puis 7T de code et de raisonnement, selon le billet), suivi d'itérations d'experts et d'apprentissage par renforcement. - Des capacités agentiques natives : appel de fonctions, navigation web (BrowseComp), développement full-stack, génération de présentations. - Une compatibilité annoncée avec le cadre Claude Code et des évaluations CC-Bench sur 52 tâches de code. ### Architecture et caractéristiques - GLM-4.5 : 355B au total, 32B actifs. GLM-4.5-Air : 106B au total, 12B actifs. Versions Base, hybrides et FP8 publiées. - Contexte : 128K tokens ; sortie maximale : 96K (documentation API). Modalité : texte. Langues : chinois et anglais. - Date de coupure des connaissances : non communiquée. - Licence : MIT, usage commercial et dérivés autorisés. - Poids : Hugging Face (zai-org/GLM-4.5, GLM-4.5-Air) et ModelScope. Rapport technique : arXiv 2508.06471. ### Coût et accès | Modèle (API Z.ai, tarifs courants) | Entrée /M | Sortie /M | Entrée en cache /M | |---|---|---|---| | GLM-4.5 | 0,6 USD | 2,2 USD | 0,11 USD | | GLM-4.5-Air | 0,2 USD | 1,1 USD | 0,03 USD | | GLM-4.5-X | 2,2 USD | 8,9 USD | 0,45 USD | Auto-hébergement (fiche modèle, avec MTP, lot inférieur ou égal à 8) : GLM-4.5 en FP8 sur 8 H100 ou 4 H200 ; GLM-4.5-Air en FP8 sur 2 H100 ou 1 H200 ; contexte complet 128K : 16 H100 (GLM-4.5 FP8) ou 4 H100 (Air FP8). ### Benchmarks | Mesure | GLM-4.5 | Comparaison | |---|---|---| | BrowseComp (avec navigation) | 26,4 % | Claude-4-Opus 18,8 % ; o4-mini-high 28,3 % | | SWE-bench Verified | 64,2 % | Score des modèles fermés non repris (tableau en image) | | TAU-Bench | 70,1 % | idem | | AIME 24 | 91,0 % | idem | | Moyenne sur 12 benchmarks | 63,2 (3e rang) | GLM-4.5-Air : 59,8 | Sources : billet officiel z.ai/blog/glm-4.5 (BrowseComp), résumé du rapport arXiv 2508.06471 (SWE-bench, TAU, AIME) et fiche Hugging Face (moyenne) ; scores mesurés par l'éditeur. Sur CC-Bench, GLM-4.5 obtient 53,9 % de victoires contre Kimi K2 et 80,8 % contre Qwen3-Coder, avec « une marge de progression » face à Claude-4-Sonnet selon l'éditeur (pas de chiffre donné). ### Face aux modèles fermés Selon l'éditeur, GLM-4.5 se classe 3e sur 12 benchmarks parmi l'ensemble des modèles évalués, ouverts et fermés, et 2e sur les benchmarks agentiques (rapport arXiv). Sur BrowseComp, il devance Claude-4-Opus (26,4 % contre 18,8 %) et reste proche d'o4-mini-high (28,3 %). L'éditeur reconnaît un retard sur Claude-4-Sonnet en code agentique (CC-Bench), sans donner le score. L'API est à 0,6 USD en entrée et 2,2 USD en sortie par million de tokens, soit un niveau que l'éditeur présente comme très bas ; aucun tarif de modèle fermé contemporain n'a été vérifié pour chiffrer l'écart. Pour l'entreprise, la licence MIT et l'empreinte matérielle réduite (8 H100 en FP8) rendent l'auto-hébergement d'un modèle de classe frontière envisageable. ### À retenir GLM-4.5 est le jalon qui fait passer les GLM de modèles de 32B à un MoE de 355B, sous MIT et avec un mode agentique complet. La déclinaison Air (106B, 12B actifs) est la plus accessible à l'auto-hébergement.
Liens
Tags : LLM, Open Source, Z.ai, Zhipu AI, GLM, MIT, MoE, Agents