GLM-4.7 (et GLM-4.7-Flash)

2025-12-22 · Éditeur : Z.ai · Domaine : Intelligence Artificielle

Z.ai a publié GLM-4.7, modèle ouvert orienté code (73,8 % sur SWE-bench Verified), avec pensée entre les actions, pensée préservée entre les tours et contrôle de la réflexion par tour, sous licence MIT.

Ce qui change

  • +5,8 points sur SWE-bench Verified (73,8 contre 68,0) et +12,9 points sur SWE-bench Multilingual (66,7 contre 53,8) face à GLM-4.6.
  • +16,5 points sur Terminal Bench 2.0 (41,0 contre 24,5) et 42,8 % sur HLE avec outils (+12,4 points).
  • Interleaved Thinking, ainsi que deux nouveautés : Preserved Thinking (les blocs de réflexion sont conservés d'un tour à l'autre dans les agents de code) et Turn-level Thinking (réflexion activable par tour pour arbitrer latence et précision).
  • Une qualité d'interface améliorée : pages web plus propres, diapositives mieux dimensionnées.

Z.ai a publié GLM-4.7, modèle ouvert orienté code (73,8 % sur SWE-bench Verified), avec pensée entre les actions, pensée préservée entre les tours et contrôle de la réflexion par tour, sous licence MIT. ### Contexte Fin 2025, les modèles fermés vedettes sont Gemini 3 Pro, Claude Opus 4.5 et GPT-5.1, et le code agentique reste leur point fort. GLM-4.7 succède à GLM-4.6 trois mois après, avec un objectif explicite de « coding partner ». Le 19 janvier 2026, GLM-4.7-Flash, un MoE 30B-A3B, complète la gamme pour le déploiement léger. ### Ce que le modèle apporte - +5,8 points sur SWE-bench Verified (73,8 contre 68,0) et +12,9 points sur SWE-bench Multilingual (66,7 contre 53,8) face à GLM-4.6. - +16,5 points sur Terminal Bench 2.0 (41,0 contre 24,5) et 42,8 % sur HLE avec outils (+12,4 points). - Interleaved Thinking, ainsi que deux nouveautés : Preserved Thinking (les blocs de réflexion sont conservés d'un tour à l'autre dans les agents de code) et Turn-level Thinking (réflexion activable par tour pour arbitrer latence et précision). - Une qualité d'interface améliorée : pages web plus propres, diapositives mieux dimensionnées. ### Architecture et caractéristiques - Environ 358,3 Md de paramètres au décompte HF (famille GLM-4.5, MoE) ; nombre de paramètres actifs non repris dans la fiche. - Contexte : 200K tokens ; sortie maximale : 128K (documentation API). Modalité : texte. Date de coupure : non communiquée. - GLM-4.7-Flash : MoE 30B-A3B (31,2 Md au décompte HF), 200K de contexte. - Licence : MIT. Poids : zai-org/GLM-4.7, GLM-4.7-FP8, GLM-4.7-Flash. Pas de rapport dédié : renvoi vers arXiv 2508.06471. ### Coût et accès | Modèle (API Z.ai, tarif courant) | Entrée /M | Sortie /M | Cache /M | |---|---|---|---| | GLM-4.7 | 0,6 USD | 2,2 USD | 0,11 USD | | GLM-4.7-FlashX | 0,07 USD | 0,4 USD | 0,01 USD | | GLM-4.7-Flash | Gratuit | Gratuit | Gratuit | Auto-hébergement : vLLM et SGLang (branches principales à la publication) ; matériel requis non communiqué. ### Benchmarks | Benchmark | GLM-4.7 | Claude Sonnet 4.5 | GPT-5-High | GPT-5.1-High | Gemini 3.0 Pro | |---|---|---|---|---|---| | SWE-bench Verified | 73,8 | 77,2 | 74,9 | 76,3 | 76,2 | | Terminal Bench 2.0 | 41,0 | 42,8 | 35,2 | 47,6 | 54,2 | | GPQA-Diamond | 85,7 | 83,4 | 85,7 | 88,1 | 91,9 | | AIME 2025 | 95,7 | 87,0 | 94,6 | 94,0 | 95,0 | | HLE avec outils | 42,8 | 32,0 | 35,2 | 42,7 | 45,8 | | τ²-Bench | 87,4 | 87,2 | 82,4 | 82,7 | 90,7 | | BrowseComp | 52,0 | 24,1 | 54,9 | 50,8 | - | Source : fiche modèle Hugging Face de GLM-4.7, scores publiés et mesurés par l'éditeur. ### Face aux modèles fermés Dans le tableau de l'éditeur, GLM-4.7 est légèrement sous GPT-5-High sur SWE-bench Verified (73,8 contre 74,9) mais devant lui sur HLE avec outils (42,8 contre 35,2), τ²-Bench (87,4 contre 82,4) et Terminal Bench 2.0 (41,0 contre 35,2). Il reste derrière Gemini 3.0 Pro sur 5 des 6 lignes comparables (par exemple 76,2 contre 73,8 sur SWE-bench Verified et 54,2 contre 41,0 sur Terminal Bench 2.0), sauf AIME 2025 (95,7 contre 95,0), et derrière GPT-5.1-High sur Terminal Bench 2.0 (47,6). La comparaison inclut aussi Claude Sonnet 4.5, en avance en code (77,2 sur SWE-bench Verified). Le prix API (0,6 USD entrée, 2,2 USD sortie) et la licence MIT sont les points différenciants ; l'écart de score en code agentique avec la tête du classement fermé reste de 2 à 13 points sur ces lignes. ### À retenir GLM-4.7 réduit l'écart de code avec les modèles fermés de fin 2025 sans le supprimer. Le Preserved Thinking, utile dans les agents de code longs, est la nouveauté d'usage principale.

Liens

Tags : LLM, Open Source, Z.ai, Zhipu AI, GLM, MIT, MoE, Code