GLM-4-0414 (GLM-4-32B, GLM-Z1, GLM-Z1-Rumination)
2025-04-14 · Éditeur : Z.ai · Domaine : Intelligence Artificielle
Zhipu AI a publié la famille GLM-4-0414 sous licence MIT : GLM-4-32B, les modèles de raisonnement GLM-Z1 (32B et 9B) et GLM-Z1-Rumination, présentés comme comparables à GPT-4o et DeepSeek-V3/R1.
Ce qui change
- Un modèle dense de 32 milliards de paramètres, GLM-4-32B-0414, pré-entraîné sur 15T tokens de données, dont une part importante de données synthétiques de raisonnement.
- Un post-entraînement combinant alignement sur préférences humaines, rejection sampling et apprentissage par renforcement pour l'instruction, le code d'ingénierie, l'appel de fonctions et la génération d'artefacts (pages web, SVG).
- GLM-Z1-32B-0414, un modèle de raisonnement obtenu par démarrage à froid, apprentissage par renforcement étendu (maths, code, logique) et retour de préférence par paires.
- GLM-Z1-Rumination-32B-0414, un modèle de « rumination » (réflexion longue avec recherche web) positionné face aux fonctions de recherche approfondie de type Deep Research.
- Une variante 9B, GLM-Z1-9B-0414, qualifiée par l'éditeur de meilleur résultat parmi les modèles ouverts de taille comparable.
Zhipu AI a publié la famille GLM-4-0414 sous licence MIT : GLM-4-32B, les modèles de raisonnement GLM-Z1 (32B et 9B) et GLM-Z1-Rumination, présentés comme comparables à GPT-4o et DeepSeek-V3/R1. ### Contexte En avril 2025, le marché ouvert est dominé par DeepSeek-V3 et R1, très grands (671B au total selon la presse spécialisée), et par les Qwen2.5. Zhipu AI, société issue de l'université Tsinghua, avait publié GLM-4-9B en juin 2024. Cette nouvelle série vise un modèle de taille intermédiaire, déployable en local, avec des scores affichés proches de modèles beaucoup plus gros. ### Ce que le modèle apporte - Un modèle dense de 32 milliards de paramètres, GLM-4-32B-0414, pré-entraîné sur 15T tokens de données, dont une part importante de données synthétiques de raisonnement. - Un post-entraînement combinant alignement sur préférences humaines, rejection sampling et apprentissage par renforcement pour l'instruction, le code d'ingénierie, l'appel de fonctions et la génération d'artefacts (pages web, SVG). - GLM-Z1-32B-0414, un modèle de raisonnement obtenu par démarrage à froid, apprentissage par renforcement étendu (maths, code, logique) et retour de préférence par paires. - GLM-Z1-Rumination-32B-0414, un modèle de « rumination » (réflexion longue avec recherche web) positionné face aux fonctions de recherche approfondie de type Deep Research. - Une variante 9B, GLM-Z1-9B-0414, qualifiée par l'éditeur de meilleur résultat parmi les modèles ouverts de taille comparable. ### Architecture et caractéristiques - Modèles denses (pas de MoE) : 32B et 9B, avec versions Base, chat et raisonnement. - Données : 15T tokens pour GLM-4-32B-Base-0414. Fenêtre de contexte et date de coupure : non communiquées dans la fiche modèle ; la fiche Z1 recommande d'activer YaRN au-delà de 8 192 tokens d'entrée. - Langues : chinois et anglais. - Licence : MIT (usage commercial autorisé, sans seuil ni restriction géographique). - Poids : Hugging Face (zai-org/GLM-4-32B-0414 et déclinaisons) et ModelScope. ### Coût et accès | Élément | Valeur | |---|---| | API Z.ai, GLM-4-32B-0414-128K (tarif courant) | 0,1 USD entrée / 0,1 USD sortie par million de tokens | | Auto-hébergement | Matériel requis non communiqué par l'éditeur dans la fiche | ### Benchmarks | Benchmark | GLM-4-32B-0414 | GPT-4o-1120 | Qwen2.5-Max | DeepSeek-V3-0324 (ouvert) | |---|---|---|---|---| | IFEval | 87,6 | 81,9 | 85,6 | 83,4 | | BFCL-v3 (global) | 69,6 | 69,6 | 50,9 | 66,2 | | TAU-Bench Retail | 68,7 | 62,8 | 58,3 | 60,7 | | TAU-Bench Airline | 51,2 | 46,0 | 22,0 | 32,4 | | SimpleQA | 88,1 | 82,8 | 79,0 | 82,6 | Source : fiche modèle Hugging Face GLM-4-32B-0414, scores mesurés par l'éditeur ; SimpleQA et HotpotQA sur environ 500 cas, avec outils de recherche, moyenne de 3 exécutions. Sur SWE-bench Verified, GLM-4-32B-0414 obtient 33,8 (Moatless), 30,7 (Agentless) et 27,2 (OpenHands) selon la même fiche ; aucun score de modèle fermé n'y figure. ### Face aux modèles fermés Dans le tableau publié par l'éditeur, GLM-4-32B-0414 dépasse GPT-4o-1120 sur IFEval (87,6 contre 81,9), TAU-Bench Retail (68,7 contre 62,8) et SimpleQA (88,1 contre 82,8), et l'égale sur BFCL-v3 global (69,6). Ces comparaisons sont choisies et mesurées par Zhipu AI, sans reproduction indépendante citée. Le modèle est 32B dense, donc exécutable sur un petit nombre de GPU, alors que l'écart de taille avec DeepSeek-R1 est présenté comme l'argument principal. Pour le choix ouvert ou fermé, l'intérêt est la licence MIT, l'auto-hébergement possible et un coût API de 0,1 USD par million de tokens en entrée comme en sortie sur la plateforme de l'éditeur. En code agentique, les 33,8 % sur SWE-bench Verified restent nettement en dessous des scores de la génération suivante (GLM-4.5 : 64,2 %). ### À retenir GLM-4-0414 marque le retour de Zhipu AI parmi les modèles ouverts utilisables en entreprise : licence MIT, taille modeste, raisonnement et recherche approfondie inclus. C'est le socle de la série GLM-4.1V puis du passage au MoE avec GLM-4.5.
Liens
Tags : LLM, Open Source, Zhipu AI, Z.ai, GLM, MIT, Raisonnement