GLM-5.3-Flash (et GLM-5.3-FlashX)

2026-08-26 · Éditeur : Z.ai · Domaine : Intelligence Artificielle

Z.ai a publié GLM-5.3-Flash, MoE multimodal natif de 320B paramètres (18B actifs) à attention hybride et contexte 1M, sous licence MIT, facturé 0,15 USD en entrée et 0,50 USD en sortie par million de tokens.

Ce qui change

  • Une architecture hybride qui combine attention linéaire (dépendances locales) et attention parcimonieuse avec indexeur léger ; IndexPool compresse quatre vecteurs de clés d'indexeur en un.
  • Des Manifold-Constrained Hyper-Connections (mHC) pour l'efficacité de mise à l'échelle.
  • Par rapport à GLM-5.3, 3,0 fois moins de calcul d'attention et un cache KV 4,4 fois plus petit ; 45 couches contre 92 pour GLM-4.5, et 18B actifs contre 32B.
  • Le premier GLM nativement multimodal (image, vidéo, texte, fichiers), avec un usage visuel dans la boucle de code (auto-vérification du rendu) et de l'interaction avec les interfaces (OSWorld 2.0 : 59,1).
  • Un score de 57 à l'Artificial Analysis Intelligence Index v4.1.1 pour 0,045 USD par tâche (tarif remisé), selon l'éditeur.

Z.ai a publié GLM-5.3-Flash, MoE multimodal natif de 320B paramètres (18B actifs) à attention hybride et contexte 1M, sous licence MIT, facturé 0,15 USD en entrée et 0,50 USD en sortie par million de tokens. ### Contexte GLM-5.2 et 5.3 ont une base de 744B et un tarif de 1,4/4,4 USD. GLM-5.3-Flash repart d'une base nouvellement entraînée, avec pour objectif un coût d'inférence très bas. Selon le billet, le modèle a été testé anonymement avant sa sortie sur OpenCode et OpenRouter, où il serait devenu le modèle le plus populaire de la semaine, sur des puces chinoises. ### Ce que le modèle apporte - Une architecture hybride qui combine attention linéaire (dépendances locales) et attention parcimonieuse avec indexeur léger ; IndexPool compresse quatre vecteurs de clés d'indexeur en un. - Des Manifold-Constrained Hyper-Connections (mHC) pour l'efficacité de mise à l'échelle. - Par rapport à GLM-5.3, 3,0 fois moins de calcul d'attention et un cache KV 4,4 fois plus petit ; 45 couches contre 92 pour GLM-4.5, et 18B actifs contre 32B. - Le premier GLM nativement multimodal (image, vidéo, texte, fichiers), avec un usage visuel dans la boucle de code (auto-vérification du rendu) et de l'interaction avec les interfaces (OSWorld 2.0 : 59,1). - Un score de 57 à l'Artificial Analysis Intelligence Index v4.1.1 pour 0,045 USD par tâche (tarif remisé), selon l'éditeur. ### Architecture et caractéristiques - 320B au total, 18B actifs (environ 321,3 Md au décompte HF). Corpus de pré-entraînement multimodal de 30T tokens. - Contexte : 1M tokens ; sortie maximale : 128K ; entrées : image, vidéo, texte, fichier ; sortie : texte (documentation API). Date de coupure : non communiquée. - Licence : MIT (fichier LICENSE, « Copyright (c) 2026 Z.AI Co., Ltd »). Poids : zai-org/GLM-5.3-Flash et version BF16. - Paramètre reasoning_effort : low, high, max (max par défaut). ### Coût et accès | Modèle (API Z.ai, tarif courant) | Entrée /M | Entrée en cache /M | Sortie /M | |---|---|---|---| | GLM-5.3-Flash | 0,15 USD | 0,03 USD | 0,50 USD | | GLM-5.3-FlashX (environ 200 tokens/s) | 0,37 USD | 0,075 USD | 1,25 USD | Auto-hébergement : SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth ; matériel requis non chiffré. ### Benchmarks | Benchmark | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash | |---|---|---|---|---|---| | Terminal Bench 2.1 | 84,3 | 81,0 | 85,0 | 87,4 | 85,8 | | DeepSWE (v1.1) | 63,4 | 46,2 | 58 | 69,6 | 65,3 | | Toolathlon Verified | 78,4 | 59,9 | 76,2 | 74,9 | - | | AutomationBench (v1.0.6) | 48,8 | 26,2 | 41,0 | 37,2 | 52,3 | | HLE avec outils | 55,3 | 54,7 | 57,9 | - | - | | GDPval-AA v2 | 1773 | 1504 | 1582 | 1571 | 1527 | | OSWorld 2.0 | 59,1 | - | 54,8 | 50,2 | 47,9 | | BabyVision | 53,4 | - | 46,8 | 61,6 | 70,9 | Source : billet z.ai de GLM-5.3-Flash, scores publiés par l'éditeur ; GDPval-AA v2 mesuré par Artificial Analysis. ### Face aux modèles fermés Dans le tableau de l'éditeur, GLM-5.3-Flash est en retrait d'Opus 4.8 sur Terminal Bench 2.1 (84,3 contre 85,0) mais devant sur DeepSWE (63,4 contre 58), Toolathlon Verified (78,4 contre 76,2), AutomationBench (48,8 contre 41,0) et GDPval-AA v2 (1773 contre 1582). Il est derrière GPT-5.6 Terra sur DeepSWE (69,6) et sur Terminal Bench 2.1 (87,4), et derrière Gemini 3.7 Flash sur BabyVision (70,9 contre 53,4), donc la vision pure n'est pas son point fort. À 0,15 USD par million de tokens en entrée, le prix est environ neuf fois inférieur à celui de GLM-5.3 (1,4 USD), écart cohérent avec la mention « un dixième du prix » du billet ; aucun tarif fermé n'a été vérifié. Le modèle est sous MIT, contrairement à GLM-5.3. ### À retenir GLM-5.3-Flash apporte une nouvelle base plus petite, multimodale, à contexte 1M, avec des scores d'agents proches d'un modèle fermé de pointe pour un coût d'inférence très bas. Il reste sous licence MIT alors que GLM-5.3 a changé de licence.

Liens

Tags : LLM, Open Source, Z.ai, Zhipu AI, GLM, MIT, MoE, Multimodal