GLM 5.2 : le modèle qui divise votre facture API par cinq
753 milliards de paramètres en licence MIT | Un sixième du prix de GPT-5.5 | 750 Go à télécharger, donc oubliez votre PC
Poids d’abord, benchmarks ensuite. Z.ai a publié GLM-5.2 sur Hugging Face le 16 juin, ses résultats le 17. N’importe qui pouvait vérifier avant de croire. Ça n’a l’air de rien, c’est pourtant l’inverse de ce que fait toute l’industrie.
Deux mois plus tard, deux successeurs sont sortis. Le 5.2 n’est plus la vitrine, il reste le mieux servi par les hébergeurs tiers. Pour une raison simple.
Le prix, parlons-en tout de suite
1,40 $ le million de tokens en entrée, 4,40 $ en sortie. Environ un sixième de GPT-5.5.
Et comme la licence MIT laisse n’importe qui héberger le modèle, la concurrence a fait le reste : chez les fournisseurs tiers, le ticket d’entrée est tombé autour de 0,34 $ le million en trois mois. Personne ne vous tient.
Le calcul se fait en trente secondes. Vous brûlez un budget API sur Claude ou GPT ? Basculez les tâches de fond sur GLM-5.2, gardez le premium pour ce qui le mérite, divisez la facture par cinq.
Pour tester dans un terminal, le GLM Coding Plan démarre à 18 $ par mois (80 prompts par cycle de cinq heures en Lite, puis 72 $ en Pro, 160 $ en Max). Il se branche dans les agents habituels, ceux du match Claude Code contre Cursor.
Où l’essayer sans payer
Sur chat.z.ai, avec un compte gratuit. Sans compte, vous n’aurez que GLM-4.7.
Z.ai ne publie aucun quota chiffré pour le palier gratuit, ce qui veut dire en clair : tant que ça passe, ça passe. Le chat sert à se faire une idée en dix minutes, pas à travailler.
En local ? Oubliez
Les poids sont là, librement téléchargeables, licence MIT. La promesse open source est tenue.
Le dimensionnement, lui, est brutal : 1,5 To en BF16, 750 Go en FP8. Aucune carte grand public n’approche ça, quelle que soit la génération.
Ollama référence bien glm-5.2 dans sa bibliothèque, ce qui aide si vous avez un serveur multi-GPU qui traîne (spoiler : vous n’en avez pas). Pour un poste normal, le guide Ollama dit ce qui tourne vraiment selon la VRAM, et Llama 3 reste la porte d’entrée réaliste.
Face à Claude et GPT sur le code
62,1 sur SWE-bench Pro contre 58,6 pour GPT-5.5. 99,2 % sur les problèmes AIME 2026.
Ce sont les chiffres de Z.ai, et un benchmark n’a jamais réparé un ticket dans un dépôt qui traîne cinq ans de dette technique. Un indice extérieur quand même : dans les classements en aveugle de LMArena, les modèles GLM tiennent le peloton de tête depuis le printemps. Ce sont des humains qui votent sans savoir quel modèle ils notent.
Le terrain revendiqué est précis : sessions d’agent qui s’étirent, refactorings multi-fichiers, chaînes d’appels d’outils. C’est aussi celui de Kimi K3. Les départager se joue sur le contexte et le prix.
Ce qui coince quand on bascule
Changer de fournisseur API n’est pas un remplacement de clé. Les formats d’appel d’outils diffèrent, les schémas de réponse aussi, et le code qui pilote vos agents demande une passe de réécriture avant de tourner en face.
Deuxième friction, les hébergeurs tiers. Le prix cassé se paie ailleurs : latence irrégulière selon la charge, aucun engagement de disponibilité, et un modèle qui peut sortir du catalogue sans préavis. L’API officielle de Z.ai coûte quatre fois plus cher que les moins-disants et reste le choix raisonnable pour ce qui tourne en production.
Reste la langue. Les prompts système écrits en français passent sans difficulté, mais la documentation et le support de Z.ai vivent en anglais et en chinois (comptez-le dans le temps d’intégration, pas dans le prix).
Les accès en un coup d’œil
| Accès | Ce qu’on obtient | Prix | Le hic |
|---|---|---|---|
| Chat sans compte | GLM-4.7 seulement | 0 $ | les modèles récents sont grisés |
| Compte gratuit | GLM-5.2 et 5.3 | 0 $ | quotas jamais publiés |
| API officielle | GLM-5.2 complet | 1,40 $ / 4,40 $ par million | facturation à l’usage |
| GLM Coding Plan | 5.2 et 5.3 dans vos outils | 18 à 160 $ / mois | 80 prompts par 5 h en Lite |
| Poids ouverts | le modèle entier, MIT | 0 $ | 750 Go, serveur multi-GPU |
5.3 puis 5.3 Flash : le 5.2 vient d’être doublé
Z.ai ne laisse pas ses modèles vieillir. GLM-5.3 est sorti le 14 août, même base, post-entraînement retravaillé, et surtout même tarif : 1,40 $ et 4,40 $ le million. Un successeur qui ne change rien à l’addition.
Le 26 août a été autrement plus brutal. GLM-5.3-Flash, 320 milliards de paramètres dont 18 actifs, image et vidéo en entrée, un million de tokens de contexte, licence MIT, à 0,15 $ et 0,50 $ le million.
Faites la division : près de neuf fois moins cher que le 5.2, pour de meilleurs résultats sur les bancs de code publiés par l’éditeur. Jusqu’au 9 septembre, la promo de lancement à 0,075 $ et 0,25 $ porte l’écart à dix-sept fois.
Alors on garde le 5.2 ? Pour les tâches de fond, non : basculez sur le Flash, il est fait pour ça. Le 5.2 conserve trois mois de recul et un maillage d’hébergeurs tiers qui cassent les prix depuis juin, ce que le Flash n’a pas encore.
Quant au GLM-5.5 à plus de mille milliards de paramètres, évoqué par une note de JPMorgan fin juin : au 30 août, toujours aucune fiche modèle, aucun endpoint. Une projection d’analystes (on verra).
Le mouvement de fond, lui, est difficile à contester. Après DeepSeek, la séquence 5.2, 5.3 puis 5.3 Flash confirme que les labos chinois publient des poids ouverts au rythme où d’autres publient des communiqués. Chaque itération tire les prix vers le bas. Pour une fois, c’est l’utilisateur qui encaisse dans le bon sens.
Verdict
Le bon plan de juin, doublé par son propre éditeur fin août. Le 5.2 tient encore pour des agents de code via API ou hébergeur tiers, jamais sur votre machine. Si vous démarrez aujourd’hui, regardez d’abord le 5.3 Flash.
Si vous payez aujourd’hui cinq fois ce prix chez Anthropic ou OpenAI pour des tâches de fond, testez le basculement sur une semaine avant de renouveler quoi que ce soit. Le Coding Plan à 18 $ est la porte d’essai la moins risquée du marché.
Deux cas où il faut passer votre chemin. Le local sur poste de travail : 750 Go, le dossier se referme avant d’ouvrir le terminal. Et l’entreprise qui veut un interlocuteur commercial, des engagements de service et une doc en français : l’offre de Z.ai est encore jeune face aux acteurs installés.
Questions fréquentes
GLM 5.2 est-il gratuit ?
Le chat sur chat.z.ai est gratuit avec un compte. Les poids se téléchargent librement sous licence MIT. L’API, elle, est payante : 1,40 $ le million de tokens en entrée, 4,40 $ en sortie.
Peut-on faire tourner GLM 5.2 sur son PC ?
Non. 750 Go en FP8, 1,5 To en BF16 : il faut un serveur multi-GPU. Sur un poste de travail, passez par l’API ou choisissez un modèle ouvert dimensionné pour votre VRAM.
Quelle différence entre GLM 5.2 et GLM 5.3 ?
Même base technique, post-entraînement plus récent pour le 5.3 du 14 août, au même tarif API que le 5.2. C’est la variante Flash, sortie le 26 août, qui change l’addition : 0,15 $ et 0,50 $ le million, près de neuf fois moins cher, avec l’image et la vidéo en entrée.
La licence MIT autorise-t-elle un usage commercial ?
Oui, sans réserve. Modification, intégration dans un produit payant, redistribution, sans obligation de publier vos changements. L’une des licences les plus permissives du marché.
