GLM (Z.ai)
FREEMIUMLa famille de modèles de Z.ai (ex-Zhipu AI) et son assistant gratuit chat.z.ai. GLM-5.3 est le modèle phare depuis le 14 août 2026, avec un contexte d'un million de tokens ; GLM-5.2, sous licence MIT, reste la référence des poids ouverts.
Note de la rédaction, basée sur l'analyse des avis utilisateurs et de la documentation disponible.

À quoi sert GLM ?
GLM (pour General Language Model) est la famille de modèles d'intelligence artificielle de Z.ai, l'entreprise chinoise anciennement connue à l'international sous le nom de Zhipu AI. On y accède de trois façons : par l'assistant gratuit chat.z.ai, par une API pour développeurs, ou en téléchargeant les poids des modèles publiés pour les faire tourner sur sa propre infrastructure.
L'assistant s'utilise sans compte, avec un sélecteur de modèles qui propose GLM-5.3 (marqué « New »), GLM-5.2, GLM-5-Turbo, le modèle de vision GLM-5V-Turbo et GLM-4.7 ; sur l'accueil, c'est GLM-4.7 qui s'affiche par défaut. Un panneau invite à se connecter pour « des réponses plus intelligentes et l'accès aux modèles avancés ». L'interface, elle, s'affiche en anglais, sans version française : c'est le premier écart avec Kimi ou Qwen, dont les assistants sont traduits.

Le cœur du sujet est désormais GLM-5.3, lancé le 14 août 2026 et présenté par l'éditeur comme le modèle phare de la maison : il reprend la base de GLM-5.2 (744 milliards de paramètres, dont 40 Md activés par token) et tire tous ses gains d'une nouvelle campagne de post-entraînement sur des environnements d'agents long horizon. Le raisonnement est imposé, avec trois niveaux d'effort (low, high, max, par défaut max), le contexte reste d'un million de tokens pour 128 000 de sortie maximum, et les entrées sont limitées au texte à sa sortie. Z.ai annonce 50 % de gain sur son banc interne Z.ai Code Bench et la première place du codage parmi les modèles à poids ouverts (Terminal Bench 3.0, Agents' Last Exam en CLI). Son prédécesseur, GLM-5.2, lancé le 16 juin 2026, reste disponible dans l'assistant et à l'API.
Le 26 août 2026, Z.ai a confirmé que le mystérieux modèle Ox Alpha aperçu sur OpenRouter était en réalité sa variante GLM-5.3-Flash : 320 milliards de paramètres dont 18 Md activés, contexte d'un million de tokens, licence MIT, présentée comme tournant entièrement sur des puces IA chinoises, et facturée à l'API 0,15 $/M en entrée et 0,50 $/M en sortie (remise de 50 % jusqu'au 9 septembre 2026). L'article sur Ox Alpha reste la référence sur la phase anonyme et ses limites.
C'est le quatrième grand modèle chinois de notre annuaire, aux côtés de Kimi, DeepSeek et Qwen.
Qui est Z.ai, l'éditeur de GLM ?
Z.ai est née en 2019 à Pékin, en essaimage de l'université Tsinghua. Longtemps appelée Zhipu AI hors de Chine, elle est l'un des six « tigres de l'IA » chinois, et le premier de la bande à s'être introduit en Bourse, à Hong Kong, le 8 janvier 2026. Depuis juillet 2025, elle publie ses modèles phares sous licence MIT, la plus permissive du marché.
Sur l'Intelligence Index d'Artificial Analysis, GLM-5.2 marquait 51 points au relevé du 30 juillet 2026, derrière Claude Opus 5 (61), Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) et Grok 4.5 (54). Le même relevé le classait deuxième parmi les modèles à poids ouverts de sa catégorie de taille et lui reprochait sa verbosité. Depuis, Artificial Analysis a révisé sa méthodologie (version 4.1.1, début août 2026) et référencé GLM-5.3 (variante max) à son catalogue le 18 août 2026. Au relevé du 31 août 2026, GLM-5.3 (max) affiche 59,5, sixième de tous les modèles confondus, devant Qwen3.8-Max (57,7) ; le face-à-face détaillé est dans notre comparatif Qwen contre GLM. Face à l'autre géant chinois des poids ouverts, dont les tarifs API ont grimpé en août, voyez notre comparatif GLM contre DeepSeek.
La licence MIT, confirmée pour GLM-5.2, autorise tout, y compris l'usage commercial. Encore faut-il pouvoir charger le modèle : 744 milliards de paramètres supposent un serveur multi-GPU, pas un ordinateur de bureau. Pour GLM-5.3, la promesse a été tenue dans le délai annoncé : les poids sont arrivés sur Hugging Face le 25 août 2026, sous une licence maison qui reprend le texte de la MIT en y ajoutant une revue de sécurité pour les activités de « modèle en service » dépassant 10 milliards de dollars de revenus sur douze mois consécutifs. Enfin, la politique de confidentialité de l'assistant hébergé désigne comme responsable de traitement une société enregistrée à Singapour, indique que les données y sont « généralement traitées » et prévoit leur usage pour « entraîner et améliorer nos modèles » au titre de l'intérêt légitime.
GLM est-il gratuit ? Les offres et les tarifs
L'assistant chat.z.ai est gratuit, sans abonnement grand public publié à ce jour. Ce qui se paie, c'est le GLM Coding Plan, un forfait pensé pour les outils de développement, et l'API.
| Offre | Prix mensuel (sans engagement) | En annuel (30 % de remise) | Quota hebdomadaire |
|---|---|---|---|
| Lite | 18 $ | 12,60 $/mois, soit 151,20 $/an | 10 000 crédits |
| Pro | 80 $ | 56 $/mois, soit 672 $/an | 6× le Lite |
| Max | 168 $ | 117,60 $/mois, soit 1 411,20 $/an | 14× le Lite |
Tarifs relevés le 24 août 2026 sur la page d'abonnement de z.ai, en dollars américains. Attention au piège : la page s'ouvre sur l'onglet annuel, remisé de 30 %. Le trimestriel est remisé de 20 %, le mensuel ne l'est pas. Depuis la mi-août 2026, le plan fonctionne en crédits, avec une limite d'usage de 5 heures et un quota hebdomadaire ; les appels hors heures de pointe (14 h à 18 h, heure de Pékin, en semaine) consomment 50 % des crédits, les week-ends étant considérés comme heures creuses.
Côté API, les prix sont publics et facturés au million de tokens :
| Modèle (API) | Entrée | Sortie |
|---|---|---|
| GLM-5.3-Flash | 0,15 $ | 0,50 $ |
| GLM-5.3 | 1,40 $ | 4,40 $ |
| GLM-5.2 | 1,40 $ | 4,40 $ |
| GLM-5-Turbo | 1,20 $ | 4,00 $ |
| GLM-4.7 | 0,60 $ | 2,20 $ |
| GLM-4.7-FlashX | 0,07 $ | 0,40 $ |
| GLM-4.7-Flash | Gratuit | Gratuit |
Tarifs officiels de la documentation Z.ai : GLM-5.3 et GLM-5.2 relevés le 24 août 2026, GLM-5.3-Flash relevé le 27 août 2026 (remise de 50 % jusqu'au 9 septembre). Les tokens déjà en cache tombent à 0,26 $/M en entrée pour GLM-5.3 et GLM-5.2. Les deux modèles se consomment aussi chez des hébergeurs tiers, via OpenRouter ou en direct.
Le modèle sur lequel Hugging Face s'est rabattue
C'est l'épisode qui a fait connaître GLM-5.2 au-delà du cercle des développeurs. En juillet 2026, après l'intrusion d'un agent d'OpenAI dans son infrastructure, Hugging Face a dû analyser plus de 17 000 événements de journal. Les modèles de frontière appelés par API ont refusé la tâche, leurs garde-fous ne distinguant pas un répondeur d'incident d'un attaquant.
Nous avons donc mené l'analyse forensique sur GLM 5.2, un modèle à poids ouverts, sur notre propre infrastructure. Cela a eu un second avantage : aucune donnée d'attaquant, ni aucun des identifiants qu'elle mentionnait, n'a quitté notre environnement.Hugging Face, billet « Security incident, July 2026 », 16 juillet 2026 · traduit de l'anglais
Notre article sur cet incident revient sur le dossier en détail. L'affaire a fait remonter GLM jusqu'aux réunions d'investisseurs : le 29 juillet 2026, lors de l'appel de résultats de Microsoft, Satya Nadella citait l'épisode pour défendre une architecture multi-modèles, avec cette formule reprise dans la transcription officielle : « vous ne pouvez pas être soumis aux refus d'un seul modèle ».
Ce qu'en disent les utilisateurs
Les retours de développeurs sur GLM-5.2 convergent : le modèle fait le travail pour une fraction du prix, sans égaler les meilleurs. Sur Hacker News, l'utilisateur sroerick écrivait le 26 juillet 2026 être « extrêmement satisfait » de ce qu'il produit, tout en trouvant Kimi « nettement meilleur pour l'architecture ». D'autres sont plus sévères.
Les modèles chinois ne m'ont pas impressionné (j'ai essayé DeepSeek V4 Pro et Flash, et GLM5.2) : la quantité de code douteux, d'erreurs et de contresens faisait que l'argent économisé et la vitesse supérieure ne se traduisaient pas par des progrès plus rapides pour moi.torginus, Hacker News, 28 juillet 2026 · traduit de l'anglais
Sur r/LocalLLaMA, un fil très commenté rappelle enfin la limite de l'ouverture quand le modèle pèse 744 milliards de paramètres.
Les benchmarks de choses comme GLM-5.2 ont l'air dingues. 753 milliards de paramètres, un million de tokens de contexte, licence MIT (…). Mais concrètement, qu'est-ce qui est encore « local » là-dedans ? (…) C'est bien que les poids soient vraiment publiés plutôt qu'enfermés dans un coffre. Mais en pratique ? Pour des gens normaux, ils pourraient tout aussi bien être fermés.u/Mountain_Patience231, r/LocalLLaMA, 17 juillet 2026 · traduit de l'anglais
Questions fréquentes
Quelle IA utilise GLM ?
L'assistant chat.z.ai et l'application de bureau ZCode, tous deux édités par Z.ai. GLM-5.3 est le modèle phare depuis le 14 août 2026 ; le GLM Coding Plan donne accès à GLM-5.3, GLM-5-Turbo et GLM-4.7, utilisables dans Claude Code, Cline, OpenCode et une vingtaine d'outils.
Z.ai est-il gratuit ou payant ?
Les deux. L'assistant web est gratuit, sans abonnement grand public publié à ce jour. Le GLM Coding Plan, destiné aux outils de développement, coûte de 18 à 168 $ par mois, et l'API est facturée à l'usage.
Pourquoi le GLM Coding Plan semble moins cher sur la page de z.ai ?
La page s'ouvre sur l'onglet annuel, remisé de 30 % : 12,60 $ par mois au lieu de 18 $ en Lite, avec engagement d'un an. L'onglet mensuel affiche le prix réel sans engagement.
Comment obtenir une clé API GLM gratuite ?
Z.ai ne distribue pas de clé gratuite, mais deux modèles sont facturés 0 $ à l'usage sur son API, GLM-4.7-Flash et GLM-4.6V-Flash. Il faut tout de même créer un compte sur la plateforme et générer une clé.
GLM-5.2 est-il vraiment open source ?
Ses poids sont publiés sous licence MIT, sans restriction géographique ni clause de repartage, comme ceux de DeepSeek, là où Kimi impose une licence maison. Les données et le code d'entraînement, en revanche, ne sont pas publiés, d'où le terme plus juste de « poids ouverts ». GLM-5.3 est annoncé en poids ouverts deux semaines après son lancement du 14 août 2026 ; sa licence n'était pas encore connue au 24 août. La variante GLM-5.3-Flash, sortie le 26 août, est, elle, publiée sous MIT.
GLM parle-t-il français ?
Il comprend et rédige le français, mais sa fiche modèle ne déclare officiellement que l'anglais et le chinois, l'interface de l'assistant s'affiche en anglais, et aucune source indépendante n'a évalué sa qualité rédactionnelle en français. À éprouver sur vos propres textes avant d'y compter.
GLM ou Kimi : lequel choisir ?
Kimi K3 reste mieux classé sur l'Intelligence Index d'Artificial Analysis au relevé du 30 juillet 2026 (57 contre 51) et son assistant est traduit en français, mais sa licence maison impose un accord commercial aux revendeurs d'inférence. GLM-5.3 revendique la meilleure performance en codage parmi les poids ouverts (Terminal Bench 3.0, Z.ai Code Bench) et l'API reste nettement moins chère.
Peut-on faire tourner GLM chez soi ?
Rien ne l'interdit, la licence MIT de GLM-5.2 étant sans restriction, mais ses 744 milliards de paramètres supposent un serveur multi-GPU, pas un ordinateur personnel. Les frameworks vLLM, SGLang, Transformers, KTransformers et Unsloth le prennent en charge. Les poids de GLM-5.3 n'étaient pas encore publiés au 24 août 2026 ; seuls ceux de la variante Flash (320 Md dont 18 Md actifs) sont en ligne à ce jour.
Les données envoyées à l'assistant sont-elles réutilisées ?
Sa politique de confidentialité prévoit l'usage des contenus pour « entraîner et améliorer » les modèles, au titre de l'intérêt légitime, avec un traitement situé « généralement » à Singapour. Pour un dossier confidentiel, préférez l'auto-hébergement des poids.
Points forts & limites
Sur la page d'abonnement de z.ai, l'onglet annuel est sélectionné par défaut : le prix mis en avant est le mensuel équivalent après 30 % de remise, avec un engagement d'un an (12,60 $ au lieu de 18 $ en Lite). Cliquez sur « Monthly » pour voir le prix réel sans engagement.
Cas d'usage typiques
Alternatives à GLM (Z.ai)
Trois outils qui répondent au même besoin, avec leur note et leur tarif d'entrée.
Le chatbot chinois open-weight de Moonshot AI : le modèle géant K3, contexte d'un million de tokens, gratuit pour démarrer.
Le chatbot chinois aux modèles ouverts, très bon en code, et l'une des API les moins chères du marché.
La famille de modèles ouverts la plus déclinée du marché, signée Alibaba, et son assistant gratuit Qwen Studio.
GLM (Z.ai) face aux autres
Nos comparatifs critère par critère, pour trancher.