Outils Intelligence Artificielle
Accueil/ Annuaire/ Chatbots & agents/ GLM (Z.ai)
GLM (Z.ai)

GLM (Z.ai)

FREEMIUM

La famille de modèles de Z.ai (ex-Zhipu AI) et son assistant gratuit chat.z.ai. GLM-5.3 est le modèle phare depuis le 14 août 2026, avec un contexte d'un million de tokens ; GLM-5.2, sous licence MIT, reste la référence des poids ouverts.

4,3 · Note de la rédaction : 4,3 sur 5 Z.ai (Zhipu AI) Web · API · Bureau · Local

Note de la rédaction, basée sur l'analyse des avis utilisateurs et de la documentation disponible.

Aperçu de l'interface

À quoi sert GLM ?

GLM (pour General Language Model) est la famille de modèles d'intelligence artificielle de Z.ai, l'entreprise chinoise anciennement connue à l'international sous le nom de Zhipu AI. On y accède de trois façons : par l'assistant gratuit chat.z.ai, par une API pour développeurs, ou en téléchargeant les poids des modèles publiés pour les faire tourner sur sa propre infrastructure.

L'assistant s'utilise sans compte, avec un sélecteur de modèles qui propose GLM-5.3 (marqué « New »), GLM-5.2, GLM-5-Turbo, le modèle de vision GLM-5V-Turbo et GLM-4.7 ; sur l'accueil, c'est GLM-4.7 qui s'affiche par défaut. Un panneau invite à se connecter pour « des réponses plus intelligentes et l'accès aux modèles avancés ». L'interface, elle, s'affiche en anglais, sans version française : c'est le premier écart avec Kimi ou Qwen, dont les assistants sont traduits.

Le sélecteur de modèles de chat.z.ai, capturé le 24 août 2026 : GLM-5.3 (nouveau modèle phare) devant GLM-5.2, le précédent fleuron.
Le sélecteur de modèles de chat.z.ai, capturé le 24 août 2026 : GLM-5.3 (nouveau modèle phare) devant GLM-5.2, le précédent fleuron.

Le cœur du sujet est désormais GLM-5.3, lancé le 14 août 2026 et présenté par l'éditeur comme le modèle phare de la maison : il reprend la base de GLM-5.2 (744 milliards de paramètres, dont 40 Md activés par token) et tire tous ses gains d'une nouvelle campagne de post-entraînement sur des environnements d'agents long horizon. Le raisonnement est imposé, avec trois niveaux d'effort (low, high, max, par défaut max), le contexte reste d'un million de tokens pour 128 000 de sortie maximum, et les entrées sont limitées au texte à sa sortie. Z.ai annonce 50 % de gain sur son banc interne Z.ai Code Bench et la première place du codage parmi les modèles à poids ouverts (Terminal Bench 3.0, Agents' Last Exam en CLI). Son prédécesseur, GLM-5.2, lancé le 16 juin 2026, reste disponible dans l'assistant et à l'API.

Le 26 août 2026, Z.ai a confirmé que le mystérieux modèle Ox Alpha aperçu sur OpenRouter était en réalité sa variante GLM-5.3-Flash : 320 milliards de paramètres dont 18 Md activés, contexte d'un million de tokens, licence MIT, présentée comme tournant entièrement sur des puces IA chinoises, et facturée à l'API 0,15 $/M en entrée et 0,50 $/M en sortie (remise de 50 % jusqu'au 9 septembre 2026). L'article sur Ox Alpha reste la référence sur la phase anonyme et ses limites.

C'est le quatrième grand modèle chinois de notre annuaire, aux côtés de Kimi, DeepSeek et Qwen.

GLM en chiffres
744 Md
paramètres de GLM-5.2, dont 40 Md activés par token ; GLM-5.3 reprend cette base
1 M
tokens de contexte, pour 128 K de sortie maximum
MIT
la licence des poids de GLM-5.2 ; GLM-5.3, publié le 25 août, y ajoute une revue de sécurité pour les MaaS au-delà de 10 Md$ de revenus
14 août 2026
lancement de GLM-5.3, poids ouverts promis dans les deux semaines

Qui est Z.ai, l'éditeur de GLM ?

Z.ai est née en 2019 à Pékin, en essaimage de l'université Tsinghua. Longtemps appelée Zhipu AI hors de Chine, elle est l'un des six « tigres de l'IA » chinois, et le premier de la bande à s'être introduit en Bourse, à Hong Kong, le 8 janvier 2026. Depuis juillet 2025, elle publie ses modèles phares sous licence MIT, la plus permissive du marché.

Les grandes étapes
2019Fondation à Pékin, dans le sillage de l'université Tsinghua.
Juillet 2025GLM-4.5 sort sous licence MIT et la marque internationale devient Z.ai.
8 janvier 2026Introduction en Bourse à Hong Kong, une première pour un éditeur chinois de grands modèles.
12 février 2026Lancement de GLM-5.
7 avril 2026Les poids de GLM-5.1 sont publiés à leur tour.
16 juin 2026GLM-5.2 : contexte d'un million de tokens, licence MIT, architecture IndexShare.
14 août 2026GLM-5.3 : même base que GLM-5.2, gains par post-entraînement, poids ouverts annoncés dans les deux semaines.
25 août 2026Les poids de GLM-5.3 sont publiés sur Hugging Face, sous une licence maison inspirée de la MIT.
26 août 2026GLM-5.3-Flash : la variante repérée sous le nom Ox Alpha, licence MIT, 320 Md dont 18 Md actifs, présentée sur puces chinoises.

Sur l'Intelligence Index d'Artificial Analysis, GLM-5.2 marquait 51 points au relevé du 30 juillet 2026, derrière Claude Opus 5 (61), Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) et Grok 4.5 (54). Le même relevé le classait deuxième parmi les modèles à poids ouverts de sa catégorie de taille et lui reprochait sa verbosité. Depuis, Artificial Analysis a révisé sa méthodologie (version 4.1.1, début août 2026) et référencé GLM-5.3 (variante max) à son catalogue le 18 août 2026. Au relevé du 31 août 2026, GLM-5.3 (max) affiche 59,5, sixième de tous les modèles confondus, devant Qwen3.8-Max (57,7) ; le face-à-face détaillé est dans notre comparatif Qwen contre GLM. Face à l'autre géant chinois des poids ouverts, dont les tarifs API ont grimpé en août, voyez notre comparatif GLM contre DeepSeek.

!
Ce que « poids ouverts » ne veut pas dire

La licence MIT, confirmée pour GLM-5.2, autorise tout, y compris l'usage commercial. Encore faut-il pouvoir charger le modèle : 744 milliards de paramètres supposent un serveur multi-GPU, pas un ordinateur de bureau. Pour GLM-5.3, la promesse a été tenue dans le délai annoncé : les poids sont arrivés sur Hugging Face le 25 août 2026, sous une licence maison qui reprend le texte de la MIT en y ajoutant une revue de sécurité pour les activités de « modèle en service » dépassant 10 milliards de dollars de revenus sur douze mois consécutifs. Enfin, la politique de confidentialité de l'assistant hébergé désigne comme responsable de traitement une société enregistrée à Singapour, indique que les données y sont « généralement traitées » et prévoit leur usage pour « entraîner et améliorer nos modèles » au titre de l'intérêt légitime.

GLM est-il gratuit ? Les offres et les tarifs

L'assistant chat.z.ai est gratuit, sans abonnement grand public publié à ce jour. Ce qui se paie, c'est le GLM Coding Plan, un forfait pensé pour les outils de développement, et l'API.

OffrePrix mensuel (sans engagement)En annuel (30 % de remise)Quota hebdomadaire
Lite18 $12,60 $/mois, soit 151,20 $/an10 000 crédits
Pro80 $56 $/mois, soit 672 $/an6× le Lite
Max168 $117,60 $/mois, soit 1 411,20 $/an14× le Lite

Tarifs relevés le 24 août 2026 sur la page d'abonnement de z.ai, en dollars américains. Attention au piège : la page s'ouvre sur l'onglet annuel, remisé de 30 %. Le trimestriel est remisé de 20 %, le mensuel ne l'est pas. Depuis la mi-août 2026, le plan fonctionne en crédits, avec une limite d'usage de 5 heures et un quota hebdomadaire ; les appels hors heures de pointe (14 h à 18 h, heure de Pékin, en semaine) consomment 50 % des crédits, les week-ends étant considérés comme heures creuses.

Côté API, les prix sont publics et facturés au million de tokens :

Modèle (API)EntréeSortie
GLM-5.3-Flash0,15 $0,50 $
GLM-5.31,40 $4,40 $
GLM-5.21,40 $4,40 $
GLM-5-Turbo1,20 $4,00 $
GLM-4.70,60 $2,20 $
GLM-4.7-FlashX0,07 $0,40 $
GLM-4.7-FlashGratuitGratuit

Tarifs officiels de la documentation Z.ai : GLM-5.3 et GLM-5.2 relevés le 24 août 2026, GLM-5.3-Flash relevé le 27 août 2026 (remise de 50 % jusqu'au 9 septembre). Les tokens déjà en cache tombent à 0,26 $/M en entrée pour GLM-5.3 et GLM-5.2. Les deux modèles se consomment aussi chez des hébergeurs tiers, via OpenRouter ou en direct.

Le modèle sur lequel Hugging Face s'est rabattue

C'est l'épisode qui a fait connaître GLM-5.2 au-delà du cercle des développeurs. En juillet 2026, après l'intrusion d'un agent d'OpenAI dans son infrastructure, Hugging Face a dû analyser plus de 17 000 événements de journal. Les modèles de frontière appelés par API ont refusé la tâche, leurs garde-fous ne distinguant pas un répondeur d'incident d'un attaquant.

Nous avons donc mené l'analyse forensique sur GLM 5.2, un modèle à poids ouverts, sur notre propre infrastructure. Cela a eu un second avantage : aucune donnée d'attaquant, ni aucun des identifiants qu'elle mentionnait, n'a quitté notre environnement.
Hugging Face, billet « Security incident, July 2026 », 16 juillet 2026 · traduit de l'anglais

Notre article sur cet incident revient sur le dossier en détail. L'affaire a fait remonter GLM jusqu'aux réunions d'investisseurs : le 29 juillet 2026, lors de l'appel de résultats de Microsoft, Satya Nadella citait l'épisode pour défendre une architecture multi-modèles, avec cette formule reprise dans la transcription officielle : « vous ne pouvez pas être soumis aux refus d'un seul modèle ».

Ce qu'en disent les utilisateurs

Les retours de développeurs sur GLM-5.2 convergent : le modèle fait le travail pour une fraction du prix, sans égaler les meilleurs. Sur Hacker News, l'utilisateur sroerick écrivait le 26 juillet 2026 être « extrêmement satisfait » de ce qu'il produit, tout en trouvant Kimi « nettement meilleur pour l'architecture ». D'autres sont plus sévères.

Les modèles chinois ne m'ont pas impressionné (j'ai essayé DeepSeek V4 Pro et Flash, et GLM5.2) : la quantité de code douteux, d'erreurs et de contresens faisait que l'argent économisé et la vitesse supérieure ne se traduisaient pas par des progrès plus rapides pour moi.
torginus, Hacker News, 28 juillet 2026 · traduit de l'anglais

Sur r/LocalLLaMA, un fil très commenté rappelle enfin la limite de l'ouverture quand le modèle pèse 744 milliards de paramètres.

Les benchmarks de choses comme GLM-5.2 ont l'air dingues. 753 milliards de paramètres, un million de tokens de contexte, licence MIT (…). Mais concrètement, qu'est-ce qui est encore « local » là-dedans ? (…) C'est bien que les poids soient vraiment publiés plutôt qu'enfermés dans un coffre. Mais en pratique ? Pour des gens normaux, ils pourraient tout aussi bien être fermés.
u/Mountain_Patience231, r/LocalLLaMA, 17 juillet 2026 · traduit de l'anglais
À retenir
Idéal pourLe développement sur un gros dépôt, en agent, à un coût très inférieur aux modèles de frontière.
TarifAssistant gratuit ; GLM Coding Plan de 18 à 168 $/mois ; API dès 0,07 $ le million de tokens.
LimiteInterface en anglais, éditeur chinois, raisonnement imposé, modèle trop gros pour tourner chez soi et poids de GLM-5.3 pas encore publiés au 24 août 2026.

Questions fréquentes

Quelle IA utilise GLM ?

L'assistant chat.z.ai et l'application de bureau ZCode, tous deux édités par Z.ai. GLM-5.3 est le modèle phare depuis le 14 août 2026 ; le GLM Coding Plan donne accès à GLM-5.3, GLM-5-Turbo et GLM-4.7, utilisables dans Claude Code, Cline, OpenCode et une vingtaine d'outils.

Z.ai est-il gratuit ou payant ?

Les deux. L'assistant web est gratuit, sans abonnement grand public publié à ce jour. Le GLM Coding Plan, destiné aux outils de développement, coûte de 18 à 168 $ par mois, et l'API est facturée à l'usage.

Pourquoi le GLM Coding Plan semble moins cher sur la page de z.ai ?

La page s'ouvre sur l'onglet annuel, remisé de 30 % : 12,60 $ par mois au lieu de 18 $ en Lite, avec engagement d'un an. L'onglet mensuel affiche le prix réel sans engagement.

Comment obtenir une clé API GLM gratuite ?

Z.ai ne distribue pas de clé gratuite, mais deux modèles sont facturés 0 $ à l'usage sur son API, GLM-4.7-Flash et GLM-4.6V-Flash. Il faut tout de même créer un compte sur la plateforme et générer une clé.

GLM-5.2 est-il vraiment open source ?

Ses poids sont publiés sous licence MIT, sans restriction géographique ni clause de repartage, comme ceux de DeepSeek, là où Kimi impose une licence maison. Les données et le code d'entraînement, en revanche, ne sont pas publiés, d'où le terme plus juste de « poids ouverts ». GLM-5.3 est annoncé en poids ouverts deux semaines après son lancement du 14 août 2026 ; sa licence n'était pas encore connue au 24 août. La variante GLM-5.3-Flash, sortie le 26 août, est, elle, publiée sous MIT.

GLM parle-t-il français ?

Il comprend et rédige le français, mais sa fiche modèle ne déclare officiellement que l'anglais et le chinois, l'interface de l'assistant s'affiche en anglais, et aucune source indépendante n'a évalué sa qualité rédactionnelle en français. À éprouver sur vos propres textes avant d'y compter.

GLM ou Kimi : lequel choisir ?

Kimi K3 reste mieux classé sur l'Intelligence Index d'Artificial Analysis au relevé du 30 juillet 2026 (57 contre 51) et son assistant est traduit en français, mais sa licence maison impose un accord commercial aux revendeurs d'inférence. GLM-5.3 revendique la meilleure performance en codage parmi les poids ouverts (Terminal Bench 3.0, Z.ai Code Bench) et l'API reste nettement moins chère.

Peut-on faire tourner GLM chez soi ?

Rien ne l'interdit, la licence MIT de GLM-5.2 étant sans restriction, mais ses 744 milliards de paramètres supposent un serveur multi-GPU, pas un ordinateur personnel. Les frameworks vLLM, SGLang, Transformers, KTransformers et Unsloth le prennent en charge. Les poids de GLM-5.3 n'étaient pas encore publiés au 24 août 2026 ; seuls ceux de la variante Flash (320 Md dont 18 Md actifs) sont en ligne à ce jour.

Les données envoyées à l'assistant sont-elles réutilisées ?

Sa politique de confidentialité prévoit l'usage des contenus pour « entraîner et améliorer » les modèles, au titre de l'intérêt légitime, avec un traitement situé « généralement » à Singapour. Pour un dossier confidentiel, préférez l'auto-hébergement des poids.

Points forts & limites

On aime
+ GLM-5.3 annoncé comme le poids ouvert le plus performant en codage (Z.ai Code Bench, Terminal Bench 3.0) et déjà servi par API et dans l'assistant+ Contexte d'un million de tokens, taillé pour les tâches de développement qui durent des heures+ Forfait GLM Coding Plan dès 18 $/mois (10 000 crédits par semaine en Lite), utilisable dans Claude Code, Cline, OpenCode et une vingtaine d'outils+ API nettement moins chère que celles des modèles de frontière occidentaux
On aime moins
- Interface de l'assistant affichée en anglais, sans version française- Éditeur chinois, inscrit depuis janvier 2025 sur l'Entity List du département du Commerce américain- Poids ouverts mais modèle trop gros pour une machine personnelle : 744 milliards de paramètres- Qualité du français jamais évaluée par une source indépendante ; la fiche modèle ne déclare que l'anglais et le chinois- GLM-5.3 n'accepte que du texte à sa sortie et impose le raisonnement, avec trois niveaux d'effort mais aucune option pour le couper
Astuce

Sur la page d'abonnement de z.ai, l'onglet annuel est sélectionné par défaut : le prix mis en avant est le mensuel équivalent après 30 % de remise, avec un engagement d'un an (12,60 $ au lieu de 18 $ en Lite). Cliquez sur « Monthly » pour voir le prix réel sans engagement.

Cas d'usage typiques

01
Coder sur un gros dépôt
Un contexte d'un million de tokens pour garder architecture, contrats d'API et conventions sur une tâche longue.
02
Remplacer un abonnement de codage
Le GLM Coding Plan se branche dans Claude Code, Cline ou OpenCode à partir de 18 $/mois.
03
Auto-héberger un modèle de haut niveau
Les poids de GLM-5.2 sont sous licence MIT, à condition de disposer d'un serveur multi-GPU ; ceux de GLM-5.3, publiés le 25 août 2026, portent une licence maison proche de la MIT (revue de sécurité pour les hébergeurs MaaS au-delà de 10 Md$ de revenus sur douze mois).

GLM (Z.ai) face aux autres

Nos comparatifs critère par critère, pour trancher.