Outils Intelligence Artificielle
Accueil/ Annuaire/ Chatbots & agents/ GLM (Z.ai)
GLM (Z.ai)

GLM (Z.ai)

FREEMIUM

La famille de modèles ouverts de Z.ai (ex-Zhipu AI) et son assistant gratuit chat.z.ai. GLM-5.2 est sous licence MIT, avec un contexte d'un million de tokens.

4,3 · Note de la rédaction : 4,3 sur 5 Z.ai (Zhipu AI) Web · API · Bureau · Local

Note de la rédaction, basée sur l'analyse des avis utilisateurs et de la documentation disponible.

Aperçu de l'interface

À quoi sert GLM ?

GLM (pour General Language Model) est la famille de modèles d'intelligence artificielle de Z.ai, l'entreprise chinoise anciennement connue à l'international sous le nom de Zhipu AI. On y accède de trois façons : par l'assistant gratuit chat.z.ai, par une API pour développeurs, ou en téléchargeant les poids du modèle pour le faire tourner sur sa propre infrastructure.

L'assistant s'utilise sans compte, avec un sélecteur de modèles qui propose GLM-5.2, GLM-5.1, GLM-5-Turbo, le modèle de vision GLM-5V-Turbo et GLM-4.7. Un bandeau invite à créer un compte gratuit pour « des réponses plus intelligentes et l'accès aux modèles avancés ». L'interface, elle, s'affiche en anglais, sans version française : c'est le premier écart avec Kimi ou Qwen, dont les assistants sont traduits.

L'assistant chat.z.ai, accessible sans compte, avec le sélecteur de modèles en haut à gauche et les raccourcis Magic Design, Full-Stack et Write Code.
L'assistant chat.z.ai, accessible sans compte, avec le sélecteur de modèles en haut à gauche et les raccourcis Magic Design, Full-Stack et Write Code.

Le cœur du sujet reste GLM-5.2, sorti le 16 juin 2026 et présenté par l'éditeur comme un modèle « conçu pour l'ère des tâches à long horizon » : il vise moins la conversation que les chantiers de développement qui s'étalent sur des heures, avec un contexte d'un million de tokens et 128 000 tokens de sortie maximum. C'est le quatrième grand modèle chinois de notre annuaire, aux côtés de Kimi, DeepSeek et Qwen.

GLM en chiffres
753 Md
paramètres de GLM-5.2, dont 40 Md activés par token
1 M
tokens de contexte, pour 128 K de sortie maximum
MIT
la licence des poids, sans restriction géographique
1,4 M
téléchargements de GLM-5.2 sur Hugging Face depuis sa sortie

Qui est Z.ai, l'éditeur de GLM ?

Z.ai est née en 2019 à Pékin, en essaimage de l'université Tsinghua. Longtemps appelée Zhipu AI hors de Chine, elle est l'un des six « tigres de l'IA » chinois, et le premier de la bande à s'être introduit en Bourse, à Hong Kong, le 8 janvier 2026. Depuis juillet 2025, elle publie ses modèles phares sous licence MIT, la plus permissive du marché.

Les grandes étapes
2019Fondation à Pékin, dans le sillage de l'université Tsinghua.
Juillet 2025GLM-4.5 sort sous licence MIT et la marque internationale devient Z.ai.
8 janvier 2026Introduction en Bourse à Hong Kong, une première pour un éditeur chinois de grands modèles.
12 février 2026Lancement de GLM-5.
7 avril 2026Les poids de GLM-5.1 sont publiés à leur tour.
16 juin 2026GLM-5.2 : contexte d'un million de tokens, licence MIT, architecture IndexShare.

Sur l'Intelligence Index d'Artificial Analysis, GLM-5.2 marque 51 points (relevé du 30 juillet 2026), derrière Claude Opus 5 (61), Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) et Grok 4.5 (54). Le même relevé le classe deuxième parmi les modèles à poids ouverts de sa catégorie de taille, et lui reproche sa verbosité.

!
Ce que « poids ouverts » ne veut pas dire

La licence MIT autorise tout, y compris l'usage commercial. Encore faut-il pouvoir charger le modèle : 753 milliards de paramètres supposent un serveur multi-GPU, pas un ordinateur de bureau. Par ailleurs, la politique de confidentialité de l'assistant hébergé désigne comme responsable de traitement une société enregistrée à Singapour, indique que les données y sont « généralement traitées » et prévoit leur usage pour « entraîner et améliorer nos modèles » au titre de l'intérêt légitime.

GLM est-il gratuit ? Les offres et les tarifs

L'assistant chat.z.ai est gratuit, sans abonnement grand public publié à ce jour. Ce qui se paie, c'est le GLM Coding Plan, un forfait pensé pour les outils de développement, et l'API.

OffrePrix catalogue (par mois)En annuelQuota estimé (5 h / semaine)
Lite18 $12,60 $/mois, soit 151,20 $/an~80 / ~400 requêtes
Pro72 $50,40 $/mois, soit 604,80 $/an~400 / ~2 000 requêtes
Max160 $112 $/mois, soit 1 344 $/an~1 600 / ~8 000 requêtes

Tarifs relevés le 30 juillet 2026 sur la page d'abonnement de z.ai, en dollars américains. Attention au piège : la page s'ouvre sur l'onglet annuel, remisé de 30 %. Une remise de 10 % s'applique aussi au paiement mensuel (16,20 $, 64,80 $ et 144 $) et de 20 % au trimestriel. La documentation précise qu'une requête déclenche 15 à 20 appels du modèle, et que GLM-5.2 consomme le quota au double ou au triple selon l'heure.

Côté API, les prix sont publics et facturés au million de tokens :

Modèle (API)EntréeSortie
GLM-5.21,40 $4,40 $
GLM-5-Turbo1,20 $4,00 $
GLM-4.70,60 $2,20 $
GLM-4.7-FlashX0,07 $0,40 $
GLM-4.7-FlashGratuitGratuit

Tarifs officiels de la documentation Z.ai, relevés le 30 juillet 2026. Les tokens déjà en cache tombent à 0,26 $/M en entrée pour GLM-5.2. GLM-5.2 se consomme aussi chez des hébergeurs tiers, via OpenRouter ou en direct : sa page Hugging Face en référence sept, dont le français Scaleway.

Le modèle sur lequel Hugging Face s'est rabattue

C'est l'épisode qui a fait connaître GLM-5.2 au-delà du cercle des développeurs. En juillet 2026, après l'intrusion d'un agent d'OpenAI dans son infrastructure, Hugging Face a dû analyser plus de 17 000 événements de journal. Les modèles de frontière appelés par API ont refusé la tâche, leurs garde-fous ne distinguant pas un répondeur d'incident d'un attaquant.

Nous avons donc mené l'analyse forensique sur GLM 5.2, un modèle à poids ouverts, sur notre propre infrastructure. Cela a eu un second avantage : aucune donnée d'attaquant, ni aucun des identifiants qu'elle mentionnait, n'a quitté notre environnement.
Hugging Face, billet « Security incident, July 2026 », 16 juillet 2026 · traduit de l'anglais

Notre article sur cet incident revient sur le dossier en détail. L'affaire a fait remonter GLM jusqu'aux réunions d'investisseurs : le 29 juillet 2026, lors de l'appel de résultats de Microsoft, Satya Nadella citait l'épisode pour défendre une architecture multi-modèles, avec cette formule reprise dans la transcription officielle : « vous ne pouvez pas être soumis aux refus d'un seul modèle ».

Ce qu'en disent les utilisateurs

Les retours de développeurs convergent : GLM-5.2 fait le travail pour une fraction du prix, sans égaler les meilleurs. Sur Hacker News, l'utilisateur sroerick écrivait le 26 juillet 2026 être « extrêmement satisfait » de ce qu'il produit, tout en trouvant Kimi « nettement meilleur pour l'architecture ». D'autres sont plus sévères.

Les modèles chinois ne m'ont pas impressionné (j'ai essayé DeepSeek V4 Pro et Flash, et GLM5.2) : la quantité de code douteux, d'erreurs et de contresens faisait que l'argent économisé et la vitesse supérieure ne se traduisaient pas par des progrès plus rapides pour moi.
torginus, Hacker News, 28 juillet 2026 · traduit de l'anglais

Sur r/LocalLLaMA, un fil très commenté rappelle enfin la limite de l'ouverture quand le modèle pèse 753 milliards de paramètres.

Les benchmarks de choses comme GLM-5.2 ont l'air dingues. 753 milliards de paramètres, un million de tokens de contexte, licence MIT (…). Mais concrètement, qu'est-ce qui est encore « local » là-dedans ? (…) C'est bien que les poids soient vraiment publiés plutôt qu'enfermés dans un coffre. Mais en pratique ? Pour des gens normaux, ils pourraient tout aussi bien être fermés.
u/Mountain_Patience231, r/LocalLLaMA, 17 juillet 2026 · traduit de l'anglais
À retenir
Idéal pourLe développement sur un gros dépôt, en agent, à un coût très inférieur aux modèles de frontière.
TarifAssistant gratuit ; GLM Coding Plan de 18 à 160 $/mois ; API dès 0,07 $ le million de tokens.
LimiteInterface en anglais, éditeur chinois, et un modèle bien trop gros pour tourner chez soi.

Questions fréquentes

Quelle IA utilise GLM ?

L'assistant chat.z.ai et l'application de bureau ZCode, tous deux édités par Z.ai. GLM-5.2 est aussi disponible dans des outils tiers (Claude Code, Cline, OpenCode) via le GLM Coding Plan, et par API chez Z.ai ou OpenRouter.

Z.ai est-il gratuit ou payant ?

Les deux. L'assistant web est gratuit, sans abonnement grand public publié à ce jour. Le GLM Coding Plan, destiné aux outils de développement, coûte de 18 à 160 $ par mois, et l'API est facturée à l'usage.

Comment obtenir une clé API GLM gratuite ?

Z.ai ne distribue pas de clé gratuite, mais deux modèles sont facturés 0 $ à l'usage sur son API, GLM-4.7-Flash et GLM-4.6V-Flash. Il faut tout de même créer un compte sur la plateforme et générer une clé.

GLM-5.2 est-il vraiment open source ?

Ses poids sont publiés sous licence MIT, sans restriction géographique ni clause de repartage, comme ceux de DeepSeek, là où Kimi impose une licence maison. Les données et le code d'entraînement, en revanche, ne sont pas publiés, d'où le terme plus juste de « poids ouverts ».

GLM parle-t-il français ?

Il comprend et rédige le français, mais sa fiche modèle ne déclare officiellement que l'anglais et le chinois, l'interface de l'assistant s'affiche en anglais, et aucune source indépendante n'a évalué sa qualité rédactionnelle en français. À éprouver sur vos propres textes avant d'y compter.

GLM ou Kimi : lequel choisir ?

Kimi K3 est mieux classé sur l'Intelligence Index d'Artificial Analysis (57 contre 51 au 30 juillet 2026) et son assistant est traduit en français, mais sa licence maison impose un accord commercial aux revendeurs d'inférence. GLM-5.2 est plus léger, moins cher à l'API et sous licence MIT.

Peut-on faire tourner GLM chez soi ?

Rien ne l'interdit, la licence MIT étant sans restriction, mais les 753 milliards de paramètres de GLM-5.2 supposent un serveur multi-GPU, pas un ordinateur personnel. Les frameworks vLLM, SGLang, Transformers, KTransformers et Unsloth le prennent en charge.

Les données envoyées à l'assistant sont-elles réutilisées ?

Sa politique de confidentialité prévoit l'usage des contenus pour « entraîner et améliorer » les modèles, au titre de l'intérêt légitime, avec un traitement situé « généralement » à Singapour. Pour un dossier confidentiel, préférez l'auto-hébergement des poids.

Points forts & limites

On aime
+ Poids de GLM-5.2 publiés sous licence MIT, sans restriction géographique ni clause de repartage+ Contexte d'un million de tokens, taillé pour les tâches de développement qui durent des heures+ Forfait GLM Coding Plan dès 18 $/mois, utilisable dans Claude Code, Cline, OpenCode et une vingtaine d'outils+ API nettement moins chère que celles des modèles de frontière occidentaux
On aime moins
- Interface de l'assistant affichée en anglais, sans version française- Éditeur chinois, inscrit depuis janvier 2025 sur l'Entity List du département du Commerce américain- Poids ouverts mais modèle trop gros pour une machine personnelle : 753 milliards de paramètres- Qualité du français jamais évaluée par une source indépendante ; la fiche modèle ne déclare que l'anglais et le chinois- Très bavard : Artificial Analysis mesure 140 millions de tokens de sortie pour passer son indice, contre 99 millions en médiane
Astuce

Sur la page d'abonnement de z.ai, l'onglet annuel est sélectionné par défaut : le prix mis en avant est le mensuel équivalent après 30 % de remise, avec un engagement d'un an. Cliquez sur « Monthly » pour voir le prix réel sans engagement.

Cas d'usage typiques

01
Coder sur un gros dépôt
Un contexte d'un million de tokens pour garder architecture, contrats d'API et conventions sur une tâche longue.
02
Remplacer un abonnement de codage
Le GLM Coding Plan se branche dans Claude Code, Cline ou OpenCode à partir de 18 $/mois.
03
Auto-héberger un modèle de haut niveau
Les poids de GLM-5.2 sont sous licence MIT, à condition de disposer d'un serveur multi-GPU.