GLM (Z.ai)
FREEMIUMLa famille de modèles ouverts de Z.ai (ex-Zhipu AI) et son assistant gratuit chat.z.ai. GLM-5.2 est sous licence MIT, avec un contexte d'un million de tokens.
Note de la rédaction, basée sur l'analyse des avis utilisateurs et de la documentation disponible.

À quoi sert GLM ?
GLM (pour General Language Model) est la famille de modèles d'intelligence artificielle de Z.ai, l'entreprise chinoise anciennement connue à l'international sous le nom de Zhipu AI. On y accède de trois façons : par l'assistant gratuit chat.z.ai, par une API pour développeurs, ou en téléchargeant les poids du modèle pour le faire tourner sur sa propre infrastructure.
L'assistant s'utilise sans compte, avec un sélecteur de modèles qui propose GLM-5.2, GLM-5.1, GLM-5-Turbo, le modèle de vision GLM-5V-Turbo et GLM-4.7. Un bandeau invite à créer un compte gratuit pour « des réponses plus intelligentes et l'accès aux modèles avancés ». L'interface, elle, s'affiche en anglais, sans version française : c'est le premier écart avec Kimi ou Qwen, dont les assistants sont traduits.

Le cœur du sujet reste GLM-5.2, sorti le 16 juin 2026 et présenté par l'éditeur comme un modèle « conçu pour l'ère des tâches à long horizon » : il vise moins la conversation que les chantiers de développement qui s'étalent sur des heures, avec un contexte d'un million de tokens et 128 000 tokens de sortie maximum. C'est le quatrième grand modèle chinois de notre annuaire, aux côtés de Kimi, DeepSeek et Qwen.
Qui est Z.ai, l'éditeur de GLM ?
Z.ai est née en 2019 à Pékin, en essaimage de l'université Tsinghua. Longtemps appelée Zhipu AI hors de Chine, elle est l'un des six « tigres de l'IA » chinois, et le premier de la bande à s'être introduit en Bourse, à Hong Kong, le 8 janvier 2026. Depuis juillet 2025, elle publie ses modèles phares sous licence MIT, la plus permissive du marché.
Sur l'Intelligence Index d'Artificial Analysis, GLM-5.2 marque 51 points (relevé du 30 juillet 2026), derrière Claude Opus 5 (61), Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) et Grok 4.5 (54). Le même relevé le classe deuxième parmi les modèles à poids ouverts de sa catégorie de taille, et lui reproche sa verbosité.
La licence MIT autorise tout, y compris l'usage commercial. Encore faut-il pouvoir charger le modèle : 753 milliards de paramètres supposent un serveur multi-GPU, pas un ordinateur de bureau. Par ailleurs, la politique de confidentialité de l'assistant hébergé désigne comme responsable de traitement une société enregistrée à Singapour, indique que les données y sont « généralement traitées » et prévoit leur usage pour « entraîner et améliorer nos modèles » au titre de l'intérêt légitime.
GLM est-il gratuit ? Les offres et les tarifs
L'assistant chat.z.ai est gratuit, sans abonnement grand public publié à ce jour. Ce qui se paie, c'est le GLM Coding Plan, un forfait pensé pour les outils de développement, et l'API.
| Offre | Prix catalogue (par mois) | En annuel | Quota estimé (5 h / semaine) |
|---|---|---|---|
| Lite | 18 $ | 12,60 $/mois, soit 151,20 $/an | ~80 / ~400 requêtes |
| Pro | 72 $ | 50,40 $/mois, soit 604,80 $/an | ~400 / ~2 000 requêtes |
| Max | 160 $ | 112 $/mois, soit 1 344 $/an | ~1 600 / ~8 000 requêtes |
Tarifs relevés le 30 juillet 2026 sur la page d'abonnement de z.ai, en dollars américains. Attention au piège : la page s'ouvre sur l'onglet annuel, remisé de 30 %. Une remise de 10 % s'applique aussi au paiement mensuel (16,20 $, 64,80 $ et 144 $) et de 20 % au trimestriel. La documentation précise qu'une requête déclenche 15 à 20 appels du modèle, et que GLM-5.2 consomme le quota au double ou au triple selon l'heure.
Côté API, les prix sont publics et facturés au million de tokens :
| Modèle (API) | Entrée | Sortie |
|---|---|---|
| GLM-5.2 | 1,40 $ | 4,40 $ |
| GLM-5-Turbo | 1,20 $ | 4,00 $ |
| GLM-4.7 | 0,60 $ | 2,20 $ |
| GLM-4.7-FlashX | 0,07 $ | 0,40 $ |
| GLM-4.7-Flash | Gratuit | Gratuit |
Tarifs officiels de la documentation Z.ai, relevés le 30 juillet 2026. Les tokens déjà en cache tombent à 0,26 $/M en entrée pour GLM-5.2. GLM-5.2 se consomme aussi chez des hébergeurs tiers, via OpenRouter ou en direct : sa page Hugging Face en référence sept, dont le français Scaleway.
Le modèle sur lequel Hugging Face s'est rabattue
C'est l'épisode qui a fait connaître GLM-5.2 au-delà du cercle des développeurs. En juillet 2026, après l'intrusion d'un agent d'OpenAI dans son infrastructure, Hugging Face a dû analyser plus de 17 000 événements de journal. Les modèles de frontière appelés par API ont refusé la tâche, leurs garde-fous ne distinguant pas un répondeur d'incident d'un attaquant.
Nous avons donc mené l'analyse forensique sur GLM 5.2, un modèle à poids ouverts, sur notre propre infrastructure. Cela a eu un second avantage : aucune donnée d'attaquant, ni aucun des identifiants qu'elle mentionnait, n'a quitté notre environnement.Hugging Face, billet « Security incident, July 2026 », 16 juillet 2026 · traduit de l'anglais
Notre article sur cet incident revient sur le dossier en détail. L'affaire a fait remonter GLM jusqu'aux réunions d'investisseurs : le 29 juillet 2026, lors de l'appel de résultats de Microsoft, Satya Nadella citait l'épisode pour défendre une architecture multi-modèles, avec cette formule reprise dans la transcription officielle : « vous ne pouvez pas être soumis aux refus d'un seul modèle ».
Ce qu'en disent les utilisateurs
Les retours de développeurs convergent : GLM-5.2 fait le travail pour une fraction du prix, sans égaler les meilleurs. Sur Hacker News, l'utilisateur sroerick écrivait le 26 juillet 2026 être « extrêmement satisfait » de ce qu'il produit, tout en trouvant Kimi « nettement meilleur pour l'architecture ». D'autres sont plus sévères.
Les modèles chinois ne m'ont pas impressionné (j'ai essayé DeepSeek V4 Pro et Flash, et GLM5.2) : la quantité de code douteux, d'erreurs et de contresens faisait que l'argent économisé et la vitesse supérieure ne se traduisaient pas par des progrès plus rapides pour moi.torginus, Hacker News, 28 juillet 2026 · traduit de l'anglais
Sur r/LocalLLaMA, un fil très commenté rappelle enfin la limite de l'ouverture quand le modèle pèse 753 milliards de paramètres.
Les benchmarks de choses comme GLM-5.2 ont l'air dingues. 753 milliards de paramètres, un million de tokens de contexte, licence MIT (…). Mais concrètement, qu'est-ce qui est encore « local » là-dedans ? (…) C'est bien que les poids soient vraiment publiés plutôt qu'enfermés dans un coffre. Mais en pratique ? Pour des gens normaux, ils pourraient tout aussi bien être fermés.u/Mountain_Patience231, r/LocalLLaMA, 17 juillet 2026 · traduit de l'anglais
Questions fréquentes
Quelle IA utilise GLM ?
L'assistant chat.z.ai et l'application de bureau ZCode, tous deux édités par Z.ai. GLM-5.2 est aussi disponible dans des outils tiers (Claude Code, Cline, OpenCode) via le GLM Coding Plan, et par API chez Z.ai ou OpenRouter.
Z.ai est-il gratuit ou payant ?
Les deux. L'assistant web est gratuit, sans abonnement grand public publié à ce jour. Le GLM Coding Plan, destiné aux outils de développement, coûte de 18 à 160 $ par mois, et l'API est facturée à l'usage.
Comment obtenir une clé API GLM gratuite ?
Z.ai ne distribue pas de clé gratuite, mais deux modèles sont facturés 0 $ à l'usage sur son API, GLM-4.7-Flash et GLM-4.6V-Flash. Il faut tout de même créer un compte sur la plateforme et générer une clé.
GLM-5.2 est-il vraiment open source ?
Ses poids sont publiés sous licence MIT, sans restriction géographique ni clause de repartage, comme ceux de DeepSeek, là où Kimi impose une licence maison. Les données et le code d'entraînement, en revanche, ne sont pas publiés, d'où le terme plus juste de « poids ouverts ».
GLM parle-t-il français ?
Il comprend et rédige le français, mais sa fiche modèle ne déclare officiellement que l'anglais et le chinois, l'interface de l'assistant s'affiche en anglais, et aucune source indépendante n'a évalué sa qualité rédactionnelle en français. À éprouver sur vos propres textes avant d'y compter.
GLM ou Kimi : lequel choisir ?
Kimi K3 est mieux classé sur l'Intelligence Index d'Artificial Analysis (57 contre 51 au 30 juillet 2026) et son assistant est traduit en français, mais sa licence maison impose un accord commercial aux revendeurs d'inférence. GLM-5.2 est plus léger, moins cher à l'API et sous licence MIT.
Peut-on faire tourner GLM chez soi ?
Rien ne l'interdit, la licence MIT étant sans restriction, mais les 753 milliards de paramètres de GLM-5.2 supposent un serveur multi-GPU, pas un ordinateur personnel. Les frameworks vLLM, SGLang, Transformers, KTransformers et Unsloth le prennent en charge.
Les données envoyées à l'assistant sont-elles réutilisées ?
Sa politique de confidentialité prévoit l'usage des contenus pour « entraîner et améliorer » les modèles, au titre de l'intérêt légitime, avec un traitement situé « généralement » à Singapour. Pour un dossier confidentiel, préférez l'auto-hébergement des poids.
Points forts & limites
Sur la page d'abonnement de z.ai, l'onglet annuel est sélectionné par défaut : le prix mis en avant est le mensuel équivalent après 30 % de remise, avec un engagement d'un an. Cliquez sur « Monthly » pour voir le prix réel sans engagement.
Cas d'usage typiques
Alternatives à GLM (Z.ai)
Trois outils qui répondent au même besoin, avec leur note et leur tarif d'entrée.
Le chatbot chinois open-weight de Moonshot AI : le modèle géant K3, contexte d'un million de tokens, gratuit pour démarrer.
Le chatbot chinois aux modèles ouverts, très bon en code, au prix le plus bas du marché.
La famille de modèles ouverts la plus déclinée du marché, signée Alibaba, et son assistant gratuit Qwen Studio.