Accueil › Avis & tests › GLM Coding Plan
GLM Coding Plan : notre avis après test
L'accès API aux modèles GLM, pensé pour les assistants de code — par le laboratoire qui publie ses poids en open-weights.
Le meilleur rapport qualité/prix du moment pour brancher un assistant de code sur un grand modèle — précisément parce que les poids sont ouverts et que vous gardez une porte de sortie locale. La réserve est réelle : les quotas du plan sont jugés opaques par une partie des abonnés.

C'est quoi, exactement ?
GLM est la famille de modèles du laboratoire chinois Zhipu AI (marque internationale : Z.ai), coté à Hong Kong depuis janvier 2026. Sa particularité, et la raison pour laquelle ce site en parle depuis des mois : les poids sont publiés en open-weights. GLM-5, GLM-5.1, GLM-5.2 figurent dans notre catalogue, avec leurs exigences VRAM.
Le Coding Plan est l'abonnement API orienté code : il expose les modèles GLM via un protocole compatible avec les assistants existants (Claude Code, Cline, Roo Code), à un tarif nettement inférieur aux API équivalentes américaines. L'idée est simple : votre outil de code ne voit pas la différence, votre facture si.
Notre test : où s’arrête le GLM local sur un GPU grand public
Avant de juger l'API, nous avons poussé l'option locale jusqu'à sa limite, sur notre machine de test (RTX 5070 Ti 12 Go + Intel Core Ultra 9 275HX, CachyOS, Ollama). C'est tout l'intérêt d'une famille open-weights : la question n'est pas « API ou rien », mais « à partir de quand l'API devient-elle nécessaire ». Réponse mesurée, chiffres à l'appui :
| Mesure (26/08/2026) | Résultat |
|---|---|
| Modèle testé en local | GLM-4.7-flash (quantifié q4) |
| Poids en mémoire | 20 Go — pour 12 Go de VRAM : déchargement 47 % CPU / 53 % GPU |
| Génération (tâche de code Python) | 35 tokens/s — étonnamment fluide |
| Traitement du prompt (prefill) | 5.8 tokens/s — le vrai goulot |
| Chargement du modèle | 25 s |
La mesure raconte une histoire plus fine que « ça ne tient pas » : même déchargé pour moitié sur le CPU, le modèle génère à 35 tokens/s — confortable pour du chat. Mais le traitement du prompt plafonne à 5.8 tokens/s : envoyer un fichier de 2 000 tokens à analyser prend déjà plus de cinq minutes de silence avant le premier mot. Or un assistant de code passe son temps à faire exactement ça — relire vos fichiers à chaque itération.
Conclusion sans ambiguïté : sur un GPU grand public de 12 Go, cette famille de modèles est inutilisable en agent de code local, non pas par la génération mais par le prefill. C'est précisément le trou que le Coding Plan vient boucher : la même famille de modèles, servie avec un prefill instantané, pendant que votre GPU reste libre. Et si vous avez 24 Go de VRAM ou plus, refaites le calcul — le configurateur vous le donne pour votre machine.
Tarifs
Le Coding Plan existe en plusieurs paliers (du plan d'entrée pour un usage individuel au palier « Max » pour un usage intensif multi-agents). Les tarifs constatés en août 2026 vont de quelques dollars par mois pour l'entrée de gamme à quelques dizaines pour les paliers supérieurs — soit un ordre de grandeur sous les abonnements équivalents d'Anthropic ou d'OpenAI. Z.ai pratique des promotions fréquentes sur le premier mois : vérifiez le prix courant avant de souscrire, il évolue vite.
Points forts et réserves
- Poids ouverts = pas de verrouillage : vos prompts, votre workflow et même le modèle restent récupérables en local
- Compatible avec les assistants de code existants (Claude Code, Cline, Roo Code) sans changer d'outil
- Tarif d'entrée très en dessous des API américaines équivalentes
- Entreprise solide : Zhipu AI, cotée à Hong Kong, un des laboratoires majeurs du modèle ouvert
- Quotas jugés opaques par une partie des abonnés (« 3× Claude » contesté aux heures de pointe) — Trustpilot 2,1/5 sur 32 avis en août 2026, surveillez votre consommation la première semaine
- Support client lent d'après les mêmes retours
- Vos requêtes transitent par les serveurs de Z.ai : à exclure pour du code sous NDA — c'est vrai de toute API, et c'est pour ça que le local reste notre référence
Questions fréquentes
Peut-on utiliser GLM gratuitement ?
Oui. Les modèles GLM sont publiés en open-weights : les variantes quantifiées se téléchargent et tournent gratuitement avec Ollama ou LM Studio, dans la limite de votre VRAM. L'abonnement ne concerne que l'accès API aux variantes complètes, servies sur l'infrastructure de Z.ai.
Le GLM Coding Plan fonctionne-t-il avec Claude Code ?
Oui, c'est son argument principal : l'API expose un protocole compatible, il suffit de pointer l'outil vers l'endpoint de Z.ai. Cline et Roo Code sont également supportés. La configuration prend quelques minutes.
Les quotas annoncés sont-ils fiables ?
C'est la principale réserve documentée. Une partie des abonnés rapporte une consommation du quota plus rapide qu'annoncé aux heures de pointe, et la note Trustpilot du service s'en ressent (2,1/5 sur un petit échantillon de 32 avis). Notre conseil : prenez le palier d'entrée, mesurez une semaine d'usage réel, puis décidez.
Où vont mes données avec ce plan ?
Vos requêtes sont traitées sur les serveurs de Z.ai. Pour du code propriétaire sous NDA ou des données réglementées, la règle ne change pas : restez sur un modèle local — c'est justement possible avec cette famille, puisque les poids sont ouverts.
Quelle machine faut-il pour faire tourner GLM en local ?
Les petites variantes quantifiées passent sur un GPU de 8 à 12 Go. Les variantes MoE récentes (GLM-4.7-flash : ~20 Go chargé en q4, mesuré sur notre machine) exigent davantage — c'est mesurable dans notre configurateur, qui vous dit précisément ce que votre machine encaisse.
Les autres avis de la sélection
Transcription, sous-titres et traduction par IA, avec relecture humaine en option — l'entreprise européenne la mieux notée de notre sélection.
Lire l'avis →Transformer une conversation en agent réutilisable, connecté à vos outils — sans écrire de code.
Lire l'avis →Bootcamps en ligne — data science & IA, cybersécurité, UX et développement web — avec accréditation qualité allemande.
Lire l'avis →Transparence. Le lien « Voir GLM Coding Plan » est un lien affilié (plateforme Impact.com). En cas de souscription, QuelLLM.fr perçoit une commission versée par la marque, sans surcoût pour vous. Cette commission n'influence ni la note ni le contenu : l'alternative locale gratuite est citée avant le lien d'achat, et les réserves issues des avis clients sont publiées telles quelles. Méthodologie complète · Mentions légales.