Famille GLM · 31B paramètres

GLM 4.7 Flash

GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.

🇨🇳 Zhipu AI·Licence MIT·Contexte 125k tokens·Sortie Février 2026← Catalogue

01Ce qu'il sait faire

Points forts
  • SWE-bench Verified 59.2 — top classe 30B
  • MIT totalement libre
  • ~3B actifs : 60-100 tok/s sur 3090/4090
  • 128k contexte
Limites à connaître
  • 19 Go en Q4 — juste pour 16 Go
  • Moins naturel en français que Qwen/Mistral
Architecture
MoE 31,2B total · ~3B actifs (glm4_moe_lite) · 128k ctx
Entraînement
Famille GLM 4.7 de Zhipu AI / Z.ai. Variante Flash orientée code et agents : le modèle le plus fort de la classe 30B à sa sortie.
Idéal pour
Code (classe 30B)Agents codeMultilingue zh / en

02Mémoire requise

VRAM GPU approximative pour faire tourner ce modèle, overhead contexte de 4k tokens inclus. Pour un contexte plus long, ajoutez ~1 Go par tranche de 8k tokens.

Q4_K_M
Le plus léger, ~5% de perte
19 Go
Q5_K_M
Bon compromis qualité/taille
23 Go
Q8_0
Quasi-indistinguable de FP16
35 Go
FP16
Pleine précision — usage serveur
62 Go
Fallback CPU · Si vous n'avez pas de GPU, comptez 33 Go de RAM minimum pour faire tourner ce modèle à vitesse réduite.

Quel GPU pour faire tourner GLM 4.7 Flash ?

Pour exécuter GLM 4.7 Flash en local en quantification Q4, il faut environ 19 Go de VRAM. Le meilleur rapport prix/performance : un RTX 4090 (24 Go de VRAM).

Où acheter le RTX 4090
DartyVoir RTX 4090AmazonVoir RTX 4090

Liens affiliés — commission possible sans surcoût pour vous, reco indépendante. En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

En mobilité : GLM 4.7 Flash tourne aussi sur un PC portable RTX (24 Go de VRAM) →

03Vitesse attendue

Tokens générés par seconde en Q4_K_M, contexte 4k. Au-delà de 20 t/s, la lecture est confortable. En dessous de 10 t/s, c'est juste pour tester.

Entrée de gamme
~15t/s
GTX 1650, RX 6600, MBA M2 8Go
Milieu de gamme
~40t/s
RTX 4060, 4070, MBP M3 Pro
Haut de gamme
~100t/s
RTX 4090, M4 Max, Radeon 7900

04Benchmarks publics

Scores reproduits depuis les model cards ou MMLU-Pro / communautaires. Unité : % bonnes réponses.

SWE-Bench Verified
59.2
LiveCodeBench v6
64

05Installer

Le chemin le plus court : Ollama. Une commande, le modèle est téléchargé et lancé.

$ollama run glm-4.7-flash
Premier téléchargement : entre 2 et 40 Go selon la quantization choisie. Espace disque à prévoir, connexion stable recommandée. Les relances suivantes sont instantanées.