🇨🇳 GLM 4.7 Flash
GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.
ollama run glm-4.7-flash
Classement mis à jour le 18/08/2026
Le MacBook Pro M4 Pro / Max (24-128 Go, 273-546 Go/s) est le meilleur laptop pour l'IA locale en 2026. Ventilateur actif + grosse bande passante = on peut viser 30B-70B en Q4/Q5.
GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.
ollama run glm-4.7-flash
Premier dLLM open Apache 2.0 : MoE 16B/1B + décodeur diffusion 6.2B. Texte+vision unifié. Sortie 22 avril 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Hybride Mamba-2 + MoE 32B/9B actifs. ~70% de RAM en moins en long contexte. Apache 2.0.
ollama run granite4:small-h
MoE 30B/3B actifs hybrid thinking. MMLU 81.4, AIME24 80.4. 100+ langues.
ollama run qwen3:30b-a3b
MoE 33B/3B actifs Apache 2.0 spécialiste coding agentic. 68.2% SWE-Bench Verified, 128k ctx. Tourne sur Mac 36 Go. Sortie 28 avril 2026.
ollama run laguna-xs.2
Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.
ollama run qwen3.8:27b
MoE 30B/3B actifs : thinking mode + instruct. Médaille d'or IMO 2025 et IOI 2025. Inférence rapide grâce aux 3B actifs, capacités raisonnement de niveau 30B. Sortie avril 2026.
ollama run nemotron-cascade-2
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur Apple M4 Max (64 GB) |
|---|---|---|---|---|---|---|
| #1 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT | 40 tok/s · Q8 |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 | 60 tok/s · FP16 |
| #3 | Granite 4.0 H-Small 32B-A9B | 32B | 19 GB | 128 000 | Apache 2.0 | 30 tok/s · Q8 |
| #4 | Qwen 3 30B-A3B | 30B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #5 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 | 40 tok/s · Q8 |
| #6 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 13 tok/s · Q8 |
| #7 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 | 14 tok/s · Q8 |
| #8 | Nemotron Cascade 2 30B-A3B | 30B | 17 GB | 128 000 | NVIDIA Open Model License | 30 tok/s · Q8 |
Comparez les prix de MacBook Pro M4 chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen2.5-Coder 7B (Q4) | ollama run qwen2.5-coder:7b |
| 12 Go | RTX 4070 / 5070 | Qwen2.5-Coder 14B (Q4) | ollama run qwen2.5-coder:14b |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | DeepSeek-Coder-V2-Lite 16B ou Qwen2.5-Coder 14B Q8 | ollama run deepseek-coder-v2:16b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen2.5-Coder 32B (Q4) — le « proche Copilot » | ollama run qwen2.5-coder:32b |
| 32 Go | RTX 5090 | Qwen2.5-Coder 32B en Q5/Q6 ou Devstral Small 2 (agentique) | ollama run devstral |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (MoE rapide) ou un 32B en Q8 | ollama run qwen3-coder:30b |
🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : 3-100B dont Q4_K_M tient sous 80 Go (laisse 16 Go à macOS sur M4 Max 96 Go). Bonus 13-70B (Max) et 7-32B (Pro). MoE bien notés (Qwen 3 30B-A3B excelle sur M4).
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
MBP M4 Pro 24 Go : quel modèle ?
Qwen 3 14B Q4 (~8 Go) à 35-45 tok/s, ou Qwen 3 30B-A3B (MoE, ~17 Go) à 28-32 tok/s. Le M4 Pro 24 Go est le meilleur rapport perf/prix laptop en 2026. Voir le guide MBP M4.
MBP M4 Max 64 / 128 Go : peut-on faire tourner Llama 70B ?
Oui — Llama 3.3 70B Q4_K_M (~40 Go) tourne à 12-18 tok/s sur M4 Max 128 Go. Q5_K_M (~48 Go) tient sur 64 Go. Pour 200B+, voir Mac Studio Ultra.
MBP M4 vs RTX 4090 ?
RTX 4090 (24 Go VRAM, 1008 Go/s) est ~2-3× plus rapide sur les modèles qui tiennent en 24 Go. M4 Max gagne dès qu'on dépasse 24 Go (70B impossible sur 4090 seule). Voir RTX 4090.
MLX vs Ollama sur M4 Max ?
MLX donne 20-30 % de tok/s en plus sur M4 Max (mémoire unifiée native, fused kernels). Pour de la production, ça vaut la conversion. Ollama reste plus simple pour du chat ponctuel.
Approfondissez avec nos duels détaillés des finalistes :