Intermédiaire 12 minMacBook Pro
Quel LLM sur MacBook Pro M4 Pro / Max (24–128 Go) ?
Le MacBook Pro M4 Pro / Max (octobre 2024) est en 2026 le meilleur laptop pour l'IA locale — aucun concurrent ne s'en approche. Le M4 Max 16-core pousse la bande passante à 546 Go/s, jusqu'à 128 Go de mémoire unifiée, tout en gardant un châssis de 16 pouces transportable. En 2026, la frontière open-weight locale, ce ne sont plus les 70B denses mais des MoE ~30B ultra-efficaces : Qwen 3.6 35B-A3B à 44 tok/s, Qwen3-Coder 30B-A3B à 50 tok/s, et de la marge pour les faire tourner en pleine qualité Q8 avec un contexte de 256k. Des chiffres qui rivalisent avec une workstation dédiée. Ce guide détaille comment choisir et exploiter chaque config.
#MBP M4 Pro / Max en 2026
- Sortie
- Octobre 2024. Configuration actuelle en 2026 (avant M5 attendu fin 2026).
- M4 Pro
- 12 ou 14 cœurs CPU + 16 ou 20 cœurs GPU, 273 Go/s, RAM 24 ou 48 Go.
- M4 Max 14-core
- 14 cœurs CPU + 32 cœurs GPU, 410 Go/s, RAM 36 ou 96 Go.
- M4 Max 16-core
- 16 cœurs CPU + 40 cœurs GPU, 546 Go/s, RAM 48, 64 ou 128 Go.
- Neural Engine
- 16 cœurs, 38 TOPS (+110 % vs M3). Exploitable via Core ML et MLX.
#1. M4 Pro vs M4 Max
- M4 Pro 273 Go/s
- Rattrape le M2 Max en bande passante. Excellent jusqu'à ~30B, MoE Qwen 3.6 35B-A3B compris. Limité à 48 Go RAM = pas de Q8 des gros MoE.
- M4 Max 14-core 410 Go/s
- Fait tourner les gros MoE 30-35B en pleine qualité Q8 (~38 tok/s). Option 96 Go = large marge pour du contexte 256k.
- M4 Max 16-core 546 Go/s
- Le haut de gamme laptop. 128 Go RAM, +33 % de vitesse sur les gros MoE et les contextes longs. Pour du travail sérieux sur gros modèles.
#2. 24 à 128 Go : modèles
Modèles compatibles par config MBP M4 (les MoE A3B tournent bien plus vite que leur taille ne le suggère — 3B actifs par token)
| Modèle | Quant | M4 Pro 24 | M4 Pro 48 | M4 Max 64 | M4 Max 96 | M4 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 42 | ✓ 44 | ✓ 52 | ✓ 55 | ✓ 58 |
| Gemma 4 12B | Q5_K_M | ✓ 27 | ✓ 28 | ✓ 34 | ✓ 36 | ✓ 38 |
| Mistral Small 24B | Q5_K_M | — | ✓ 15 | ✓ 22 | ✓ 23 | ✓ 24 |
| Qwen 3.8 27B | Q5_K_M | — | ✓ 13 | ✓ 18 | ✓ 20 | ✓ 21 |
| Qwen 3.6 35B-A3B | Q4_K_M | — | ✓ 34 | ✓ 42 | ✓ 46 | ✓ 48 |
| Qwen3-Coder 30B-A3B | Q4_K_M | — | ✓ 36 | ✓ 44 | ✓ 48 | ✓ 50 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 34 | ✓ 38 | ✓ 40 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 36 | ✓ 40 | ✓ 42 |
#3. Benchmarks 2026
MBP M4 Max 16-core GPU, 128 Go, Ollama 0.12.x, secteur — ordres de grandeur, pas des mesures certifiées
| Modèle | Q4_K_M | Q5_K_M | Flash Attn 8k | MLX 4-bit |
|---|---|---|---|---|
| Qwen 3.5 9B | 62 t/s | 58 t/s | 55 t/s | 66 t/s |
| Gemma 4 12B | 40 t/s | 38 t/s | 35 t/s | 44 t/s |
| Mistral Small 24B | 26 t/s | 24 t/s | 22 t/s | 28 t/s |
| Qwen 3.8 27B | 23 t/s | 21 t/s | 19 t/s | 25 t/s |
| Qwen 3.6 35B-A3B | 48 t/s | 44 t/s | 42 t/s | 52 t/s |
| Qwen3-Coder 30B-A3B | 50 t/s | 46 t/s | 44 t/s | 54 t/s |
#4. Installation optimisée M4
#5. Exploiter les 546 Go/s du M4 Max
- Utilisez MLX sur gros modèles
- Sur M4 Max, MLX tire mieux parti de la bande passante que llama.cpp. De l'ordre de +15 % sur les gros MoE (Qwen 3.6 35B-A3B).
- Contextes longs profitent le plus
- L'écart avec M3 Max se creuse à 16k+ de contexte : de l'ordre de +40 % vs +25 % sur contexte court. Les 256k de Qwen 3.8 27B en profitent à plein.
- Spéculatif decoding
- Sur Qwen 3.8 27B + draft Qwen 3.5 2B, llama.cpp atteint ~34 tok/s (vs 21 sans draft). Voir flag --draft-model sur llama.cpp.
- Qwen 3.8 27B : raisonnement en low
- Par défaut, Qwen 3.8 27B sur-réfléchit (chaînes de pensée interminables). Passez son effort de raisonnement en « low » pour des réponses directes et un bien meilleur débit.
- Core ML pour Whisper
- Si vous faites du pipeline voix → LLM, Whisper passe par le Neural Engine du M4 (jusqu'à 60× temps réel). Économise du GPU.
#MBP M4 Max vs Mac Studio M4 Max
- Performance
- Identique sur la même puce (M4 Max 16-core). Bande passante et RAM max égales.
- Mobilité
- MBP = partout. Mac Studio = bureau fixe. Si vous êtes sédentaire, le Studio est 30-40 % moins cher à perf égale.
- Prix M4 Max 128 Go
- MBP 16" M4 Max 128 Go ≈ 5500 € / Mac Studio M4 Max 128 Go ≈ 4300 €. Écart de 1200 €.
- Verdict
- Si l'usage est 100 % bureau, Mac Studio. Si vous bougez (clients, voyages, conférences), MBP M4 Max — aucun autre laptop n'approche.
#Limites à connaître
- Plafond 128 Go
- Impossible d'aller au-delà. Pour 256-512 Go, il faut un Mac Studio Ultra.
- Pas de CUDA
- Certaines libs (bitsandbytes, xformers) ne tournent pas. Pour du développement, prévoyez Docker ou une VM.
- Fine-tuning contraint
- LoRA OK via MLX. Full fine-tuning d'un 7B+ reste mieux sur GPU NVIDIA.
- Prix
- MBP M4 Max 128 Go à 5500 €. Cher — mais sans équivalent fonctionnel.
#Questions fréquentes
Le MacBook Pro M4 Max est-il meilleur qu'une RTX 4090 pour les LLM ?+
Pour 7B-34B qui rentrent en 24 Go VRAM, la 4090 est plus rapide (bande passante 1 To/s). Au-delà, le MBP M4 Max gagne sur la souplesse : ses 96-128 Go de mémoire unifiée font tourner un MoE comme Qwen 3.6 35B-A3B en pleine qualité Q8 avec un contexte 256k (~40 tok/s), là où la 4090 seule est plafonnée à 24 Go. Le Mac gagne sur la mémoire, la 4090 sur la vitesse pure.
M4 Pro 48 Go ou M4 Max 48 Go ?+
Le M4 Max sans hésiter si la différence de prix est < 800 €. +50 % de bande passante (410 vs 273 Go/s), même RAM. Sur Gemma 4 12B : ~28 tok/s (Pro) vs ~38 tok/s (Max). Pour les modèles au-delà de 24B, seul le Max reste vraiment confortable.
Faut-il 96 ou 128 Go de RAM sur M4 Max ?+
96 Go couvre 95 % des usages (gros MoE 30-35B en Q8, contexte 256k confortable). 128 Go ajoute : faire tourner plusieurs modèles en parallèle, contexte 256k sur les MoE les plus lourds, marge pour du FP16. +600 € Apple. Si vous jonglez avec plusieurs gros modèles à la fois, le 128 Go se justifie.
Le MBP M4 Max peut-il faire du fine-tuning ?+
Oui, via MLX, pour LoRA et QLoRA jusqu'à 14B en FP16 avec 96 Go. Plus gros que ça devient lent. Le full fine-tuning d'un 30B n'est pas praticable — prévoyez un service cloud ponctuel pour ça.
Autonomie batterie pendant une inférence sur un gros modèle (Qwen 3.6 35B-A3B) ?+
MBP 16" M4 Max : environ 1h45 en chat continu, 1h en batch. MBP 14" : 1h15 / 45 min (batterie plus petite). Pour des sessions longues, branchez.
Ollama, LM Studio, MLX ou llama.cpp : quel choix sur M4 Max ?+
Ollama pour 90 % des usages (simple, robuste). LM Studio pour explorer les modèles avec UI. MLX pour les 5-10 % de perf en plus sur gros modèles ou pour du fine-tuning. llama.cpp maison pour accéder aux dernières features (spéculatif decoding, flash attention avancé) avant qu'Ollama les intègre.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.