Intermédiaire 12 minMacBook Pro

Quel LLM sur MacBook Pro M4 Pro / Max (24–128 Go) ?

Le MacBook Pro M4 Pro / Max (octobre 2024) est en 2026 le meilleur laptop pour l'IA locale — aucun concurrent ne s'en approche. Le M4 Max 16-core pousse la bande passante à 546 Go/s, jusqu'à 128 Go de mémoire unifiée, tout en gardant un châssis de 16 pouces transportable. En 2026, la frontière open-weight locale, ce ne sont plus les 70B denses mais des MoE ~30B ultra-efficaces : Qwen 3.6 35B-A3B à 44 tok/s, Qwen3-Coder 30B-A3B à 50 tok/s, et de la marge pour les faire tourner en pleine qualité Q8 avec un contexte de 256k. Des chiffres qui rivalisent avec une workstation dédiée. Ce guide détaille comment choisir et exploiter chaque config.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur macOS 14+

#MBP M4 Pro / Max en 2026

Sortie
Octobre 2024. Configuration actuelle en 2026 (avant M5 attendu fin 2026).
M4 Pro
12 ou 14 cœurs CPU + 16 ou 20 cœurs GPU, 273 Go/s, RAM 24 ou 48 Go.
M4 Max 14-core
14 cœurs CPU + 32 cœurs GPU, 410 Go/s, RAM 36 ou 96 Go.
M4 Max 16-core
16 cœurs CPU + 40 cœurs GPU, 546 Go/s, RAM 48, 64 ou 128 Go.
Neural Engine
16 cœurs, 38 TOPS (+110 % vs M3). Exploitable via Core ML et MLX.

#1. M4 Pro vs M4 Max

M4 Pro 273 Go/s
Rattrape le M2 Max en bande passante. Excellent jusqu'à ~30B, MoE Qwen 3.6 35B-A3B compris. Limité à 48 Go RAM = pas de Q8 des gros MoE.
M4 Max 14-core 410 Go/s
Fait tourner les gros MoE 30-35B en pleine qualité Q8 (~38 tok/s). Option 96 Go = large marge pour du contexte 256k.
M4 Max 16-core 546 Go/s
Le haut de gamme laptop. 128 Go RAM, +33 % de vitesse sur les gros MoE et les contextes longs. Pour du travail sérieux sur gros modèles.

#2. 24 à 128 Go : modèles

Modèles compatibles par config MBP M4 (les MoE A3B tournent bien plus vite que leur taille ne le suggère — 3B actifs par token)
ModèleQuantM4 Pro 24M4 Pro 48M4 Max 64M4 Max 96M4 Max 128
Qwen 3.5 9BQ5_K_M✓ 42✓ 44✓ 52✓ 55✓ 58
Gemma 4 12BQ5_K_M✓ 27✓ 28✓ 34✓ 36✓ 38
Mistral Small 24BQ5_K_M✓ 15✓ 22✓ 23✓ 24
Qwen 3.8 27BQ5_K_M✓ 13✓ 18✓ 20✓ 21
Qwen 3.6 35B-A3BQ4_K_M✓ 34✓ 42✓ 46✓ 48
Qwen3-Coder 30B-A3BQ4_K_M✓ 36✓ 44✓ 48✓ 50
Qwen 3.6 35B-A3BQ8_0✓ 34✓ 38✓ 40
Qwen3-Coder 30B-A3BQ8_0✓ 36✓ 40✓ 42

#3. Benchmarks 2026

MBP M4 Max 16-core GPU, 128 Go, Ollama 0.12.x, secteur — ordres de grandeur, pas des mesures certifiées
ModèleQ4_K_MQ5_K_MFlash Attn 8kMLX 4-bit
Qwen 3.5 9B62 t/s58 t/s55 t/s66 t/s
Gemma 4 12B40 t/s38 t/s35 t/s44 t/s
Mistral Small 24B26 t/s24 t/s22 t/s28 t/s
Qwen 3.8 27B23 t/s21 t/s19 t/s25 t/s
Qwen 3.6 35B-A3B48 t/s44 t/s42 t/s52 t/s
Qwen3-Coder 30B-A3B50 t/s46 t/s44 t/s54 t/s

#4. Installation optimisée M4

Setup MBP M4 Max 128 Go
brew install --cask ollama

# Mémoire GPU — 128 Go → 116 Go GPU (12 Go pour système)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

# LaunchAgent pour tout garder au reboot
mkdir -p ~/Library/LaunchAgents
cat > ~/Library/LaunchAgents/ai.ollama.env.plist <<'PLIST'
<?xml version="1.0"?>
<plist version="1.0"><dict>
  <key>Label</key><string>ai.ollama.env</string>
  <key>ProgramArguments</key><array>
    <string>/bin/sh</string><string>-c</string>
    <string>launchctl setenv OLLAMA_FLASH_ATTENTION 1; launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0</string>
  </array>
  <key>RunAtLoad</key><true/>
</dict></plist>
PLIST

brew services restart ollama

#5. Exploiter les 546 Go/s du M4 Max

Utilisez MLX sur gros modèles
Sur M4 Max, MLX tire mieux parti de la bande passante que llama.cpp. De l'ordre de +15 % sur les gros MoE (Qwen 3.6 35B-A3B).
Contextes longs profitent le plus
L'écart avec M3 Max se creuse à 16k+ de contexte : de l'ordre de +40 % vs +25 % sur contexte court. Les 256k de Qwen 3.8 27B en profitent à plein.
Spéculatif decoding
Sur Qwen 3.8 27B + draft Qwen 3.5 2B, llama.cpp atteint ~34 tok/s (vs 21 sans draft). Voir flag --draft-model sur llama.cpp.
Qwen 3.8 27B : raisonnement en low
Par défaut, Qwen 3.8 27B sur-réfléchit (chaînes de pensée interminables). Passez son effort de raisonnement en « low » pour des réponses directes et un bien meilleur débit.
Core ML pour Whisper
Si vous faites du pipeline voix → LLM, Whisper passe par le Neural Engine du M4 (jusqu'à 60× temps réel). Économise du GPU.
Spéculatif decoding sur Qwen 3.8 27B
# Télécharger aussi Qwen 3.5 2B comme draft
ollama pull qwen3.5:2b

# Avec llama.cpp maison (fonctionnalité pas encore dans Ollama)
./build/bin/llama-cli \
  -m qwen3.8-27b-q5_k_m.gguf \
  --draft-model qwen3.5-2b-q4_k_m.gguf \
  -ngl 99 -fa -c 8192

#MBP M4 Max vs Mac Studio M4 Max

Performance
Identique sur la même puce (M4 Max 16-core). Bande passante et RAM max égales.
Mobilité
MBP = partout. Mac Studio = bureau fixe. Si vous êtes sédentaire, le Studio est 30-40 % moins cher à perf égale.
Prix M4 Max 128 Go
MBP 16" M4 Max 128 Go ≈ 5500 € / Mac Studio M4 Max 128 Go ≈ 4300 €. Écart de 1200 €.
Verdict
Si l'usage est 100 % bureau, Mac Studio. Si vous bougez (clients, voyages, conférences), MBP M4 Max — aucun autre laptop n'approche.

#Limites à connaître

Plafond 128 Go
Impossible d'aller au-delà. Pour 256-512 Go, il faut un Mac Studio Ultra.
Pas de CUDA
Certaines libs (bitsandbytes, xformers) ne tournent pas. Pour du développement, prévoyez Docker ou une VM.
Fine-tuning contraint
LoRA OK via MLX. Full fine-tuning d'un 7B+ reste mieux sur GPU NVIDIA.
Prix
MBP M4 Max 128 Go à 5500 €. Cher — mais sans équivalent fonctionnel.

#Questions fréquentes

Le MacBook Pro M4 Max est-il meilleur qu'une RTX 4090 pour les LLM ?+
Pour 7B-34B qui rentrent en 24 Go VRAM, la 4090 est plus rapide (bande passante 1 To/s). Au-delà, le MBP M4 Max gagne sur la souplesse : ses 96-128 Go de mémoire unifiée font tourner un MoE comme Qwen 3.6 35B-A3B en pleine qualité Q8 avec un contexte 256k (~40 tok/s), là où la 4090 seule est plafonnée à 24 Go. Le Mac gagne sur la mémoire, la 4090 sur la vitesse pure.
M4 Pro 48 Go ou M4 Max 48 Go ?+
Le M4 Max sans hésiter si la différence de prix est < 800 €. +50 % de bande passante (410 vs 273 Go/s), même RAM. Sur Gemma 4 12B : ~28 tok/s (Pro) vs ~38 tok/s (Max). Pour les modèles au-delà de 24B, seul le Max reste vraiment confortable.
Faut-il 96 ou 128 Go de RAM sur M4 Max ?+
96 Go couvre 95 % des usages (gros MoE 30-35B en Q8, contexte 256k confortable). 128 Go ajoute : faire tourner plusieurs modèles en parallèle, contexte 256k sur les MoE les plus lourds, marge pour du FP16. +600 € Apple. Si vous jonglez avec plusieurs gros modèles à la fois, le 128 Go se justifie.
Le MBP M4 Max peut-il faire du fine-tuning ?+
Oui, via MLX, pour LoRA et QLoRA jusqu'à 14B en FP16 avec 96 Go. Plus gros que ça devient lent. Le full fine-tuning d'un 30B n'est pas praticable — prévoyez un service cloud ponctuel pour ça.
Autonomie batterie pendant une inférence sur un gros modèle (Qwen 3.6 35B-A3B) ?+
MBP 16" M4 Max : environ 1h45 en chat continu, 1h en batch. MBP 14" : 1h15 / 45 min (batterie plus petite). Pour des sessions longues, branchez.
Ollama, LM Studio, MLX ou llama.cpp : quel choix sur M4 Max ?+
Ollama pour 90 % des usages (simple, robuste). LM Studio pour explorer les modèles avec UI. MLX pour les 5-10 % de perf en plus sur gros modèles ou pour du fine-tuning. llama.cpp maison pour accéder aux dernières features (spéculatif decoding, flash attention avancé) avant qu'Ollama les intègre.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.