Intermédiaire 12 minMacBook Pro

Quel LLM sur MacBook Pro M4 Pro / Max (24–128 Go) ?

Le MacBook Pro M4 Pro / Max (octobre 2024) est en 2026 le meilleur laptop pour l'IA locale — aucun concurrent ne s'en approche. Le M4 Max 16-core pousse la bande passante à 546 Go/s, jusqu'à 128 Go de mémoire unifiée, tout en gardant un châssis de 16 pouces transportable. Llama 3.3 70B Q5 à 13 tok/s, Qwen 2.5 123B Q4 à 8 tok/s : des chiffres qui rivalisent avec une workstation dédiée. Ce guide détaille comment choisir et exploiter chaque config.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#MBP M4 Pro / Max en 2026

Sortie
Octobre 2024. Configuration actuelle en 2026 (avant M5 attendu fin 2026).
M4 Pro
12 ou 14 cœurs CPU + 16 ou 20 cœurs GPU, 273 Go/s, RAM 24 ou 48 Go.
M4 Max 14-core
14 cœurs CPU + 32 cœurs GPU, 410 Go/s, RAM 36 ou 96 Go.
M4 Max 16-core
16 cœurs CPU + 40 cœurs GPU, 546 Go/s, RAM 48, 64 ou 128 Go.
Neural Engine
16 cœurs, 38 TOPS (+110 % vs M3). Exploitable via Core ML et MLX.

#1. M4 Pro vs M4 Max

M4 Pro 273 Go/s
Rattrape le M2 Max en bande passante. Excellent pour 7B-24B. Limité à 48 Go RAM = pas de 70B.
M4 Max 14-core 410 Go/s
Ouvre 70B Q4 confortable (~12 tok/s). Option 96 Go suffit pour 70B Q5.
M4 Max 16-core 546 Go/s
Le haut de gamme laptop. 128 Go RAM, +33 % vitesse sur 70B. Pour du travail sérieux sur gros modèles.

#2. 24 à 128 Go : modèles

Modèles compatibles par config MBP M4
ModèleQuantM4 Pro 24M4 Pro 48M4 Max 64M4 Max 96M4 Max 128
Mistral 7BQ5_K_M✓ 48✓ 50✓ 62✓ 65✓ 68
Phi-4 14BQ5_K_M✓ 20✓ 22✓ 30✓ 32✓ 34
Mistral Small 24BQ5_K_M✓ 15✓ 23✓ 25✓ 26
Qwen 2.5 32BQ5_K_M✓ 12✓ 18✓ 20✓ 21
Llama 3.3 70BQ4_K_M✓ 14✓ 16✓ 17
Llama 3.3 70BQ5_K_M✓ 12✓ 13
Llama 3.3 70BQ6_K✓ 10
Qwen 2.5 123BQ4_K_M✓ 8

#3. Benchmarks 2026

MBP M4 Max 16-core GPU, 128 Go, Ollama 0.5.x, secteur
ModèleQ4_K_MQ5_K_MFlash Attn 8kMLX 4-bit
Mistral 7B72 t/s68 t/s65 t/s78 t/s
Phi-4 14B36 t/s34 t/s32 t/s40 t/s
Mistral Small 24B26 t/s24 t/s22 t/s28 t/s
Qwen 2.5 32B22 t/s20 t/s19 t/s24 t/s
Llama 3.3 70B17 t/s13 t/s12 t/s19 t/s
Qwen 2.5 123B8 t/s9 t/s

#4. Installation optimisée M4

Setup MBP M4 Max 128 Go
brew install --cask ollama

# Mémoire GPU — 128 Go → 116 Go GPU (12 Go pour système)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

# LaunchAgent pour tout garder au reboot
mkdir -p ~/Library/LaunchAgents
cat > ~/Library/LaunchAgents/ai.ollama.env.plist <<'PLIST'
<?xml version="1.0"?>
<plist version="1.0"><dict>
  <key>Label</key><string>ai.ollama.env</string>
  <key>ProgramArguments</key><array>
    <string>/bin/sh</string><string>-c</string>
    <string>launchctl setenv OLLAMA_FLASH_ATTENTION 1; launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0</string>
  </array>
  <key>RunAtLoad</key><true/>
</dict></plist>
PLIST

brew services restart ollama

#5. Exploiter les 546 Go/s du M4 Max

Utilisez MLX sur gros modèles
Sur M4 Max, MLX tire mieux parti de la bande passante que llama.cpp. +15 % sur 70B mesuré.
Contextes longs profitent le plus
L'écart avec M3 Max se creuse à 16k+ de contexte : +40 % mesuré vs +25 % sur contexte court.
Spéculatif decoding
Sur 70B + draft 1B, llama.cpp atteint 22 tok/s (vs 13 sans draft). Voir flag --draft sur llama.cpp.
Core ML pour Whisper
Si vous faites du pipeline voix → LLM, Whisper passe par le Neural Engine du M4 (jusqu'à 60× temps réel). Économise du GPU.
Spéculatif decoding sur Llama 70B
# Télécharger aussi Llama 3.2 1B comme draft
ollama pull llama3.2:1b

# Avec llama.cpp maison (fonctionnalité pas encore dans Ollama)
./build/bin/llama-cli \
  -m llama-3.3-70b-q5_k_m.gguf \
  --draft-model llama-3.2-1b-q4_k_m.gguf \
  -ngl 99 -fa -c 8192

#MBP M4 Max vs Mac Studio M4 Max

Performance
Identique sur la même puce (M4 Max 16-core). Bande passante et RAM max égales.
Mobilité
MBP = partout. Mac Studio = bureau fixe. Si vous êtes sédentaire, le Studio est 30-40 % moins cher à perf égale.
Prix M4 Max 128 Go
MBP 16" M4 Max 128 Go ≈ 5500 € / Mac Studio M4 Max 128 Go ≈ 4300 €. Écart de 1200 €.
Verdict
Si l'usage est 100 % bureau, Mac Studio. Si vous bougez (clients, voyages, conférences), MBP M4 Max — aucun autre laptop n'approche.

#Limites à connaître

Plafond 128 Go
Impossible d'aller au-delà. Pour 256-512 Go, il faut un Mac Studio Ultra.
Pas de CUDA
Certaines libs (bitsandbytes, xformers) ne tournent pas. Pour du développement, prévoyez Docker ou une VM.
Fine-tuning contraint
LoRA OK via MLX. Full fine-tuning d'un 7B+ reste mieux sur GPU NVIDIA.
Prix
MBP M4 Max 128 Go à 5500 €. Cher — mais sans équivalent fonctionnel.

#Questions fréquentes

Le MacBook Pro M4 Max est-il meilleur qu'une RTX 4090 pour les LLM ?+
Pour 7B-34B qui rentrent en 24 Go VRAM, la 4090 est plus rapide (bande passante 1 To/s). Au-delà, le MBP M4 Max gagne : 70B Q4 à 17 tok/s sur M4 Max contre impossible nativement sur 4090 seule (24 Go VRAM insuffisants). Le Mac gagne sur RAM, la 4090 sur vitesse pure.
M4 Pro 48 Go ou M4 Max 48 Go ?+
Le M4 Max sans hésiter si la différence de prix est < 800 €. +50 % de bande passante (410 vs 273 Go/s), même RAM. Sur Phi-4 14B : 28 tok/s (Pro) vs 34 tok/s (Max). Pour 70B, seul le Max est capable.
Faut-il 96 ou 128 Go de RAM sur M4 Max ?+
96 Go couvre 95 % des usages (70B Q5 confortable). 128 Go ajoute : 70B Q6 (qualité quasi-FP16), Qwen 123B Q4, marge de contexte 32k+. +600 € Apple. Si vous travaillez régulièrement sur 70B+, le 128 Go se justifie.
Le MBP M4 Max peut-il faire du fine-tuning ?+
Oui, via MLX, pour LoRA et QLoRA jusqu'à 14B en FP16 avec 96 Go. Plus gros que ça devient lent. Full fine-tuning d'un 70B n'est pas praticable — prévoyez un service cloud ponctuel pour ça.
Autonomie batterie pendant une inférence Llama 70B ?+
MBP 16" M4 Max : environ 1h45 en chat continu, 1h en batch. MBP 14" : 1h15 / 45 min (batterie plus petite). Pour des sessions longues, branchez.
Ollama, LM Studio, MLX ou llama.cpp : quel choix sur M4 Max ?+
Ollama pour 90 % des usages (simple, robuste). LM Studio pour explorer les modèles avec UI. MLX pour les 5-10 % de perf en plus sur gros modèles ou pour du fine-tuning. llama.cpp maison pour accéder aux dernières features (spéculatif decoding, flash attention avancé) avant qu'Ollama les intègre.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.