Intermédiaire 12 minMacBook Pro

Quel LLM sur MacBook Pro M3 Pro / Max (18–128 Go) ?

Le MacBook Pro M3 Pro / Max (fin 2023) est en 2026 le sweet spot du laptop pour LLM local. Le M3 Max 16-core offre 400 Go/s de bande passante et jusqu'à 128 Go de mémoire unifiée — assez pour Llama 3.3 70B en Q5 confortable, voire Qwen 2.5 123B en Q4. Attention : le M3 Pro a subi un downgrade mémoire (150 Go/s, contre 200 pour M2 Pro). Ce guide démêle ce que chaque variante permet vraiment.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#MBP M3 Pro / Max en 2026

Sortie
Octobre-novembre 2023. Toujours supporté par macOS Sequoia et au-delà.
M3 Pro
11 ou 12 cœurs CPU + 14 ou 18 cœurs GPU, 150 Go/s (downgrade vs M2 Pro), RAM 18 ou 36 Go.
M3 Max 14-core
14 cœurs CPU + 30 cœurs GPU, 300 Go/s, RAM 36 ou 96 Go.
M3 Max 16-core
16 cœurs CPU + 40 cœurs GPU, 400 Go/s, RAM 48, 64 ou 128 Go.
!
Le piège du M3 Pro
Apple a baissé la bande passante mémoire du M3 Pro (150 Go/s contre 200 pour M2 Pro). Résultat : le M3 Pro est plus lent que le M2 Pro en LLM. Si vous cherchez du M3, visez directement le M3 Max — ou gardez un M2 Pro d'occasion.

#1. M3 Pro vs M3 Max (attention au piège)

M3 Pro 150 Go/s
Correct pour 7B-8B (~35 tok/s) mais s'essouffle sur 14B+ (~12 tok/s). Évitez si vous visez du 14B+.
M3 Max 14-core 300 Go/s
Le bon compromis : 70B Q4 à 10-12 tok/s, 32B à 15-17 tok/s. RAM max 96 Go.
M3 Max 16-core 400 Go/s
Le haut de gamme. +30 % de vitesse sur gros modèles, ouvre 128 Go RAM pour 70B Q6 ou 123B Q4.

#2. 18 à 128 Go : quels LLM

Modèles compatibles par config MBP M3
ModèleQuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Mistral 7BQ5_K_M✓ 34✓ 36✓ 52✓ 55✓ 58
Phi-4 14BQ5_K_M✓ 14✓ 24✓ 26✓ 28
Mistral Small 24BQ5_K_M✓ 10✓ 17✓ 19✓ 20
Qwen 2.5 32BQ5_K_M✓ 13✓ 15✓ 16
Llama 3.3 70BQ4_K_M✓ 10✓ 11✓ 12
Llama 3.3 70BQ5_K_M✓ 9✓ 10
Llama 3.3 70BQ6_K✓ 8
Qwen 2.5 123BQ4_K_M✓ 6

#3. Benchmarks tokens/sec

MBP M3 Max 16-core GPU, 128 Go, Ollama 0.5.x, secteur
ModèleQ4_K_MQ5_K_MFlash Attn 8k
Mistral 7B62 t/s58 t/s55 t/s
Phi-4 14B32 t/s28 t/s27 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 2.5 32B18 t/s16 t/s15 t/s
Llama 3.3 70B13 t/s10 t/s10 t/s

#4. Installation et config

Setup complet MBP M3 Max 128 Go
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull llama3.3:70b-instruct-q5_K_M

#5. Faire tourner un 70B avec Flash Attention

Flash Attention, longtemps réservé à CUDA, est dispo sur Metal depuis fin 2024 via llama.cpp et Ollama. Gain majeur sur les contextes longs.

llama.cpp compilé maison — Llama 70B contexte 16k
./build/bin/llama-cli \
  -m ./models/llama-3.3-70b-instruct-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
Gains mesurés avec Flash Attention sur M3 Max
Contexte 4k : +8 %. Contexte 8k : +15 %. Contexte 16k : +25 %. Plus vous avez de contexte, plus le gain est net. À activer systématiquement sur M3 Max.

#6. Le M3 Max 128 Go : territoire workstation

Llama 3.3 70B Q6_K
Qualité quasi-FP16. 8 tok/s. Seul laptop au monde capable de ça (hors M4 Max 128 Go).
Qwen 2.5 123B Q4
Dense 123B — le plus gros modèle open-weights qui rentre. 6 tok/s. Usage patient.
2 × 32B en parallèle
Un 32B Q5 + un 32B Coder Q5 chargés simultanément. 40 Go total. Pour agents multi-spécialistes.
Context 32k+ sur 70B
Avec KV cache Q8, 70B + contexte 32k tient dans 90 Go. Analyse de docs longs sérieuse.

#M3 Max vs M4 Max

Bande passante
M3 Max 16-core = 400 Go/s. M4 Max 16-core = 546 Go/s (+36 %).
Vitesse 70B
M3 Max ~11 tok/s, M4 Max ~16 tok/s. +45 % en usage réel.
RAM max
Identique : 128 Go sur les deux top configs.
Verdict
M4 Max si achat neuf. M3 Max d'occasion à -25 % de prix est aussi un excellent deal.

#Questions fréquentes

Le M3 Pro est-il vraiment plus lent que le M2 Pro pour les LLM ?+
Oui, pour les modèles 13B+, à cause de la bande passante (150 Go/s vs 200). Sur Mistral 7B, l'écart est faible (~5 %). Sur Phi-4 14B, le M2 Pro est 10-15 % plus rapide. Conseil : si vous achetez d'occasion et visez du 14B+, préférez M2 Pro ou sautez directement à M3 Max.
Quel MBP M3 pour faire tourner Llama 3.3 70B ?+
M3 Max 14-core 64 Go minimum (10 tok/s Q4), M3 Max 16-core 64-128 Go pour du confort. Le M3 Pro 36 Go ne peut pas charger de 70B.
Différence M3 Max 14-core vs 16-core en pratique ?+
+30 % de bande passante (300 vs 400 Go/s), +33 % de cœurs GPU, option 128 Go RAM. Sur 70B Q4 : +40 % de vitesse. Sur 7B : +8 % seulement. Si vous visez des gros modèles, le 16-core est un vrai investissement.
128 Go de RAM, est-ce vraiment utile en 2026 ?+
Oui si vous voulez : 70B en Q6 (meilleure qualité qu'un Q4), 123B en Q4, ou deux modèles 32B+ en parallèle. Pour du 70B Q4 standard, 64 Go suffit largement.
Flash Attention change vraiment quelque chose sur M3 Max ?+
Oui, 15 à 25 % de vitesse en plus sur contextes 8k-16k, sans perte de qualité. À activer par défaut via OLLAMA_FLASH_ATTENTION=1.
Autonomie batterie pendant un chat Llama 70B ?+
Environ 1h40 en chat continu sur le 16" M3 Max (conso ~50 W). Confortable pour une session en déplacement. En batch sur 70B, comptez 1h max — préférez le secteur.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.