Intermédiaire 12 minMacBook Pro

Quel LLM sur MacBook Pro M3 Pro / Max (18–128 Go) ?

Le MacBook Pro M3 Pro / Max (fin 2023) est en 2026 le sweet spot du laptop pour LLM local. Le M3 Max 16-core offre 400 Go/s de bande passante et jusqu'à 128 Go de mémoire unifiée — assez pour faire tourner tout le catalogue open-weight 2026 en pleine précision : Qwen 3.6 35B-A3B en Q8, Qwen 3.8 27B en dense, ou plusieurs modèles chargés en parallèle avec des contextes de 128k et plus. Attention : le M3 Pro a subi un downgrade mémoire (150 Go/s, contre 200 pour M2 Pro). Ce guide démêle ce que chaque variante permet vraiment.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur macOS 14+

#MBP M3 Pro / Max en 2026

Sortie
Octobre-novembre 2023. Toujours supporté par macOS Sequoia et au-delà.
M3 Pro
11 ou 12 cœurs CPU + 14 ou 18 cœurs GPU, 150 Go/s (downgrade vs M2 Pro), RAM 18 ou 36 Go.
M3 Max 14-core
14 cœurs CPU + 30 cœurs GPU, 300 Go/s, RAM 36 ou 96 Go.
M3 Max 16-core
16 cœurs CPU + 40 cœurs GPU, 400 Go/s, RAM 48, 64 ou 128 Go.
!
Le piège du M3 Pro
Apple a baissé la bande passante mémoire du M3 Pro (150 Go/s contre 200 pour M2 Pro). Résultat : le M3 Pro est plus lent que le M2 Pro en LLM. Si vous cherchez du M3, visez directement le M3 Max — ou gardez un M2 Pro d'occasion.

#1. M3 Pro vs M3 Max (attention au piège)

M3 Pro 150 Go/s
Correct pour du 9B-12B (~30 tok/s) mais s'essouffle sur du 24B+ dense (~12 tok/s). Évitez si vous visez du 24B+ dense.
M3 Max 14-core 300 Go/s
Le bon compromis : Qwen 3.6 35B-A3B (MoE) à 35-38 tok/s, Qwen 3.8 27B dense à 15-17 tok/s. RAM max 96 Go.
M3 Max 16-core 400 Go/s
Le haut de gamme. +30 % de vitesse sur gros modèles, ouvre 128 Go RAM pour la pleine précision Q8 et plusieurs modèles en parallèle.

#2. 18 à 128 Go : quels LLM

Modèles compatibles par config MBP M3
ModèleQuantM3 Pro 18M3 Pro 36M3 Max 64M3 Max 96M3 Max 128
Qwen 3.5 9BQ5_K_M✓ 30✓ 32✓ 46✓ 48✓ 50
Gemma 4 12BQ5_K_M✓ 14✓ 16✓ 26✓ 28✓ 30
Mistral Small 24BQ5_K_M✓ 10✓ 17✓ 19✓ 20
Qwen 3.8 27BQ5_K_M✓ 15✓ 16✓ 17
Qwen 3.6 35B-A3BQ5_K_M✓ 38✓ 40✓ 42
Qwen 3.6 35B-A3BQ8_0✓ 32✓ 34✓ 36
Qwen3-Coder 30B-A3BQ8_0✓ 33✓ 35✓ 37
GLM 4.7 FlashQ4_K_M✓ 44✓ 46✓ 48

#3. Benchmarks tokens/sec

Ordres de grandeur — MBP M3 Max 16-core GPU, 128 Go, Ollama, secteur
ModèleQ4_K_MQ5_K_MFlash Attn 8k
Qwen 3.5 9B54 t/s50 t/s48 t/s
Gemma 4 12B34 t/s30 t/s29 t/s
Mistral Small 24B22 t/s20 t/s19 t/s
Qwen 3.8 27B19 t/s17 t/s16 t/s
Qwen 3.6 35B-A3B46 t/s42 t/s40 t/s

#4. Installation et config

Setup complet MBP M3 Max 128 Go
brew install --cask ollama

# Relever la mémoire GPU (128 Go → 116 Go GPU)
sudo sysctl iogpu.wired_limit_mb=118784
echo "iogpu.wired_limit_mb=118784" | sudo tee -a /etc/sysctl.conf

# Flash Attention + KV cache Q8
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

brew services restart ollama
ollama pull qwen3.6:35b

#5. Gros modèles en pleine précision avec Flash Attention

Flash Attention, longtemps réservé à CUDA, est dispo sur Metal depuis fin 2024 via llama.cpp et Ollama. Gain majeur sur les contextes longs — indispensable pour pousser un Qwen 3.6 35B-A3B à 128k de contexte.

llama.cpp compilé maison — Qwen 3.6 35B contexte 16k
./build/bin/llama-cli \
  -m ./models/qwen3.6-35b-a3b-q5_K_M.gguf \
  -ngl 99 -fa \
  -ctk q8_0 -ctv q8_0 \
  -c 16384 \
  --temp 0.7
Gains mesurés avec Flash Attention sur M3 Max
Contexte 4k : +8 %. Contexte 8k : +15 %. Contexte 16k : +25 %. Plus vous avez de contexte, plus le gain est net. À activer systématiquement sur M3 Max.

#6. Le M3 Max 128 Go : territoire workstation

Qwen 3.6 35B-A3B Q8
Pleine précision, qualité maximale. ~36 tok/s (MoE, 3B actifs). Le 128 Go permet le Q8 sans compromis sur le contexte.
Qwen 3.8 27B Q8
Le plus gros généraliste dense en pleine précision (~29 Go). ~15 tok/s. Le "proche Copilot" 2026, vision incluse.
2 modèles 30B en parallèle
Un Qwen 3.6 35B-A3B + un Qwen3-Coder 30B-A3B chargés simultanément. ~42 Go total. Pour agents multi-spécialistes.
Context 128k+ sur 35B
Avec KV cache Q8, Qwen 3.6 35B-A3B + contexte 128k tient dans ~50 Go. Analyse de docs longs sérieuse.

#M3 Max vs M4 Max

Bande passante
M3 Max 16-core = 400 Go/s. M4 Max 16-core = 546 Go/s (+36 %).
Vitesse Qwen 3.6 35B-A3B
M3 Max ~40 tok/s, M4 Max ~54 tok/s. +35 % en usage réel.
RAM max
Identique : 128 Go sur les deux top configs.
Verdict
M4 Max si achat neuf. M3 Max d'occasion à -25 % de prix est aussi un excellent deal.

#Questions fréquentes

Le M3 Pro est-il vraiment plus lent que le M2 Pro pour les LLM ?+
Oui, pour les modèles 24B+ dense, à cause de la bande passante (150 Go/s vs 200). Sur Qwen 3.5 9B, l'écart est faible (~5 %). Sur Mistral Small 24B, le M2 Pro est 10-15 % plus rapide. Conseil : si vous achetez d'occasion et visez du 24B+ dense, préférez M2 Pro ou sautez directement à M3 Max.
Quel MBP M3 pour faire tourner les gros modèles 2026 ?+
M3 Max 14-core 64 Go pour un Qwen 3.6 35B-A3B en Q8 (~35 tok/s, MoE), M3 Max 16-core 96-128 Go pour charger plusieurs modèles ou pousser le contexte à 128k. Le M3 Pro 36 Go se limite au 24B dense.
Différence M3 Max 14-core vs 16-core en pratique ?+
+30 % de bande passante (300 vs 400 Go/s), +33 % de cœurs GPU, option 128 Go RAM. Sur un gros MoE 35B : +40 % de vitesse. Sur du 9B : +8 % seulement. Si vous visez des gros modèles, le 16-core est un vrai investissement.
128 Go de RAM, est-ce vraiment utile en 2026 ?+
Oui si vous voulez : Qwen 3.6 35B-A3B en Q8 (pleine précision, meilleure qualité qu'un Q4), deux modèles 30B en parallèle, ou un contexte de 128k. Pour un usage standard, 64 Go suffit largement.
Flash Attention change vraiment quelque chose sur M3 Max ?+
Oui, 15 à 25 % de vitesse en plus sur contextes 8k-16k, sans perte de qualité. À activer par défaut via OLLAMA_FLASH_ATTENTION=1.
Autonomie batterie pendant un chat sur un gros modèle ?+
Environ 1h40 en chat continu sur le 16" M3 Max (conso ~50 W). Confortable pour une session en déplacement. En batch sur un gros modèle, comptez 1h max — préférez le secteur.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.