Intermédiaire 11 minMacBook Pro

Quel LLM sur MacBook Pro M2 Pro / Max (16–96 Go) ?

Le MacBook Pro M2 Pro / Max (2023) est en 2026 un excellent choix pour qui veut faire tourner des LLM en local sans compromis : ventilateurs actifs, mémoire unifiée jusqu'à 96 Go (record à l'époque), bande passante 200-400 Go/s. Un Llama 3.3 70B Q4 tourne à 10-12 tokens/seconde sur un M2 Max 96 Go, un Mistral Small 24B à 20 tok/s. Ce guide passe en revue chaque config.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#MBP M2 Pro / Max en 2026

Sortie
Janvier 2023. Actuellement en fin de cycle, remplacé par M3/M4. Occasion attractive.
M2 Pro
10 ou 12 cœurs CPU + 16 ou 19 cœurs GPU, 200 Go/s, RAM 16 ou 32 Go.
M2 Max
12 cœurs CPU + 30 ou 38 cœurs GPU, 400 Go/s, RAM 32, 64 ou 96 Go.
Gain vs M1
+15 % de vitesse sur 7B, +25 % sur 70B grâce au GPU plus large et aux optimisations Metal 3.

#1. M2 Pro vs M2 Max

M2 Pro (200 Go/s)
Identique à M1 Pro côté bande passante. Gain de 10-15 % vs M1 grâce à Metal 3 et GPU élargi.
M2 Max (400 Go/s)
Double bande passante, indispensable pour 32B+. Option 96 Go ouvre des modèles quasi-inatteignables ailleurs.
96 Go M2 Max
Exclusivité M2 Max (pas dispo sur M1 Max). Permet Llama 70B Q5 confortable ou deux modèles 32B chargés simultanément.

#2. 16 à 96 Go : capacités

Modèles compatibles par config MBP M2
ModèleQuantRAM modèleM2 Pro 16M2 Pro 32M2 Max 64M2 Max 96
Mistral 7BQ5_K_M5 Go✓ 40✓ 45✓ 60✓ 60
Llama 3.1 8BQ5_K_M6 Go✓ 34✓ 38✓ 52✓ 52
Phi-4 14BQ5_K_M10,5 Go✓ 19✓ 28✓ 28
Qwen 2.5 32BQ4_K_M19 Go✓ 16✓ 17
Mistral Small 24BQ5_K_M16 Go✓ 12✓ 20✓ 20
Llama 3.3 70BQ4_K_M42 Go✓ 10✓ 12
Llama 3.3 70BQ5_K_M50 Go✓ 10
DeepSeek 70BQ4_K_M42 Go✓ 10✓ 11

#3. Benchmarks

MBP M2 Max 38-core GPU, 96 Go, Ollama, secteur
ModèleQ4_K_MQ5_K_MContexte 8k
Mistral 7B62 t/s58 t/s55 t/s
Phi-4 14B30 t/s28 t/s26 t/s
Mistral Small 24B22 t/s20 t/s18 t/s
Qwen 2.5 32B17 t/s15 t/s14 t/s
Llama 3.3 70B11 t/s10 t/s9 t/s

#4. Installation

Setup Ollama + optimisations
brew install --cask ollama

# Flash Attention + KV cache Q8 (gain pour gros modèles)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

# Relever mémoire GPU si M2 Max 64+ Go
sudo sysctl iogpu.wired_limit_mb=57344   # M2 Max 64 Go
# sudo sysctl iogpu.wired_limit_mb=86016 # M2 Max 96 Go

brew services start ollama
ollama run llama3.3  # 70B sur 64-96 Go

#5. Modèles recommandés par usage

Chat généraliste
Mistral 7B Q5 (rapide, FR natif) ou Llama 3.1 8B Q5 (meilleur raisonnement).
Code
Qwen 2.5 Coder 14B Q5 sur 32 Go, DeepSeek Coder v2 16B Q5 sur 32 Go+, ou Qwen 32B Coder sur 64 Go+.
RAG documentaire
Phi-4 14B (contexte 16k) ou Mistral Small 24B (meilleur raisonnement mais plus lent).
Raisonnement / analyse
Sur 64 Go+, Llama 3.3 70B Q4 bat tout le reste en qualité pure. 32B sur 32 Go est un bon compromis.

#6. Optimisations avancées

Flash Attention
Activé via OLLAMA_FLASH_ATTENTION=1. Gain de 10-15 % sur contextes 8k+.
KV cache Q8
Via OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 70B contexte 16k+.
Spéculatif decoding
Disponible dans llama.cpp maison. Sur 70B + un 1B comme draft, gain 1,5× sur génération.
Allocation manuelle GPU
sysctl iogpu.wired_limit_mb. Sur 96 Go, montez à 86016 Mo (84 Go) pour charger 70B Q5 + contexte long.

#Upgrade vers M4 Max ?

Le M4 Max 16-core apporte 546 Go/s de bande passante (+36 % vs M2 Max), et jusqu'à 128 Go de RAM. Concrètement :

Gain vitesse 70B
De 11 tok/s (M2 Max) à ~17 tok/s (M4 Max 16-core). Significatif.
Capacité RAM
De 96 Go à 128 Go. Ouvre Llama 70B Q6 ou 123B Q4.
Prix upgrade
Revente M2 Max 96 Go ~2500 € / achat M4 Max 128 Go neuf ~4500 €. Coût net ~2000 €.
Verdict
Upgrade uniquement si vous travaillez quotidiennement sur du 70B+ et que la vitesse compte. Sinon, M2 Max 96 Go reste très bien en 2026.

#Questions fréquentes

MBP M2 Pro 16 Go est-il suffisant pour l'IA locale ?+
Oui, pour Mistral 7B, Llama 3.1 8B et Qwen 7B en Q5 à 35-40 tok/s. Pour un usage plus ambitieux (14B, 24B), visez 32 Go.
Différence entre M2 Max 30-core et 38-core GPU ?+
Environ 15-20 % de vitesse en plus pour le 38-core sur des 32B+. Négligeable sur 7B (limité par la bande passante commune). Si votre usage vise les gros modèles, optez pour le 38-core.
Peut-on faire tourner deux LLM en parallèle sur MBP M2 Max 64 Go ?+
Oui : par exemple Mistral 7B (5 Go) + Phi-4 14B (10 Go) + contexte = 20 Go. Reste 40 Go pour le système et les apps. Ollama gère très bien le multi-modèle.
Quel modèle pour du français sur MBP M2 Max 64 Go ?+
Mistral Small 24B Q5 (excellente maîtrise FR, 20 tok/s) ou Llama 3.3 70B Q4 (meilleure qualité mais 10 tok/s). Sur 32 Go, restez sur Mistral Small 24B.
Le MBP M2 Max chauffe-t-il plus que le M1 Max ?+
Légèrement — efficience énergétique moins bonne que M1. Mais les ventilateurs actifs absorbent la différence. Conso soutenue : ~50 W sur 70B vs ~45 W sur M1 Max.
Faut-il installer MLX à côté d'Ollama sur M2 Max ?+
Seulement si vous voulez fine-tuner un LoRA en local ou utiliser des modèles MLX-community non disponibles en GGUF. Pour 95 % des usages, Ollama seul suffit.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.