Intermédiaire 11 minMacBook Pro

Quel LLM sur MacBook Pro M2 Pro / Max (16–96 Go) ?

Le MacBook Pro M2 Pro / Max (2023) est en 2026 un excellent choix pour qui veut faire tourner des LLM en local sans compromis : ventilateurs actifs, mémoire unifiée jusqu'à 96 Go (record à l'époque), bande passante 200-400 Go/s. Un Qwen 3.8 27B (dense, vision, 262k de contexte) tourne à ~20 tokens/seconde sur un M2 Max 96 Go, un Mistral Small 24B à 22 tok/s. Ce guide passe en revue chaque config.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur macOS 14+

#MBP M2 Pro / Max en 2026

Sortie
Janvier 2023. Actuellement en fin de cycle, remplacé par M3/M4. Occasion attractive.
M2 Pro
10 ou 12 cœurs CPU + 16 ou 19 cœurs GPU, 200 Go/s, RAM 16 ou 32 Go.
M2 Max
12 cœurs CPU + 30 ou 38 cœurs GPU, 400 Go/s, RAM 32, 64 ou 96 Go.
Gain vs M1
+15 % de vitesse sur les petits modèles, +25 % sur les gros grâce au GPU plus large et aux optimisations Metal 3.

#1. M2 Pro vs M2 Max

M2 Pro (200 Go/s)
Identique à M1 Pro côté bande passante. Gain de 10-15 % vs M1 grâce à Metal 3 et GPU élargi.
M2 Max (400 Go/s)
Double bande passante, indispensable pour 32B+. Option 96 Go ouvre des modèles quasi-inatteignables ailleurs.
96 Go M2 Max
Exclusivité M2 Max (pas dispo sur M1 Max). Permet un Qwen 3.6 35B-A3B Q8 confortable ou deux modèles 24-30B chargés simultanément.

#2. 16 à 96 Go : capacités

Modèles compatibles par config MBP M2
ModèleQuantRAM modèleM2 Pro 16M2 Pro 32M2 Max 64M2 Max 96
Granite 4.2 8BQ5_K_M6 Go✓ 40✓ 44✓ 58✓ 58
Qwen 3.5 9BQ5_K_M7 Go✓ 36✓ 40✓ 52✓ 52
Gemma 4 12BQ5_K_M9 Go✓ 28✓ 40✓ 40
Mistral Small 24BQ5_K_M16 Go✓ 14✓ 22✓ 22
Qwen 3.8 27BQ4_K_M18 Go✓ 13✓ 20✓ 20
Qwen 3.6 35B-A3BQ4_K_M23 Go✓ 42✓ 42
Qwen3-Coder 30B-A3BQ8_032 Go✓ 42✓ 44
Qwen 3.6 35B-A3BQ8_035 Go✓ 38

#3. Benchmarks

MBP M2 Max 38-core GPU, 96 Go, Ollama, secteur — ordres de grandeur. Le 35B-A3B est un MoE (3 B actifs) : il va plus vite que sa taille totale ne le laisse croire.
ModèleQ4_K_MQ5_K_MContexte 8k
Qwen 3.5 9B56 t/s52 t/s48 t/s
Gemma 4 12B42 t/s40 t/s37 t/s
Qwen 3.6 35B-A3B42 t/s40 t/s36 t/s
Mistral Small 24B24 t/s22 t/s20 t/s
Qwen 3.8 27B20 t/s18 t/s16 t/s

#4. Installation

Setup Ollama + optimisations
brew install --cask ollama

# Flash Attention + KV cache Q8 (gain pour gros modèles)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0

# Relever mémoire GPU si M2 Max 64+ Go
sudo sysctl iogpu.wired_limit_mb=57344   # M2 Max 64 Go
# sudo sysctl iogpu.wired_limit_mb=86016 # M2 Max 96 Go

brew services start ollama
ollama run qwen3.6:35b  # MoE 35B-A3B sur 64-96 Go

#5. Modèles recommandés par usage

Chat généraliste
Qwen 3.5 9B Q5 (256k de contexte, vision, rapide) ou Granite 4.2 8B (plus sobre).
Code
Qwen3-Coder 30B-A3B (MoE, 256k ctx) sur 32 Go+, ou Devstral 24B (spécialiste agent de code, Mistral AI) sur 32 Go. Pour l'autocomplétion inline, Qwen2.5-Coder 7B base reste la référence FIM.
RAG documentaire
Gemma 4 12B (multimodal, léger) ou Mistral Small 24B (meilleur raisonnement mais plus lent).
Raisonnement / analyse
Sur 64 Go+, Qwen 3.6 35B-A3B (MoE rapide) ou Qwen 3.8 27B (le plus proche d'un Copilot, 262k ctx) dominent en qualité. Le Qwen 3.8 27B sur 32 Go est un bon compromis.

#6. Optimisations avancées

Flash Attention
Activé via OLLAMA_FLASH_ATTENTION=1. Gain de 10-15 % sur contextes 8k+.
KV cache Q8
Via OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 70B contexte 16k+.
Spéculatif decoding
Disponible dans llama.cpp maison. Sur un Qwen 3.8 27B + un Qwen 3.5 2B comme draft, gain 1,5× sur génération.
Allocation manuelle GPU
sysctl iogpu.wired_limit_mb. Sur 96 Go, montez à 86016 Mo (84 Go) pour charger un 35B-A3B Q8 + contexte long.
Qwen 3.8 27B : raisonnement
Par défaut il « sur-réfléchit » avec son réglage de raisonnement, ce qui ralentit les réponses simples. Passez-le en low pour des sorties plus directes.

#Upgrade vers M4 Max ?

Le M4 Max 16-core apporte 546 Go/s de bande passante (+36 % vs M2 Max), et jusqu'à 128 Go de RAM. Concrètement :

Gain vitesse gros modèle
Sur un Qwen 3.8 27B, de ~20 tok/s (M2 Max) à ~28 tok/s (M4 Max 16-core). Significatif.
Capacité RAM
De 96 Go à 128 Go. Ouvre les gros MoE en Q8 ou deux modèles 30B chargés simultanément.
Prix upgrade
Revente M2 Max 96 Go ~2500 € / achat M4 Max 128 Go neuf ~4500 €. Coût net ~2000 €.
Verdict
Upgrade uniquement si vous travaillez quotidiennement sur des gros modèles (30B+) et que la vitesse compte. Sinon, M2 Max 96 Go reste très bien en 2026.

#Questions fréquentes

MBP M2 Pro 16 Go est-il suffisant pour l'IA locale ?+
Oui, pour Qwen 3.5 9B et Granite 4.2 8B en Q5 à 35-40 tok/s. Pour un usage plus ambitieux (12B, 24B), visez 32 Go.
Différence entre M2 Max 30-core et 38-core GPU ?+
Environ 15-20 % de vitesse en plus pour le 38-core sur des 32B+. Négligeable sur 7B (limité par la bande passante commune). Si votre usage vise les gros modèles, optez pour le 38-core.
Peut-on faire tourner deux LLM en parallèle sur MBP M2 Max 64 Go ?+
Oui : par exemple Granite 4.2 8B (5 Go) + Gemma 4 12B (8 Go) + contexte = 18 Go. Reste 45 Go pour le système et les apps. Ollama gère très bien le multi-modèle.
Quel modèle pour du français sur MBP M2 Max 64 Go ?+
Mistral Small 24B Q5 (excellente maîtrise FR, 22 tok/s) ou Qwen 3.8 27B (raisonnement supérieur, 262k ctx, 20 tok/s). Sur 32 Go, les deux tiennent confortablement.
Le MBP M2 Max chauffe-t-il plus que le M1 Max ?+
Légèrement — efficience énergétique moins bonne que M1. Mais les ventilateurs actifs absorbent la différence. Conso soutenue : ~50 W sur un gros modèle vs ~45 W sur M1 Max.
Faut-il installer MLX à côté d'Ollama sur M2 Max ?+
Seulement si vous voulez fine-tuner un LoRA en local ou utiliser des modèles MLX-community non disponibles en GGUF. Pour 95 % des usages, Ollama seul suffit.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.