Intermédiaire 11 minMacBook Pro
Quel LLM sur MacBook Pro M2 Pro / Max (16–96 Go) ?
Le MacBook Pro M2 Pro / Max (2023) est en 2026 un excellent choix pour qui veut faire tourner des LLM en local sans compromis : ventilateurs actifs, mémoire unifiée jusqu'à 96 Go (record à l'époque), bande passante 200-400 Go/s. Un Qwen 3.8 27B (dense, vision, 262k de contexte) tourne à ~20 tokens/seconde sur un M2 Max 96 Go, un Mistral Small 24B à 22 tok/s. Ce guide passe en revue chaque config.
#MBP M2 Pro / Max en 2026
- Sortie
- Janvier 2023. Actuellement en fin de cycle, remplacé par M3/M4. Occasion attractive.
- M2 Pro
- 10 ou 12 cœurs CPU + 16 ou 19 cœurs GPU, 200 Go/s, RAM 16 ou 32 Go.
- M2 Max
- 12 cœurs CPU + 30 ou 38 cœurs GPU, 400 Go/s, RAM 32, 64 ou 96 Go.
- Gain vs M1
- +15 % de vitesse sur les petits modèles, +25 % sur les gros grâce au GPU plus large et aux optimisations Metal 3.
#1. M2 Pro vs M2 Max
- M2 Pro (200 Go/s)
- Identique à M1 Pro côté bande passante. Gain de 10-15 % vs M1 grâce à Metal 3 et GPU élargi.
- M2 Max (400 Go/s)
- Double bande passante, indispensable pour 32B+. Option 96 Go ouvre des modèles quasi-inatteignables ailleurs.
- 96 Go M2 Max
- Exclusivité M2 Max (pas dispo sur M1 Max). Permet un Qwen 3.6 35B-A3B Q8 confortable ou deux modèles 24-30B chargés simultanément.
#2. 16 à 96 Go : capacités
Modèles compatibles par config MBP M2
| Modèle | Quant | RAM modèle | M2 Pro 16 | M2 Pro 32 | M2 Max 64 | M2 Max 96 |
|---|---|---|---|---|---|---|
| Granite 4.2 8B | Q5_K_M | 6 Go | ✓ 40 | ✓ 44 | ✓ 58 | ✓ 58 |
| Qwen 3.5 9B | Q5_K_M | 7 Go | ✓ 36 | ✓ 40 | ✓ 52 | ✓ 52 |
| Gemma 4 12B | Q5_K_M | 9 Go | — | ✓ 28 | ✓ 40 | ✓ 40 |
| Mistral Small 24B | Q5_K_M | 16 Go | — | ✓ 14 | ✓ 22 | ✓ 22 |
| Qwen 3.8 27B | Q4_K_M | 18 Go | — | ✓ 13 | ✓ 20 | ✓ 20 |
| Qwen 3.6 35B-A3B | Q4_K_M | 23 Go | — | — | ✓ 42 | ✓ 42 |
| Qwen3-Coder 30B-A3B | Q8_0 | 32 Go | — | — | ✓ 42 | ✓ 44 |
| Qwen 3.6 35B-A3B | Q8_0 | 35 Go | — | — | — | ✓ 38 |
#3. Benchmarks
MBP M2 Max 38-core GPU, 96 Go, Ollama, secteur — ordres de grandeur. Le 35B-A3B est un MoE (3 B actifs) : il va plus vite que sa taille totale ne le laisse croire.
| Modèle | Q4_K_M | Q5_K_M | Contexte 8k |
|---|---|---|---|
| Qwen 3.5 9B | 56 t/s | 52 t/s | 48 t/s |
| Gemma 4 12B | 42 t/s | 40 t/s | 37 t/s |
| Qwen 3.6 35B-A3B | 42 t/s | 40 t/s | 36 t/s |
| Mistral Small 24B | 24 t/s | 22 t/s | 20 t/s |
| Qwen 3.8 27B | 20 t/s | 18 t/s | 16 t/s |
#4. Installation
#5. Modèles recommandés par usage
- Chat généraliste
- Qwen 3.5 9B Q5 (256k de contexte, vision, rapide) ou Granite 4.2 8B (plus sobre).
- Code
- Qwen3-Coder 30B-A3B (MoE, 256k ctx) sur 32 Go+, ou Devstral 24B (spécialiste agent de code, Mistral AI) sur 32 Go. Pour l'autocomplétion inline, Qwen2.5-Coder 7B base reste la référence FIM.
- RAG documentaire
- Gemma 4 12B (multimodal, léger) ou Mistral Small 24B (meilleur raisonnement mais plus lent).
- Raisonnement / analyse
- Sur 64 Go+, Qwen 3.6 35B-A3B (MoE rapide) ou Qwen 3.8 27B (le plus proche d'un Copilot, 262k ctx) dominent en qualité. Le Qwen 3.8 27B sur 32 Go est un bon compromis.
#6. Optimisations avancées
- Flash Attention
- Activé via OLLAMA_FLASH_ATTENTION=1. Gain de 10-15 % sur contextes 8k+.
- KV cache Q8
- Via OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 70B contexte 16k+.
- Spéculatif decoding
- Disponible dans llama.cpp maison. Sur un Qwen 3.8 27B + un Qwen 3.5 2B comme draft, gain 1,5× sur génération.
- Allocation manuelle GPU
- sysctl iogpu.wired_limit_mb. Sur 96 Go, montez à 86016 Mo (84 Go) pour charger un 35B-A3B Q8 + contexte long.
- Qwen 3.8 27B : raisonnement
- Par défaut il « sur-réfléchit » avec son réglage de raisonnement, ce qui ralentit les réponses simples. Passez-le en low pour des sorties plus directes.
#Upgrade vers M4 Max ?
Le M4 Max 16-core apporte 546 Go/s de bande passante (+36 % vs M2 Max), et jusqu'à 128 Go de RAM. Concrètement :
- Gain vitesse gros modèle
- Sur un Qwen 3.8 27B, de ~20 tok/s (M2 Max) à ~28 tok/s (M4 Max 16-core). Significatif.
- Capacité RAM
- De 96 Go à 128 Go. Ouvre les gros MoE en Q8 ou deux modèles 30B chargés simultanément.
- Prix upgrade
- Revente M2 Max 96 Go ~2500 € / achat M4 Max 128 Go neuf ~4500 €. Coût net ~2000 €.
- Verdict
- Upgrade uniquement si vous travaillez quotidiennement sur des gros modèles (30B+) et que la vitesse compte. Sinon, M2 Max 96 Go reste très bien en 2026.
#Questions fréquentes
MBP M2 Pro 16 Go est-il suffisant pour l'IA locale ?+
Oui, pour Qwen 3.5 9B et Granite 4.2 8B en Q5 à 35-40 tok/s. Pour un usage plus ambitieux (12B, 24B), visez 32 Go.
Différence entre M2 Max 30-core et 38-core GPU ?+
Environ 15-20 % de vitesse en plus pour le 38-core sur des 32B+. Négligeable sur 7B (limité par la bande passante commune). Si votre usage vise les gros modèles, optez pour le 38-core.
Peut-on faire tourner deux LLM en parallèle sur MBP M2 Max 64 Go ?+
Oui : par exemple Granite 4.2 8B (5 Go) + Gemma 4 12B (8 Go) + contexte = 18 Go. Reste 45 Go pour le système et les apps. Ollama gère très bien le multi-modèle.
Quel modèle pour du français sur MBP M2 Max 64 Go ?+
Mistral Small 24B Q5 (excellente maîtrise FR, 22 tok/s) ou Qwen 3.8 27B (raisonnement supérieur, 262k ctx, 20 tok/s). Sur 32 Go, les deux tiennent confortablement.
Le MBP M2 Max chauffe-t-il plus que le M1 Max ?+
Légèrement — efficience énergétique moins bonne que M1. Mais les ventilateurs actifs absorbent la différence. Conso soutenue : ~50 W sur un gros modèle vs ~45 W sur M1 Max.
Faut-il installer MLX à côté d'Ollama sur M2 Max ?+
Seulement si vous voulez fine-tuner un LoRA en local ou utiliser des modèles MLX-community non disponibles en GGUF. Pour 95 % des usages, Ollama seul suffit.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.