Intermédiaire 11 minMacBook Pro
Quel LLM sur MacBook Pro M2 Pro / Max (16–96 Go) ?
Le MacBook Pro M2 Pro / Max (2023) est en 2026 un excellent choix pour qui veut faire tourner des LLM en local sans compromis : ventilateurs actifs, mémoire unifiée jusqu'à 96 Go (record à l'époque), bande passante 200-400 Go/s. Un Llama 3.3 70B Q4 tourne à 10-12 tokens/seconde sur un M2 Max 96 Go, un Mistral Small 24B à 20 tok/s. Ce guide passe en revue chaque config.
#MBP M2 Pro / Max en 2026
- Sortie
- Janvier 2023. Actuellement en fin de cycle, remplacé par M3/M4. Occasion attractive.
- M2 Pro
- 10 ou 12 cœurs CPU + 16 ou 19 cœurs GPU, 200 Go/s, RAM 16 ou 32 Go.
- M2 Max
- 12 cœurs CPU + 30 ou 38 cœurs GPU, 400 Go/s, RAM 32, 64 ou 96 Go.
- Gain vs M1
- +15 % de vitesse sur 7B, +25 % sur 70B grâce au GPU plus large et aux optimisations Metal 3.
#1. M2 Pro vs M2 Max
- M2 Pro (200 Go/s)
- Identique à M1 Pro côté bande passante. Gain de 10-15 % vs M1 grâce à Metal 3 et GPU élargi.
- M2 Max (400 Go/s)
- Double bande passante, indispensable pour 32B+. Option 96 Go ouvre des modèles quasi-inatteignables ailleurs.
- 96 Go M2 Max
- Exclusivité M2 Max (pas dispo sur M1 Max). Permet Llama 70B Q5 confortable ou deux modèles 32B chargés simultanément.
#2. 16 à 96 Go : capacités
Modèles compatibles par config MBP M2
| Modèle | Quant | RAM modèle | M2 Pro 16 | M2 Pro 32 | M2 Max 64 | M2 Max 96 |
|---|---|---|---|---|---|---|
| Mistral 7B | Q5_K_M | 5 Go | ✓ 40 | ✓ 45 | ✓ 60 | ✓ 60 |
| Llama 3.1 8B | Q5_K_M | 6 Go | ✓ 34 | ✓ 38 | ✓ 52 | ✓ 52 |
| Phi-4 14B | Q5_K_M | 10,5 Go | — | ✓ 19 | ✓ 28 | ✓ 28 |
| Qwen 2.5 32B | Q4_K_M | 19 Go | — | — | ✓ 16 | ✓ 17 |
| Mistral Small 24B | Q5_K_M | 16 Go | — | ✓ 12 | ✓ 20 | ✓ 20 |
| Llama 3.3 70B | Q4_K_M | 42 Go | — | — | ✓ 10 | ✓ 12 |
| Llama 3.3 70B | Q5_K_M | 50 Go | — | — | — | ✓ 10 |
| DeepSeek 70B | Q4_K_M | 42 Go | — | — | ✓ 10 | ✓ 11 |
#3. Benchmarks
MBP M2 Max 38-core GPU, 96 Go, Ollama, secteur
| Modèle | Q4_K_M | Q5_K_M | Contexte 8k |
|---|---|---|---|
| Mistral 7B | 62 t/s | 58 t/s | 55 t/s |
| Phi-4 14B | 30 t/s | 28 t/s | 26 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 18 t/s |
| Qwen 2.5 32B | 17 t/s | 15 t/s | 14 t/s |
| Llama 3.3 70B | 11 t/s | 10 t/s | 9 t/s |
#4. Installation
#5. Modèles recommandés par usage
- Chat généraliste
- Mistral 7B Q5 (rapide, FR natif) ou Llama 3.1 8B Q5 (meilleur raisonnement).
- Code
- Qwen 2.5 Coder 14B Q5 sur 32 Go, DeepSeek Coder v2 16B Q5 sur 32 Go+, ou Qwen 32B Coder sur 64 Go+.
- RAG documentaire
- Phi-4 14B (contexte 16k) ou Mistral Small 24B (meilleur raisonnement mais plus lent).
- Raisonnement / analyse
- Sur 64 Go+, Llama 3.3 70B Q4 bat tout le reste en qualité pure. 32B sur 32 Go est un bon compromis.
#6. Optimisations avancées
- Flash Attention
- Activé via OLLAMA_FLASH_ATTENTION=1. Gain de 10-15 % sur contextes 8k+.
- KV cache Q8
- Via OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 70B contexte 16k+.
- Spéculatif decoding
- Disponible dans llama.cpp maison. Sur 70B + un 1B comme draft, gain 1,5× sur génération.
- Allocation manuelle GPU
- sysctl iogpu.wired_limit_mb. Sur 96 Go, montez à 86016 Mo (84 Go) pour charger 70B Q5 + contexte long.
#Upgrade vers M4 Max ?
Le M4 Max 16-core apporte 546 Go/s de bande passante (+36 % vs M2 Max), et jusqu'à 128 Go de RAM. Concrètement :
- Gain vitesse 70B
- De 11 tok/s (M2 Max) à ~17 tok/s (M4 Max 16-core). Significatif.
- Capacité RAM
- De 96 Go à 128 Go. Ouvre Llama 70B Q6 ou 123B Q4.
- Prix upgrade
- Revente M2 Max 96 Go ~2500 € / achat M4 Max 128 Go neuf ~4500 €. Coût net ~2000 €.
- Verdict
- Upgrade uniquement si vous travaillez quotidiennement sur du 70B+ et que la vitesse compte. Sinon, M2 Max 96 Go reste très bien en 2026.
#Questions fréquentes
MBP M2 Pro 16 Go est-il suffisant pour l'IA locale ?+
Oui, pour Mistral 7B, Llama 3.1 8B et Qwen 7B en Q5 à 35-40 tok/s. Pour un usage plus ambitieux (14B, 24B), visez 32 Go.
Différence entre M2 Max 30-core et 38-core GPU ?+
Environ 15-20 % de vitesse en plus pour le 38-core sur des 32B+. Négligeable sur 7B (limité par la bande passante commune). Si votre usage vise les gros modèles, optez pour le 38-core.
Peut-on faire tourner deux LLM en parallèle sur MBP M2 Max 64 Go ?+
Oui : par exemple Mistral 7B (5 Go) + Phi-4 14B (10 Go) + contexte = 20 Go. Reste 40 Go pour le système et les apps. Ollama gère très bien le multi-modèle.
Quel modèle pour du français sur MBP M2 Max 64 Go ?+
Mistral Small 24B Q5 (excellente maîtrise FR, 20 tok/s) ou Llama 3.3 70B Q4 (meilleure qualité mais 10 tok/s). Sur 32 Go, restez sur Mistral Small 24B.
Le MBP M2 Max chauffe-t-il plus que le M1 Max ?+
Légèrement — efficience énergétique moins bonne que M1. Mais les ventilateurs actifs absorbent la différence. Conso soutenue : ~50 W sur 70B vs ~45 W sur M1 Max.
Faut-il installer MLX à côté d'Ollama sur M2 Max ?+
Seulement si vous voulez fine-tuner un LoRA en local ou utiliser des modèles MLX-community non disponibles en GGUF. Pour 95 % des usages, Ollama seul suffit.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.