Quel LLM sur MacBook Pro M1 Pro / Max (16–64 Go) ?
Sorti fin 2021, le MacBook Pro M1 Pro / Max reste en 2026 une machine remarquable pour l'IA locale, surtout en version Max 64 Go. Bande passante 200 à 400 Go/s, ventilateurs actifs (pas de throttle), jusqu'à 64 Go de mémoire unifiée : un MoE Qwen 3.6 35B tourne à ~34 tokens/seconde et un modèle 30B tient en Q8 pleine qualité, chose impossible sur un PC portable grand public équivalent. Ce guide détaille comment exploiter cette machine aujourd'hui.
#MBP M1 Pro / Max en 2026
- Sortie
- Octobre 2021. Toujours supporté par macOS Sequoia (15) en 2026.
- M1 Pro
- 8 ou 10 cœurs CPU + 14 ou 16 cœurs GPU, bande passante 200 Go/s, RAM 16 ou 32 Go.
- M1 Max
- 10 cœurs CPU + 24 ou 32 cœurs GPU, bande passante 400 Go/s, RAM 32 ou 64 Go.
- Refroidissement
- Ventilateurs actifs — aucun throttle en usage LLM. Peut tourner en continu 24h.
- Valeur d'occasion 2026
- MBP M1 Pro 16 Go à partir de 900 €. MBP M1 Max 64 Go entre 1500 et 1900 € selon état.
#1. M1 Pro vs M1 Max : choisir
- M1 Pro (200 Go/s)
- Excellent pour les modèles 8-12B. Un MoE 30-35B (Qwen 3.6 35B-A3B) tient sur la version 32 Go, mais pas sur 16 Go.
- M1 Max (400 Go/s)
- 2× la bande passante = 2× la vitesse d'inférence sur modèles ≥ 13B. Indispensable pour faire tourner un 30B en Q8 pleine qualité.
- Cœurs GPU
- M1 Max 32-core est 15-20 % plus rapide que 24-core sur des 8B. L'écart se creuse sur les modèles 27-35B.
#2. 16, 32, 64 Go : quels modèles
| Modèle | Quant | RAM modèle | M1 Pro 16 Go | M1 Pro 32 Go | M1 Max 64 Go |
|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | 7 Go | 28 | 31 | 43 |
| Granite 4.2 8B | Q5_K_M | 6 Go | 30 | 34 | 47 |
| Gemma 4 12B | Q5_K_M | 9 Go | 18 | 21 | 30 |
| Qwen 3.8 27B | Q4_K_M | 18 Go | — | 11 | 18 |
| Mistral Small 24B | Q5_K_M | 16 Go | — | 10 | 18 |
| Qwen 3.6 35B-A3B (MoE) | Q4_K_M | 23 Go | — | 22 | 34 |
| Qwen3-Coder 30B-A3B | Q8_0 | 32 Go | — | — | 24 |
#3. Benchmarks tokens/sec
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Qwen 3.5 9B | 46 t/s | 43 t/s | 28 t/s |
| Granite 4.2 8B | 50 t/s | 47 t/s | 30 t/s |
| Gemma 4 12B | 32 t/s | 30 t/s | 19 t/s |
| Qwen 3.8 27B | 18 t/s | 16 t/s | 10 t/s |
| Qwen 3.6 35B-A3B | 34 t/s | — | 22 t/s |
#4. Installation et setup
#5. Relever la limite mémoire GPU
Sur MBP M1 Max 64 Go, macOS alloue par défaut ~43 Go au GPU. Pour charger un modèle 30-35B en Q8 (~35 Go) avec un contexte étendu — le cache KV d'un contexte 256k peut à lui seul dépasser 10 Go — l'ensemble franchit vite les 43 Go, et il faut relever le plafond.
#6. Faire tourner un gros modèle 2026 sur M1 Max
Le MBP M1 Max 64 Go fait tourner les plus gros modèles 2026 en pleine qualité : un MoE 30-35B en Q8, ou plusieurs modèles chargés en parallèle. Voici la config optimale :
#Upgrade vers M3 Max ou M4 Max ?
- M3 Max 16-core (2023)
- +50 % de vitesse pure vs M1 Max. 128 Go RAM possible (vs 64 Go). Justifie l'upgrade si vous voulez pousser un MoE 30-35B au-delà de 50 tok/s.
- M4 Max 16-core (2024)
- +90 % vs M1 Max, bande passante 546 Go/s. 128 Go RAM. Meilleur Mac laptop pour LLM en 2026.
- Rester sur M1 Max 64 Go
- Totalement viable : MoE 35B à ~34 tok/s, 27B dense à 18 tok/s. Pas de raison d'upgrader avant 2027 si la vitesse actuelle vous convient.
#Questions fréquentes
MBP M1 Pro 16 Go ou M1 Max 32 Go pour l'IA locale ?+
Peut-on faire tourner un gros modèle sur MBP M1 Max 32 Go ?+
Le MBP M1 Pro est-il meilleur qu'un PC RTX 3060 pour les LLM ?+
Les ventilateurs tournent fort en inférence LLM ?+
Faut-il l'écran 16" ou 14" pour les LLM ?+
Ollama ou MLX sur MBP M1 Max ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.