Quel LLM sur MacBook Pro M1 Pro / Max (16–64 Go) ?
Sorti fin 2021, le MacBook Pro M1 Pro / Max reste en 2026 une machine remarquable pour l'IA locale, surtout en version Max 64 Go. Bande passante 200 à 400 Go/s, ventilateurs actifs (pas de throttle), jusqu'à 64 Go de mémoire unifiée : un Llama 3.1 70B Q4 tourne à 8-10 tokens/seconde, chose impossible sur tout PC grand public de la même année. Ce guide détaille comment exploiter cette machine aujourd'hui.
#MBP M1 Pro / Max en 2026
- Sortie
- Octobre 2021. Toujours supporté par macOS Sequoia (15) en 2026.
- M1 Pro
- 8 ou 10 cœurs CPU + 14 ou 16 cœurs GPU, bande passante 200 Go/s, RAM 16 ou 32 Go.
- M1 Max
- 10 cœurs CPU + 24 ou 32 cœurs GPU, bande passante 400 Go/s, RAM 32 ou 64 Go.
- Refroidissement
- Ventilateurs actifs — aucun throttle en usage LLM. Peut tourner en continu 24h.
- Valeur d'occasion 2026
- MBP M1 Pro 16 Go à partir de 900 €. MBP M1 Max 64 Go entre 1500 et 1900 € selon état.
#1. M1 Pro vs M1 Max : choisir
- M1 Pro (200 Go/s)
- Excellent pour 7B-8B et jusqu'à 14B Q5. Insuffisant pour 70B même Q3.
- M1 Max (400 Go/s)
- 2× la bande passante = 2× la vitesse d'inférence sur modèles ≥ 13B. Indispensable si vous visez 70B.
- Cœurs GPU
- M1 Max 32-core est 15-20 % plus rapide que 24-core sur des 7B. Écart se creuse sur 70B.
#2. 16, 32, 64 Go : quels modèles
| Modèle | Quant | RAM modèle | M1 Pro 16 Go | M1 Pro 32 Go | M1 Max 64 Go |
|---|---|---|---|---|---|
| Mistral 7B | Q5_K_M | 5 Go | 35 | 40 | 55 |
| Llama 3.1 8B | Q5_K_M | 6 Go | 30 | 34 | 48 |
| Phi-4 14B | Q5_K_M | 10,5 Go | 15 | 17 | 26 |
| Qwen 2.5 32B | Q4_K_M | 19 Go | — | 8 | 15 |
| Mistral Small 24B | Q5_K_M | 16 Go | — | 10 | 18 |
| Llama 3.3 70B | Q3_K_M | 32 Go | — | — | 5 |
| Llama 3.3 70B | Q4_K_M | 42 Go | — | — | 8-10 |
#3. Benchmarks tokens/sec
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Mistral 7B | 58 t/s | 55 t/s | 35 t/s |
| Llama 3.1 8B | 50 t/s | 47 t/s | 30 t/s |
| Phi-4 14B | 28 t/s | 26 t/s | 16 t/s |
| Qwen 2.5 32B | 15 t/s | 13 t/s | — |
| Llama 3.3 70B | 9 t/s | — | — |
#4. Installation et setup
#5. Relever la limite mémoire GPU
Sur MBP M1 Max 64 Go, macOS alloue par défaut ~43 Go au GPU. Pour charger Llama 3.3 70B Q4 (qui demande ~45 Go), il faut relever le plafond.
#6. Faire tourner un 70B sur M1 Max
Le MBP M1 Max 64 Go est le plus petit Mac capable de faire tourner un Llama 70B en Q4. Voici la config optimale :
#Upgrade vers M3 Max ou M4 Max ?
- M3 Max 16-core (2023)
- +50 % de vitesse pure vs M1 Max. 128 Go RAM possible (vs 64 Go). Justifie l'upgrade si vous voulez 70B à 15 tok/s.
- M4 Max 16-core (2024)
- +90 % vs M1 Max, bande passante 546 Go/s. 128 Go RAM. Meilleur Mac laptop pour LLM en 2026.
- Rester sur M1 Max 64 Go
- Totalement viable : 70B Q4 à 8-10 tok/s, 32B à 15 tok/s. Pas de raison d'upgrader avant 2027 si la vitesse actuelle vous convient.
#Questions fréquentes
MBP M1 Pro 16 Go ou M1 Max 32 Go pour l'IA locale ?+
Peut-on faire tourner un 70B sur MBP M1 Max 32 Go ?+
Le MBP M1 Pro est-il meilleur qu'un PC RTX 3060 pour les LLM ?+
Les ventilateurs tournent fort en inférence LLM ?+
Faut-il l'écran 16" ou 14" pour les LLM ?+
Ollama ou MLX sur MBP M1 Max ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.