Intermédiaire 12 minMacBook Pro
Quel LLM sur MacBook Pro M3 Pro / Max (18–128 Go) ?
Le MacBook Pro M3 Pro / Max (fin 2023) est en 2026 le sweet spot du laptop pour LLM local. Le M3 Max 16-core offre 400 Go/s de bande passante et jusqu'à 128 Go de mémoire unifiée — assez pour Llama 3.3 70B en Q5 confortable, voire Qwen 2.5 123B en Q4. Attention : le M3 Pro a subi un downgrade mémoire (150 Go/s, contre 200 pour M2 Pro). Ce guide démêle ce que chaque variante permet vraiment.
#MBP M3 Pro / Max en 2026
- Sortie
- Octobre-novembre 2023. Toujours supporté par macOS Sequoia et au-delà.
- M3 Pro
- 11 ou 12 cœurs CPU + 14 ou 18 cœurs GPU, 150 Go/s (downgrade vs M2 Pro), RAM 18 ou 36 Go.
- M3 Max 14-core
- 14 cœurs CPU + 30 cœurs GPU, 300 Go/s, RAM 36 ou 96 Go.
- M3 Max 16-core
- 16 cœurs CPU + 40 cœurs GPU, 400 Go/s, RAM 48, 64 ou 128 Go.
!
Le piège du M3 Pro
Apple a baissé la bande passante mémoire du M3 Pro (150 Go/s contre 200 pour M2 Pro). Résultat : le M3 Pro est plus lent que le M2 Pro en LLM. Si vous cherchez du M3, visez directement le M3 Max — ou gardez un M2 Pro d'occasion.
#1. M3 Pro vs M3 Max (attention au piège)
- M3 Pro 150 Go/s
- Correct pour 7B-8B (~35 tok/s) mais s'essouffle sur 14B+ (~12 tok/s). Évitez si vous visez du 14B+.
- M3 Max 14-core 300 Go/s
- Le bon compromis : 70B Q4 à 10-12 tok/s, 32B à 15-17 tok/s. RAM max 96 Go.
- M3 Max 16-core 400 Go/s
- Le haut de gamme. +30 % de vitesse sur gros modèles, ouvre 128 Go RAM pour 70B Q6 ou 123B Q4.
#2. 18 à 128 Go : quels LLM
Modèles compatibles par config MBP M3
| Modèle | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Mistral 7B | Q5_K_M | ✓ 34 | ✓ 36 | ✓ 52 | ✓ 55 | ✓ 58 |
| Phi-4 14B | Q5_K_M | — | ✓ 14 | ✓ 24 | ✓ 26 | ✓ 28 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 2.5 32B | Q5_K_M | — | — | ✓ 13 | ✓ 15 | ✓ 16 |
| Llama 3.3 70B | Q4_K_M | — | — | ✓ 10 | ✓ 11 | ✓ 12 |
| Llama 3.3 70B | Q5_K_M | — | — | — | ✓ 9 | ✓ 10 |
| Llama 3.3 70B | Q6_K | — | — | — | — | ✓ 8 |
| Qwen 2.5 123B | Q4_K_M | — | — | — | — | ✓ 6 |
#3. Benchmarks tokens/sec
MBP M3 Max 16-core GPU, 128 Go, Ollama 0.5.x, secteur
| Modèle | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Mistral 7B | 62 t/s | 58 t/s | 55 t/s |
| Phi-4 14B | 32 t/s | 28 t/s | 27 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 2.5 32B | 18 t/s | 16 t/s | 15 t/s |
| Llama 3.3 70B | 13 t/s | 10 t/s | 10 t/s |
#4. Installation et config
#5. Faire tourner un 70B avec Flash Attention
Flash Attention, longtemps réservé à CUDA, est dispo sur Metal depuis fin 2024 via llama.cpp et Ollama. Gain majeur sur les contextes longs.
→
Gains mesurés avec Flash Attention sur M3 Max
Contexte 4k : +8 %. Contexte 8k : +15 %. Contexte 16k : +25 %. Plus vous avez de contexte, plus le gain est net. À activer systématiquement sur M3 Max.
#6. Le M3 Max 128 Go : territoire workstation
- Llama 3.3 70B Q6_K
- Qualité quasi-FP16. 8 tok/s. Seul laptop au monde capable de ça (hors M4 Max 128 Go).
- Qwen 2.5 123B Q4
- Dense 123B — le plus gros modèle open-weights qui rentre. 6 tok/s. Usage patient.
- 2 × 32B en parallèle
- Un 32B Q5 + un 32B Coder Q5 chargés simultanément. 40 Go total. Pour agents multi-spécialistes.
- Context 32k+ sur 70B
- Avec KV cache Q8, 70B + contexte 32k tient dans 90 Go. Analyse de docs longs sérieuse.
#M3 Max vs M4 Max
- Bande passante
- M3 Max 16-core = 400 Go/s. M4 Max 16-core = 546 Go/s (+36 %).
- Vitesse 70B
- M3 Max ~11 tok/s, M4 Max ~16 tok/s. +45 % en usage réel.
- RAM max
- Identique : 128 Go sur les deux top configs.
- Verdict
- M4 Max si achat neuf. M3 Max d'occasion à -25 % de prix est aussi un excellent deal.
#Questions fréquentes
Le M3 Pro est-il vraiment plus lent que le M2 Pro pour les LLM ?+
Oui, pour les modèles 13B+, à cause de la bande passante (150 Go/s vs 200). Sur Mistral 7B, l'écart est faible (~5 %). Sur Phi-4 14B, le M2 Pro est 10-15 % plus rapide. Conseil : si vous achetez d'occasion et visez du 14B+, préférez M2 Pro ou sautez directement à M3 Max.
Quel MBP M3 pour faire tourner Llama 3.3 70B ?+
M3 Max 14-core 64 Go minimum (10 tok/s Q4), M3 Max 16-core 64-128 Go pour du confort. Le M3 Pro 36 Go ne peut pas charger de 70B.
Différence M3 Max 14-core vs 16-core en pratique ?+
+30 % de bande passante (300 vs 400 Go/s), +33 % de cœurs GPU, option 128 Go RAM. Sur 70B Q4 : +40 % de vitesse. Sur 7B : +8 % seulement. Si vous visez des gros modèles, le 16-core est un vrai investissement.
128 Go de RAM, est-ce vraiment utile en 2026 ?+
Oui si vous voulez : 70B en Q6 (meilleure qualité qu'un Q4), 123B en Q4, ou deux modèles 32B+ en parallèle. Pour du 70B Q4 standard, 64 Go suffit largement.
Flash Attention change vraiment quelque chose sur M3 Max ?+
Oui, 15 à 25 % de vitesse en plus sur contextes 8k-16k, sans perte de qualité. À activer par défaut via OLLAMA_FLASH_ATTENTION=1.
Autonomie batterie pendant un chat Llama 70B ?+
Environ 1h40 en chat continu sur le 16" M3 Max (conso ~50 W). Confortable pour une session en déplacement. En batch sur 70B, comptez 1h max — préférez le secteur.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.