Quel LLM sur MacBook Pro M3 Pro / Max (18–128 Go) ?
Le MacBook Pro M3 Pro / Max (fin 2023) est en 2026 le sweet spot du laptop pour LLM local. Le M3 Max 16-core offre 400 Go/s de bande passante et jusqu'à 128 Go de mémoire unifiée — assez pour faire tourner tout le catalogue open-weight 2026 en pleine précision : Qwen 3.6 35B-A3B en Q8, Qwen 3.8 27B en dense, ou plusieurs modèles chargés en parallèle avec des contextes de 128k et plus. Attention : le M3 Pro a subi un downgrade mémoire (150 Go/s, contre 200 pour M2 Pro). Ce guide démêle ce que chaque variante permet vraiment.
#MBP M3 Pro / Max en 2026
- Sortie
- Octobre-novembre 2023. Toujours supporté par macOS Sequoia et au-delà.
- M3 Pro
- 11 ou 12 cœurs CPU + 14 ou 18 cœurs GPU, 150 Go/s (downgrade vs M2 Pro), RAM 18 ou 36 Go.
- M3 Max 14-core
- 14 cœurs CPU + 30 cœurs GPU, 300 Go/s, RAM 36 ou 96 Go.
- M3 Max 16-core
- 16 cœurs CPU + 40 cœurs GPU, 400 Go/s, RAM 48, 64 ou 128 Go.
#1. M3 Pro vs M3 Max (attention au piège)
- M3 Pro 150 Go/s
- Correct pour du 9B-12B (~30 tok/s) mais s'essouffle sur du 24B+ dense (~12 tok/s). Évitez si vous visez du 24B+ dense.
- M3 Max 14-core 300 Go/s
- Le bon compromis : Qwen 3.6 35B-A3B (MoE) à 35-38 tok/s, Qwen 3.8 27B dense à 15-17 tok/s. RAM max 96 Go.
- M3 Max 16-core 400 Go/s
- Le haut de gamme. +30 % de vitesse sur gros modèles, ouvre 128 Go RAM pour la pleine précision Q8 et plusieurs modèles en parallèle.
#2. 18 à 128 Go : quels LLM
| Modèle | Quant | M3 Pro 18 | M3 Pro 36 | M3 Max 64 | M3 Max 96 | M3 Max 128 |
|---|---|---|---|---|---|---|
| Qwen 3.5 9B | Q5_K_M | ✓ 30 | ✓ 32 | ✓ 46 | ✓ 48 | ✓ 50 |
| Gemma 4 12B | Q5_K_M | ✓ 14 | ✓ 16 | ✓ 26 | ✓ 28 | ✓ 30 |
| Mistral Small 24B | Q5_K_M | — | ✓ 10 | ✓ 17 | ✓ 19 | ✓ 20 |
| Qwen 3.8 27B | Q5_K_M | — | — | ✓ 15 | ✓ 16 | ✓ 17 |
| Qwen 3.6 35B-A3B | Q5_K_M | — | — | ✓ 38 | ✓ 40 | ✓ 42 |
| Qwen 3.6 35B-A3B | Q8_0 | — | — | ✓ 32 | ✓ 34 | ✓ 36 |
| Qwen3-Coder 30B-A3B | Q8_0 | — | — | ✓ 33 | ✓ 35 | ✓ 37 |
| GLM 4.7 Flash | Q4_K_M | — | — | ✓ 44 | ✓ 46 | ✓ 48 |
#3. Benchmarks tokens/sec
| Modèle | Q4_K_M | Q5_K_M | Flash Attn 8k |
|---|---|---|---|
| Qwen 3.5 9B | 54 t/s | 50 t/s | 48 t/s |
| Gemma 4 12B | 34 t/s | 30 t/s | 29 t/s |
| Mistral Small 24B | 22 t/s | 20 t/s | 19 t/s |
| Qwen 3.8 27B | 19 t/s | 17 t/s | 16 t/s |
| Qwen 3.6 35B-A3B | 46 t/s | 42 t/s | 40 t/s |
#4. Installation et config
#5. Gros modèles en pleine précision avec Flash Attention
Flash Attention, longtemps réservé à CUDA, est dispo sur Metal depuis fin 2024 via llama.cpp et Ollama. Gain majeur sur les contextes longs — indispensable pour pousser un Qwen 3.6 35B-A3B à 128k de contexte.
#6. Le M3 Max 128 Go : territoire workstation
- Qwen 3.6 35B-A3B Q8
- Pleine précision, qualité maximale. ~36 tok/s (MoE, 3B actifs). Le 128 Go permet le Q8 sans compromis sur le contexte.
- Qwen 3.8 27B Q8
- Le plus gros généraliste dense en pleine précision (~29 Go). ~15 tok/s. Le "proche Copilot" 2026, vision incluse.
- 2 modèles 30B en parallèle
- Un Qwen 3.6 35B-A3B + un Qwen3-Coder 30B-A3B chargés simultanément. ~42 Go total. Pour agents multi-spécialistes.
- Context 128k+ sur 35B
- Avec KV cache Q8, Qwen 3.6 35B-A3B + contexte 128k tient dans ~50 Go. Analyse de docs longs sérieuse.
#M3 Max vs M4 Max
- Bande passante
- M3 Max 16-core = 400 Go/s. M4 Max 16-core = 546 Go/s (+36 %).
- Vitesse Qwen 3.6 35B-A3B
- M3 Max ~40 tok/s, M4 Max ~54 tok/s. +35 % en usage réel.
- RAM max
- Identique : 128 Go sur les deux top configs.
- Verdict
- M4 Max si achat neuf. M3 Max d'occasion à -25 % de prix est aussi un excellent deal.
#Questions fréquentes
Le M3 Pro est-il vraiment plus lent que le M2 Pro pour les LLM ?+
Quel MBP M3 pour faire tourner les gros modèles 2026 ?+
Différence M3 Max 14-core vs 16-core en pratique ?+
128 Go de RAM, est-ce vraiment utile en 2026 ?+
Flash Attention change vraiment quelque chose sur M3 Max ?+
Autonomie batterie pendant un chat sur un gros modèle ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.