Intermédiaire 11 minMacBook Pro

Quel LLM sur MacBook Pro M1 Pro / Max (16–64 Go) ?

Sorti fin 2021, le MacBook Pro M1 Pro / Max reste en 2026 une machine remarquable pour l'IA locale, surtout en version Max 64 Go. Bande passante 200 à 400 Go/s, ventilateurs actifs (pas de throttle), jusqu'à 64 Go de mémoire unifiée : un Llama 3.1 70B Q4 tourne à 8-10 tokens/seconde, chose impossible sur tout PC grand public de la même année. Ce guide détaille comment exploiter cette machine aujourd'hui.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#MBP M1 Pro / Max en 2026

Sortie
Octobre 2021. Toujours supporté par macOS Sequoia (15) en 2026.
M1 Pro
8 ou 10 cœurs CPU + 14 ou 16 cœurs GPU, bande passante 200 Go/s, RAM 16 ou 32 Go.
M1 Max
10 cœurs CPU + 24 ou 32 cœurs GPU, bande passante 400 Go/s, RAM 32 ou 64 Go.
Refroidissement
Ventilateurs actifs — aucun throttle en usage LLM. Peut tourner en continu 24h.
Valeur d'occasion 2026
MBP M1 Pro 16 Go à partir de 900 €. MBP M1 Max 64 Go entre 1500 et 1900 € selon état.
Pourquoi c'est une affaire en 2026
Un MBP M1 Max 64 Go d'occasion à 1700 € fait tourner Llama 3.3 70B Q4. Pour la même capacité LLM sur PC, il faut 2 × RTX 3090 (~1400 €) + un CPU / carte mère / PSU compatibles (~800 €) = 2200 € minimum, bruyant et énergivore.

#1. M1 Pro vs M1 Max : choisir

M1 Pro (200 Go/s)
Excellent pour 7B-8B et jusqu'à 14B Q5. Insuffisant pour 70B même Q3.
M1 Max (400 Go/s)
2× la bande passante = 2× la vitesse d'inférence sur modèles ≥ 13B. Indispensable si vous visez 70B.
Cœurs GPU
M1 Max 32-core est 15-20 % plus rapide que 24-core sur des 7B. Écart se creuse sur 70B.

#2. 16, 32, 64 Go : quels modèles

Modèles recommandés par config MBP M1
ModèleQuantRAM modèleM1 Pro 16 GoM1 Pro 32 GoM1 Max 64 Go
Mistral 7BQ5_K_M5 Go354055
Llama 3.1 8BQ5_K_M6 Go303448
Phi-4 14BQ5_K_M10,5 Go151726
Qwen 2.5 32BQ4_K_M19 Go815
Mistral Small 24BQ5_K_M16 Go1018
Llama 3.3 70BQ3_K_M32 Go5
Llama 3.3 70BQ4_K_M42 Go8-10

#3. Benchmarks tokens/sec

MBP M1 Max 32-core GPU, 64 Go, Ollama, secteur
ModèleQ4_K_MQ5_K_MQ8_0
Mistral 7B58 t/s55 t/s35 t/s
Llama 3.1 8B50 t/s47 t/s30 t/s
Phi-4 14B28 t/s26 t/s16 t/s
Qwen 2.5 32B15 t/s13 t/s
Llama 3.3 70B9 t/s

#4. Installation et setup

Terminal — setup complet
# Homebrew
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Ollama + démarrage auto
brew install --cask ollama
brew services start ollama

# Modèles conseillés
ollama run mistral         # M1 Pro 16 Go
ollama run phi4            # M1 Pro 32 Go
ollama run llama3.3        # M1 Max 64 Go (70B)

#5. Relever la limite mémoire GPU

Sur MBP M1 Max 64 Go, macOS alloue par défaut ~43 Go au GPU. Pour charger Llama 3.3 70B Q4 (qui demande ~45 Go), il faut relever le plafond.

Augmenter la mémoire GPU allouable
# Vérifier la valeur actuelle
sysctl iogpu.wired_limit_mb

# Relever à 56 Go (64 Go - 8 Go système)
sudo sysctl iogpu.wired_limit_mb=57344

# Rendre permanent
echo "iogpu.wired_limit_mb=57344" | sudo tee -a /etc/sysctl.conf
!
Laissez ≥ 8 Go à macOS
En dessous, le système swape et l'inférence ralentit dramatiquement. 8 Go est la marge minimale sur un MBP 64 Go ; restez sur 6 Go uniquement si vous fermez toutes les apps Electron et n'utilisez pas de navigateur.

#6. Faire tourner un 70B sur M1 Max

Le MBP M1 Max 64 Go est le plus petit Mac capable de faire tourner un Llama 70B en Q4. Voici la config optimale :

Llama 3.3 70B Q4 sur M1 Max 64 Go
# Augmenter la RAM GPU (fait une seule fois)
sudo sysctl iogpu.wired_limit_mb=57344

# Activer flash attention + KV cache quantifié
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
brew services restart ollama

# Lancer le modèle
ollama run llama3.3
# Comptez ~8-10 tokens/seconde, contexte 8k confortable
i
Autonomie batterie sur 70B
Environ 1h30 d'autonomie en chat continu sur Llama 70B (conso ~40 W). Pour des sessions longues, branchez — le MBP M1 Max bride fortement le GPU sur batterie basse.

#Upgrade vers M3 Max ou M4 Max ?

M3 Max 16-core (2023)
+50 % de vitesse pure vs M1 Max. 128 Go RAM possible (vs 64 Go). Justifie l'upgrade si vous voulez 70B à 15 tok/s.
M4 Max 16-core (2024)
+90 % vs M1 Max, bande passante 546 Go/s. 128 Go RAM. Meilleur Mac laptop pour LLM en 2026.
Rester sur M1 Max 64 Go
Totalement viable : 70B Q4 à 8-10 tok/s, 32B à 15 tok/s. Pas de raison d'upgrader avant 2027 si la vitesse actuelle vous convient.

#Questions fréquentes

MBP M1 Pro 16 Go ou M1 Max 32 Go pour l'IA locale ?+
Le M1 Max 32 Go pour un gain réel : double bande passante (400 vs 200 Go/s) = double vitesse sur 13B+, et 20 Go utilisables en plus. En revanche, pour ne tourner que des 7B-8B, le M1 Pro 16 Go suffit largement.
Peut-on faire tourner un 70B sur MBP M1 Max 32 Go ?+
Non, pas en Q4 (trop gros). En Q3 très compressé (~30 Go), techniquement oui mais à ~4 tok/s et avec une qualité fortement dégradée. En pratique, 64 Go est le minimum pour un 70B exploitable.
Le MBP M1 Pro est-il meilleur qu'un PC RTX 3060 pour les LLM ?+
Pour Mistral 7B Q4 : vitesse comparable (30-40 tok/s). Avantage Mac : 16 Go utilisables vs 12 Go VRAM, silence, pas de drivers. Avantage PC : écosystème CUDA, fine-tuning plus simple.
Les ventilateurs tournent fort en inférence LLM ?+
Audible sur un 70B en chat continu (RPM ~4000, équivalent à un MacBook Pro Intel 2019 en compilation). Calme sur 7B-14B (RPM ~2500). Bien moins bruyant qu'un laptop PC gamer à la même charge GPU.
Faut-il l'écran 16" ou 14" pour les LLM ?+
Aucun impact sur les performances. Le 16" a une meilleure dissipation thermique (châssis plus grand) donc soutient la charge un peu plus longtemps. 14" si la portabilité prime, 16" si les sessions longues prévalent.
Ollama ou MLX sur MBP M1 Max ?+
Ollama reste la base pour 95 % des usages (simple, robuste, API OpenAI). MLX est intéressant pour fine-tuner un 7B en local ou pour des modèles MLX-native qui profitent du M1 Max. Les deux coexistent sans conflit.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.